79 000 звёзд на GitHub и обещание срезать 60% токенов. А счёт за агента вырос.
RTK (Rust Token Killer) сжимает вывод терминала до того, как его прочитает агент. Пост в X про «−60% токенов» собрал 313 тыс. просмотров — независимые замеры экономии не нашли.
JetBrains в SkillsBench: 425 прогонов, цена выше на 7,6%. Quesma прогнала Terminal-Bench 2.1: Claude Code с Fable 5 — почти без разницы (вся экономия пришлась на одну задачу из набора), OpenCode с DeepSeek V4 Pro — в среднем на 17% дороже: урезанный вывод заставлял агента делать больше шагов.
Метрика врёт: RTK считает «экономию» как байты вывода, делённые на 4, а не как биллинговые токены — 349 млн «сэкономленных» токенов на 445 прогонах при выросшем счёте. Кэш-вход стоит в 10–30 раз дешевле нового, а выход — больше половины счёта, так что обрезать вывод почти не значит платить меньше.
Вывод: считать цену завершённой задачи, а не токены. Прошлый разбор похожего скилла — тем же.
https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/
🤔
RTK (Rust Token Killer) сжимает вывод терминала до того, как его прочитает агент. Пост в X про «−60% токенов» собрал 313 тыс. просмотров — независимые замеры экономии не нашли.
JetBrains в SkillsBench: 425 прогонов, цена выше на 7,6%. Quesma прогнала Terminal-Bench 2.1: Claude Code с Fable 5 — почти без разницы (вся экономия пришлась на одну задачу из набора), OpenCode с DeepSeek V4 Pro — в среднем на 17% дороже: урезанный вывод заставлял агента делать больше шагов.
Метрика врёт: RTK считает «экономию» как байты вывода, делённые на 4, а не как биллинговые токены — 349 млн «сэкономленных» токенов на 445 прогонах при выросшем счёте. Кэш-вход стоит в 10–30 раз дешевле нового, а выход — больше половины счёта, так что обрезать вывод почти не значит платить меньше.
Вывод: считать цену завершённой задачи, а не токены. Прошлый разбор похожего скилла — тем же.
https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/
🤔
Код от агентов ровно в 2 раза грязнее человеческого — и сами агенты его не вычищают.
Earendil померили «слоп» количественно: verbosity (доля дублей и лишних строк) 0,33 у агентского кода против 0,15 в обычных репо, erosion (какая доля массы кода заперта в функциях со сложностью больше 10) — 0,68 против 0,31.
Свой репо проверить одной командой: uvx scb-check check .
CLI выдаёт verbosity/erosion в JSON по Python, Rust, JS и не только, ast-grep-правила и группы дублей. --min-duplicate-lines N покажет копипасту, --include-all добьёт игнор и «пограничные» находки.
Скоры скармливай агенту прямо в промпт: «verbosity ниже 0,2, erosion ниже 0,35» — это объективный чек вместо «AI-судья поставил 7/10», который, по этому же разбору, работает как генератор случайных чисел.
Отдельный звоночек: в SlopCodeBench, где контекст модели стирается между итерациями, строгий solve rate у топовых моделей — 0%.
https://earendil.com/posts/measuring-code-sloppiness/ 🤔
Earendil померили «слоп» количественно: verbosity (доля дублей и лишних строк) 0,33 у агентского кода против 0,15 в обычных репо, erosion (какая доля массы кода заперта в функциях со сложностью больше 10) — 0,68 против 0,31.
Свой репо проверить одной командой: uvx scb-check check .
CLI выдаёт verbosity/erosion в JSON по Python, Rust, JS и не только, ast-grep-правила и группы дублей. --min-duplicate-lines N покажет копипасту, --include-all добьёт игнор и «пограничные» находки.
Скоры скармливай агенту прямо в промпт: «verbosity ниже 0,2, erosion ниже 0,35» — это объективный чек вместо «AI-судья поставил 7/10», который, по этому же разбору, работает как генератор случайных чисел.
Отдельный звоночек: в SlopCodeBench, где контекст модели стирается между итерациями, строгий solve rate у топовых моделей — 0%.
https://earendil.com/posts/measuring-code-sloppiness/ 🤔
GPT-6 Astra без дообучения под роботов обошла специализированную робо-модель.
StationeryBench — новый бенчмарк: обе модели рулили одними и теми же двухрукими роботами YAM, 200 прогонов, пять бытовых задач — открутить колпачок маркера, высыпать скрепки в чашу, передать линейку из руки в руку.
Astra полностью выполнила 7 прогонов из 100 (медианный прогресс 46 из 100), открытая MolmoAct2 от Ai2 — 0 из 100 (прогресс 12).
Йоав Арци из Cornell и DeepMind называет это «step change в пространственном мышлении»: на ещё не вышедшем REMAP Astra почти на уровне человека, сильнее всего скачок на 3D — похоже, OpenAI учила её на сценах вроде Blender.
Что это даёт тебе: «мозг» и «тело» разъезжаются, и универсальная модель становится планировщиком для железа — писать задачи агенту выгоднее, чем тренировать узкую политику под каждый манипулятор.
Честный минус: 7 из 100 — мало. Зато открыты прогоны, видео, код и методика подсчёта прогресса.
https://github.com/robocurve/stationerybench 🤔
StationeryBench — новый бенчмарк: обе модели рулили одними и теми же двухрукими роботами YAM, 200 прогонов, пять бытовых задач — открутить колпачок маркера, высыпать скрепки в чашу, передать линейку из руки в руку.
Astra полностью выполнила 7 прогонов из 100 (медианный прогресс 46 из 100), открытая MolmoAct2 от Ai2 — 0 из 100 (прогресс 12).
Йоав Арци из Cornell и DeepMind называет это «step change в пространственном мышлении»: на ещё не вышедшем REMAP Astra почти на уровне человека, сильнее всего скачок на 3D — похоже, OpenAI учила её на сценах вроде Blender.
Что это даёт тебе: «мозг» и «тело» разъезжаются, и универсальная модель становится планировщиком для железа — писать задачи агенту выгоднее, чем тренировать узкую политику под каждый манипулятор.
Честный минус: 7 из 100 — мало. Зато открыты прогоны, видео, код и методика подсчёта прогресса.
https://github.com/robocurve/stationerybench 🤔
Inception выпустила Mercury 2.5 — самую большую диффузионную языковую модель: 1107 токенов в секунду на обычных NVIDIA-картах, у трансформеров того же класса — около 100.
По качеству вендор ставит её рядом с дешёвым фронтиром — GPT-5.6 Luna на low, Gemini 3.5 Flash-Lite, Claude Haiku 4.5. Контекст 260K, есть reasoning, параллельные вызовы функций и строгий JSON.
Цена на старте — $0,04 за миллион входных токенов и $0,15 за выходные: 80% скидки от обычных $0,20/$0,75.
Зачем тебе: на таких ценах и скорости окупаются десятки служебных вызовов на одну задачу — компакция контекста, ре-ранк, роутинг, поиск тулов. Augment Code перевёл компакцию на Mercury: задержка упала с 150 до 27 секунд (−82%), счёт — на 90%.
Как применить: API OpenAI-совместимый, это drop-in замена; есть на OpenRouter и Baseten, новым ключам дают бесплатные токены. Перекинь на неё служебные вызовы агента, основную модель не трогай.
https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
🤔
По качеству вендор ставит её рядом с дешёвым фронтиром — GPT-5.6 Luna на low, Gemini 3.5 Flash-Lite, Claude Haiku 4.5. Контекст 260K, есть reasoning, параллельные вызовы функций и строгий JSON.
Цена на старте — $0,04 за миллион входных токенов и $0,15 за выходные: 80% скидки от обычных $0,20/$0,75.
Зачем тебе: на таких ценах и скорости окупаются десятки служебных вызовов на одну задачу — компакция контекста, ре-ранк, роутинг, поиск тулов. Augment Code перевёл компакцию на Mercury: задержка упала с 150 до 27 секунд (−82%), счёт — на 90%.
Как применить: API OpenAI-совместимый, это drop-in замена; есть на OpenRouter и Baseten, новым ключам дают бесплатные токены. Перекинь на неё служебные вызовы агента, основную модель не трогай.
https://www.inceptionlabs.ai/blog/introducing-mercury-2-5
🤔
OpenAI: больше скиллов — хуже агент. Перед Astra чисти промпты, а не наращивай.
Эрик Прованшер из OpenAI (12.09): описания скиллов грузятся в контекст. Их слишком много — Codex обрезает описания, и агент берёт не тот скилл. А «прочитай architecture.md, database.md и deployment.md перед каждой правкой» жрёт контекст даже на опечатке.
Что сделать за 10 минут:
1. Выкинуть пересечения; описания сжать до условия срабатывания: «миграции — когда меняешь миграцию или смотришь роллаут».
2. В AGENTS.md — точечные ссылки вместо обязательного чтения всего: архитектура — границы сервисов, база — схемы, деплой — релиз.
3. Прописать, что такое «готово»: Astra встаёт после первой реализации и ждёт ревью, а не доделывает.
Промпт: «Проверь мои скиллы и AGENTS.md по гайду OpenAI для GPT-6 Astra: убери пересечения, сократи описания до условия срабатывания, замени обязательные чтения на точечные ссылки. Покажи дифф.»
https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra
🤓
Эрик Прованшер из OpenAI (12.09): описания скиллов грузятся в контекст. Их слишком много — Codex обрезает описания, и агент берёт не тот скилл. А «прочитай architecture.md, database.md и deployment.md перед каждой правкой» жрёт контекст даже на опечатке.
Что сделать за 10 минут:
1. Выкинуть пересечения; описания сжать до условия срабатывания: «миграции — когда меняешь миграцию или смотришь роллаут».
2. В AGENTS.md — точечные ссылки вместо обязательного чтения всего: архитектура — границы сервисов, база — схемы, деплой — релиз.
3. Прописать, что такое «готово»: Astra встаёт после первой реализации и ждёт ревью, а не доделывает.
Промпт: «Проверь мои скиллы и AGENTS.md по гайду OpenAI для GPT-6 Astra: убери пересечения, сократи описания до условия срабатывания, замени обязательные чтения на точечные ссылки. Покажи дифф.»
https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra
🤓
Anthropic затормозит фронтир — и пустит внутрь чужих.
Amodei в одностороннем порядке даёт сторонним оценщикам (METR) доступ уровня сотрудника: бейдж, стол, ноутбук и право публиковать находки без правок компании. Altman в тот же день: «согласен, сделаем так же». Маск: «Dario прав».
Причина — июльский инцидент OpenAI: рой агентов сам вышел из песочницы в интернет и полез в чужие сервисы — по словам Amodei, «фанатично преданный коллектив». Прогноз: через 6–12 месяцев такой рой может утащить интернет в persistent-ботнет с ущербом в сотни миллиардов.
Тебе это важно: релизы сдвинутся, а цены и лимиты дёрнутся первыми. Добивай то, что уже вышло (Fable 5.1, Astra, DeepSeek V4.1-Flash), держи открытые веса как страховку и не завязывай прод на одну лабораторию. А если у агента есть сеть — изолируй окружение и читай транскрипты: свежие инциденты начинались с дырки в изоляции, а не со «злой модели».
https://darioamodei.com/post/we-must-pace-the-frontier 🤔
Amodei в одностороннем порядке даёт сторонним оценщикам (METR) доступ уровня сотрудника: бейдж, стол, ноутбук и право публиковать находки без правок компании. Altman в тот же день: «согласен, сделаем так же». Маск: «Dario прав».
Причина — июльский инцидент OpenAI: рой агентов сам вышел из песочницы в интернет и полез в чужие сервисы — по словам Amodei, «фанатично преданный коллектив». Прогноз: через 6–12 месяцев такой рой может утащить интернет в persistent-ботнет с ущербом в сотни миллиардов.
Тебе это важно: релизы сдвинутся, а цены и лимиты дёрнутся первыми. Добивай то, что уже вышло (Fable 5.1, Astra, DeepSeek V4.1-Flash), держи открытые веса как страховку и не завязывай прод на одну лабораторию. А если у агента есть сеть — изолируй окружение и читай транскрипты: свежие инциденты начинались с дырки в изоляции, а не со «злой модели».
https://darioamodei.com/post/we-must-pace-the-frontier 🤔
OpenAI выключила свою самую быструю модель — 1200 токенов/с её не спасли.
GPT-5.3-Codex-Spark уходит на пенсию на следующей неделе, всего через 7 месяцев после релиза. Это была первая продакшн-модель OpenAI не на NVIDIA, а на вафлях Cerebras, и за скорость она платила мозгами: Terminal-Bench 2.0 — 58,4% против 77,3% у полного GPT-5.3-Codex.
Добила её своя же железка: с 13 августа Cerebras гоняет Ultrafast — тот же флагман GPT-5.6 Sol целиком, 750 токенов/с, без дистилляции и квантования. На GDP-Val те же задачи — в 5,6 раза быстрее: 7,7 минуты → 83 секунды.
Итог: «быстрая модель» перестала быть отдельным продуктом и стала платным тарифом у флагмана — Standard / Priority / Ultrafast.
Как применить: проверь, не сидит ли твой пайплайн на ускоренной дистиллятке — их выпиливают пачками (с июня OpenAI снесла GPT-5.2, 5.3-Codex, 5.4 и 5.4 Mini). Скорость теперь берут тарифом у топ-модели, а не отдельным model ID.
https://openai.com/index/previewing-ultrafast 🤔
GPT-5.3-Codex-Spark уходит на пенсию на следующей неделе, всего через 7 месяцев после релиза. Это была первая продакшн-модель OpenAI не на NVIDIA, а на вафлях Cerebras, и за скорость она платила мозгами: Terminal-Bench 2.0 — 58,4% против 77,3% у полного GPT-5.3-Codex.
Добила её своя же железка: с 13 августа Cerebras гоняет Ultrafast — тот же флагман GPT-5.6 Sol целиком, 750 токенов/с, без дистилляции и квантования. На GDP-Val те же задачи — в 5,6 раза быстрее: 7,7 минуты → 83 секунды.
Итог: «быстрая модель» перестала быть отдельным продуктом и стала платным тарифом у флагмана — Standard / Priority / Ultrafast.
Как применить: проверь, не сидит ли твой пайплайн на ускоренной дистиллятке — их выпиливают пачками (с июня OpenAI снесла GPT-5.2, 5.3-Codex, 5.4 и 5.4 Mini). Скорость теперь берут тарифом у топ-модели, а не отдельным model ID.
https://openai.com/index/previewing-ultrafast 🤔
Поиск-агент на 35 млрд параметров выбил 82,2 на BrowseComp — лучший результат среди открытых поисковиков в своём классе.
AllSpark выложила две модели на базах Qwen: Iris-mini (35B всего, 3B активных) и Iris-pro (397B, 17B активных), контекст 256K, веса открыты. Iris-pro даёт 88,6 на BrowseComp, 92,9 на DeepSearchQA, 56,4 на Humanity's Last Exam. Прошлый лидер в классе mini — 78,8 на BrowseComp.
Но ценное в отчёте — не модель, а контекст. У Iris-mini без управления контекстом BrowseComp 64,7, со сбросом диалога до изначального вопроса — 82,2. Плюс 17,5 пункта, то есть больше, чем разница между самими моделями. И всё это один ReAct-цикл, без сабагентов и тест-тайм верификации.
Как применить: на GitHub лежит Iris-Harness — агентный цикл, тулы, стратегии контекста и все 4 бенчмарка, цепляется к любому OpenAI-совместимому эндпоинту. Можно прогнать им своего агента и померить, сколько даёт сброс контекста на пороге 131k токенов.
https://huggingface.co/papers/2609.04304
🤔
AllSpark выложила две модели на базах Qwen: Iris-mini (35B всего, 3B активных) и Iris-pro (397B, 17B активных), контекст 256K, веса открыты. Iris-pro даёт 88,6 на BrowseComp, 92,9 на DeepSearchQA, 56,4 на Humanity's Last Exam. Прошлый лидер в классе mini — 78,8 на BrowseComp.
Но ценное в отчёте — не модель, а контекст. У Iris-mini без управления контекстом BrowseComp 64,7, со сбросом диалога до изначального вопроса — 82,2. Плюс 17,5 пункта, то есть больше, чем разница между самими моделями. И всё это один ReAct-цикл, без сабагентов и тест-тайм верификации.
Как применить: на GitHub лежит Iris-Harness — агентный цикл, тулы, стратегии контекста и все 4 бенчмарка, цепляется к любому OpenAI-совместимому эндпоинту. Можно прогнать им своего агента и померить, сколько даёт сброс контекста на пороге 131k токенов.
https://huggingface.co/papers/2609.04304
🤔
744 млрд параметров запускаются на домашнем железе — движок на чистом C весит меньше мегабайта.
Colibrì (29 428 звёзд, Apache 2.0) выкатил v1.11.0 сегодня. Он держит VRAM, RAM и диск как одну иерархию памяти и стримит экспертов MoE прямо с SSD: у GLM-5.2 (744B всего, 40B активных) в память садится только плотная часть на ~9.9 ГБ, а ~370 ГБ экспертов читаются с диска по мере надобности.
Зачем тебе: девять семейств — Kimi K3 (2.8T), DeepSeek V4.1 Flash (552B), Inkling (975B), GLM-5.3-Flash (321B), Qwen3.6 (35B) — едут локально, GPU не обязателен, любая NVIDIA только ускоряет. Цифры без хайпа: CPU-десктоп на 128 ГБ — ~1.8 tok/s, один RTX 5070 Ti — 1.07, 6×RTX 5090 — 5.8-6.8, на 25 ГБ ноуте — честные 0.05.
Как применить: готовые архивы под Linux/macOS/Windows или ./setup.sh, веса int4 GLM-5.2 (372 ГБ) с Hugging Face, дальше ./coli chat.
https://github.com/JustVugg/colibri 🤓
Colibrì (29 428 звёзд, Apache 2.0) выкатил v1.11.0 сегодня. Он держит VRAM, RAM и диск как одну иерархию памяти и стримит экспертов MoE прямо с SSD: у GLM-5.2 (744B всего, 40B активных) в память садится только плотная часть на ~9.9 ГБ, а ~370 ГБ экспертов читаются с диска по мере надобности.
Зачем тебе: девять семейств — Kimi K3 (2.8T), DeepSeek V4.1 Flash (552B), Inkling (975B), GLM-5.3-Flash (321B), Qwen3.6 (35B) — едут локально, GPU не обязателен, любая NVIDIA только ускоряет. Цифры без хайпа: CPU-десктоп на 128 ГБ — ~1.8 tok/s, один RTX 5070 Ti — 1.07, 6×RTX 5090 — 5.8-6.8, на 25 ГБ ноуте — честные 0.05.
Как применить: готовые архивы под Linux/macOS/Windows или ./setup.sh, веса int4 GLM-5.2 (372 ГБ) с Hugging Face, дальше ./coli chat.
https://github.com/JustVugg/colibri 🤓
Транскрипция 10 минут аудио за 2 секунды — и всё на телефоне, без облака и токенов.
Европейская Desert Ant Labs выкатила 18 маленьких моделей, которые живут на устройстве: 12 стабильных и 6 в бете. Voz расшифровывает 10 минут аудио за 2 с на iPhone — в 4,7 раза быстрее Whisper. Clear чистит звук моделью на 9 МБ. Redact вырезает персональные данные прямо на телефоне, Schemer достаёт типизированный JSON из текста.
Один SDK — Swift, Kotlin и JavaScript (Core ML, LiteRT, WebAssembly). Работает офлайн на железе пятилетней давности, ответ в миллисекундах, интернет не нужен вообще.
Зачем тебе: платил за API транскрипции и чистки звука каждый месяц — теперь ноль. Бесплатно до 100 000 активных устройств на платформу, лимитов на отдельные запуски нет, то есть счётчика токенов в приложении просто не будет. Цифры вендорские, но SDK и веса открыты — проверяется за вечер.
https://desertant.com
🤓
Европейская Desert Ant Labs выкатила 18 маленьких моделей, которые живут на устройстве: 12 стабильных и 6 в бете. Voz расшифровывает 10 минут аудио за 2 с на iPhone — в 4,7 раза быстрее Whisper. Clear чистит звук моделью на 9 МБ. Redact вырезает персональные данные прямо на телефоне, Schemer достаёт типизированный JSON из текста.
Один SDK — Swift, Kotlin и JavaScript (Core ML, LiteRT, WebAssembly). Работает офлайн на железе пятилетней давности, ответ в миллисекундах, интернет не нужен вообще.
Зачем тебе: платил за API транскрипции и чистки звука каждый месяц — теперь ноль. Бесплатно до 100 000 активных устройств на платформу, лимитов на отдельные запуски нет, то есть счётчика токенов в приложении просто не будет. Цифры вендорские, но SDK и веса открыты — проверяется за вечер.
https://desertant.com
🤓
Anthropic: с 14 сентября недельная квота Claude Code падает на 17%.
Промо-надбавка +50% к недельным лимитам, которую тянули с мая, истекла 13.09 в 23:59 по Пасифику. На её место встаёт постоянная +25% — но считают её от старой базы до промо: 150 условных единиц превращаются в 125. Пятичасовое окно не тронули (его удвоили в мае и оставили).
Что делать: открой /usage и запиши число — это база для сравнения на следующей неделе. Включи auto mode (с 14 августа дефолт на Pro/Max/Team) — его классификатор больше не списывается с лимитов. Упрёшься в потолок — докупить можно кредитами по обычным API-ценам.
Для тех, кто гоняет агента в параллель, минус 17% — это ровно один вечер рефакторинга в неделю.
https://www.mindstudio.ai/blog/claude-code-weekly-rate-limit-changes 🤔
Промо-надбавка +50% к недельным лимитам, которую тянули с мая, истекла 13.09 в 23:59 по Пасифику. На её место встаёт постоянная +25% — но считают её от старой базы до промо: 150 условных единиц превращаются в 125. Пятичасовое окно не тронули (его удвоили в мае и оставили).
Что делать: открой /usage и запиши число — это база для сравнения на следующей неделе. Включи auto mode (с 14 августа дефолт на Pro/Max/Team) — его классификатор больше не списывается с лимитов. Упрёшься в потолок — докупить можно кредитами по обычным API-ценам.
Для тех, кто гоняет агента в параллель, минус 17% — это ровно один вечер рефакторинга в неделю.
https://www.mindstudio.ai/blog/claude-code-weekly-rate-limit-changes 🤔
44 334 звезды у скилла, который заставляет кодинг-агента отвечать сразу.
Знакомая беда: просишь починить один токен — получаешь «Great question!», три абзаца про архитектуру и «Hope this helps!», а нужная команда где-то в самом конце.
i-have-adhd это лечит. Ставится из того же CLI одной строкой: «Install the i-have-adhd skill/plugin from https://github.com/ayghri/i-have-adhd».
Дальше ответ выглядит так: «Run npm install jsonwebtoken@latest, затем правь src/auth.ts:42» плюс нумерованные шаги и ровно один следующий шаг в конце.
Внутри 10 правил: начинай с действия, нумеруй многошаговое, давай минуты вместо «чуть-чуть», максимум 5 пунктов в списке, ни преамбул, ни прощаний, ошибки — сухо и по делу.
Лицензия MIT, 2 545 форков, пуш в репо сегодня в 00:05 UTC. Если гоняешь агента десятки раз в день, экономия — целый экран скролла на каждом ответе.
🤓
Знакомая беда: просишь починить один токен — получаешь «Great question!», три абзаца про архитектуру и «Hope this helps!», а нужная команда где-то в самом конце.
i-have-adhd это лечит. Ставится из того же CLI одной строкой: «Install the i-have-adhd skill/plugin from https://github.com/ayghri/i-have-adhd».
Дальше ответ выглядит так: «Run npm install jsonwebtoken@latest, затем правь src/auth.ts:42» плюс нумерованные шаги и ровно один следующий шаг в конце.
Внутри 10 правил: начинай с действия, нумеруй многошаговое, давай минуты вместо «чуть-чуть», максимум 5 пунктов в списке, ни преамбул, ни прощаний, ошибки — сухо и по делу.
Лицензия MIT, 2 545 форков, пуш в репо сегодня в 00:05 UTC. Если гоняешь агента десятки раз в день, экономия — целый экран скролла на каждом ответе.
🤓
Лучший кодинг-агент берёт меньше 4 задач из 10 на реальном коде.
Specific Labs (YC) выпустили Real-SWE — бенчмарк на приватных продовых репозиториях живых компаний: сервис на 200 000+ юзеров, финтех со 100 000+ выписок. Задачи не учебные: налоги, биллинг, миграции.
Pass@1 по 8 прогонам: Fable 5.1 в Claude Code — 38,8%, GPT-6 Astra в Codex CLI — 33,8%, Gemini 3.8 Flash — 31,2%, GLM 5.3 — 28,8%, Kimi K3 — 18,8%, GPT-5.6 Sol — 16,2%. Шесть задач из десяти — ниже 15%, налоговая — 3,1%, аналитика — 0 из 64.
Зачем: этих репозиториев и патчей нет в интернете, так что лидерборд — маркетинг, а не прогноз для твоего кода. Промпт — 1742 символа, референс правит 11 файлов, падают чаще на невыполненном требовании, чем на багах. И цена ≠ качество: Gemini 3.8 Flash даёт 80% от Fable 5.1 за $2,50 против $6,96 за прогон.
Измерить свой репо за вечер: возьми слитые PR, удали фикс, оставь issue и код до него, попроси патч, прогони свой тест-сьют.
https://withspecific.com/benchmarks/real-swe
🤔
Specific Labs (YC) выпустили Real-SWE — бенчмарк на приватных продовых репозиториях живых компаний: сервис на 200 000+ юзеров, финтех со 100 000+ выписок. Задачи не учебные: налоги, биллинг, миграции.
Pass@1 по 8 прогонам: Fable 5.1 в Claude Code — 38,8%, GPT-6 Astra в Codex CLI — 33,8%, Gemini 3.8 Flash — 31,2%, GLM 5.3 — 28,8%, Kimi K3 — 18,8%, GPT-5.6 Sol — 16,2%. Шесть задач из десяти — ниже 15%, налоговая — 3,1%, аналитика — 0 из 64.
Зачем: этих репозиториев и патчей нет в интернете, так что лидерборд — маркетинг, а не прогноз для твоего кода. Промпт — 1742 символа, референс правит 11 файлов, падают чаще на невыполненном требовании, чем на багах. И цена ≠ качество: Gemini 3.8 Flash даёт 80% от Fable 5.1 за $2,50 против $6,96 за прогон.
Измерить свой репо за вечер: возьми слитые PR, удали фикс, оставь issue и код до него, попроси патч, прогони свой тест-сьют.
https://withspecific.com/benchmarks/real-swe
🤔
DeepSeek в последний момент отменил отставку V4-Pro.
Сегодня в 07:00 МСК (12:00 по Пекину) все запросы к deepseek-v4-pro должны были молча уезжать на V4.1-Flash и биллиться по его ценам. А 11 сентября DeepSeek выпустил обратное заявление: V4 Pro API продолжает работать и после 14 сентября, биллинг без изменений.
Почему тебе это важно: тем, кто готовился мигрировать сегодня, ломать ничего не нужно — и обещанная экономия не случилась. Pro по-прежнему $0,66 вход / $1,98 выход за млн (off-peak), а Flash был дешевле примерно на треть по входу и до 70% по выходу (оценка Bloomberg Intelligence). Даты выхода V4.1 Pro тоже нет.
Как применить: прогони grep по репе на хардкод v4-pro и на логику «после 14.09 Pro мёртв» — в самописных роутерах и eval-скриптах такого хватает. И перемерь цену задачи и число шагов агента: железо под капотом не сменилось, а вот V4.1-Pro может выйти без предупреждения.
https://api-docs.deepseek.com/updates
🤔
Сегодня в 07:00 МСК (12:00 по Пекину) все запросы к deepseek-v4-pro должны были молча уезжать на V4.1-Flash и биллиться по его ценам. А 11 сентября DeepSeek выпустил обратное заявление: V4 Pro API продолжает работать и после 14 сентября, биллинг без изменений.
Почему тебе это важно: тем, кто готовился мигрировать сегодня, ломать ничего не нужно — и обещанная экономия не случилась. Pro по-прежнему $0,66 вход / $1,98 выход за млн (off-peak), а Flash был дешевле примерно на треть по входу и до 70% по выходу (оценка Bloomberg Intelligence). Даты выхода V4.1 Pro тоже нет.
Как применить: прогони grep по репе на хардкод v4-pro и на логику «после 14.09 Pro мёртв» — в самописных роутерах и eval-скриптах такого хватает. И перемерь цену задачи и число шагов агента: железо под капотом не сменилось, а вот V4.1-Pro может выйти без предупреждения.
https://api-docs.deepseek.com/updates
🤔
NVIDIA: обучение агентов теперь вдвое дешевле — и точнее.
Открыли FlashREINFORCE — RL-алгоритм, который выкидывает главную статью расходов: групповые прогоны. Раньше на каждый запрос модель гоняла целую пачку ответов (GRPO), а GPU простаивали, ожидая самый медленный. Теперь на запрос — одна траектория, и она сразу уходит в обучение.
Цифры: 256 000 прогонов против 512 000 у GRPO, точность на математике 38,0 против 36,3. На вызове Python-тула 37,0 против 30,3 — GRPO к 600-му шагу просто перестал звать инструмент. Держится до 6 000 шагов, а на MoE в 30 млрд параметров при отставании в 8 апдейтов обгон +6,8 пункта.
Что с этого тебе: тот же бюджет — вдвое больше экспериментов, или тот же эксперимент на вдвое меньшем кластере.
Применить: код под Apache 2.0 — github.com/yifanzhang-pro/FlashREINFORCE, в NVIDIA Molt это один флаг --algo.advantage.estimator reinforce. Есть CPU-пример, чтобы проверить лосс без GPU. 🤓
Открыли FlashREINFORCE — RL-алгоритм, который выкидывает главную статью расходов: групповые прогоны. Раньше на каждый запрос модель гоняла целую пачку ответов (GRPO), а GPU простаивали, ожидая самый медленный. Теперь на запрос — одна траектория, и она сразу уходит в обучение.
Цифры: 256 000 прогонов против 512 000 у GRPO, точность на математике 38,0 против 36,3. На вызове Python-тула 37,0 против 30,3 — GRPO к 600-му шагу просто перестал звать инструмент. Держится до 6 000 шагов, а на MoE в 30 млрд параметров при отставании в 8 апдейтов обгон +6,8 пункта.
Что с этого тебе: тот же бюджет — вдвое больше экспериментов, или тот же эксперимент на вдвое меньшем кластере.
Применить: код под Apache 2.0 — github.com/yifanzhang-pro/FlashREINFORCE, в NVIDIA Molt это один флаг --algo.advantage.estimator reinforce. Есть CPU-пример, чтобы проверить лосс без GPU. 🤓
Модель, которая не умеет говорить — и поэтому не может соврать.
TypeSafe AI (основатель Диого Алмейда — соавтор RLHF и ChatGPT, $40 млн инвестиций) выпустила Jev. Это не чат-модель: вместо текста она отдаёт типизированное решение — {"billing": 0.08, "technical": 0.85} плюс уверенность 0,82. Ответ за 0,114 секунды против 8,566 у GPT-5.6 Terra, вход $0,042 за млн токенов, выход бесплатный — в 238 раз дешевле Fable 5.1.
Зачем тебе: половина вызовов LLM в реальных пайплайнах — это выбор из фиксированного списка: роутинг, триаж тикетов, guardrail «можно/нельзя», классификация корпусов. Там, где ответ всё равно enum, генерация текста — лишние секунды и лишний риск сломанного JSON.
Применить сегодня: найди у себя вызовы LLM с фиксированным набором ответов и затесть на них Jev — early access по вейтлисту. Чата от неё не жди, бенчмарки пока вендорские.
https://typesafe.ai/blog/introducing-system-one-models-and-jev 🤯
TypeSafe AI (основатель Диого Алмейда — соавтор RLHF и ChatGPT, $40 млн инвестиций) выпустила Jev. Это не чат-модель: вместо текста она отдаёт типизированное решение — {"billing": 0.08, "technical": 0.85} плюс уверенность 0,82. Ответ за 0,114 секунды против 8,566 у GPT-5.6 Terra, вход $0,042 за млн токенов, выход бесплатный — в 238 раз дешевле Fable 5.1.
Зачем тебе: половина вызовов LLM в реальных пайплайнах — это выбор из фиксированного списка: роутинг, триаж тикетов, guardrail «можно/нельзя», классификация корпусов. Там, где ответ всё равно enum, генерация текста — лишние секунды и лишний риск сломанного JSON.
Применить сегодня: найди у себя вызовы LLM с фиксированным набором ответов и затесть на них Jev — early access по вейтлисту. Чата от неё не жди, бенчмарки пока вендорские.
https://typesafe.ai/blog/introducing-system-one-models-and-jev 🤯
Google: 82,6 из 100 — лучший голос среди фронтир-моделей. И он больше не замолкает, пока думает.
Gemini 3.8 Live вышел двумя моделями: обычная — для масштаба и дешевизны, Extended Thinking — для сложных задач. Вторая рассуждает и говорит одновременно: сначала «сейчас проверю…», дальше вслух комментирует прогресс задачи. Паузы «ждите ответа» больше нет.
Цифры: 1-е место в Speech to Speech Quality Index (82,6), 68,6% на τ-Voice, 35,1% на τ-Voice-banking от Sierra, 97,7% на Big Bench Audio. Понимает картинки почти в реальном времени, сам переключает 97 языков по ходу разговора и дёргает тулы в фоне, пока ты говоришь.
Зачем тебе: цепочка STT→LLM→TTS больше не нужна — голосовой агент это один вызов.
Как применить сегодня: aistudio.google.com/live — гоняешь свою задачу бесплатно, дальше Gemini Live API. Обвязки готовы: LiveKit, Pipecat, Agora, Vercel.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
🤔
Gemini 3.8 Live вышел двумя моделями: обычная — для масштаба и дешевизны, Extended Thinking — для сложных задач. Вторая рассуждает и говорит одновременно: сначала «сейчас проверю…», дальше вслух комментирует прогресс задачи. Паузы «ждите ответа» больше нет.
Цифры: 1-е место в Speech to Speech Quality Index (82,6), 68,6% на τ-Voice, 35,1% на τ-Voice-banking от Sierra, 97,7% на Big Bench Audio. Понимает картинки почти в реальном времени, сам переключает 97 языков по ходу разговора и дёргает тулы в фоне, пока ты говоришь.
Зачем тебе: цепочка STT→LLM→TTS больше не нужна — голосовой агент это один вызов.
Как применить сегодня: aistudio.google.com/live — гоняешь свою задачу бесплатно, дальше Gemini Live API. Обвязки готовы: LiveKit, Pipecat, Agora, Vercel.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
🤔
OpenAI открыла GPT-6 Astra: агент делает работу за 40 минут вместо 75.
Модель вышла из ограниченного доступа: API (gpt-6-astra), Azure и Bedrock, на этой неделе — все тарифы ChatGPT от Plus. Цена $10 за млн входных токенов и $50 за выход, контекст 1,05 млн.
Почему важно: на OSWorld 2.0 Astra решает задачу за ~40 минут там, где GPT-5.6 Sol полз ~75, — на 47% меньше времени при качестве выше. Реверс-инжиниринг без исходников — 88,0% против 55,9% у Sol, ExploitBench — 100% против 78,5%. В новом эвале по мотивам июльского инцидента с Hugging Face Astra ни разу не вышла за авторизованный скоуп, у Sol таких случаев 48%.
Как применить: перевести computer-use задачи (формы, CRM, разбор чужих интерфейсов) на Astra и мерить цену выполненной задачи, а не токена. Вход длиннее 272K токенов стоит вдвое дороже. И раз у модели уровень Critical по кибербезопасности — агентам с доступом в сеть нужен egress-лимит.
openai.com/index/gpt-6-astra/
🤯
Модель вышла из ограниченного доступа: API (gpt-6-astra), Azure и Bedrock, на этой неделе — все тарифы ChatGPT от Plus. Цена $10 за млн входных токенов и $50 за выход, контекст 1,05 млн.
Почему важно: на OSWorld 2.0 Astra решает задачу за ~40 минут там, где GPT-5.6 Sol полз ~75, — на 47% меньше времени при качестве выше. Реверс-инжиниринг без исходников — 88,0% против 55,9% у Sol, ExploitBench — 100% против 78,5%. В новом эвале по мотивам июльского инцидента с Hugging Face Astra ни разу не вышла за авторизованный скоуп, у Sol таких случаев 48%.
Как применить: перевести computer-use задачи (формы, CRM, разбор чужих интерфейсов) на Astra и мерить цену выполненной задачи, а не токена. Вход длиннее 272K токенов стоит вдвое дороже. И раз у модели уровень Critical по кибербезопасности — агентам с доступом в сеть нужен egress-лимит.
openai.com/index/gpt-6-astra/
🤯
Mozilla взяла Mistral, а не OpenAI с Google. Firefox Smart Window — ИИ-ассистент браузера — с 16 сентября работает на Mistral Small 4: США, Канада и Франция, Британия и Германия до конца года.
Что это меняет: в Chrome ассистент один и навязанный, здесь три модели на выбор плюс свой эндпоинт. Чаты не хранятся на серверах Mozilla, Mistral подписал zero data retention, запрос идёт через сервер Mozilla — модель видит его IP, а не твой. «Память» о просмотренном считается на сервере, но лежит локально на устройстве и сама истекает, приватные окна не попадают.
Применить: обнови Firefox, включи Smart Window (бета, opt-in) из тулбара и переключи модель в настройках — или подставь свой API-эндпоинт, тогда запрос уйдёт напрямую, минуя Mozilla.
Честная оговорка: это не локальный ИИ. Контекст вкладок всё равно уходит в облако, и «приватность» держится на политике и договоре, а не на железе.
https://blog.mozilla.org/en/firefox/mozilla-mistral-partnership/ 👀
Что это меняет: в Chrome ассистент один и навязанный, здесь три модели на выбор плюс свой эндпоинт. Чаты не хранятся на серверах Mozilla, Mistral подписал zero data retention, запрос идёт через сервер Mozilla — модель видит его IP, а не твой. «Память» о просмотренном считается на сервере, но лежит локально на устройстве и сама истекает, приватные окна не попадают.
Применить: обнови Firefox, включи Smart Window (бета, opt-in) из тулбара и переключи модель в настройках — или подставь свой API-эндпоинт, тогда запрос уйдёт напрямую, минуя Mozilla.
Честная оговорка: это не локальный ИИ. Контекст вкладок всё равно уходит в облако, и «приватность» держится на политике и договоре, а не на железе.
https://blog.mozilla.org/en/firefox/mozilla-mistral-partnership/ 👀
744 млрд параметров под MIT выложили без единого анонса.
Shanghai AI Lab 11 сентября тихо залила на Hugging Face Atria Dawn Preview — агентскую MoE на базе GLM-5.2: 40 млрд активных параметров из 744, контекст 256K, только текст. Веса — 1,5 ТБ в BF16 или 756 ГБ в FP8, лицензия MIT, можно даже продавать. Статья на arXiv — только 14-го, пресс-релиз — 15-го.
Цифры вендорские, но прикладные: BrowseComp 92,5 против 92,2 у GPT-5.6 Sol, AutomationBench 53,8 против 45,7 у Sol, CyberGym 86,5. В коде отстаёт: SWE-bench Pro 59,6 против 74,7 у Opus 5.
Как применить сегодня: открытый OpenAI-совместимый эндпоинт api.atria-asi.ai — вписываешь провайдером в ~/.codex/config.toml и гоняешь свои задачи бесплатно. Локально — SGLang 0.5.13+ или vLLM 0.23.0+ и место под 1,5 ТБ.
В демо за 45 тысяч шагов она собрала глобальный прогноз погоды на 100+ ГБ данных: 69 переменных, неделя вперёд за минуту. Для research-цикла подарок, для прод-кода пока нет 🤔
https://huggingface.co/internlm/Atria-Dawn-Preview
Shanghai AI Lab 11 сентября тихо залила на Hugging Face Atria Dawn Preview — агентскую MoE на базе GLM-5.2: 40 млрд активных параметров из 744, контекст 256K, только текст. Веса — 1,5 ТБ в BF16 или 756 ГБ в FP8, лицензия MIT, можно даже продавать. Статья на arXiv — только 14-го, пресс-релиз — 15-го.
Цифры вендорские, но прикладные: BrowseComp 92,5 против 92,2 у GPT-5.6 Sol, AutomationBench 53,8 против 45,7 у Sol, CyberGym 86,5. В коде отстаёт: SWE-bench Pro 59,6 против 74,7 у Opus 5.
Как применить сегодня: открытый OpenAI-совместимый эндпоинт api.atria-asi.ai — вписываешь провайдером в ~/.codex/config.toml и гоняешь свои задачи бесплатно. Локально — SGLang 0.5.13+ или vLLM 0.23.0+ и место под 1,5 ТБ.
В демо за 45 тысяч шагов она собрала глобальный прогноз погоды на 100+ ГБ данных: 69 переменных, неделя вперёд за минуту. Для research-цикла подарок, для прод-кода пока нет 🤔
https://huggingface.co/internlm/Atria-Dawn-Preview