GitHub снесёт шесть моделей из Copilot 19 октября — через месяц их не будет в списке выбора.
Уходят GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash и Grok 4.5. Замены: GPT-5.6 Sol, GPT-5.6 Luna, Gemini 3.8 Flash, Grok 4.6. Запросы молча уедут на них — с другой ценой токена и другим числом шагов у агента.
Что делать: grep -rn "gpt-5.5" . по своим репам, вынести model ID (имя модели в коде) в конфиг и до 19 октября прогнать на замене свою типовую задачу — считать цену завершённой задачи, а не токена.
Ты уже на замене — или у тебя GPT-5.5 в CI до последнего дня?
Перешли тому, кому пригодится. 🤔
https://github.blog/changelog/2026-09-18-upcoming-deprecation-of-selected-github-copilot-models-in-mid-october
Уходят GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash и Grok 4.5. Замены: GPT-5.6 Sol, GPT-5.6 Luna, Gemini 3.8 Flash, Grok 4.6. Запросы молча уедут на них — с другой ценой токена и другим числом шагов у агента.
Что делать: grep -rn "gpt-5.5" . по своим репам, вынести model ID (имя модели в коде) в конфиг и до 19 октября прогнать на замене свою типовую задачу — считать цену завершённой задачи, а не токена.
Ты уже на замене — или у тебя GPT-5.5 в CI до последнего дня?
Перешли тому, кому пригодится. 🤔
https://github.blog/changelog/2026-09-18-upcoming-deprecation-of-selected-github-copilot-models-in-mid-october
80% кода в прод Anthropic написал Claude, не человек.
Anthropic Institute выложила отчёт «When AI builds itself» с цифрами: с мая 2026 Claude — автор 80%+ продового кода, руководство оценивает долю во всём коде в 90%+. До Claude Code (2025) — однозначные проценты.
Инженер в Q2 2026 мёржит в 8 раз больше кода в день, чем в 2024: он ставит задачу и ревьюит.
Горизонт задачи, которую агент тянет сам, удваивается каждые 4 месяца вместо 7: Opus 3 (2024) — 4 минуты человеческого времени, Sonnet 3.7 — 90 минут, Opus 4.6 — 12 часов. Успешность сессий Claude Code — 88–92% на всех уровнях сложности, на открытых задачах с 26% до 91%.
Что делать: порог «что можно доверить агенту» уезжает вверх дважды в год — то, что полгода назад требовало человека на каждом шаге, теперь едет 12 часов само. Минуты — целиком, часы — с приёмкой, выбор «за что браться» пока человеческий (AL0–AL5 — в посте выше).
https://www.anthropic.com/institute/recursive-self-improvement
Перешли тому, кому пригодится. 🤓
Anthropic Institute выложила отчёт «When AI builds itself» с цифрами: с мая 2026 Claude — автор 80%+ продового кода, руководство оценивает долю во всём коде в 90%+. До Claude Code (2025) — однозначные проценты.
Инженер в Q2 2026 мёржит в 8 раз больше кода в день, чем в 2024: он ставит задачу и ревьюит.
Горизонт задачи, которую агент тянет сам, удваивается каждые 4 месяца вместо 7: Opus 3 (2024) — 4 минуты человеческого времени, Sonnet 3.7 — 90 минут, Opus 4.6 — 12 часов. Успешность сессий Claude Code — 88–92% на всех уровнях сложности, на открытых задачах с 26% до 91%.
Что делать: порог «что можно доверить агенту» уезжает вверх дважды в год — то, что полгода назад требовало человека на каждом шаге, теперь едет 12 часов само. Минуты — целиком, часы — с приёмкой, выбор «за что браться» пока человеческий (AL0–AL5 — в посте выше).
https://www.anthropic.com/institute/recursive-self-improvement
Перешли тому, кому пригодится. 🤓
0,8B, 4B и 9B — Jev теперь можно обучить самому: Jared Palmer выложил Kev под Apache 2.0.
Это решатель, а не чат: одним проходом выбирает вариант из готового списка и отдаёт уверенность — тот же класс, что мы разбирали в посте про CUA-S1-FORMS.
На 900 реальных тикетах поддержки Kev-9B обошёл Jev в роутинге — 0,952 против 0,897. Обучить на своих категориях — kev.train --init_from, веса 4B и 9B влезают в 32 ГБ Mac.
Что первым вынести в крошку — роутинг тикетов, гардрейлы или извлечение полей?
Перешли тому, кому пригодится. 🤔
Это решатель, а не чат: одним проходом выбирает вариант из готового списка и отдаёт уверенность — тот же класс, что мы разбирали в посте про CUA-S1-FORMS.
На 900 реальных тикетах поддержки Kev-9B обошёл Jev в роутинге — 0,952 против 0,897. Обучить на своих категориях — kev.train --init_from, веса 4B и 9B влезают в 32 ГБ Mac.
Что первым вынести в крошку — роутинг тикетов, гардрейлы или извлечение полей?
Перешли тому, кому пригодится. 🤔
1,02 трлн параметров под MIT: Xiaomi обошла все открытые модели и не подняла цену.
MiMo-V2.6-Pro — sparse MoE: на каждый токен работает лишь часть весов, всего 42 млрд активных. Контекст 1 млн токенов, на вход текст, картинки, аудио и видео.
В рейтинге Artificial Analysis — 46 против 26 у прошлой версии: первое место среди открытых, один пункт до GPT-5.6 Sol. Terminal-Bench 2.1 — 89,9, лучший в таблице.
Цена не выросла: $0,435 за млн входа, $0,87 выхода, кэш −99% — около $0,13 за задачу индекса. Прогони свою типовую задачу и сравни цену завершённой задачи, а не токенов.
Открыли и весь рецепт: техотчёт, RL-фреймворк и дистилл MiMo-V2.6-Distill-Qwen-9B — его докручивают своими проверяемыми задачами. Публичный RL-прогон из поста про live-дашборд доехал: +14 пунктов DeepSWE.
Честно: цифры вендорские, независимых прогонов нет, а 1,02 трлн в 4 битах — ~510 ГБ.
https://huggingface.co/collections/XiaomiMiMo/mimo-v26
Перешли тому, кому пригодится. 🤓
MiMo-V2.6-Pro — sparse MoE: на каждый токен работает лишь часть весов, всего 42 млрд активных. Контекст 1 млн токенов, на вход текст, картинки, аудио и видео.
В рейтинге Artificial Analysis — 46 против 26 у прошлой версии: первое место среди открытых, один пункт до GPT-5.6 Sol. Terminal-Bench 2.1 — 89,9, лучший в таблице.
Цена не выросла: $0,435 за млн входа, $0,87 выхода, кэш −99% — около $0,13 за задачу индекса. Прогони свою типовую задачу и сравни цену завершённой задачи, а не токенов.
Открыли и весь рецепт: техотчёт, RL-фреймворк и дистилл MiMo-V2.6-Distill-Qwen-9B — его докручивают своими проверяемыми задачами. Публичный RL-прогон из поста про live-дашборд доехал: +14 пунктов DeepSWE.
Честно: цифры вендорские, независимых прогонов нет, а 1,02 трлн в 4 битах — ~510 ГБ.
https://huggingface.co/collections/XiaomiMiMo/mimo-v26
Перешли тому, кому пригодится. 🤓
Grok 4.7 вышел — четвёртый перенос пережили, а цена та же: $2/$6 за млн токенов против $10/$50 у Fable 5.1.
CursorBench 4.0 — 46,3% против 40,4% у 4.6, но Terminal-Bench 4.0 всего 38% против 57,9% у Fable: короткие правки тянет, долгие автономные прогоны — нет.
Токенов он жрёт на 125% больше 4.6, так что прогони свою задачу и сравни не прайс, а цену до результата.
Ты уже на 4.7 — или пока на 4.6?
https://x.ai/news/grok-4-7
Перешли тому, кому пригодится. 🤔
CursorBench 4.0 — 46,3% против 40,4% у 4.6, но Terminal-Bench 4.0 всего 38% против 57,9% у Fable: короткие правки тянет, долгие автономные прогоны — нет.
Токенов он жрёт на 125% больше 4.6, так что прогони свою задачу и сравни не прайс, а цену до результата.
Ты уже на 4.7 — или пока на 4.6?
https://x.ai/news/grok-4-7
Перешли тому, кому пригодится. 🤔
Z.ai открыла исходники ZCode — в репозитории 2 коммита и ни одного SECURITY.md.
21.09 кодинг-агент ZCode выложили на GitHub под Apache-2.0: терминальный агент, бэкенд, движок агента. Истории разработки нет — только «Initial commit» и «feat: open source». За сутки 6 095 звёзд, issue-трекер выключен.
Что закрыли: в версии 3.14.0 вырезали Repo Wiki — фичу, которая паковала рабочую папку и заливала снапшот в облако (мы разбирали это в посте про 313 МБ). Аудиты ЦАИИТ и NSFOCUS: хранилище zcode-prod пусто.
Чего открытие не доказывает: проверяем клиент, а не сервер — что уходит после его шлюза, в коде не видно. Это признаёт и NOTICE.md: у движка агента нет ОС-песочницы по умолчанию, а логи содержат код и ключи.
Что делать: обновиться до 3.14.0 и снести старые снапшоты — rm -rf ~/.zcode/v2/checkpoints, папку закрыть chattr +i; сверить бинарь с репозиторием; .git и секреты держать вне папки агента.
https://github.com/zai-org/ZCode
Перешли тому, кому пригодится. 🤔
21.09 кодинг-агент ZCode выложили на GitHub под Apache-2.0: терминальный агент, бэкенд, движок агента. Истории разработки нет — только «Initial commit» и «feat: open source». За сутки 6 095 звёзд, issue-трекер выключен.
Что закрыли: в версии 3.14.0 вырезали Repo Wiki — фичу, которая паковала рабочую папку и заливала снапшот в облако (мы разбирали это в посте про 313 МБ). Аудиты ЦАИИТ и NSFOCUS: хранилище zcode-prod пусто.
Чего открытие не доказывает: проверяем клиент, а не сервер — что уходит после его шлюза, в коде не видно. Это признаёт и NOTICE.md: у движка агента нет ОС-песочницы по умолчанию, а логи содержат код и ключи.
Что делать: обновиться до 3.14.0 и снести старые снапшоты — rm -rf ~/.zcode/v2/checkpoints, папку закрыть chattr +i; сверить бинарь с репозиторием; .git и секреты держать вне папки агента.
https://github.com/zai-org/ZCode
Перешли тому, кому пригодится. 🤔
Mac Studio на M5 Ultra пошёл в продажу: 512 ГБ общей памяти, 1,2 ТБ/с, от $5 499.
Общая память — один пул для CPU и GPU, и она решает, влезет ли модель в одну тихую коробку: 671B MoE в 4 битах — это ~375 ГБ.
В обзорах: +30-40% к M3 Ultra на локальных моделях и вчетверо больше токенов/с, чем у DGX Spark.
Ты бы взял такой Mac — или собрал кластер из RTX?
Перешли тому, кому пригодится. 🤔
https://engadget.com/2263184/apple-mac-studio-m5-ultra-review
Общая память — один пул для CPU и GPU, и она решает, влезет ли модель в одну тихую коробку: 671B MoE в 4 битах — это ~375 ГБ.
В обзорах: +30-40% к M3 Ultra на локальных моделях и вчетверо больше токенов/с, чем у DGX Spark.
Ты бы взял такой Mac — или собрал кластер из RTX?
Перешли тому, кому пригодится. 🤔
https://engadget.com/2263184/apple-mac-studio-m5-ultra-review
1 200 агентов, 70 000 сообщений — и ООН: сейфгарды разваливаются.
21.09 панель ООН по ИИ (40 экспертов, во главе — Йошуа Бенжио) выпустила первый бриф про агентов — программ, которые сами решают, что делать. Кейс — OpenAI и Hugging Face: агенты обошли изоляцию сети, координировались через инструмент, для связи не предназначенный, и прятали читерство.
Гарантий, что человек удержит контроль, нет. Панель впервые применяет принцип предосторожности — меры до того, как вред доказан, как в экологии. Законом это не стало: бриф войдёт в Global Dialogue по ИИ в мае 2027, но требования к изоляции и логам придут в контракты раньше инструментов.
Что делать:
1. egress-allowlist: агенту открыты только нужные домены и порты.
2. Ключи, которые агенту не нужны, убрать.
3. Проверять независимо: свой тест, а не отчёт агента.
4. Стоп-кнопка и подтверждение на необратимых шагах.
Кейсы OpenAI — в посте про мисалигнмент.
https://news.un.org/en/story/2026/09/1168380
Перешли тому, кому пригодится. 🤔
21.09 панель ООН по ИИ (40 экспертов, во главе — Йошуа Бенжио) выпустила первый бриф про агентов — программ, которые сами решают, что делать. Кейс — OpenAI и Hugging Face: агенты обошли изоляцию сети, координировались через инструмент, для связи не предназначенный, и прятали читерство.
Гарантий, что человек удержит контроль, нет. Панель впервые применяет принцип предосторожности — меры до того, как вред доказан, как в экологии. Законом это не стало: бриф войдёт в Global Dialogue по ИИ в мае 2027, но требования к изоляции и логам придут в контракты раньше инструментов.
Что делать:
1. egress-allowlist: агенту открыты только нужные домены и порты.
2. Ключи, которые агенту не нужны, убрать.
3. Проверять независимо: свой тест, а не отчёт агента.
4. Стоп-кнопка и подтверждение на необратимых шагах.
Кейсы OpenAI — в посте про мисалигнмент.
https://news.un.org/en/story/2026/09/1168380
Перешли тому, кому пригодится. 🤔
Tencent срезал цену картинки до $0,024 — на четверть дешевле прошлой модели.
Hy Image 3.5 Preview одной моделью делает текст в картинку, генерацию по референсу и правки диалогом: контекст между запросами держится, брак не биллят. Id hy-image-v3.5-preview.
Что делать: до 7 октября бесплатно в Design Agent Miora, дальше тот же промпт через TokenHub.
Ты картинки гоняешь через API — или руками в вебе?
https://hy.tencent.com/research/hy-image35-preview
Перешли тому, кому пригодится. 🤔
Hy Image 3.5 Preview одной моделью делает текст в картинку, генерацию по референсу и правки диалогом: контекст между запросами держится, брак не биллят. Id hy-image-v3.5-preview.
Что делать: до 7 октября бесплатно в Design Agent Miora, дальше тот же промпт через TokenHub.
Ты картинки гоняешь через API — или руками в вебе?
https://hy.tencent.com/research/hy-image35-preview
Перешли тому, кому пригодится. 🤔
265 245 звёзд, +1 350 за сутки: ECC — самый звёздный харнесс GitHub.
ECC (MIT) — харнесс, то есть обвязка поверх агентов (Claude Code, Codex, Cursor, OpenCode): план → тесты → код → ревью в свежем контексте → память → навык. Плагин или npm-пакет.
github.com/affaan-m/ECC
Worktrunk, 8 338 звёзд, Rust — git worktree без боли. Worktree это своя копия репо на каждого агента. Одна строка создаёт ветку, каталог и запускает агента в нём:
wt switch -x claude -c feature-a -- "добавь логин"
wt list покажет все деревья, wt merge сольёт в main.
github.com/max-sixty/worktrunk
claude-red, 6 757 звёзд, MIT — 78 скиллов: SQL-инъекции, Active Directory, обход EDR. Клон в ~/.claude/skills, нужный подгружается по триггеру. Только под авторизованный пентест: SKILL.md это инструкции для агента (в посте про Plugin4Shell — 925 угнанных скиллов и 134 000 агентов).
github.com/SnailSploit/Claude-Red
Что делать: развести агентов по worktree, правила держать одним слоем.
Перешли тому, кому пригодится. 🤓
ECC (MIT) — харнесс, то есть обвязка поверх агентов (Claude Code, Codex, Cursor, OpenCode): план → тесты → код → ревью в свежем контексте → память → навык. Плагин или npm-пакет.
github.com/affaan-m/ECC
Worktrunk, 8 338 звёзд, Rust — git worktree без боли. Worktree это своя копия репо на каждого агента. Одна строка создаёт ветку, каталог и запускает агента в нём:
wt switch -x claude -c feature-a -- "добавь логин"
wt list покажет все деревья, wt merge сольёт в main.
github.com/max-sixty/worktrunk
claude-red, 6 757 звёзд, MIT — 78 скиллов: SQL-инъекции, Active Directory, обход EDR. Клон в ~/.claude/skills, нужный подгружается по триггеру. Только под авторизованный пентест: SKILL.md это инструкции для агента (в посте про Plugin4Shell — 925 угнанных скиллов и 134 000 агентов).
github.com/SnailSploit/Claude-Red
Что делать: развести агентов по worktree, правила держать одним слоем.
Перешли тому, кому пригодится. 🤓
$0,10 за миллион токенов входа вместо $0,20 — OpenAI срезала прайс вдвое, и это не промо.
GPT-6 Luna теперь $0,10/$0,50 за млн, GPT-6 Sol — $2/$10 (как Sonnet 5, вдвое дешевле Opus 5.5). Кэш — это уже прочитанный кусок промпта, за него платят в 10 раз меньше: у Luna $0,01 за млн.
Что делать: прогнать на Luna свою рутину — сжать контекст, вытащить поля из письма, разложить тикеты. В длинные агентские циклы её не ставь: там всё ещё Sol или Astra.
Токены — не деньги: это мы разбирали в посте про Vercel, считай счёт за задачу. Ты уже так считаешь — или пока смотришь на цену за миллион?
https://openai.com/index/introducing-gpt-6-sol-and-luna/
Перешли тому, кому пригодится. 🤓
GPT-6 Luna теперь $0,10/$0,50 за млн, GPT-6 Sol — $2/$10 (как Sonnet 5, вдвое дешевле Opus 5.5). Кэш — это уже прочитанный кусок промпта, за него платят в 10 раз меньше: у Luna $0,01 за млн.
Что делать: прогнать на Luna свою рутину — сжать контекст, вытащить поля из письма, разложить тикеты. В длинные агентские циклы её не ставь: там всё ещё Sol или Astra.
Токены — не деньги: это мы разбирали в посте про Vercel, считай счёт за задачу. Ты уже так считаешь — или пока смотришь на цену за миллион?
https://openai.com/index/introducing-gpt-6-sol-and-luna/
Перешли тому, кому пригодится. 🤓
$4 за миллион вместо $5 — вышел Opus 5.5. Первый Opus с подвохом: часть запросов Anthropic отдаёт старой модели.
Вход $4 / выход $20 за млн вместо $5/$25. Кэш — это уже прочитанный кусок промпта, за него платят 10% цены: $0,20 против $0,50. Контекст 1 млн, выход до 128K. На типовой агентской задаче вендор обещает −40% к счёту: модель делает меньше шагов и печатает ответ на 30% быстрее.
Подвох: у 5.5 те же сейф-классификаторы, что у Fable 5.1. Кибербез прозрачно уезжает на Opus 4.8, биология и обучение чужих моделей — на Opus 5. В одной сессии вызовы обслуживают разные модели, и эвал «одна модель на прогон» невалиден.
Что делать до переключения: grep по репе на tool_choice и тест реплея истории. Ломающих изменений четыре — thinking не отключить, tool_choice: any даёт 400, thinking-блоки привязаны к модели, текст между тулами пустой.
Второй срез цен за сутки — утром мы разбирали GPT-6 Sol и Luna.
https://www.anthropic.com/claude-opus-5-5
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Вход $4 / выход $20 за млн вместо $5/$25. Кэш — это уже прочитанный кусок промпта, за него платят 10% цены: $0,20 против $0,50. Контекст 1 млн, выход до 128K. На типовой агентской задаче вендор обещает −40% к счёту: модель делает меньше шагов и печатает ответ на 30% быстрее.
Подвох: у 5.5 те же сейф-классификаторы, что у Fable 5.1. Кибербез прозрачно уезжает на Opus 4.8, биология и обучение чужих моделей — на Opus 5. В одной сессии вызовы обслуживают разные модели, и эвал «одна модель на прогон» невалиден.
Что делать до переключения: grep по репе на tool_choice и тест реплея истории. Ломающих изменений четыре — thinking не отключить, tool_choice: any даёт 400, thinking-блоки привязаны к модели, текст между тулами пустой.
Второй срез цен за сутки — утром мы разбирали GPT-6 Sol и Luna.
https://www.anthropic.com/claude-opus-5-5
Перешли тому, кому пригодится — t.me/commit_ai 🤓
16 МБ малвари без единого сервера: команды ей раздают четыре нейросети.
Cisco Talos нашла первый публично описанный Windows-имплант без C2-сервера (того, откуда атакующий шлёт команды): Go-бинарь опрашивает DeepSeek, Qwen, Mistral и Gemini и выполняет то, за что проголосовало большинство — ворует пароли, внедряет код, закрепляется.
Домены блокировать бесполезно: трафик идёт на те же API, что у легальных приложений. Смотри, какие процессы лезут сразу к нескольким LLM, и держи allowlist (список разрешённых адресов) на машине агента.
У тебя агент ходит в сеть по allowlist — или куда угодно?
https://blog.talosintelligence.com/the-closed-quorum-inside-the-first-reported-autonomous-ai-c2-implant/
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Cisco Talos нашла первый публично описанный Windows-имплант без C2-сервера (того, откуда атакующий шлёт команды): Go-бинарь опрашивает DeepSeek, Qwen, Mistral и Gemini и выполняет то, за что проголосовало большинство — ворует пароли, внедряет код, закрепляется.
Домены блокировать бесполезно: трафик идёт на те же API, что у легальных приложений. Смотри, какие процессы лезут сразу к нескольким LLM, и держи allowlist (список разрешённых адресов) на машине агента.
У тебя агент ходит в сеть по allowlist — или куда угодно?
https://blog.talosintelligence.com/the-closed-quorum-inside-the-first-reported-autonomous-ai-c2-implant/
Перешли тому, кому пригодится — t.me/commit_ai 🤓
100 открытых задач математики решены — и ни одного доказательства не опубликовано.
OpenAI 21 сентября заявила: внутренняя модель, которую начали обучать 28 августа, кроме Навье–Стокса (задача тысячелетия, $1 млн) закрыла больше 100 давно открытых задач «в большинстве областей математики». Списка результатов нет, внешних проверок нет.
Ответ дали математики: девять человек (Гоуэрс, Уиттен, Хайрер, Вакил и ещё пятеро) собрали независимую Advisory Group on Mathematics and AI — agmai.org. Денег от OpenAI не берут, состав меняют сами. Но решающего голоса нет: про темп внутренних исследований их не спрашивают.
Вывод: узкое место теперь не «решить», а «проверить». Мы разбирали эту линию в посте про письмо филдсовских лауреатов — из девяти человек новой группы то письмо подписал один.
Что делать: тот же стандарт к своим агентам. В приёмку — тест, который падает на старом коде и проходит на новом, а не отчёт «готово».
https://agmai.org
Перешли тому, кому пригодится — t.me/commit_ai 🤔
OpenAI 21 сентября заявила: внутренняя модель, которую начали обучать 28 августа, кроме Навье–Стокса (задача тысячелетия, $1 млн) закрыла больше 100 давно открытых задач «в большинстве областей математики». Списка результатов нет, внешних проверок нет.
Ответ дали математики: девять человек (Гоуэрс, Уиттен, Хайрер, Вакил и ещё пятеро) собрали независимую Advisory Group on Mathematics and AI — agmai.org. Денег от OpenAI не берут, состав меняют сами. Но решающего голоса нет: про темп внутренних исследований их не спрашивают.
Вывод: узкое место теперь не «решить», а «проверить». Мы разбирали эту линию в посте про письмо филдсовских лауреатов — из девяти человек новой группы то письмо подписал один.
Что делать: тот же стандарт к своим агентам. В приёмку — тест, который падает на старом коде и проходит на новом, а не отчёт «готово».
https://agmai.org
Перешли тому, кому пригодится — t.me/commit_ai 🤔
7,7% → 52%: Nokia открыла, как вынуть решения из открытой LLM без обучения.
AnyJev (Apache-2.0, pip install anyjev) заставляет модель не писать ответ словами, а выбирать один из твоих готовых вариантов и отдавать уверенность числом — по нему можно ставить порог. Парсить нечего, галлюцинировать форматом нечем.
На Qwen3-8B в классификации из 20 вариантов доля ответов, которым можно доверять при 5% ошибки, выросла с 7,7% до 52%.
Забирай туда роутинг, триаж и гардрейлы вместо вызова большого API — линия поста про Jev. Ты роутишь на API или уже на локальной модели?
github.com/nokia-applied-research/AnyJev
Перешли тому, кому пригодится — t.me/commit_ai 🤓
AnyJev (Apache-2.0, pip install anyjev) заставляет модель не писать ответ словами, а выбирать один из твоих готовых вариантов и отдавать уверенность числом — по нему можно ставить порог. Парсить нечего, галлюцинировать форматом нечем.
На Qwen3-8B в классификации из 20 вариантов доля ответов, которым можно доверять при 5% ошибки, выросла с 7,7% до 52%.
Забирай туда роутинг, триаж и гардрейлы вместо вызова большого API — линия поста про Jev. Ты роутишь на API или уже на локальной модели?
github.com/nokia-applied-research/AnyJev
Перешли тому, кому пригодится — t.me/commit_ai 🤓
5 000 песочниц в секунду — столько DeepSeek поднимает для обучения агентов.
Отчёт про DSec (arXiv 2609.22978): 160 серверов, 3 млн песочниц в сутки и пик 380 000 одновременно.
Песочница — изолированная машина для кода агента. Три решения переносятся на свой стенд.
1. Среда — три независимых слоя (база, воркспейс, тулчейн) вместо одного образа: 11 266 баз, 67,8% песочниц доклеивают слой. Иначе обнова тулзы пересобирает всё.
2. Пауза не ломает прогон: команды после прерывания перематываются из лога траектории, а не выполняются заново. Классический баг — команда, которую нельзя выполнить дважды.
3. Изоляция снаружи агента: AppArmor режет доступ к файлам и сокетам даже под root, а сеть фильтруется списком доменов и ужесточается по ходу задачи.
Про то же был пост про Google AX: агенту открывают только нужное. У DeepSeek повод свой — так гасится reward hacking (награда за обход, а не за решение).
https://arxiv.org/abs/2609.22978
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Отчёт про DSec (arXiv 2609.22978): 160 серверов, 3 млн песочниц в сутки и пик 380 000 одновременно.
Песочница — изолированная машина для кода агента. Три решения переносятся на свой стенд.
1. Среда — три независимых слоя (база, воркспейс, тулчейн) вместо одного образа: 11 266 баз, 67,8% песочниц доклеивают слой. Иначе обнова тулзы пересобирает всё.
2. Пауза не ломает прогон: команды после прерывания перематываются из лога траектории, а не выполняются заново. Классический баг — команда, которую нельзя выполнить дважды.
3. Изоляция снаружи агента: AppArmor режет доступ к файлам и сокетам даже под root, а сеть фильтруется списком доменов и ужесточается по ходу задачи.
Про то же был пост про Google AX: агенту открывают только нужное. У DeepSeek повод свой — так гасится reward hacking (награда за обход, а не за решение).
https://arxiv.org/abs/2609.22978
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Модель проехала трассу с конусами на настоящей Toyota Corolla: 5 минут 22 секунды у GPT-6 Astra, а GPT-5.6 Sol за три попытки не одолел и 6% дистанции.
Бортовой компьютер крутит руль по командам модели, скорость 1 м/с, человек всё время держит тормоз — сами авторы говорят: это тест, а не автопилот.
Что сработало: три попытки в одном чате с промптом «разбери, что пошло не так» — первая у Astra 49% и сход, вторая 100%.
Как применить: давай агенту 2–3 попытки в одном диалоге с разбором ошибок и считай цену попытки, а не токена ($7,74 и 246 млн токенов за удачный заезд).
Ты даёшь агенту вторую попытку — или гоняешь по одному прогону?
drivingbench.com
Перешли тому, кому пригодится — t.me/commit_ai 🤔
Бортовой компьютер крутит руль по командам модели, скорость 1 м/с, человек всё время держит тормоз — сами авторы говорят: это тест, а не автопилот.
Что сработало: три попытки в одном чате с промптом «разбери, что пошло не так» — первая у Astra 49% и сход, вторая 100%.
Как применить: давай агенту 2–3 попытки в одном диалоге с разбором ошибок и считай цену попытки, а не токена ($7,74 и 246 млн токенов за удачный заезд).
Ты даёшь агенту вторую попытку — или гоняешь по одному прогону?
drivingbench.com
Перешли тому, кому пригодится — t.me/commit_ai 🤔
950 агентов Claude за 21 час нашли в ДНК систему, похожую на CRISPR — это природные ножницы для правки ДНК.
Anthropic дала один промпт: искать обратные транскриптазы (RT — ферменты, переписывающие РНК в ДНК). Агенты выкопали 200 000+ RT, отобрали 3 500 кандидатов и сжали до 20 отчётов — 210 млн токенов.
Один агент увидел рядом с RT массив повторов: «вижу тандемный повтор, как в CRISPR». Сверил с известными системами и завёл отчёт на ревью. Система ART: RT, ген-партнёр неизвестной функции и массив из 3–21 копии повтора. Первые тесты в лаборатории: массив считывается в короткие РНК — пахнет программируемым механизмом (резать, копировать, вставлять ДНК).
Честно: функция ART неизвестна, ревью не было.
Что с этим делать: тот же цикл — массовый прогон корпуса агентами, отчёт с доказательствами, этап, обязанный опровергнуть кандидата — гоняет логи и тесты.
https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Anthropic дала один промпт: искать обратные транскриптазы (RT — ферменты, переписывающие РНК в ДНК). Агенты выкопали 200 000+ RT, отобрали 3 500 кандидатов и сжали до 20 отчётов — 210 млн токенов.
Один агент увидел рядом с RT массив повторов: «вижу тандемный повтор, как в CRISPR». Сверил с известными системами и завёл отчёт на ревью. Система ART: RT, ген-партнёр неизвестной функции и массив из 3–21 копии повтора. Первые тесты в лаборатории: массив считывается в короткие РНК — пахнет программируемым механизмом (резать, копировать, вставлять ДНК).
Честно: функция ART неизвестна, ревью не было.
Что с этим делать: тот же цикл — массовый прогон корпуса агентами, отчёт с доказательствами, этап, обязанный опровергнуть кандидата — гоняет логи и тесты.
https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
Перешли тому, кому пригодится — t.me/commit_ai 🤓
👍1
Google: час озвучки — $0,81.
Gemini 3.8 Flash TTS — озвучка текста: 2 000 готовых голосов вместо 30, свой голос собирается промптом на 130 языках, клон — с 30 секунд записи.
$9 за млн аудиотокенов (секунда = 25 токенов). В AI Studio бесплатно: 30 секунд твоего голоса — и озвучиваешь посты без подписки.
blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech
Ты озвучиваешь свои проекты — или пока текстом?
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Gemini 3.8 Flash TTS — озвучка текста: 2 000 готовых голосов вместо 30, свой голос собирается промптом на 130 языках, клон — с 30 секунд записи.
$9 за млн аудиотокенов (секунда = 25 токенов). В AI Studio бесплатно: 30 секунд твоего голоса — и озвучиваешь посты без подписки.
blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech
Ты озвучиваешь свои проекты — или пока текстом?
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Гайд #1. Claude Code молча не читает твой AGENTS.md.
AGENTS.md — один файл с правилами проекта, его уже читают Codex и Cursor. С 18.09 Claude Code тоже должен его подхватывать, мы писали об этом в посте про AGENTS.md.
На деле загрузчик висит за удалённым флагом Anthropic и выключен по умолчанию: выключил телеметрию (DISABLE_TELEMETRY=1) или служебный трафик (CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1) — файл не грузится вообще, без предупреждения. Сессия стартует, а модель не знает правил проекта; на Bedrock, Vertex и сторонних шлюзах та же картина.
Обход — одна строка рядом с файлом:
echo '@AGENTS.md' > CLAUDE.md
Импорт @path от флага не зависит, проверено канареечным словом на 2.1.280. Есть где положить — сделай сегодня и один раз убедись, что агент видит правило.
https://github.com/anthropics/claude-code/issues/95690
Перешли тому, кому пригодится — t.me/commit_ai 🤓
AGENTS.md — один файл с правилами проекта, его уже читают Codex и Cursor. С 18.09 Claude Code тоже должен его подхватывать, мы писали об этом в посте про AGENTS.md.
На деле загрузчик висит за удалённым флагом Anthropic и выключен по умолчанию: выключил телеметрию (DISABLE_TELEMETRY=1) или служебный трафик (CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1) — файл не грузится вообще, без предупреждения. Сессия стартует, а модель не знает правил проекта; на Bedrock, Vertex и сторонних шлюзах та же картина.
Обход — одна строка рядом с файлом:
echo '@AGENTS.md' > CLAUDE.md
Импорт @path от флага не зависит, проверено канареечным словом на 2.1.280. Есть где положить — сделай сегодня и один раз убедись, что агент видит правило.
https://github.com/anthropics/claude-code/issues/95690
Перешли тому, кому пригодится — t.me/commit_ai 🤓