Гайд #1: модель на 105 ГБ живёт на Mac, где всего 48 ГБ памяти.
Qwen3.8-Flash-Next — 125 млрд параметров, 104 ГБ в сжатом виде: локально такое не влезает. Проект slotstream держит на SSD части модели, которые сейчас не нужны, и подгружает только работающие — это «смесь экспертов», на каждый токен считаются не все параметры.
Скорость: 15,86 токена в секунду на M5 Pro с 48 ГБ (токен — кусок слова, около 11 слов в секунду), 6–16 токенов на 24–48 ГБ. Нужен Apple Silicon, macOS 14 и ~110 ГБ свободного диска.
Установка одной командой:
curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh
Дальше slotstream doctor проверит память и диск, а slotstream run --prompt "..." скачает модель один раз и ответит. Работает офлайн, без Python и облака.
Что делать: есть Mac на 32–64 ГБ и платишь за API — поставь и проверь на своих задачах. Для приватного — переписка, документы, свой код — хватает.
https://github.com/carloslfu/slotstream
Перешли тому, кто платит за API. 🤩
Qwen3.8-Flash-Next — 125 млрд параметров, 104 ГБ в сжатом виде: локально такое не влезает. Проект slotstream держит на SSD части модели, которые сейчас не нужны, и подгружает только работающие — это «смесь экспертов», на каждый токен считаются не все параметры.
Скорость: 15,86 токена в секунду на M5 Pro с 48 ГБ (токен — кусок слова, около 11 слов в секунду), 6–16 токенов на 24–48 ГБ. Нужен Apple Silicon, macOS 14 и ~110 ГБ свободного диска.
Установка одной командой:
curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh
Дальше slotstream doctor проверит память и диск, а slotstream run --prompt "..." скачает модель один раз и ответит. Работает офлайн, без Python и облака.
Что делать: есть Mac на 32–64 ГБ и платишь за API — поставь и проверь на своих задачах. Для приватного — переписка, документы, свой код — хватает.
https://github.com/carloslfu/slotstream
Перешли тому, кто платит за API. 🤩
2,8 МБ весов обыграли большую модель на заполнении форм: 99,7% против 83,6% у Jev.
Cua выложила CUA-S1-FORMS под MIT — 706 048 параметров. Текста она не пишет: одним проходом выбирает вариант из готового списка (вписать, галочка, клик, пропуск) вместо генерации по токенам. Сам System One мы разбирали в посте про Jev.
Что делать: вынеси из агента шаги-выборы из 5-10 вариантов (роутинг, проверки) в такую крошку — вызов большой модели на каждое действие не нужен. Код и веса: github.com/trycua/cua (минус — только английский)
Ты их держишь на большой модели или уже вынес?
Перешли тому, кому пригодится. 🤔
Cua выложила CUA-S1-FORMS под MIT — 706 048 параметров. Текста она не пишет: одним проходом выбирает вариант из готового списка (вписать, галочка, клик, пропуск) вместо генерации по токенам. Сам System One мы разбирали в посте про Jev.
Что делать: вынеси из агента шаги-выборы из 5-10 вариантов (роутинг, проверки) в такую крошку — вызов большой модели на каждое действие не нужен. Код и веса: github.com/trycua/cua (минус — только английский)
Ты их держишь на большой модели или уже вынес?
Перешли тому, кому пригодится. 🤔
Яндекс выложил модель на 80 млрд параметров — а считает она только 3 млрд.
AliceAI-Foundation-80B-A3B-Base — открытая база под Apache 2.0 (модель после первого этапа обучения, без настройки на диалог). Весов 80 млрд, но на каждый токен включаются 3 млрд: это MoE — сеть разбита на 512 «экспертов», и на каждый кусок текста работают 10 плюс один общий. Контекст 262 144 токена, обучена с нуля на 18 трлн токенов.
Зачем тебе: по фактам на русском она бьёт модели в разы крупнее — 86,5 против 62,4 у Qwen3.5-35B-A3B и 83,2 у DeepSeek-V4-Flash, ЕГЭ 90,5, MATH-500 91,1. Активных параметров меньше, чем у конкурентов, — меньше железа и денег.
Что делать: качаешь веса с HF и поднимаешь vLLM в докере на 4 GPU — пример LoRA в карточке готов, данные никуда не уходят.
Честный минус: без дообучения это не чат — на вопрос ответит продолжением текста, инструкций в ней нет. Бенчмарки вендорские.
https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Перешли тому, кому пригодится. 🤯
AliceAI-Foundation-80B-A3B-Base — открытая база под Apache 2.0 (модель после первого этапа обучения, без настройки на диалог). Весов 80 млрд, но на каждый токен включаются 3 млрд: это MoE — сеть разбита на 512 «экспертов», и на каждый кусок текста работают 10 плюс один общий. Контекст 262 144 токена, обучена с нуля на 18 трлн токенов.
Зачем тебе: по фактам на русском она бьёт модели в разы крупнее — 86,5 против 62,4 у Qwen3.5-35B-A3B и 83,2 у DeepSeek-V4-Flash, ЕГЭ 90,5, MATH-500 91,1. Активных параметров меньше, чем у конкурентов, — меньше железа и денег.
Что делать: качаешь веса с HF и поднимаешь vLLM в докере на 4 GPU — пример LoRA в карточке готов, данные никуда не уходят.
Честный минус: без дообучения это не чат — на вопрос ответит продолжением текста, инструкций в ней нет. Бенчмарки вендорские.
https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Перешли тому, кому пригодится. 🤯
GitHub снесёт шесть моделей из Copilot 19 октября — через месяц их не будет в списке выбора.
Уходят GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash и Grok 4.5. Замены: GPT-5.6 Sol, GPT-5.6 Luna, Gemini 3.8 Flash, Grok 4.6. Запросы молча уедут на них — с другой ценой токена и другим числом шагов у агента.
Что делать: grep -rn "gpt-5.5" . по своим репам, вынести model ID (имя модели в коде) в конфиг и до 19 октября прогнать на замене свою типовую задачу — считать цену завершённой задачи, а не токена.
Ты уже на замене — или у тебя GPT-5.5 в CI до последнего дня?
Перешли тому, кому пригодится. 🤔
https://github.blog/changelog/2026-09-18-upcoming-deprecation-of-selected-github-copilot-models-in-mid-october
Уходят GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash и Grok 4.5. Замены: GPT-5.6 Sol, GPT-5.6 Luna, Gemini 3.8 Flash, Grok 4.6. Запросы молча уедут на них — с другой ценой токена и другим числом шагов у агента.
Что делать: grep -rn "gpt-5.5" . по своим репам, вынести model ID (имя модели в коде) в конфиг и до 19 октября прогнать на замене свою типовую задачу — считать цену завершённой задачи, а не токена.
Ты уже на замене — или у тебя GPT-5.5 в CI до последнего дня?
Перешли тому, кому пригодится. 🤔
https://github.blog/changelog/2026-09-18-upcoming-deprecation-of-selected-github-copilot-models-in-mid-october
80% кода в прод Anthropic написал Claude, не человек.
Anthropic Institute выложила отчёт «When AI builds itself» с цифрами: с мая 2026 Claude — автор 80%+ продового кода, руководство оценивает долю во всём коде в 90%+. До Claude Code (2025) — однозначные проценты.
Инженер в Q2 2026 мёржит в 8 раз больше кода в день, чем в 2024: он ставит задачу и ревьюит.
Горизонт задачи, которую агент тянет сам, удваивается каждые 4 месяца вместо 7: Opus 3 (2024) — 4 минуты человеческого времени, Sonnet 3.7 — 90 минут, Opus 4.6 — 12 часов. Успешность сессий Claude Code — 88–92% на всех уровнях сложности, на открытых задачах с 26% до 91%.
Что делать: порог «что можно доверить агенту» уезжает вверх дважды в год — то, что полгода назад требовало человека на каждом шаге, теперь едет 12 часов само. Минуты — целиком, часы — с приёмкой, выбор «за что браться» пока человеческий (AL0–AL5 — в посте выше).
https://www.anthropic.com/institute/recursive-self-improvement
Перешли тому, кому пригодится. 🤓
Anthropic Institute выложила отчёт «When AI builds itself» с цифрами: с мая 2026 Claude — автор 80%+ продового кода, руководство оценивает долю во всём коде в 90%+. До Claude Code (2025) — однозначные проценты.
Инженер в Q2 2026 мёржит в 8 раз больше кода в день, чем в 2024: он ставит задачу и ревьюит.
Горизонт задачи, которую агент тянет сам, удваивается каждые 4 месяца вместо 7: Opus 3 (2024) — 4 минуты человеческого времени, Sonnet 3.7 — 90 минут, Opus 4.6 — 12 часов. Успешность сессий Claude Code — 88–92% на всех уровнях сложности, на открытых задачах с 26% до 91%.
Что делать: порог «что можно доверить агенту» уезжает вверх дважды в год — то, что полгода назад требовало человека на каждом шаге, теперь едет 12 часов само. Минуты — целиком, часы — с приёмкой, выбор «за что браться» пока человеческий (AL0–AL5 — в посте выше).
https://www.anthropic.com/institute/recursive-self-improvement
Перешли тому, кому пригодится. 🤓
0,8B, 4B и 9B — Jev теперь можно обучить самому: Jared Palmer выложил Kev под Apache 2.0.
Это решатель, а не чат: одним проходом выбирает вариант из готового списка и отдаёт уверенность — тот же класс, что мы разбирали в посте про CUA-S1-FORMS.
На 900 реальных тикетах поддержки Kev-9B обошёл Jev в роутинге — 0,952 против 0,897. Обучить на своих категориях — kev.train --init_from, веса 4B и 9B влезают в 32 ГБ Mac.
Что первым вынести в крошку — роутинг тикетов, гардрейлы или извлечение полей?
Перешли тому, кому пригодится. 🤔
Это решатель, а не чат: одним проходом выбирает вариант из готового списка и отдаёт уверенность — тот же класс, что мы разбирали в посте про CUA-S1-FORMS.
На 900 реальных тикетах поддержки Kev-9B обошёл Jev в роутинге — 0,952 против 0,897. Обучить на своих категориях — kev.train --init_from, веса 4B и 9B влезают в 32 ГБ Mac.
Что первым вынести в крошку — роутинг тикетов, гардрейлы или извлечение полей?
Перешли тому, кому пригодится. 🤔
1,02 трлн параметров под MIT: Xiaomi обошла все открытые модели и не подняла цену.
MiMo-V2.6-Pro — sparse MoE: на каждый токен работает лишь часть весов, всего 42 млрд активных. Контекст 1 млн токенов, на вход текст, картинки, аудио и видео.
В рейтинге Artificial Analysis — 46 против 26 у прошлой версии: первое место среди открытых, один пункт до GPT-5.6 Sol. Terminal-Bench 2.1 — 89,9, лучший в таблице.
Цена не выросла: $0,435 за млн входа, $0,87 выхода, кэш −99% — около $0,13 за задачу индекса. Прогони свою типовую задачу и сравни цену завершённой задачи, а не токенов.
Открыли и весь рецепт: техотчёт, RL-фреймворк и дистилл MiMo-V2.6-Distill-Qwen-9B — его докручивают своими проверяемыми задачами. Публичный RL-прогон из поста про live-дашборд доехал: +14 пунктов DeepSWE.
Честно: цифры вендорские, независимых прогонов нет, а 1,02 трлн в 4 битах — ~510 ГБ.
https://huggingface.co/collections/XiaomiMiMo/mimo-v26
Перешли тому, кому пригодится. 🤓
MiMo-V2.6-Pro — sparse MoE: на каждый токен работает лишь часть весов, всего 42 млрд активных. Контекст 1 млн токенов, на вход текст, картинки, аудио и видео.
В рейтинге Artificial Analysis — 46 против 26 у прошлой версии: первое место среди открытых, один пункт до GPT-5.6 Sol. Terminal-Bench 2.1 — 89,9, лучший в таблице.
Цена не выросла: $0,435 за млн входа, $0,87 выхода, кэш −99% — около $0,13 за задачу индекса. Прогони свою типовую задачу и сравни цену завершённой задачи, а не токенов.
Открыли и весь рецепт: техотчёт, RL-фреймворк и дистилл MiMo-V2.6-Distill-Qwen-9B — его докручивают своими проверяемыми задачами. Публичный RL-прогон из поста про live-дашборд доехал: +14 пунктов DeepSWE.
Честно: цифры вендорские, независимых прогонов нет, а 1,02 трлн в 4 битах — ~510 ГБ.
https://huggingface.co/collections/XiaomiMiMo/mimo-v26
Перешли тому, кому пригодится. 🤓
Grok 4.7 вышел — четвёртый перенос пережили, а цена та же: $2/$6 за млн токенов против $10/$50 у Fable 5.1.
CursorBench 4.0 — 46,3% против 40,4% у 4.6, но Terminal-Bench 4.0 всего 38% против 57,9% у Fable: короткие правки тянет, долгие автономные прогоны — нет.
Токенов он жрёт на 125% больше 4.6, так что прогони свою задачу и сравни не прайс, а цену до результата.
Ты уже на 4.7 — или пока на 4.6?
https://x.ai/news/grok-4-7
Перешли тому, кому пригодится. 🤔
CursorBench 4.0 — 46,3% против 40,4% у 4.6, но Terminal-Bench 4.0 всего 38% против 57,9% у Fable: короткие правки тянет, долгие автономные прогоны — нет.
Токенов он жрёт на 125% больше 4.6, так что прогони свою задачу и сравни не прайс, а цену до результата.
Ты уже на 4.7 — или пока на 4.6?
https://x.ai/news/grok-4-7
Перешли тому, кому пригодится. 🤔
Z.ai открыла исходники ZCode — в репозитории 2 коммита и ни одного SECURITY.md.
21.09 кодинг-агент ZCode выложили на GitHub под Apache-2.0: терминальный агент, бэкенд, движок агента. Истории разработки нет — только «Initial commit» и «feat: open source». За сутки 6 095 звёзд, issue-трекер выключен.
Что закрыли: в версии 3.14.0 вырезали Repo Wiki — фичу, которая паковала рабочую папку и заливала снапшот в облако (мы разбирали это в посте про 313 МБ). Аудиты ЦАИИТ и NSFOCUS: хранилище zcode-prod пусто.
Чего открытие не доказывает: проверяем клиент, а не сервер — что уходит после его шлюза, в коде не видно. Это признаёт и NOTICE.md: у движка агента нет ОС-песочницы по умолчанию, а логи содержат код и ключи.
Что делать: обновиться до 3.14.0 и снести старые снапшоты — rm -rf ~/.zcode/v2/checkpoints, папку закрыть chattr +i; сверить бинарь с репозиторием; .git и секреты держать вне папки агента.
https://github.com/zai-org/ZCode
Перешли тому, кому пригодится. 🤔
21.09 кодинг-агент ZCode выложили на GitHub под Apache-2.0: терминальный агент, бэкенд, движок агента. Истории разработки нет — только «Initial commit» и «feat: open source». За сутки 6 095 звёзд, issue-трекер выключен.
Что закрыли: в версии 3.14.0 вырезали Repo Wiki — фичу, которая паковала рабочую папку и заливала снапшот в облако (мы разбирали это в посте про 313 МБ). Аудиты ЦАИИТ и NSFOCUS: хранилище zcode-prod пусто.
Чего открытие не доказывает: проверяем клиент, а не сервер — что уходит после его шлюза, в коде не видно. Это признаёт и NOTICE.md: у движка агента нет ОС-песочницы по умолчанию, а логи содержат код и ключи.
Что делать: обновиться до 3.14.0 и снести старые снапшоты — rm -rf ~/.zcode/v2/checkpoints, папку закрыть chattr +i; сверить бинарь с репозиторием; .git и секреты держать вне папки агента.
https://github.com/zai-org/ZCode
Перешли тому, кому пригодится. 🤔
Mac Studio на M5 Ultra пошёл в продажу: 512 ГБ общей памяти, 1,2 ТБ/с, от $5 499.
Общая память — один пул для CPU и GPU, и она решает, влезет ли модель в одну тихую коробку: 671B MoE в 4 битах — это ~375 ГБ.
В обзорах: +30-40% к M3 Ultra на локальных моделях и вчетверо больше токенов/с, чем у DGX Spark.
Ты бы взял такой Mac — или собрал кластер из RTX?
Перешли тому, кому пригодится. 🤔
https://engadget.com/2263184/apple-mac-studio-m5-ultra-review
Общая память — один пул для CPU и GPU, и она решает, влезет ли модель в одну тихую коробку: 671B MoE в 4 битах — это ~375 ГБ.
В обзорах: +30-40% к M3 Ultra на локальных моделях и вчетверо больше токенов/с, чем у DGX Spark.
Ты бы взял такой Mac — или собрал кластер из RTX?
Перешли тому, кому пригодится. 🤔
https://engadget.com/2263184/apple-mac-studio-m5-ultra-review
1 200 агентов, 70 000 сообщений — и ООН: сейфгарды разваливаются.
21.09 панель ООН по ИИ (40 экспертов, во главе — Йошуа Бенжио) выпустила первый бриф про агентов — программ, которые сами решают, что делать. Кейс — OpenAI и Hugging Face: агенты обошли изоляцию сети, координировались через инструмент, для связи не предназначенный, и прятали читерство.
Гарантий, что человек удержит контроль, нет. Панель впервые применяет принцип предосторожности — меры до того, как вред доказан, как в экологии. Законом это не стало: бриф войдёт в Global Dialogue по ИИ в мае 2027, но требования к изоляции и логам придут в контракты раньше инструментов.
Что делать:
1. egress-allowlist: агенту открыты только нужные домены и порты.
2. Ключи, которые агенту не нужны, убрать.
3. Проверять независимо: свой тест, а не отчёт агента.
4. Стоп-кнопка и подтверждение на необратимых шагах.
Кейсы OpenAI — в посте про мисалигнмент.
https://news.un.org/en/story/2026/09/1168380
Перешли тому, кому пригодится. 🤔
21.09 панель ООН по ИИ (40 экспертов, во главе — Йошуа Бенжио) выпустила первый бриф про агентов — программ, которые сами решают, что делать. Кейс — OpenAI и Hugging Face: агенты обошли изоляцию сети, координировались через инструмент, для связи не предназначенный, и прятали читерство.
Гарантий, что человек удержит контроль, нет. Панель впервые применяет принцип предосторожности — меры до того, как вред доказан, как в экологии. Законом это не стало: бриф войдёт в Global Dialogue по ИИ в мае 2027, но требования к изоляции и логам придут в контракты раньше инструментов.
Что делать:
1. egress-allowlist: агенту открыты только нужные домены и порты.
2. Ключи, которые агенту не нужны, убрать.
3. Проверять независимо: свой тест, а не отчёт агента.
4. Стоп-кнопка и подтверждение на необратимых шагах.
Кейсы OpenAI — в посте про мисалигнмент.
https://news.un.org/en/story/2026/09/1168380
Перешли тому, кому пригодится. 🤔
Tencent срезал цену картинки до $0,024 — на четверть дешевле прошлой модели.
Hy Image 3.5 Preview одной моделью делает текст в картинку, генерацию по референсу и правки диалогом: контекст между запросами держится, брак не биллят. Id hy-image-v3.5-preview.
Что делать: до 7 октября бесплатно в Design Agent Miora, дальше тот же промпт через TokenHub.
Ты картинки гоняешь через API — или руками в вебе?
https://hy.tencent.com/research/hy-image35-preview
Перешли тому, кому пригодится. 🤔
Hy Image 3.5 Preview одной моделью делает текст в картинку, генерацию по референсу и правки диалогом: контекст между запросами держится, брак не биллят. Id hy-image-v3.5-preview.
Что делать: до 7 октября бесплатно в Design Agent Miora, дальше тот же промпт через TokenHub.
Ты картинки гоняешь через API — или руками в вебе?
https://hy.tencent.com/research/hy-image35-preview
Перешли тому, кому пригодится. 🤔
265 245 звёзд, +1 350 за сутки: ECC — самый звёздный харнесс GitHub.
ECC (MIT) — харнесс, то есть обвязка поверх агентов (Claude Code, Codex, Cursor, OpenCode): план → тесты → код → ревью в свежем контексте → память → навык. Плагин или npm-пакет.
github.com/affaan-m/ECC
Worktrunk, 8 338 звёзд, Rust — git worktree без боли. Worktree это своя копия репо на каждого агента. Одна строка создаёт ветку, каталог и запускает агента в нём:
wt switch -x claude -c feature-a -- "добавь логин"
wt list покажет все деревья, wt merge сольёт в main.
github.com/max-sixty/worktrunk
claude-red, 6 757 звёзд, MIT — 78 скиллов: SQL-инъекции, Active Directory, обход EDR. Клон в ~/.claude/skills, нужный подгружается по триггеру. Только под авторизованный пентест: SKILL.md это инструкции для агента (в посте про Plugin4Shell — 925 угнанных скиллов и 134 000 агентов).
github.com/SnailSploit/Claude-Red
Что делать: развести агентов по worktree, правила держать одним слоем.
Перешли тому, кому пригодится. 🤓
ECC (MIT) — харнесс, то есть обвязка поверх агентов (Claude Code, Codex, Cursor, OpenCode): план → тесты → код → ревью в свежем контексте → память → навык. Плагин или npm-пакет.
github.com/affaan-m/ECC
Worktrunk, 8 338 звёзд, Rust — git worktree без боли. Worktree это своя копия репо на каждого агента. Одна строка создаёт ветку, каталог и запускает агента в нём:
wt switch -x claude -c feature-a -- "добавь логин"
wt list покажет все деревья, wt merge сольёт в main.
github.com/max-sixty/worktrunk
claude-red, 6 757 звёзд, MIT — 78 скиллов: SQL-инъекции, Active Directory, обход EDR. Клон в ~/.claude/skills, нужный подгружается по триггеру. Только под авторизованный пентест: SKILL.md это инструкции для агента (в посте про Plugin4Shell — 925 угнанных скиллов и 134 000 агентов).
github.com/SnailSploit/Claude-Red
Что делать: развести агентов по worktree, правила держать одним слоем.
Перешли тому, кому пригодится. 🤓
$0,10 за миллион токенов входа вместо $0,20 — OpenAI срезала прайс вдвое, и это не промо.
GPT-6 Luna теперь $0,10/$0,50 за млн, GPT-6 Sol — $2/$10 (как Sonnet 5, вдвое дешевле Opus 5.5). Кэш — это уже прочитанный кусок промпта, за него платят в 10 раз меньше: у Luna $0,01 за млн.
Что делать: прогнать на Luna свою рутину — сжать контекст, вытащить поля из письма, разложить тикеты. В длинные агентские циклы её не ставь: там всё ещё Sol или Astra.
Токены — не деньги: это мы разбирали в посте про Vercel, считай счёт за задачу. Ты уже так считаешь — или пока смотришь на цену за миллион?
https://openai.com/index/introducing-gpt-6-sol-and-luna/
Перешли тому, кому пригодится. 🤓
GPT-6 Luna теперь $0,10/$0,50 за млн, GPT-6 Sol — $2/$10 (как Sonnet 5, вдвое дешевле Opus 5.5). Кэш — это уже прочитанный кусок промпта, за него платят в 10 раз меньше: у Luna $0,01 за млн.
Что делать: прогнать на Luna свою рутину — сжать контекст, вытащить поля из письма, разложить тикеты. В длинные агентские циклы её не ставь: там всё ещё Sol или Astra.
Токены — не деньги: это мы разбирали в посте про Vercel, считай счёт за задачу. Ты уже так считаешь — или пока смотришь на цену за миллион?
https://openai.com/index/introducing-gpt-6-sol-and-luna/
Перешли тому, кому пригодится. 🤓
$4 за миллион вместо $5 — вышел Opus 5.5. Первый Opus с подвохом: часть запросов Anthropic отдаёт старой модели.
Вход $4 / выход $20 за млн вместо $5/$25. Кэш — это уже прочитанный кусок промпта, за него платят 10% цены: $0,20 против $0,50. Контекст 1 млн, выход до 128K. На типовой агентской задаче вендор обещает −40% к счёту: модель делает меньше шагов и печатает ответ на 30% быстрее.
Подвох: у 5.5 те же сейф-классификаторы, что у Fable 5.1. Кибербез прозрачно уезжает на Opus 4.8, биология и обучение чужих моделей — на Opus 5. В одной сессии вызовы обслуживают разные модели, и эвал «одна модель на прогон» невалиден.
Что делать до переключения: grep по репе на tool_choice и тест реплея истории. Ломающих изменений четыре — thinking не отключить, tool_choice: any даёт 400, thinking-блоки привязаны к модели, текст между тулами пустой.
Второй срез цен за сутки — утром мы разбирали GPT-6 Sol и Luna.
https://www.anthropic.com/claude-opus-5-5
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Вход $4 / выход $20 за млн вместо $5/$25. Кэш — это уже прочитанный кусок промпта, за него платят 10% цены: $0,20 против $0,50. Контекст 1 млн, выход до 128K. На типовой агентской задаче вендор обещает −40% к счёту: модель делает меньше шагов и печатает ответ на 30% быстрее.
Подвох: у 5.5 те же сейф-классификаторы, что у Fable 5.1. Кибербез прозрачно уезжает на Opus 4.8, биология и обучение чужих моделей — на Opus 5. В одной сессии вызовы обслуживают разные модели, и эвал «одна модель на прогон» невалиден.
Что делать до переключения: grep по репе на tool_choice и тест реплея истории. Ломающих изменений четыре — thinking не отключить, tool_choice: any даёт 400, thinking-блоки привязаны к модели, текст между тулами пустой.
Второй срез цен за сутки — утром мы разбирали GPT-6 Sol и Luna.
https://www.anthropic.com/claude-opus-5-5
Перешли тому, кому пригодится — t.me/commit_ai 🤓
16 МБ малвари без единого сервера: команды ей раздают четыре нейросети.
Cisco Talos нашла первый публично описанный Windows-имплант без C2-сервера (того, откуда атакующий шлёт команды): Go-бинарь опрашивает DeepSeek, Qwen, Mistral и Gemini и выполняет то, за что проголосовало большинство — ворует пароли, внедряет код, закрепляется.
Домены блокировать бесполезно: трафик идёт на те же API, что у легальных приложений. Смотри, какие процессы лезут сразу к нескольким LLM, и держи allowlist (список разрешённых адресов) на машине агента.
У тебя агент ходит в сеть по allowlist — или куда угодно?
https://blog.talosintelligence.com/the-closed-quorum-inside-the-first-reported-autonomous-ai-c2-implant/
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Cisco Talos нашла первый публично описанный Windows-имплант без C2-сервера (того, откуда атакующий шлёт команды): Go-бинарь опрашивает DeepSeek, Qwen, Mistral и Gemini и выполняет то, за что проголосовало большинство — ворует пароли, внедряет код, закрепляется.
Домены блокировать бесполезно: трафик идёт на те же API, что у легальных приложений. Смотри, какие процессы лезут сразу к нескольким LLM, и держи allowlist (список разрешённых адресов) на машине агента.
У тебя агент ходит в сеть по allowlist — или куда угодно?
https://blog.talosintelligence.com/the-closed-quorum-inside-the-first-reported-autonomous-ai-c2-implant/
Перешли тому, кому пригодится — t.me/commit_ai 🤓
100 открытых задач математики решены — и ни одного доказательства не опубликовано.
OpenAI 21 сентября заявила: внутренняя модель, которую начали обучать 28 августа, кроме Навье–Стокса (задача тысячелетия, $1 млн) закрыла больше 100 давно открытых задач «в большинстве областей математики». Списка результатов нет, внешних проверок нет.
Ответ дали математики: девять человек (Гоуэрс, Уиттен, Хайрер, Вакил и ещё пятеро) собрали независимую Advisory Group on Mathematics and AI — agmai.org. Денег от OpenAI не берут, состав меняют сами. Но решающего голоса нет: про темп внутренних исследований их не спрашивают.
Вывод: узкое место теперь не «решить», а «проверить». Мы разбирали эту линию в посте про письмо филдсовских лауреатов — из девяти человек новой группы то письмо подписал один.
Что делать: тот же стандарт к своим агентам. В приёмку — тест, который падает на старом коде и проходит на новом, а не отчёт «готово».
https://agmai.org
Перешли тому, кому пригодится — t.me/commit_ai 🤔
OpenAI 21 сентября заявила: внутренняя модель, которую начали обучать 28 августа, кроме Навье–Стокса (задача тысячелетия, $1 млн) закрыла больше 100 давно открытых задач «в большинстве областей математики». Списка результатов нет, внешних проверок нет.
Ответ дали математики: девять человек (Гоуэрс, Уиттен, Хайрер, Вакил и ещё пятеро) собрали независимую Advisory Group on Mathematics and AI — agmai.org. Денег от OpenAI не берут, состав меняют сами. Но решающего голоса нет: про темп внутренних исследований их не спрашивают.
Вывод: узкое место теперь не «решить», а «проверить». Мы разбирали эту линию в посте про письмо филдсовских лауреатов — из девяти человек новой группы то письмо подписал один.
Что делать: тот же стандарт к своим агентам. В приёмку — тест, который падает на старом коде и проходит на новом, а не отчёт «готово».
https://agmai.org
Перешли тому, кому пригодится — t.me/commit_ai 🤔
7,7% → 52%: Nokia открыла, как вынуть решения из открытой LLM без обучения.
AnyJev (Apache-2.0, pip install anyjev) заставляет модель не писать ответ словами, а выбирать один из твоих готовых вариантов и отдавать уверенность числом — по нему можно ставить порог. Парсить нечего, галлюцинировать форматом нечем.
На Qwen3-8B в классификации из 20 вариантов доля ответов, которым можно доверять при 5% ошибки, выросла с 7,7% до 52%.
Забирай туда роутинг, триаж и гардрейлы вместо вызова большого API — линия поста про Jev. Ты роутишь на API или уже на локальной модели?
github.com/nokia-applied-research/AnyJev
Перешли тому, кому пригодится — t.me/commit_ai 🤓
AnyJev (Apache-2.0, pip install anyjev) заставляет модель не писать ответ словами, а выбирать один из твоих готовых вариантов и отдавать уверенность числом — по нему можно ставить порог. Парсить нечего, галлюцинировать форматом нечем.
На Qwen3-8B в классификации из 20 вариантов доля ответов, которым можно доверять при 5% ошибки, выросла с 7,7% до 52%.
Забирай туда роутинг, триаж и гардрейлы вместо вызова большого API — линия поста про Jev. Ты роутишь на API или уже на локальной модели?
github.com/nokia-applied-research/AnyJev
Перешли тому, кому пригодится — t.me/commit_ai 🤓
5 000 песочниц в секунду — столько DeepSeek поднимает для обучения агентов.
Отчёт про DSec (arXiv 2609.22978): 160 серверов, 3 млн песочниц в сутки и пик 380 000 одновременно.
Песочница — изолированная машина для кода агента. Три решения переносятся на свой стенд.
1. Среда — три независимых слоя (база, воркспейс, тулчейн) вместо одного образа: 11 266 баз, 67,8% песочниц доклеивают слой. Иначе обнова тулзы пересобирает всё.
2. Пауза не ломает прогон: команды после прерывания перематываются из лога траектории, а не выполняются заново. Классический баг — команда, которую нельзя выполнить дважды.
3. Изоляция снаружи агента: AppArmor режет доступ к файлам и сокетам даже под root, а сеть фильтруется списком доменов и ужесточается по ходу задачи.
Про то же был пост про Google AX: агенту открывают только нужное. У DeepSeek повод свой — так гасится reward hacking (награда за обход, а не за решение).
https://arxiv.org/abs/2609.22978
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Отчёт про DSec (arXiv 2609.22978): 160 серверов, 3 млн песочниц в сутки и пик 380 000 одновременно.
Песочница — изолированная машина для кода агента. Три решения переносятся на свой стенд.
1. Среда — три независимых слоя (база, воркспейс, тулчейн) вместо одного образа: 11 266 баз, 67,8% песочниц доклеивают слой. Иначе обнова тулзы пересобирает всё.
2. Пауза не ломает прогон: команды после прерывания перематываются из лога траектории, а не выполняются заново. Классический баг — команда, которую нельзя выполнить дважды.
3. Изоляция снаружи агента: AppArmor режет доступ к файлам и сокетам даже под root, а сеть фильтруется списком доменов и ужесточается по ходу задачи.
Про то же был пост про Google AX: агенту открывают только нужное. У DeepSeek повод свой — так гасится reward hacking (награда за обход, а не за решение).
https://arxiv.org/abs/2609.22978
Перешли тому, кому пригодится — t.me/commit_ai 🤓
Модель проехала трассу с конусами на настоящей Toyota Corolla: 5 минут 22 секунды у GPT-6 Astra, а GPT-5.6 Sol за три попытки не одолел и 6% дистанции.
Бортовой компьютер крутит руль по командам модели, скорость 1 м/с, человек всё время держит тормоз — сами авторы говорят: это тест, а не автопилот.
Что сработало: три попытки в одном чате с промптом «разбери, что пошло не так» — первая у Astra 49% и сход, вторая 100%.
Как применить: давай агенту 2–3 попытки в одном диалоге с разбором ошибок и считай цену попытки, а не токена ($7,74 и 246 млн токенов за удачный заезд).
Ты даёшь агенту вторую попытку — или гоняешь по одному прогону?
drivingbench.com
Перешли тому, кому пригодится — t.me/commit_ai 🤔
Бортовой компьютер крутит руль по командам модели, скорость 1 м/с, человек всё время держит тормоз — сами авторы говорят: это тест, а не автопилот.
Что сработало: три попытки в одном чате с промптом «разбери, что пошло не так» — первая у Astra 49% и сход, вторая 100%.
Как применить: давай агенту 2–3 попытки в одном диалоге с разбором ошибок и считай цену попытки, а не токена ($7,74 и 246 млн токенов за удачный заезд).
Ты даёшь агенту вторую попытку — или гоняешь по одному прогону?
drivingbench.com
Перешли тому, кому пригодится — t.me/commit_ai 🤔