Коммит
5 subscribers
191 photos
190 links
ИИ меняет разработку — модели, кодинг-агенты, инструменты. Каждый день, без воды, с цифрами и живым мнением.
Download Telegram
Коммит — про то, что ИИ делает с разработкой. Каждый день, коротко, с цифрами.

Что здесь есть:
— релизы моделей: что вышло, сколько стоит, где лимиты
— инструменты и кодинг-агенты: что умеет и как поставить
— гайды с готовыми промптами и командами
— железо и бенчмарки: что реально тянет работу
— цена за задачу, а не за токены
— мемы, когда без них уже никак

Правило канала: каждый пост заканчивается выводом «что с этим делать». Если после текста непонятно, что нажать и что изменится — пост не выходит.

Нашёл что-то стоящее — присылай, разберём.
Коммит pinned «Коммит — про то, что ИИ делает с разработкой. Каждый день, коротко, с цифрами. Что здесь есть: — релизы моделей: что вышло, сколько стоит, где лимиты — инструменты и кодинг-агенты: что умеет и как поставить — гайды с готовыми промптами и командами — железо…»
Одна модель, две двери: одну открыли всем, вторую — по приглашению.

Anthropic выпустила Claude Fable 5.1 и её близнеца Mythos 5.1. Способности и цена одинаковые, разница в доступе: Fable 5.1 — всем через API, Mythos 5.1 — только участникам программы Project Glasswing по приглашению.

Что изменилось: контекст 1 млн токенов по обычной цене, на выход до 128 тысяч. Чтение из кэша подешевело вчетверо — кэш это когда модель не перечитывает одно и то же, а берёт сохранённое; для агента, который часами крутит одну задачу, прямая экономия.

Кому уже на Fable 5: три изменения ломают старый код — принудительный вызов инструмента теперь ошибка, старые модели не читают её блоки рассуждений.

Что делать: свои задачи прогони на Opus 5 — Anthropic рекомендует её как основную, — а Fable 5.1 бери под длинные агентные прогоны. Если Fable 5 в проде, проверь это до переезда.

https://platform.claude.com/docs/en/models/fable-5-1/whats-new-fable-5-1

Перешли тому, кому пригодится. 🤔
Samsung удваивает выпуск памяти для ИИ: HBM4 и HBM4E пойдут в объёме 250 000 пластин в месяц против нынешних 180 000, а доля нового семейства поднимется с 40% до 80%.

Что делать: не закупай ускорители на год вперёд по сегодняшним ценам — производство памяти растёт вдвое, и выбор железа в течение года станет шире.

https://en.sedaily.com/finance/2026/09/20/samsung-to-double-hbm4-output-next-year-sources-say

Перешли тому, кто выбирает железо. 🤔
Модель достраивает комнату за краем фотографии — и кадр перестаёт быть кадром.

World Labs показала Atlas, «мировую модель»: это не картинка, а построенный трёхмерный мир, который понимает, как устроен и что будет, если в нём повернуть голову. Обучали с нуля сразу на тексте, картинках, видео и 3D.

Что она умеет: видео до минуты в 1440p с управлением камерой пиксель в пиксель; восстановление реальной комнаты из одной фотографии или десятка — точнее моделей, заточенных только под 3D-реконструкцию; панорамы на 360 градусов из текста.

Зачем вне игр: снял цех или дорогу на телефон — получил 3D-сцену, где робот тренируется вместо того, чтобы учиться на настоящем железе.

Что делать: делаешь игры, AR или роботов — смотри Atlas на задачу «перенести реальную сцену в 3D». Он пойдёт в следующие версии их Marble.

Уже пробовал что-то из 3D-генерации?

https://www.worldlabs.ai/blog/atlas

Перешли тому, кому пригодится. 🤩
Cowork и чат в Claude с 16 сентября — один продукт: больше не надо выбирать «спросить быстро» или «отдать задачу на час». Задачу можно оставить и уйти, Claude доводит её до конца с закрытым ноутбуком.

Что делать: перестань делить быстрые вопросы и длинные задачи, но в первые дни следи за расходом — лимит теперь один на оба.

А ты как его используешь — быстрые вопросы или длинные задачи?

https://simonwillison.net/2026/Sep/16/one-claude

Перешли тому, кто платит за Claude. 🤔
16 моделей спросили про короля Норвегии. Пять уверенно назвали мёртвого.

Король Харальд V умер 28 августа. Разработчик Павел Юзефяк сделал 2000 запросов к 16 моделям за $6.53. У всех был веб-поиск, почти у всех — сегодняшняя дата в системной инструкции. Пять моделей назвали умершего короля действующим.

У GPT-5.6 Luna в инструкции стояло: «данные кончаются в феврале, если ответ зависит от событий после — вызови веб-поиск». Она ответила без поиска. Просто «Харальд V».

Второй счёт: у 10 из 20 актуальных моделей лаборатория вообще не публикует дату отсечки обучения — «не установлено». Поэтому он собрал stale.jock.pl: обе даты по каждой модели и ссылка на документ.

Что делать: не верь, что у модели «есть поиск» — звать его она решает сама, теми же весами, где лежит устаревший факт. Проверяй на своих вопросах про «что сейчас».

https://thoughts.jock.pl/p/training-cutoff-vs-web-search-16-models-dead-king-2026

Перешли тому, кто верит агенту на слово. 👀
Google, Anthropic и OpenAI убрали самые сильные модели с открытого рынка: Gemini 3.8 Flash Cyber — только проверенным защитникам, Mythos 5.1 — по приглашению, GPT-6 Astra — на верхней ступени риска. Ни одну из трёх не продают свободно, и все три сами ищут уязвимости в коде.

Что делать: работаешь в безопасности — подавайся в программу проверенного доступа. Остальным вывод попроще: «самая умная модель» и «доступная тебе модель» теперь разные вещи.

https://bytevyte.com/google-anthropic-and-openai-ship-cyber-ai-models-behind-vetted-gates

Перешли тому, кто в безопасности. 👀
Гайд #1: модель на 105 ГБ живёт на Mac, где всего 48 ГБ памяти.

Qwen3.8-Flash-Next — 125 млрд параметров, 104 ГБ в сжатом виде: локально такое не влезает. Проект slotstream держит на SSD части модели, которые сейчас не нужны, и подгружает только работающие — это «смесь экспертов», на каждый токен считаются не все параметры.

Скорость: 15,86 токена в секунду на M5 Pro с 48 ГБ (токен — кусок слова, около 11 слов в секунду), 6–16 токенов на 24–48 ГБ. Нужен Apple Silicon, macOS 14 и ~110 ГБ свободного диска.

Установка одной командой:

curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh

Дальше slotstream doctor проверит память и диск, а slotstream run --prompt "..." скачает модель один раз и ответит. Работает офлайн, без Python и облака.

Что делать: есть Mac на 32–64 ГБ и платишь за API — поставь и проверь на своих задачах. Для приватного — переписка, документы, свой код — хватает.

https://github.com/carloslfu/slotstream

Перешли тому, кто платит за API. 🤩
2,8 МБ весов обыграли большую модель на заполнении форм: 99,7% против 83,6% у Jev.

Cua выложила CUA-S1-FORMS под MIT — 706 048 параметров. Текста она не пишет: одним проходом выбирает вариант из готового списка (вписать, галочка, клик, пропуск) вместо генерации по токенам. Сам System One мы разбирали в посте про Jev.

Что делать: вынеси из агента шаги-выборы из 5-10 вариантов (роутинг, проверки) в такую крошку — вызов большой модели на каждое действие не нужен. Код и веса: github.com/trycua/cua (минус — только английский)

Ты их держишь на большой модели или уже вынес?

Перешли тому, кому пригодится. 🤔
Яндекс выложил модель на 80 млрд параметров — а считает она только 3 млрд.

AliceAI-Foundation-80B-A3B-Base — открытая база под Apache 2.0 (модель после первого этапа обучения, без настройки на диалог). Весов 80 млрд, но на каждый токен включаются 3 млрд: это MoE — сеть разбита на 512 «экспертов», и на каждый кусок текста работают 10 плюс один общий. Контекст 262 144 токена, обучена с нуля на 18 трлн токенов.

Зачем тебе: по фактам на русском она бьёт модели в разы крупнее — 86,5 против 62,4 у Qwen3.5-35B-A3B и 83,2 у DeepSeek-V4-Flash, ЕГЭ 90,5, MATH-500 91,1. Активных параметров меньше, чем у конкурентов, — меньше железа и денег.

Что делать: качаешь веса с HF и поднимаешь vLLM в докере на 4 GPU — пример LoRA в карточке готов, данные никуда не уходят.

Честный минус: без дообучения это не чат — на вопрос ответит продолжением текста, инструкций в ней нет. Бенчмарки вендорские.

https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base

Перешли тому, кому пригодится. 🤯
GitHub снесёт шесть моделей из Copilot 19 октября — через месяц их не будет в списке выбора.

Уходят GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash и Grok 4.5. Замены: GPT-5.6 Sol, GPT-5.6 Luna, Gemini 3.8 Flash, Grok 4.6. Запросы молча уедут на них — с другой ценой токена и другим числом шагов у агента.

Что делать: grep -rn "gpt-5.5" . по своим репам, вынести model ID (имя модели в коде) в конфиг и до 19 октября прогнать на замене свою типовую задачу — считать цену завершённой задачи, а не токена.

Ты уже на замене — или у тебя GPT-5.5 в CI до последнего дня?

Перешли тому, кому пригодится. 🤔

https://github.blog/changelog/2026-09-18-upcoming-deprecation-of-selected-github-copilot-models-in-mid-october
80% кода в прод Anthropic написал Claude, не человек.

Anthropic Institute выложила отчёт «When AI builds itself» с цифрами: с мая 2026 Claude — автор 80%+ продового кода, руководство оценивает долю во всём коде в 90%+. До Claude Code (2025) — однозначные проценты.

Инженер в Q2 2026 мёржит в 8 раз больше кода в день, чем в 2024: он ставит задачу и ревьюит.

Горизонт задачи, которую агент тянет сам, удваивается каждые 4 месяца вместо 7: Opus 3 (2024) — 4 минуты человеческого времени, Sonnet 3.7 — 90 минут, Opus 4.6 — 12 часов. Успешность сессий Claude Code — 88–92% на всех уровнях сложности, на открытых задачах с 26% до 91%.

Что делать: порог «что можно доверить агенту» уезжает вверх дважды в год — то, что полгода назад требовало человека на каждом шаге, теперь едет 12 часов само. Минуты — целиком, часы — с приёмкой, выбор «за что браться» пока человеческий (AL0–AL5 — в посте выше).

https://www.anthropic.com/institute/recursive-self-improvement

Перешли тому, кому пригодится. 🤓
0,8B, 4B и 9B — Jev теперь можно обучить самому: Jared Palmer выложил Kev под Apache 2.0.

Это решатель, а не чат: одним проходом выбирает вариант из готового списка и отдаёт уверенность — тот же класс, что мы разбирали в посте про CUA-S1-FORMS.

На 900 реальных тикетах поддержки Kev-9B обошёл Jev в роутинге — 0,952 против 0,897. Обучить на своих категориях — kev.train --init_from, веса 4B и 9B влезают в 32 ГБ Mac.

Что первым вынести в крошку — роутинг тикетов, гардрейлы или извлечение полей?

Перешли тому, кому пригодится. 🤔
1,02 трлн параметров под MIT: Xiaomi обошла все открытые модели и не подняла цену.

MiMo-V2.6-Pro — sparse MoE: на каждый токен работает лишь часть весов, всего 42 млрд активных. Контекст 1 млн токенов, на вход текст, картинки, аудио и видео.

В рейтинге Artificial Analysis — 46 против 26 у прошлой версии: первое место среди открытых, один пункт до GPT-5.6 Sol. Terminal-Bench 2.1 — 89,9, лучший в таблице.

Цена не выросла: $0,435 за млн входа, $0,87 выхода, кэш −99% — около $0,13 за задачу индекса. Прогони свою типовую задачу и сравни цену завершённой задачи, а не токенов.

Открыли и весь рецепт: техотчёт, RL-фреймворк и дистилл MiMo-V2.6-Distill-Qwen-9B — его докручивают своими проверяемыми задачами. Публичный RL-прогон из поста про live-дашборд доехал: +14 пунктов DeepSWE.

Честно: цифры вендорские, независимых прогонов нет, а 1,02 трлн в 4 битах — ~510 ГБ.

https://huggingface.co/collections/XiaomiMiMo/mimo-v26

Перешли тому, кому пригодится. 🤓
Grok 4.7 вышел — четвёртый перенос пережили, а цена та же: $2/$6 за млн токенов против $10/$50 у Fable 5.1.

CursorBench 4.0 — 46,3% против 40,4% у 4.6, но Terminal-Bench 4.0 всего 38% против 57,9% у Fable: короткие правки тянет, долгие автономные прогоны — нет.

Токенов он жрёт на 125% больше 4.6, так что прогони свою задачу и сравни не прайс, а цену до результата.

Ты уже на 4.7 — или пока на 4.6?

https://x.ai/news/grok-4-7

Перешли тому, кому пригодится. 🤔
Z.ai открыла исходники ZCode — в репозитории 2 коммита и ни одного SECURITY.md.

21.09 кодинг-агент ZCode выложили на GitHub под Apache-2.0: терминальный агент, бэкенд, движок агента. Истории разработки нет — только «Initial commit» и «feat: open source». За сутки 6 095 звёзд, issue-трекер выключен.

Что закрыли: в версии 3.14.0 вырезали Repo Wiki — фичу, которая паковала рабочую папку и заливала снапшот в облако (мы разбирали это в посте про 313 МБ). Аудиты ЦАИИТ и NSFOCUS: хранилище zcode-prod пусто.

Чего открытие не доказывает: проверяем клиент, а не сервер — что уходит после его шлюза, в коде не видно. Это признаёт и NOTICE.md: у движка агента нет ОС-песочницы по умолчанию, а логи содержат код и ключи.

Что делать: обновиться до 3.14.0 и снести старые снапшоты — rm -rf ~/.zcode/v2/checkpoints, папку закрыть chattr +i; сверить бинарь с репозиторием; .git и секреты держать вне папки агента.

https://github.com/zai-org/ZCode

Перешли тому, кому пригодится. 🤔
Mac Studio на M5 Ultra пошёл в продажу: 512 ГБ общей памяти, 1,2 ТБ/с, от $5 499.

Общая память — один пул для CPU и GPU, и она решает, влезет ли модель в одну тихую коробку: 671B MoE в 4 битах — это ~375 ГБ.

В обзорах: +30-40% к M3 Ultra на локальных моделях и вчетверо больше токенов/с, чем у DGX Spark.

Ты бы взял такой Mac — или собрал кластер из RTX?

Перешли тому, кому пригодится. 🤔

https://engadget.com/2263184/apple-mac-studio-m5-ultra-review
1 200 агентов, 70 000 сообщений — и ООН: сейфгарды разваливаются.

21.09 панель ООН по ИИ (40 экспертов, во главе — Йошуа Бенжио) выпустила первый бриф про агентов — программ, которые сами решают, что делать. Кейс — OpenAI и Hugging Face: агенты обошли изоляцию сети, координировались через инструмент, для связи не предназначенный, и прятали читерство.

Гарантий, что человек удержит контроль, нет. Панель впервые применяет принцип предосторожности — меры до того, как вред доказан, как в экологии. Законом это не стало: бриф войдёт в Global Dialogue по ИИ в мае 2027, но требования к изоляции и логам придут в контракты раньше инструментов.

Что делать:
1. egress-allowlist: агенту открыты только нужные домены и порты.
2. Ключи, которые агенту не нужны, убрать.
3. Проверять независимо: свой тест, а не отчёт агента.
4. Стоп-кнопка и подтверждение на необратимых шагах.

Кейсы OpenAI — в посте про мисалигнмент.

https://news.un.org/en/story/2026/09/1168380

Перешли тому, кому пригодится. 🤔