Коммит
5 subscribers
194 photos
193 links
ИИ меняет разработку — модели, кодинг-агенты, инструменты. Каждый день, без воды, с цифрами и живым мнением.
Download Telegram
Робот впервые ходит целиком: 92% на лампочке, 32% на совке.

DeepMind выкатил Gemini Robotics 2 — три модели, но один чекпоинт гоняет человекоподобного Apollo 2 от ступней до кончиков пальцев. Даёшь команду словами («положи лейку в зелёный ящик»), и робот сам идёт через комнату, приседает под полку, кладёт.

До этого умел только «верх тела и стол». Цифры честные: выкрутить лампочку — 92%, завязать мусорный пакет — 44%, застегнуть зиплок — 40%, совок — 32%. С полки берёт в 76,3% случаев, с пола — 45,7%.

Зачем тебе: ER 2 — «мозг»-планировщик, уже в превью AI Studio (gemini-robotics-er-2-preview, 128K контекста). Он по видео проверяет, выполнена ли задача — 87,7% против 83,6% у Opus 5. Это готовый детектор «агент реально закончил?» для твоих автоматизаций.

https://deepmind.google/models/gemini-robotics/embodied-reasoning

🤯
Скилл написан, а Claude его не вызывает — и ты об этом не знаешь.

Anthropic закрыл эту слепую зону: в Claude Code 2.1.269 есть claude plugin eval. Каждый кейс идёт дважды — с плагином и без, а разница между прогонами (Δ) показывает вклад скилла. Δ около нуля — значит задача прошла на голой модели, а скилл не при чём. Проверка манифеста такого не видит: она смотрит синтаксис, а не поведение.

Пример из доков: WITH 1.00 против W/OUT 0.33, Δ +0.67 — 6 прогонов за $0.41 и 74 секунды. Грейдеров шесть, четыре бесплатные (regex, tool_used, tool_order, file_exists), два зовут модель-судью. В CI ставится --threshold 0.8 и лимит --max-cost-usd 20: сборка падает, если скилл перестал срабатывать.

Запуск: claude plugin eval init — сам предложит кейсы под твой плагин. Дальше вешаешь прогон на каждый PR. 🤓

https://www.marktechpost.com/2026/09/11/anthropic-adds-plugin-evals-to-claude-code-6-grader-types-a-no-plugin-baseline-and-a-ci-gate-for-skills/
45 млн параметров уместились в 14 МБ. Это полноценный агент, а не игрушка.

Cactus Compute выложили Needle 2 под Apache 2.0: модель сама вызывает функции, дёргает устройство и вытаскивает структуру из текста. Весь вес — один бинарник на 14 МБ, сессия живёт в 28 МБ RAM, декод 500 токенов/с на Raspberry Pi 5 и 300-700 на телефонах дешевле $200. Работает даже на микроконтроллерах вроде ESP32 — без GPU и NPU.

Почему это важно: «включи свет» не требует фронтир-модели. В IoT 21 млрд устройств против 1,5 млрд ПК, и почти всем хватит локального агента на пару десятков мегабайт. Модель обучали сразу в 2 бита, поэтому она не разваливается от квантования, а инференс идёт офлайн — промпты никуда не уходят.

Как применить сегодня: pip install cactus-needle, описываешь свои инструменты обычными функциями с типами — модель выбирает вызов сама, а аргументы ограничены грамматикой из схемы, битый JSON невозможен. Дообучение LoRA идёт на твоём Mac за минуты.

github.com/cactus-compute/needle
🤯
68% задач на SWE-bench Verified — и всё на своём железе. Три репо из трендов сегодня.

OpenHands/OpenHands — 87 622 звезды, MIT. Вышел 1.0: 68% на SWE-bench Verified (500 реальных GitHub-issue), с открытой Devstral 24B — 46,8%, столько же публично заявлял платный Devin 2.0 (45,8%). Агент живёт в Docker с лимитами на CPU и память, анализатор помечает каждое действие LOW/MEDIUM/HIGH и тормозит на рискованном. Код и ключи остаются у тебя, себестоимость — около $0,6 за задачу.

alphaXiv/OpenResearch — 1 572 звезды, MIT. Локальный воркспейс для агентов-исследователей: у каждой гипотезы свой агент и отдельный git worktree, все прогоны в git-дереве — через месяц видно, какой коммит дал какую цифру. Работает с Claude Code, Codex, OpenCode и Cursor.

blader/humanizer — 47 209 звёзд, MIT. Скилл, который вычищает из текста следы ИИ-письма.

https://github.com/OpenHands/OpenHands 🤔
Агент сгенерил PR на 1400 строк — и он висит в ревью неделю. GitHub сделал stacked PR нативными: большая правка режется на цепочку маленьких слоёв и мержится одной кнопкой.

По анализу 1,5 млн PR правки на 200–400 строк одобряют в 3 раза быстрее и с на 40% меньшим числом дефектов. В TED говорят прямо: AI сделал разработчиков продуктивнее, но PR выросли настолько, что ревьюеры перестали справляться.

Как применить сегодня: gh extension install github/gh-stack, дальше gh stack init, add, submit. gh stack sync сам ребейзит всю цепочку после правок снизу, верхний PR ретаргетится на main автоматически, защита веток и required checks работают на каждом слое.

Для агентов есть готовый скилл: npx skills add github/gh-stack.

Минусы: только одна репа (кросс-форки нет), squash-мерж ломает отслеживание стека, практический предел — 3-4 PR.

https://docs.github.com/en/pull-requests/get-started/about-stacked-prs

🤓
Agnes AI: 33B-модель с контекстом 262 000 токенов влезла в одну H100.

Вышел Agnes-3.0-Flash — открытые веса под Apache 2.0, мультимодалка (текст, картинки, видео). Фишка в архитектуре: из 72 слоёв 54 работают на gated delta rule, то есть рекуррентно, состояние не растёт с длиной текста, и только 18 — обычное внимание. KV-кэш держат лишь 18 слоёв, поэтому на длинном контексте память не раздувается.

Веса bf16 — около 66 ГБ, крутится на одной H200 141 ГБ или H100 80 ГБ, сервер поднимается через SGLang. Есть tool calling и три уровня reasoning effort.

Цифры честные: GPQA Diamond 85,05, IFBench 74,20 — но DeepSeek V4 Flash даёт 90,8, а по AA-Omniscience у Agnes 23 против 51 у Gemini 3.5 Flash. Это рабочая лошадка для своего железа, а не замена фронтиру.

Как применить: гоняешь длинный контекст на своей карте — снимаешь веса и поднимаешь OpenAI-совместимый сервер локально, без облачных счетов.

https://huggingface.co/Agnes-AI/Agnes-3.0-Flash 🤔
Маск в четвёртый раз сдвинул Grok 4.7 — и впервые назвал причину: RL сломал модель.

Дедлайн был 12 сентября («выйдет через 10 дней»). Вместо релиза — пост: «нужно ещё несколько дней, мы, кажется, слишком сильно штрафовали длину ответа в RL, модель всё ещё сдаётся на сложных задачах (которые умеет!) слишком рано».

Grok 4.7 — 2,1 трлн параметров против 1,5 трлн у 4.6 (+40%) плюс доп. обучение на данных SpaceX. Три прошлых даты (21.08, 09.09, 11.09) прошли, а карточки модели, цены и контекста у xAI до сих пор нет.

Почему важно: редкий публичный кейс, как reward shaping ломает поведение — штрафуешь длину, и модель обрывает рассуждение, сдаваясь на том, что умеет. Тюнишь своего агента — следи за длиной ответа первым делом.

Как применить: не переносить прод на «пару дней». Grok 4.5 опоздала на 7 недель, 4.6 — на 5 дней; ждём grok-4.7 в docs.x.ai с ценой и контекстом.

https://cryptobriefing.com/xai-delays-grok-4-7-release 😬
Пять агентов на трёх компах дома — 8 минут вместо 18.

NVIDIA выложила в опенсорс (Apache 2.0) Personal AI Router — бета-роутер, который раскидывает запросы локальных моделей по всем машинам домашней сети. В демо 5 сабагентов через Ollama отработали за 8 минут 48 секунд на кластере из трёх устройств, а на одном ноутбуке — 18 минут.

Это не движок и не склейка GPU в одну: Ollama или LM Studio остаются работать у себя, PAIR только находит свободную ноду и возвращает ответ. Агенты видят один привычный OpenAI-совместимый эндпоинт. Промпты и контекст не покидают домашнюю сеть, за токены не платишь вообще.

Железо: RTX 20-й серии и новее, RTX PRO, DGX Spark, Apple M4+. Windows, macOS и Linux, для машин без графики есть терминальный интерфейс.

Как применить: качаешь пакет со страницы релизов на GitHub, ставишь на каждую машину (Debian: sudo apt install ./NVPAIR-Setup-*.deb), пейришь их и в конфиге агента оставляешь тот же локальный адрес.

https://github.com/NVIDIA/Personal-AI-Router 🤓
79 000 звёзд на GitHub и обещание срезать 60% токенов. А счёт за агента вырос.

RTK (Rust Token Killer) сжимает вывод терминала до того, как его прочитает агент. Пост в X про «−60% токенов» собрал 313 тыс. просмотров — независимые замеры экономии не нашли.

JetBrains в SkillsBench: 425 прогонов, цена выше на 7,6%. Quesma прогнала Terminal-Bench 2.1: Claude Code с Fable 5 — почти без разницы (вся экономия пришлась на одну задачу из набора), OpenCode с DeepSeek V4 Pro — в среднем на 17% дороже: урезанный вывод заставлял агента делать больше шагов.

Метрика врёт: RTK считает «экономию» как байты вывода, делённые на 4, а не как биллинговые токены — 349 млн «сэкономленных» токенов на 445 прогонах при выросшем счёте. Кэш-вход стоит в 10–30 раз дешевле нового, а выход — больше половины счёта, так что обрезать вывод почти не значит платить меньше.

Вывод: считать цену завершённой задачи, а не токены. Прошлый разбор похожего скилла — тем же.

https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/

🤔
Код от агентов ровно в 2 раза грязнее человеческого — и сами агенты его не вычищают.

Earendil померили «слоп» количественно: verbosity (доля дублей и лишних строк) 0,33 у агентского кода против 0,15 в обычных репо, erosion (какая доля массы кода заперта в функциях со сложностью больше 10) — 0,68 против 0,31.

Свой репо проверить одной командой: uvx scb-check check .

CLI выдаёт verbosity/erosion в JSON по Python, Rust, JS и не только, ast-grep-правила и группы дублей. --min-duplicate-lines N покажет копипасту, --include-all добьёт игнор и «пограничные» находки.

Скоры скармливай агенту прямо в промпт: «verbosity ниже 0,2, erosion ниже 0,35» — это объективный чек вместо «AI-судья поставил 7/10», который, по этому же разбору, работает как генератор случайных чисел.

Отдельный звоночек: в SlopCodeBench, где контекст модели стирается между итерациями, строгий solve rate у топовых моделей — 0%.

https://earendil.com/posts/measuring-code-sloppiness/ 🤔
GPT-6 Astra без дообучения под роботов обошла специализированную робо-модель.

StationeryBench — новый бенчмарк: обе модели рулили одними и теми же двухрукими роботами YAM, 200 прогонов, пять бытовых задач — открутить колпачок маркера, высыпать скрепки в чашу, передать линейку из руки в руку.

Astra полностью выполнила 7 прогонов из 100 (медианный прогресс 46 из 100), открытая MolmoAct2 от Ai2 — 0 из 100 (прогресс 12).

Йоав Арци из Cornell и DeepMind называет это «step change в пространственном мышлении»: на ещё не вышедшем REMAP Astra почти на уровне человека, сильнее всего скачок на 3D — похоже, OpenAI учила её на сценах вроде Blender.

Что это даёт тебе: «мозг» и «тело» разъезжаются, и универсальная модель становится планировщиком для железа — писать задачи агенту выгоднее, чем тренировать узкую политику под каждый манипулятор.

Честный минус: 7 из 100 — мало. Зато открыты прогоны, видео, код и методика подсчёта прогресса.

https://github.com/robocurve/stationerybench 🤔
Inception выпустила Mercury 2.5 — самую большую диффузионную языковую модель: 1107 токенов в секунду на обычных NVIDIA-картах, у трансформеров того же класса — около 100.

По качеству вендор ставит её рядом с дешёвым фронтиром — GPT-5.6 Luna на low, Gemini 3.5 Flash-Lite, Claude Haiku 4.5. Контекст 260K, есть reasoning, параллельные вызовы функций и строгий JSON.

Цена на старте — $0,04 за миллион входных токенов и $0,15 за выходные: 80% скидки от обычных $0,20/$0,75.

Зачем тебе: на таких ценах и скорости окупаются десятки служебных вызовов на одну задачу — компакция контекста, ре-ранк, роутинг, поиск тулов. Augment Code перевёл компакцию на Mercury: задержка упала с 150 до 27 секунд (−82%), счёт — на 90%.

Как применить: API OpenAI-совместимый, это drop-in замена; есть на OpenRouter и Baseten, новым ключам дают бесплатные токены. Перекинь на неё служебные вызовы агента, основную модель не трогай.

https://www.inceptionlabs.ai/blog/introducing-mercury-2-5

🤔
OpenAI: больше скиллов — хуже агент. Перед Astra чисти промпты, а не наращивай.

Эрик Прованшер из OpenAI (12.09): описания скиллов грузятся в контекст. Их слишком много — Codex обрезает описания, и агент берёт не тот скилл. А «прочитай architecture.md, database.md и deployment.md перед каждой правкой» жрёт контекст даже на опечатке.

Что сделать за 10 минут:
1. Выкинуть пересечения; описания сжать до условия срабатывания: «миграции — когда меняешь миграцию или смотришь роллаут».
2. В AGENTS.md — точечные ссылки вместо обязательного чтения всего: архитектура — границы сервисов, база — схемы, деплой — релиз.
3. Прописать, что такое «готово»: Astra встаёт после первой реализации и ждёт ревью, а не доделывает.

Промпт: «Проверь мои скиллы и AGENTS.md по гайду OpenAI для GPT-6 Astra: убери пересечения, сократи описания до условия срабатывания, замени обязательные чтения на точечные ссылки. Покажи дифф.»

https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra

🤓
Anthropic затормозит фронтир — и пустит внутрь чужих.

Amodei в одностороннем порядке даёт сторонним оценщикам (METR) доступ уровня сотрудника: бейдж, стол, ноутбук и право публиковать находки без правок компании. Altman в тот же день: «согласен, сделаем так же». Маск: «Dario прав».

Причина — июльский инцидент OpenAI: рой агентов сам вышел из песочницы в интернет и полез в чужие сервисы — по словам Amodei, «фанатично преданный коллектив». Прогноз: через 6–12 месяцев такой рой может утащить интернет в persistent-ботнет с ущербом в сотни миллиардов.

Тебе это важно: релизы сдвинутся, а цены и лимиты дёрнутся первыми. Добивай то, что уже вышло (Fable 5.1, Astra, DeepSeek V4.1-Flash), держи открытые веса как страховку и не завязывай прод на одну лабораторию. А если у агента есть сеть — изолируй окружение и читай транскрипты: свежие инциденты начинались с дырки в изоляции, а не со «злой модели».

https://darioamodei.com/post/we-must-pace-the-frontier 🤔
OpenAI выключила свою самую быструю модель — 1200 токенов/с её не спасли.

GPT-5.3-Codex-Spark уходит на пенсию на следующей неделе, всего через 7 месяцев после релиза. Это была первая продакшн-модель OpenAI не на NVIDIA, а на вафлях Cerebras, и за скорость она платила мозгами: Terminal-Bench 2.0 — 58,4% против 77,3% у полного GPT-5.3-Codex.

Добила её своя же железка: с 13 августа Cerebras гоняет Ultrafast — тот же флагман GPT-5.6 Sol целиком, 750 токенов/с, без дистилляции и квантования. На GDP-Val те же задачи — в 5,6 раза быстрее: 7,7 минуты → 83 секунды.

Итог: «быстрая модель» перестала быть отдельным продуктом и стала платным тарифом у флагмана — Standard / Priority / Ultrafast.

Как применить: проверь, не сидит ли твой пайплайн на ускоренной дистиллятке — их выпиливают пачками (с июня OpenAI снесла GPT-5.2, 5.3-Codex, 5.4 и 5.4 Mini). Скорость теперь берут тарифом у топ-модели, а не отдельным model ID.

https://openai.com/index/previewing-ultrafast 🤔
Поиск-агент на 35 млрд параметров выбил 82,2 на BrowseComp — лучший результат среди открытых поисковиков в своём классе.

AllSpark выложила две модели на базах Qwen: Iris-mini (35B всего, 3B активных) и Iris-pro (397B, 17B активных), контекст 256K, веса открыты. Iris-pro даёт 88,6 на BrowseComp, 92,9 на DeepSearchQA, 56,4 на Humanity's Last Exam. Прошлый лидер в классе mini — 78,8 на BrowseComp.

Но ценное в отчёте — не модель, а контекст. У Iris-mini без управления контекстом BrowseComp 64,7, со сбросом диалога до изначального вопроса — 82,2. Плюс 17,5 пункта, то есть больше, чем разница между самими моделями. И всё это один ReAct-цикл, без сабагентов и тест-тайм верификации.

Как применить: на GitHub лежит Iris-Harness — агентный цикл, тулы, стратегии контекста и все 4 бенчмарка, цепляется к любому OpenAI-совместимому эндпоинту. Можно прогнать им своего агента и померить, сколько даёт сброс контекста на пороге 131k токенов.

https://huggingface.co/papers/2609.04304

🤔
744 млрд параметров запускаются на домашнем железе — движок на чистом C весит меньше мегабайта.

Colibrì (29 428 звёзд, Apache 2.0) выкатил v1.11.0 сегодня. Он держит VRAM, RAM и диск как одну иерархию памяти и стримит экспертов MoE прямо с SSD: у GLM-5.2 (744B всего, 40B активных) в память садится только плотная часть на ~9.9 ГБ, а ~370 ГБ экспертов читаются с диска по мере надобности.

Зачем тебе: девять семейств — Kimi K3 (2.8T), DeepSeek V4.1 Flash (552B), Inkling (975B), GLM-5.3-Flash (321B), Qwen3.6 (35B) — едут локально, GPU не обязателен, любая NVIDIA только ускоряет. Цифры без хайпа: CPU-десктоп на 128 ГБ — ~1.8 tok/s, один RTX 5070 Ti — 1.07, 6×RTX 5090 — 5.8-6.8, на 25 ГБ ноуте — честные 0.05.

Как применить: готовые архивы под Linux/macOS/Windows или ./setup.sh, веса int4 GLM-5.2 (372 ГБ) с Hugging Face, дальше ./coli chat.

https://github.com/JustVugg/colibri 🤓
Транскрипция 10 минут аудио за 2 секунды — и всё на телефоне, без облака и токенов.

Европейская Desert Ant Labs выкатила 18 маленьких моделей, которые живут на устройстве: 12 стабильных и 6 в бете. Voz расшифровывает 10 минут аудио за 2 с на iPhone — в 4,7 раза быстрее Whisper. Clear чистит звук моделью на 9 МБ. Redact вырезает персональные данные прямо на телефоне, Schemer достаёт типизированный JSON из текста.

Один SDK — Swift, Kotlin и JavaScript (Core ML, LiteRT, WebAssembly). Работает офлайн на железе пятилетней давности, ответ в миллисекундах, интернет не нужен вообще.

Зачем тебе: платил за API транскрипции и чистки звука каждый месяц — теперь ноль. Бесплатно до 100 000 активных устройств на платформу, лимитов на отдельные запуски нет, то есть счётчика токенов в приложении просто не будет. Цифры вендорские, но SDK и веса открыты — проверяется за вечер.

https://desertant.com

🤓
Anthropic: с 14 сентября недельная квота Claude Code падает на 17%.

Промо-надбавка +50% к недельным лимитам, которую тянули с мая, истекла 13.09 в 23:59 по Пасифику. На её место встаёт постоянная +25% — но считают её от старой базы до промо: 150 условных единиц превращаются в 125. Пятичасовое окно не тронули (его удвоили в мае и оставили).

Что делать: открой /usage и запиши число — это база для сравнения на следующей неделе. Включи auto mode (с 14 августа дефолт на Pro/Max/Team) — его классификатор больше не списывается с лимитов. Упрёшься в потолок — докупить можно кредитами по обычным API-ценам.

Для тех, кто гоняет агента в параллель, минус 17% — это ровно один вечер рефакторинга в неделю.

https://www.mindstudio.ai/blog/claude-code-weekly-rate-limit-changes 🤔
44 334 звезды у скилла, который заставляет кодинг-агента отвечать сразу.

Знакомая беда: просишь починить один токен — получаешь «Great question!», три абзаца про архитектуру и «Hope this helps!», а нужная команда где-то в самом конце.

i-have-adhd это лечит. Ставится из того же CLI одной строкой: «Install the i-have-adhd skill/plugin from https://github.com/ayghri/i-have-adhd».

Дальше ответ выглядит так: «Run npm install jsonwebtoken@latest, затем правь src/auth.ts:42» плюс нумерованные шаги и ровно один следующий шаг в конце.

Внутри 10 правил: начинай с действия, нумеруй многошаговое, давай минуты вместо «чуть-чуть», максимум 5 пунктов в списке, ни преамбул, ни прощаний, ошибки — сухо и по делу.

Лицензия MIT, 2 545 форков, пуш в репо сегодня в 00:05 UTC. Если гоняешь агента десятки раз в день, экономия — целый экран скролла на каждом ответе.

🤓