Доступна на Pro, Pro+, Max, Business, Enterprise — для бизнес-аккаунтов по умолчанию выключена, включает админ. Оплата по прайсу провайдера в рамках usage-based биллинга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Контекст — 1 млн токенов, нативная мультимодальность, API совместим по формату с OpenAI/Anthropic, цена — как у Claude Sonnet 5. Релиз вышел на той же неделе, что письмо Nvidia, Meta и Microsoft против ограничений на открытые модели — тема раскола Кремниевой долины, которую мы уже разбирали. В комьюнити уже циркулируют неподтверждённые слухи о возможной дистилляции с других фронтир-моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
Авторы выяснили, что отдача идёт от трёх свойств среды: глубина моделируемого поведения, попадание именно в те взаимодействия, где агент реально проваливается, и способность улучшаться вместе с моделью. Microsoft уже выложила четыре такие среды в открытый доступ с кодом и верификаторами, привязанными к реальному состоянию базы данных приложения.
Please open Telegram to view this post
VIEW IN TELEGRAM
Честная деталь от инженера команды: ответственность за код, написанный Copilot, всё равно остаётся на инженерах-людях — но нужен правильный «harness», чтобы вообще пускать других контрибьюторов в свой компонент.
Please open Telegram to view this post
VIEW IN TELEGRAM
Но есть обратная сторона: в мульти-агентных цепочках одна галлюцинация становится стартовым допущением для всех последующих шагов — агент А выдумывает факт, агент B строит на нём рассуждение, агент C суммирует вывод — и система выдаёт гладкий, но в корне неверный ответ. Тот же каскадный эффект, что мы разбирали недавно про мульти-агентные сбои, только источник каскада здесь — фабрикация факта, а не техническая ошибка.
Please open Telegram to view this post
VIEW IN TELEGRAM
Экономика важна не меньше цифр: компактная модель закрывает около 90% задач сама, оставляя дорогие модели только для самых сложных 10% случаев — это даёт примерно 50% экономии. Логика Microsoft простая: раз стоимость поиска уязвимости атакующими обваливается благодаря ИИ, защитникам тоже нужна автоматизация вместо редких ручных аудитов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Ответ создателя Gravity Falls Алекса Хирша — короткое «А что если просто поговорить с детьми?» — набрал больше 220 тысяч лайков, полностью затмив пост Альтмана. Это не первый его заход в тему: ранее он говорил, что не представляет воспитание ребёнка без ChatGPT.
Please open Telegram to view this post
VIEW IN TELEGRAM
Инструмент не просто линтер с готовыми правилами — использует ИИ для контекстного анализа: оценивает, как код реально ведёт себя, и сам предлагает патчи. Умеет ставить pre-commit проверки, гонять сканы в CI с отсечкой по severity, находить репозитории через GitHub CLI и выполнять массовые сканирования по CSV.
Логичное продолжение темы MAI-Cyber-1-Flash от Microsoft — крупные игроки один за другим выпускают инструменты для защитной стороны безопасности.
Please open Telegram to view this post
VIEW IN TELEGRAM
Технически поддерживаются два формата: сервер отдаёт SKILL.md с ресурсами по требованию, либо весь скилл упакован архивом, который framework скачивает и распаковывает локально. Разработчику всё равно, каким способом упакован скилл.
Тот же паттерн, что мы видели с RODA MCP-сервером от AWS, только теперь про внутреннюю дистрибуцию знаний в организации, а не публичные датасеты.
Please open Telegram to view this post
VIEW IN TELEGRAM
Архитектура — простой цикл: агент получает задачу и текущее состояние браузера, решает действие, отправляет его, получает новое состояние — и повторяет. Именно эта петля лежит в основе большинства современных browser-агентов, включая более навороченные коммерческие продукты вроде Stagehand.
Тот же тренд, что мы видели у Opel/Scout от Microsoft: браузер остаётся необходим там, где API просто не существует.
Please open Telegram to view this post
VIEW IN TELEGRAM
Речь шла меньше чем о 10 позициях, но теперь компании обязаны согласовывать политику найма и сдавать отчёты дважды в год.
Показательно: крупные ИИ-лаборатории оказываются под тем же иммиграционным контролем, что и любая другая компания.
Please open Telegram to view this post
VIEW IN TELEGRAM
Хассабис написал сотрудникам, что верит: AGI «уже близко», и хочет сосредоточиться на «большой картине». По данным источников, он давно отдалялся от операционки Gemini в пользу Isomorphic Labs — своего проекта по разработке лекарств с помощью ИИ. В тот же день ушёл и Джефф Дин, главный научный сотрудник DeepMind — запускает стартап с тремя коллегами. Google говорит, что решения не связаны, хотя совпадение показательное.
Please open Telegram to view this post
VIEW IN TELEGRAM
Оценка разбита на три части: срабатывает ли триггер, точно ли агент следует процедуре, не нарушает ли запреты. 79 реальных skills, 177 задач в девяти доменах, тесты в изолированной песочнице.
Перекликается с темой skills от MCP-серверов, которую мы разбирали недавно: сама доставка skill’а — только полдела, реальное понимание, когда и как его применять, остаётся open-проблемой даже у топовых моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
Результат по семи моделям: улучшение реальное, но неравномерное. Самое интересное — авторы проверяли не только сам факт прироста, но и то, идёт ли он через правильный путь (сохранение → извлечение → обновление опыта). Оказалось, агенты с одинаковым итоговым приростом могут кардинально различаться — один реально учится через память, другой просто угадывает лучше по случайным причинам, а на выходе выглядит одинаково.
Хорошее дополнение к теме Memora от Microsoft: построить архитектуру памяти — одно, доказать, что агент реально ею правильно пользуется — совсем другое.
Please open Telegram to view this post
VIEW IN TELEGRAM
Авторы разводят три вещи, которые обычно путают: числовые форматы (FP16, INT8, INT4 — сколько бит на число), методы квантизации (GPTQ, AWQ — алгоритмы, которые решают, какие веса можно упростить без потери качества) и файловые форматы (GGUF — просто контейнер для готового результата, а не метод квантизации, хотя его часто путают с ним).
Хорошая база для тех, кто пробует запускать открытые модели вроде Kimi K3 или GLM локально и натыкается на суффиксы вроде Q4_K_M в названиях файлов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Первая волна SDD-проектов опиралась на уже существующий софт как источник истины — работает хорошо на чётко очерченных поверхностях (API, плагины, conformance-наборы), где поведение легко тестируется. Вторая волна толкает методологию в территорию без внешнего валидатора — и там проблема синхронизации резко усложняется. Автор проводит параллель с программным кризисом 1968 года: тогда ответом стал процесс, и агенты снова создали похожий кризис — кода больше, чем люди способны ревьюить — только теперь в помощь берут сам ИИ.
Please open Telegram to view this post
VIEW IN TELEGRAM
Альпёге не доказал гипотезу — он её опроверг: нашёл конкретное необратимое отображение с постоянным якобианом, контрпример уместился в 216 символов — при том что математики предполагали минимальную степень такого примера в районе 200. Помогла Fable 5, модель, которую Anthropic изначально считала слишком мощной для публичного релиза. Автор — не случайный человек: PhD из Принстона под руководством Филдсовского лауреата, лауреат премии Моргана.
Показательно, что это не единичный случай: в этом году AlphaProof от DeepMind самостоятельно решил девять открытых проблем Эрдёша, а Claude Mythos независимо и короче доказала гипотезу единичного расстояния, чем OpenAI.
Please open Telegram to view this post
VIEW IN TELEGRAM
До переделки у Kiro было три отдельных харнесса под разные поверхности (TypeScript, Rust, Python) — теперь всё объединено в единый харнесс. Практический эффект — Kiro CLI уже работает в JetBrains, Zed и других ACP-совместимых редакторах, а не только в своём интерфейсе. AWS сознательно расширила протокол, а не сделала проприетарный форк.
Продолжение темы вендор-лока, которую мы разбирали через Карпа и Менша — только теперь решение на уровне протокола связи, а не модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
Цифры: одноразрядная миллисекундная задержка при recall выше 99%, масштаб до триллионов векторов, без администрирования инфраструктуры. Можно использовать любую модель эмбеддингов — от Amazon Titan до OpenAI — и единая serverless-оплата по факту использования.
Please open Telegram to view this post
VIEW IN TELEGRAM
Один из юристов собрал собственный инструмент для работы с договорами. Вместо постоянного копирования промтов он вынес инструкции, шаблоны и внутренние материалы в репозиторий. В результате время на подготовку и проверку документов сократилось примерно вдвое.
Юристы фактически начали «программировать» на естественном языке: описывают методологию, правила и нужный результат, а AI превращает это в повторяемый workflow.
Please open Telegram to view this post
VIEW IN TELEGRAM
❓ На GitHub появился skill-forge — открытый инструмент-«мастерская», который автоматизирует создание Agent Skills для Claude Code из внешних источников: репозиториев на GitHub, онлайн-документации, PDF. Идея простая: вместо того чтобы вручную читать документацию нового инструмента и вручную писать под него SKILL.md, скидываете источник — а на выходе получаете структурированный, переиспользуемый скилл.
Технически интересны несколько деталей. Умное определение источника само распознаёт, откуда тащить материал — GitHub, сайт документации, локальный файл. Работает без настройки из коробки. Отдельно — поддержка формата llms.txt, который ускоряет сбор документации примерно в 10 раз по сравнению с обычным парсингом HTML-страниц.
⚠️ Показательно, что проект прямо указывает: он построен поверх официального skill-creator от Anthropic — то есть не изобретает велосипед с нуля, а расширяет уже существующий шаблон под более автоматизированный сценарий сбора источников.
Технически интересны несколько деталей. Умное определение источника само распознаёт, откуда тащить материал — GitHub, сайт документации, локальный файл. Работает без настройки из коробки. Отдельно — поддержка формата llms.txt, который ускоряет сбор документации примерно в 10 раз по сравнению с обычным парсингом HTML-страниц.
⚠️ Показательно, что проект прямо указывает: он построен поверх официального skill-creator от Anthropic — то есть не изобретает велосипед с нуля, а расширяет уже существующий шаблон под более автоматизированный сценарий сбора источников.