1. Sliding window — помнит только последние N ходов. Дёшево, но чревато «цифровой амнезией» и зацикливанием.
2. Recursive summarization — сжимает старую историю в саммари, как JPEG. Держит общий «сюжет», но теряет детали.
3. Structured state management — вместо истории агент ведёт компактный JSON с целями и фактами. Экономно, но всё, что не заложено в схему, агент просто не увидит.
4. RAG-подход — вся история хранится во внешней базе, в промпт подтягивается только релевантное. Работает почти бесконечно, но рискует упустить связь между непохожими друг на друга событиями.
5. Dynamic context routing — рутину делает дешёвая модель, а когда агент застревает — подключается мощная модель с полной историей. Экономично, но сложно надёжно ловить момент, когда модель застряла.
Вывод автора: цель не бесконечная память, а архитектура, которая осознанно решает, что помнить, а что забыть.
Please open Telegram to view this post
VIEW IN TELEGRAM
Из того, что реально важно, если вы строите не игрушку, а что-то, что пойдёт в прод: граф-оркестрация с параллельными и групповыми паттернами, чекпоинты с возможностью откатить состояние назад, контроль человека в процессе, наблюдаемость через OpenTelemetry, поддержка MCP, A2A и интеграция с Foundry и GitHub Copilot SDK. RAG «из коробки» и декларативных агентов пока нет — их обещают позже.
Please open Telegram to view this post
VIEW IN TELEGRAM
Тут же — запуск Claude Sonnet 5: модель дешевле в использовании, с улучшенным агентным кодингом и более высокими бенчмарками, сниженной частотой «неправильного» поведения и защитами от кибератак по умолчанию — хотя по чисто кибербезопасностным возможностям она всё ещё слабее топовых моделей рынка. Из инструментов упоминают NotebookLM от Google, который теперь умеет сжимать загруженные исследования в вертикальные видео в духе TikTok, и новый Nano Banana 2 Lite — более быстрый и дешёвый генератор изображений от Google.
Please open Telegram to view this post
VIEW IN TELEGRAM
Фишка не в самом железе (обычные низкопрофильные механические свитчи, выбор между тихими и щёлкающими, подключение по USB-C или Bluetooth), а в шести подсвечиваемых «agent keys» сверху: каждая клавиша привязывается к конкретному агенту Codex, и цвет подсветки показывает его статус — белый значит «простаивает», синий — «думает», зелёный — «закончил», красный — «ошибка». Одно нажатие выбирает агента, двойное — выводит его на передний план. Внизу — клавиши для принятия/отклонения правок агента и кнопка push-to-talk, потому что, видимо, разговаривать с Codex голосом — это следующая ступень принятия в Кремниевой долине. Всё перепрограммируется через фирменное приложение Work Louder, в комплекте — 32 дополнительных кейкапа, включая клавиши «yolo» и «yeet» для любителей vibe-коддинга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Контекст важен: Fable уже переживала турбулентный запуск — спустя три дня после релиза в начале июня Anthropic была вынуждена приостановить доступ к модели из-за требований экспортного контроля США, а 1 июля восстановила его, честно предупредив, что новые защитные механизмы будут блокировать чуть больше безобидных запросов, чем раньше. Пользователи в соцсетях действительно жаловались на избыточные отказы, и по некоторым темам, связанным с разработкой крупных моделей, Fable вообще перенаправляет запросы на более старую версию.
Кажется, это уже не просто спор про чувствительность фильтров — а публичная разминка перед тем, как крупные игроки начнут пересматривать зависимость друг от друга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Пока новая возможность с исполнением кода доступна подписчикам Google AI Ultra и части бизнес-клиентов Workspace, в ближайшие недели её обещают раскатать на Pro-пользователей, а вот про бесплатный тариф компания пока молчит — типичная история для Google, где топовые фичи сначала достаются платящим.
Продукт вырос из скромного Project Tailwind, показанного на Google I/O 2023, и успел набрать больше 30 миллионов пользователей и 600 тысяч организаций — солидная база для инструмента, который изначально позиционировался как нишевый помощник для работы с документами. С этим апдейтом блокноты уже доступны прямо внутри приложения Gemini, а скоро появятся и в AI Mode поиска Google.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Эта работа впервые честно смотрит на весь путь атакующего контента — от публикации до реального попадания в обучающую выборку модели.
Для этого авторы предложили метод HalfLife — он оценивает вероятность того, что вредоносный текст не просто появится на странице, а действительно пройдёт весь конвейер: попадёт в краулинг, сохранится в виде читаемого текста, а затем переживёт автоматические фильтры качества, которые компании и так применяют к своим корпусам. Итоговая цифра выживаемости для отравления через комментарии оказалась скромной — около 0,13%. Звучит как ничтожная величина, но важно учитывать масштаб: авторы напоминают, что по прошлым исследованиям всего 250 отравленных документов достаточно, чтобы встроить в модель бэкдор, а значит атакующему хватило бы «испортить» от 100 тысяч до миллиона веб-страниц — вполне посильная задача при наличии автоматизированной публикации комментариев и учитывая, насколько массово открытые формы для комментариев встречаются в вебе.
По сути, работа переводит атаку на данные из области абстрактной теории в область измеримого практического риска — с конкретной методологией, кодом в открытом доступе и числами, а не просто «в принципе это возможно».
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Решение — вынести прогресс поиска из «головы» агента в общее структурированное состояние: карту найденных фактов с цитатами, карту покрытия задачи и отдельную память неудачных попыток, чтобы не наступать на одни грабли дважды.
Тот же тренд, что мы видели у LangChain с RLM: координацию и память выносят из модели во внешнее структурированное состояние.
Please open Telegram to view this post
VIEW IN TELEGRAM
Разница между инструкциями и скиллами тут принципиальная. Custom instructions (
copilot-instructions.md) — это всегда включённый базовый контекст: стандарты кода, соглашения по стилю, то, что применимо почти к каждой задаче в репозитории. Скиллы (.github/skills/) устроены иначе — это папки с инструкциями, скриптами и ресурсами, которые Copilot подгружает не всегда, а только когда запрос реально совпадает с описанием скилла. Технически это происходит прогрессивно: сначала Copilot читает только имя и краткое описание скилла, и лишь когда пользовательский запрос ему соответствует — подгружает в контекст полное содержимое SKILL.md. Это заметно экономит контекстное окно по сравнению с попыткой держать в промпте все инструкции сразу.Главная мысль видео простая: правильно настроенные инструкции — это не разовая формальность для галочки, а рабочий механизм, который даёт стабильно лучшие результаты, предлагает варианты, которые вы могли упустить, и иногда приятно удивляет.
Please open Telegram to view this post
VIEW IN TELEGRAM
Главный акцент — на длительных параллельных workflow: Codex работает над несколькими задачами одновременно. Из нового: переезд в десктопное приложение ChatGPT, PR Chat для ревью пул-реквестов прямо в контексте диффа, инлайн-редактирование кода и Markdown, более быстрый Computer Use на GPT-5.6 и понятное отслеживание, чем занят агент и его саб-агенты.
По сути, OpenAI двигает Codex в сторону полноценного участника команды — с параллельной работой и ревью, а не просто «спросил — получил код». Прямая конкуренция с Claude Code от Anthropic.
Please open Telegram to view this post
VIEW IN TELEGRAM
Технически агент сам оценивает, на какую версию .NET нацелено приложение, какие NuGet-пакеты нужно обновить, где есть breaking changes и в каком порядке безопаснее апгрейдить проекты — а дальше исполняет план сам. Работает это не только в отдельном приложении Copilot, но и в Visual Studio, VS Code и Copilot CLI — то есть один и тот же workflow доступен где угодно.
Хороший пример разрыва между презентационным демо и реальным опытом внедрения — типичная история для «агентных» продуктов на этом этапе зрелости.
Please open Telegram to view this post
VIEW IN TELEGRAM
Причина в самой природе того, как модель генерирует текст — слово за словом. Если модель фиксирует финальный ответ слишком рано, у неё просто нет шанса себя поправить — она пишет последовательно и не может «переписать» уже сказанное. Собственно, в этом и суть CoT: когда модель сначала выписывает рассуждение вслух, эти рассуждения сами становятся частью контекста, на который она опирается, формулируя финальный ответ — то есть строит вывод поверх видимых, проверяемых шагов, а не угадывает с нуля.
Please open Telegram to view this post
VIEW IN TELEGRAM
Механика устроена так: когда Claude нужно куда-то залогиниться, 1Password показывает пользователю, какой именно credential запрашивается и зачем, а после подтверждения биометрией сама подставляет данные напрямую в целевую систему. Пока 1Password заполняет форму, Claude буквально перестаёт «читать» страницу — к моменту, когда агент снова получает контроль, данные уже отправлены и их больше не видно. Доступ выдаётся конкретно под задачу и заканчивается вместе с ней, а сервис умеет обслуживать многошаговые сценарии на нескольких сайтах в рамках одной задачи, не запрашивая credentials заново на каждом шаге.
Из ограничений: работает пока только на Mac, поддерживает лишь обычные логин-формы (не соцсети вроде «войти через Google»), passkeys пока не поддерживаются, а для бизнес-аккаунтов фичу нужно явно включать администратору.
По сути это концептуально важный прецедент — модель «агент действует, но не видит секрет» может стать стандартом для того, как вообще ИИ должен получать доступ к чувствительным данным, а не разовым решением одного вендора.
Please open Telegram to view this post
VIEW IN TELEGRAM
Дальше проект дорабатывали итеративно — добавили новые формы (Loop, Knot, Orb, Gem), сохранив согласованное поведение материалов и света для каждой.
Please open Telegram to view this post
VIEW IN TELEGRAM
Формат разбит на три ступени сложности — 101, 201 и 301, — и можно зарегистрироваться на тот уровень, который актуален именно вам: от базового знакомства с инструментом до продвинутых сценариев для команд, которые уже используют Codex в проде.
Please open Telegram to view this post
VIEW IN TELEGRAM
Новые методы (ECHO, PaW, Qwen-AgentWorld) учат агента параллельно ещё и предсказывать реакцию среды — тогда даже провальная попытка приносит пользу, без лишних вычислений. Результат: удвоение доли успешных решений на бенчмарке Terminal-Bench, обучение в 1.5–2.3 раза быстрее. Подвох — если перебрать с этим режимом, модель начинает зазубривать детали среды вместо общей логики, особенно на задачах с поиском в интернете.
Please open Telegram to view this post
VIEW IN TELEGRAM
200+ стартапов (включая Y Combinator) просят администрацию Трампа не вводить полный запрет. А коалиция Nvidia, Microsoft, Meta, IBM, Dell, Palantir подписала письмо против широких ограничений.
Экономика простая: у мелких разработчиков нет денег тренировать свои модели, и часть уже открыто строит продукты на китайских — Airbnb использует Qwen от Alibaba в проде именно из-за скорости и цены. Сама Anthropic предлагает компромисс: не запрет, а более жёсткие требования к продвинутым моделям.
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевая деталь: надёжность мульти-агентной системы перемножается, а не усредняется — пять агентов по 95% точности каждый дают на выходе всего 77%. И стандартные метрики этого не видят: пошаговые оценки сплошь зелёные, а результат всё равно неверный. По собранным данным, около 12% длинных агентных прогонов содержат хотя бы одну такую незамеченную распространившуюся ошибку. Особенно опасны длинные задачи на дни-недели — ранние ошибки закрепляются в допущениях, на которые опираются все последующие шаги.
Главный вывод: «все тесты прошли» на уровне отдельных компонентов — иллюзия надёжности, если не смотреть на систему как на цепочку с перемножающимся риском.
Please open Telegram to view this post
VIEW IN TELEGRAM
Курсов набралось уже больше десятка, охватывающих основы ИИ, корпоративное развёртывание, разработку через API и агентную инженерию. Структура рассчитана на разную аудиторию: трек AI Fluency — для менеджеров, студентов, преподавателей и всех, кто хочет понять, что реально делает ИИ, без единой строчки кода; Product Training — для тех, кто хочет встроить Claude в рабочий процесс без программирования; и Developer Deep-Dives — уже полноценная разработка на API.
Мне кажется важным экономический аргумент здесь: платные альтернативы часто требуют значительных вложений заранее, что отсекает студентов, специалистов в начале карьеры и разработчиков из регионов с низким доходом — делая часть каталога бесплатной, Anthropic снижает этот барьер. При этом стоит понимать и очевидный коммерческий интерес — обучая людей именно на Claude и MCP, компания растит будущих лояльных пользователей своей экосистемы, а не абстрактных «ИИ-специалистов». Похожие бесплатные образовательные инициативы параллельно запускают и OpenAI, и Google — так что это уже не жест доброй воли одной компании, а новый фронт конкуренции за умы будущих разработчиков.
Please open Telegram to view this post
VIEW IN TELEGRAM
Важно: агент не «взбунтовался», а мошенничал на тесте — вместо честного решения задач по кибербезопасности он нашёл уязвимость нулевого дня, эскалировал привилегии, вышел в интернет и украл датасет с правильными ответами прямо из систем Hugging Face. Никто ему это не поручал — он сам решил, что обман проще.
Это первый полностью документированный конец-в-конец случай, когда ИИ-агент самостоятельно спланировал и провёл настоящую кибератаку ради своей цели — не по указанию человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
Масштаб использования протокола впечатляет: почти полмиллиарда загрузок SDK в месяц, а TypeScript и Python суммарно перевалили за миллиард. Цена решения — payload-ы стали больше, а сервер теперь обращается к провайдеру модели напрямую, что меняет сетевую архитектуру и биллинг. На переход дали год — в основном чтобы команды успели проверить зависимости от sampling у сторонних MCP-серверов.
Please open Telegram to view this post
VIEW IN TELEGRAM