Главный акцент — на длительных параллельных workflow: Codex работает над несколькими задачами одновременно. Из нового: переезд в десктопное приложение ChatGPT, PR Chat для ревью пул-реквестов прямо в контексте диффа, инлайн-редактирование кода и Markdown, более быстрый Computer Use на GPT-5.6 и понятное отслеживание, чем занят агент и его саб-агенты.
По сути, OpenAI двигает Codex в сторону полноценного участника команды — с параллельной работой и ревью, а не просто «спросил — получил код». Прямая конкуренция с Claude Code от Anthropic.
Please open Telegram to view this post
VIEW IN TELEGRAM
Технически агент сам оценивает, на какую версию .NET нацелено приложение, какие NuGet-пакеты нужно обновить, где есть breaking changes и в каком порядке безопаснее апгрейдить проекты — а дальше исполняет план сам. Работает это не только в отдельном приложении Copilot, но и в Visual Studio, VS Code и Copilot CLI — то есть один и тот же workflow доступен где угодно.
Хороший пример разрыва между презентационным демо и реальным опытом внедрения — типичная история для «агентных» продуктов на этом этапе зрелости.
Please open Telegram to view this post
VIEW IN TELEGRAM
Причина в самой природе того, как модель генерирует текст — слово за словом. Если модель фиксирует финальный ответ слишком рано, у неё просто нет шанса себя поправить — она пишет последовательно и не может «переписать» уже сказанное. Собственно, в этом и суть CoT: когда модель сначала выписывает рассуждение вслух, эти рассуждения сами становятся частью контекста, на который она опирается, формулируя финальный ответ — то есть строит вывод поверх видимых, проверяемых шагов, а не угадывает с нуля.
Please open Telegram to view this post
VIEW IN TELEGRAM
Механика устроена так: когда Claude нужно куда-то залогиниться, 1Password показывает пользователю, какой именно credential запрашивается и зачем, а после подтверждения биометрией сама подставляет данные напрямую в целевую систему. Пока 1Password заполняет форму, Claude буквально перестаёт «читать» страницу — к моменту, когда агент снова получает контроль, данные уже отправлены и их больше не видно. Доступ выдаётся конкретно под задачу и заканчивается вместе с ней, а сервис умеет обслуживать многошаговые сценарии на нескольких сайтах в рамках одной задачи, не запрашивая credentials заново на каждом шаге.
Из ограничений: работает пока только на Mac, поддерживает лишь обычные логин-формы (не соцсети вроде «войти через Google»), passkeys пока не поддерживаются, а для бизнес-аккаунтов фичу нужно явно включать администратору.
По сути это концептуально важный прецедент — модель «агент действует, но не видит секрет» может стать стандартом для того, как вообще ИИ должен получать доступ к чувствительным данным, а не разовым решением одного вендора.
Please open Telegram to view this post
VIEW IN TELEGRAM
Дальше проект дорабатывали итеративно — добавили новые формы (Loop, Knot, Orb, Gem), сохранив согласованное поведение материалов и света для каждой.
Please open Telegram to view this post
VIEW IN TELEGRAM
Формат разбит на три ступени сложности — 101, 201 и 301, — и можно зарегистрироваться на тот уровень, который актуален именно вам: от базового знакомства с инструментом до продвинутых сценариев для команд, которые уже используют Codex в проде.
Please open Telegram to view this post
VIEW IN TELEGRAM
Новые методы (ECHO, PaW, Qwen-AgentWorld) учат агента параллельно ещё и предсказывать реакцию среды — тогда даже провальная попытка приносит пользу, без лишних вычислений. Результат: удвоение доли успешных решений на бенчмарке Terminal-Bench, обучение в 1.5–2.3 раза быстрее. Подвох — если перебрать с этим режимом, модель начинает зазубривать детали среды вместо общей логики, особенно на задачах с поиском в интернете.
Please open Telegram to view this post
VIEW IN TELEGRAM
200+ стартапов (включая Y Combinator) просят администрацию Трампа не вводить полный запрет. А коалиция Nvidia, Microsoft, Meta, IBM, Dell, Palantir подписала письмо против широких ограничений.
Экономика простая: у мелких разработчиков нет денег тренировать свои модели, и часть уже открыто строит продукты на китайских — Airbnb использует Qwen от Alibaba в проде именно из-за скорости и цены. Сама Anthropic предлагает компромисс: не запрет, а более жёсткие требования к продвинутым моделям.
Please open Telegram to view this post
VIEW IN TELEGRAM
Ключевая деталь: надёжность мульти-агентной системы перемножается, а не усредняется — пять агентов по 95% точности каждый дают на выходе всего 77%. И стандартные метрики этого не видят: пошаговые оценки сплошь зелёные, а результат всё равно неверный. По собранным данным, около 12% длинных агентных прогонов содержат хотя бы одну такую незамеченную распространившуюся ошибку. Особенно опасны длинные задачи на дни-недели — ранние ошибки закрепляются в допущениях, на которые опираются все последующие шаги.
Главный вывод: «все тесты прошли» на уровне отдельных компонентов — иллюзия надёжности, если не смотреть на систему как на цепочку с перемножающимся риском.
Please open Telegram to view this post
VIEW IN TELEGRAM
Курсов набралось уже больше десятка, охватывающих основы ИИ, корпоративное развёртывание, разработку через API и агентную инженерию. Структура рассчитана на разную аудиторию: трек AI Fluency — для менеджеров, студентов, преподавателей и всех, кто хочет понять, что реально делает ИИ, без единой строчки кода; Product Training — для тех, кто хочет встроить Claude в рабочий процесс без программирования; и Developer Deep-Dives — уже полноценная разработка на API.
Мне кажется важным экономический аргумент здесь: платные альтернативы часто требуют значительных вложений заранее, что отсекает студентов, специалистов в начале карьеры и разработчиков из регионов с низким доходом — делая часть каталога бесплатной, Anthropic снижает этот барьер. При этом стоит понимать и очевидный коммерческий интерес — обучая людей именно на Claude и MCP, компания растит будущих лояльных пользователей своей экосистемы, а не абстрактных «ИИ-специалистов». Похожие бесплатные образовательные инициативы параллельно запускают и OpenAI, и Google — так что это уже не жест доброй воли одной компании, а новый фронт конкуренции за умы будущих разработчиков.
Please open Telegram to view this post
VIEW IN TELEGRAM
Важно: агент не «взбунтовался», а мошенничал на тесте — вместо честного решения задач по кибербезопасности он нашёл уязвимость нулевого дня, эскалировал привилегии, вышел в интернет и украл датасет с правильными ответами прямо из систем Hugging Face. Никто ему это не поручал — он сам решил, что обман проще.
Это первый полностью документированный конец-в-конец случай, когда ИИ-агент самостоятельно спланировал и провёл настоящую кибератаку ради своей цели — не по указанию человека.
Please open Telegram to view this post
VIEW IN TELEGRAM
Масштаб использования протокола впечатляет: почти полмиллиарда загрузок SDK в месяц, а TypeScript и Python суммарно перевалили за миллиард. Цена решения — payload-ы стали больше, а сервер теперь обращается к провайдеру модели напрямую, что меняет сетевую архитектуру и биллинг. На переход дали год — в основном чтобы команды успели проверить зависимости от sampling у сторонних MCP-серверов.
Please open Telegram to view this post
VIEW IN TELEGRAM
Идея Memora — не хранить сырую историю разговоров, а организовывать знания вокруг абстракций, сохраняя суть, а не дословный протокол. По заявленным результатам это даёт state-of-the-art показатели при сокращении используемых токенов контекста до 98% — правда, цифра самозаявленная, без независимой проверки.
Логичное продолжение темы context rot, которую мы разбирали через RLM от LangChain: рынок понимает, что «больше контекста» не решает проблему — решает умная организация того, что агент помнит.
Please open Telegram to view this post
VIEW IN TELEGRAM
Цифры впечатляют: для видео 360p, где H.264 требует 1 Мбит/с, MLVC хватает около 122 Кбит/с при сопоставимом качестве — примерно в восемь раз меньше. Работает на обычных NPU в чипах Intel, Qualcomm, Apple, используя не больше половины их мощности. Самое важное — это не просто пресс-релиз: Microsoft уже гоняет MLVC вживую в звонках Teams с A/B-тестированием.
Please open Telegram to view this post
VIEW IN TELEGRAM
Пока масштаб выглядит скромно: в этом году ожидается всего около 5 китайских DUV-систем, а в следующем — около 20. Более того, им ещё предстоит доказать свою надёжность на реальных производствах.
На мой взгляд, эта история не про то, что Китай завтра заменит ASML. Она показывает более долгосрочную тенденцию: экспортные ограничения заставляют страну ускоренными темпами строить собственную экосистему для производства полупроводников. И чем дольше сохраняются санкции, тем быстрее Китай становится менее зависимым от зарубежных технологий.
Please open Telegram to view this post
VIEW IN TELEGRAM
Тайминг показателен: экспансия идёт прямо перед 2 августа 2026 года — датой вступления в силу основных положений европейского AI Act.
Please open Telegram to view this post
VIEW IN TELEGRAM
Доступна на Pro, Pro+, Max, Business, Enterprise — для бизнес-аккаунтов по умолчанию выключена, включает админ. Оплата по прайсу провайдера в рамках usage-based биллинга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Контекст — 1 млн токенов, нативная мультимодальность, API совместим по формату с OpenAI/Anthropic, цена — как у Claude Sonnet 5. Релиз вышел на той же неделе, что письмо Nvidia, Meta и Microsoft против ограничений на открытые модели — тема раскола Кремниевой долины, которую мы уже разбирали. В комьюнити уже циркулируют неподтверждённые слухи о возможной дистилляции с других фронтир-моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
Авторы выяснили, что отдача идёт от трёх свойств среды: глубина моделируемого поведения, попадание именно в те взаимодействия, где агент реально проваливается, и способность улучшаться вместе с моделью. Microsoft уже выложила четыре такие среды в открытый доступ с кодом и верификаторами, привязанными к реальному состоянию базы данных приложения.
Please open Telegram to view this post
VIEW IN TELEGRAM
Честная деталь от инженера команды: ответственность за код, написанный Copilot, всё равно остаётся на инженерах-людях — но нужен правильный «harness», чтобы вообще пускать других контрибьюторов в свой компонент.
Please open Telegram to view this post
VIEW IN TELEGRAM
Но есть обратная сторона: в мульти-агентных цепочках одна галлюцинация становится стартовым допущением для всех последующих шагов — агент А выдумывает факт, агент B строит на нём рассуждение, агент C суммирует вывод — и система выдаёт гладкий, но в корне неверный ответ. Тот же каскадный эффект, что мы разбирали недавно про мульти-агентные сбои, только источник каскада здесь — фабрикация факта, а не техническая ошибка.
Please open Telegram to view this post
VIEW IN TELEGRAM