Технически для старта нужны всего два элемента: seed-программа — исходный алгоритм с явно помеченными участками кода, которые разрешено оптимизировать, и evaluator — детерминированный скрипт на стороне пользователя, который компилирует, тестирует и оценивает каждый сгенерированный вариант, возвращая числовые метрики. Дальше цикл простой: клиентский раннер запрашивает у API AlphaEvolve мутировавших кандидатов, прогоняет их через свой evaluator (он может крутиться где угодно) и отправляет оценки обратно, из которых AlphaEvolve выбирает следующие направления поиска.
По сути, порог входа здесь ниже, чем можно было ожидать — не нужно быть исследователем в ML, достаточно уметь написать evaluator для своей задачи.
Please open Telegram to view this post
VIEW IN TELEGRAM
Сервер построен вокруг трёх функций: поиск (запрос вроде «найди датасеты для изучения температуры океана» возвращает подходящие наборы с описанием и условиями лицензии), изучение метаданных (можно попросить подробности по конкретному датасету или найти похожие) и оценка пригодности — ассистент показывает структуру S3-бакета, форматы файлов и партиционирование, а также может «заглянуть» в конкретный файл и показать его содержимое до того, как вы начнёте полноценную работу с данными.
claude mcp add roda-mcp uvx awslabs.roda-mcp-server@latest), проект открытый, под лицензией Apache 2.0.По сути это ещё один пример того, как MCP-протокол Anthropic становится стандартной «прослойкой» между ИИ-ассистентами и специализированными источниками данных — не нужно писать кастомную интеграцию под каждый каталог, достаточно поднять MCP-сервер один раз. Хорошая иллюстрация того, куда движется вся эта экосистема: от «спроси у чат-бота» к «дай агенту прямой доступ к твоим инструментам и данным».
Please open Telegram to view this post
VIEW IN TELEGRAM
/plugin marketplace add langchain-ai/langsmith-claude-code-plugins), ставишь сам плагин (/plugin install langsmith-tracing) и перезагружаешь плагины. Плюс один JSON-блок с переменными окружения — API-ключ LangSmith и название проекта.После этого в трассу автоматически попадает буквально всё: полная история диалога с моделью, каждый вызов инструмента (Bash, Read, Edit, Grep и другие) с входными и выходными данными, запуски саб-агентов как дочерние спаны, события сжатия контекста (compaction) и даже прерванные ответы — они помечаются как interrupted, а не просто теряются. В LangSmith это превращается в дерево выполнения сессии, а не плоский лог, и по вкладке Threads можно проследить весь многошаговый диалог целиком.
Системные промпты в трассу не попадают — Claude Code их просто не возвращает в транскриптах разговора, так что это единственное существенное ограничение подхода.
Please open Telegram to view this post
VIEW IN TELEGRAM
По умолчанию модель отключена — включать должен админ организации, проверить доступность можно через вкладку Models в Copilot CLI. Из практичного — цена: 95 AI-кредитов за миллион входных токенов и 400 за миллион выходных (кредит ≈ 1 цент), что делает её одной из самых дешёвых в линейке. При этом, по внутренним тестам GitHub, по качеству агентного кодинга Kimi K2.7 Code сопоставима с фронтир-моделями, а по скорости первого токена и общей отзывчивости — одна из самых быстрых в линейке, плюс 95% попаданий в кеш, что тоже про эффективность.
Доступна уже сейчас для Pro, Pro+ и Max, для бизнес- и энтерпрайз-аккаунтов — в ближайшие недели.
Заметный шаг: раньше открытые модели в основном ассоциировались с self-hosting и энтузиастами, а тут крупная открытая модель заходит прямо в мейнстримный продукт наравне с закрытыми фронтир-моделями.
Please open Telegram to view this post
VIEW IN TELEGRAM
Цифра про клики укладывается в то, что Принс говорит уже больше года: соотношение «сколько страниц краулит поисковик на одного реального посетителя» стремительно растёт — у Google счёт идёт на десятки страниц на клик, у ИИ-ассистентов вроде OpenAI и Anthropic — на сотни и тысячи. Люди получают готовый ответ прямо в чате и просто перестают переходить по ссылкам на источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
1. Sliding window — помнит только последние N ходов. Дёшево, но чревато «цифровой амнезией» и зацикливанием.
2. Recursive summarization — сжимает старую историю в саммари, как JPEG. Держит общий «сюжет», но теряет детали.
3. Structured state management — вместо истории агент ведёт компактный JSON с целями и фактами. Экономно, но всё, что не заложено в схему, агент просто не увидит.
4. RAG-подход — вся история хранится во внешней базе, в промпт подтягивается только релевантное. Работает почти бесконечно, но рискует упустить связь между непохожими друг на друга событиями.
5. Dynamic context routing — рутину делает дешёвая модель, а когда агент застревает — подключается мощная модель с полной историей. Экономично, но сложно надёжно ловить момент, когда модель застряла.
Вывод автора: цель не бесконечная память, а архитектура, которая осознанно решает, что помнить, а что забыть.
Please open Telegram to view this post
VIEW IN TELEGRAM
Из того, что реально важно, если вы строите не игрушку, а что-то, что пойдёт в прод: граф-оркестрация с параллельными и групповыми паттернами, чекпоинты с возможностью откатить состояние назад, контроль человека в процессе, наблюдаемость через OpenTelemetry, поддержка MCP, A2A и интеграция с Foundry и GitHub Copilot SDK. RAG «из коробки» и декларативных агентов пока нет — их обещают позже.
Please open Telegram to view this post
VIEW IN TELEGRAM
Тут же — запуск Claude Sonnet 5: модель дешевле в использовании, с улучшенным агентным кодингом и более высокими бенчмарками, сниженной частотой «неправильного» поведения и защитами от кибератак по умолчанию — хотя по чисто кибербезопасностным возможностям она всё ещё слабее топовых моделей рынка. Из инструментов упоминают NotebookLM от Google, который теперь умеет сжимать загруженные исследования в вертикальные видео в духе TikTok, и новый Nano Banana 2 Lite — более быстрый и дешёвый генератор изображений от Google.
Please open Telegram to view this post
VIEW IN TELEGRAM
Фишка не в самом железе (обычные низкопрофильные механические свитчи, выбор между тихими и щёлкающими, подключение по USB-C или Bluetooth), а в шести подсвечиваемых «agent keys» сверху: каждая клавиша привязывается к конкретному агенту Codex, и цвет подсветки показывает его статус — белый значит «простаивает», синий — «думает», зелёный — «закончил», красный — «ошибка». Одно нажатие выбирает агента, двойное — выводит его на передний план. Внизу — клавиши для принятия/отклонения правок агента и кнопка push-to-talk, потому что, видимо, разговаривать с Codex голосом — это следующая ступень принятия в Кремниевой долине. Всё перепрограммируется через фирменное приложение Work Louder, в комплекте — 32 дополнительных кейкапа, включая клавиши «yolo» и «yeet» для любителей vibe-коддинга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Контекст важен: Fable уже переживала турбулентный запуск — спустя три дня после релиза в начале июня Anthropic была вынуждена приостановить доступ к модели из-за требований экспортного контроля США, а 1 июля восстановила его, честно предупредив, что новые защитные механизмы будут блокировать чуть больше безобидных запросов, чем раньше. Пользователи в соцсетях действительно жаловались на избыточные отказы, и по некоторым темам, связанным с разработкой крупных моделей, Fable вообще перенаправляет запросы на более старую версию.
Кажется, это уже не просто спор про чувствительность фильтров — а публичная разминка перед тем, как крупные игроки начнут пересматривать зависимость друг от друга.
Please open Telegram to view this post
VIEW IN TELEGRAM
Пока новая возможность с исполнением кода доступна подписчикам Google AI Ultra и части бизнес-клиентов Workspace, в ближайшие недели её обещают раскатать на Pro-пользователей, а вот про бесплатный тариф компания пока молчит — типичная история для Google, где топовые фичи сначала достаются платящим.
Продукт вырос из скромного Project Tailwind, показанного на Google I/O 2023, и успел набрать больше 30 миллионов пользователей и 600 тысяч организаций — солидная база для инструмента, который изначально позиционировался как нишевый помощник для работы с документами. С этим апдейтом блокноты уже доступны прямо внутри приложения Gemini, а скоро появятся и в AI Mode поиска Google.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Эта работа впервые честно смотрит на весь путь атакующего контента — от публикации до реального попадания в обучающую выборку модели.
Для этого авторы предложили метод HalfLife — он оценивает вероятность того, что вредоносный текст не просто появится на странице, а действительно пройдёт весь конвейер: попадёт в краулинг, сохранится в виде читаемого текста, а затем переживёт автоматические фильтры качества, которые компании и так применяют к своим корпусам. Итоговая цифра выживаемости для отравления через комментарии оказалась скромной — около 0,13%. Звучит как ничтожная величина, но важно учитывать масштаб: авторы напоминают, что по прошлым исследованиям всего 250 отравленных документов достаточно, чтобы встроить в модель бэкдор, а значит атакующему хватило бы «испортить» от 100 тысяч до миллиона веб-страниц — вполне посильная задача при наличии автоматизированной публикации комментариев и учитывая, насколько массово открытые формы для комментариев встречаются в вебе.
По сути, работа переводит атаку на данные из области абстрактной теории в область измеримого практического риска — с конкретной методологией, кодом в открытом доступе и числами, а не просто «в принципе это возможно».
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Решение — вынести прогресс поиска из «головы» агента в общее структурированное состояние: карту найденных фактов с цитатами, карту покрытия задачи и отдельную память неудачных попыток, чтобы не наступать на одни грабли дважды.
Тот же тренд, что мы видели у LangChain с RLM: координацию и память выносят из модели во внешнее структурированное состояние.
Please open Telegram to view this post
VIEW IN TELEGRAM
Разница между инструкциями и скиллами тут принципиальная. Custom instructions (
copilot-instructions.md) — это всегда включённый базовый контекст: стандарты кода, соглашения по стилю, то, что применимо почти к каждой задаче в репозитории. Скиллы (.github/skills/) устроены иначе — это папки с инструкциями, скриптами и ресурсами, которые Copilot подгружает не всегда, а только когда запрос реально совпадает с описанием скилла. Технически это происходит прогрессивно: сначала Copilot читает только имя и краткое описание скилла, и лишь когда пользовательский запрос ему соответствует — подгружает в контекст полное содержимое SKILL.md. Это заметно экономит контекстное окно по сравнению с попыткой держать в промпте все инструкции сразу.Главная мысль видео простая: правильно настроенные инструкции — это не разовая формальность для галочки, а рабочий механизм, который даёт стабильно лучшие результаты, предлагает варианты, которые вы могли упустить, и иногда приятно удивляет.
Please open Telegram to view this post
VIEW IN TELEGRAM
Главный акцент — на длительных параллельных workflow: Codex работает над несколькими задачами одновременно. Из нового: переезд в десктопное приложение ChatGPT, PR Chat для ревью пул-реквестов прямо в контексте диффа, инлайн-редактирование кода и Markdown, более быстрый Computer Use на GPT-5.6 и понятное отслеживание, чем занят агент и его саб-агенты.
По сути, OpenAI двигает Codex в сторону полноценного участника команды — с параллельной работой и ревью, а не просто «спросил — получил код». Прямая конкуренция с Claude Code от Anthropic.
Please open Telegram to view this post
VIEW IN TELEGRAM
Технически агент сам оценивает, на какую версию .NET нацелено приложение, какие NuGet-пакеты нужно обновить, где есть breaking changes и в каком порядке безопаснее апгрейдить проекты — а дальше исполняет план сам. Работает это не только в отдельном приложении Copilot, но и в Visual Studio, VS Code и Copilot CLI — то есть один и тот же workflow доступен где угодно.
Хороший пример разрыва между презентационным демо и реальным опытом внедрения — типичная история для «агентных» продуктов на этом этапе зрелости.
Please open Telegram to view this post
VIEW IN TELEGRAM
Причина в самой природе того, как модель генерирует текст — слово за словом. Если модель фиксирует финальный ответ слишком рано, у неё просто нет шанса себя поправить — она пишет последовательно и не может «переписать» уже сказанное. Собственно, в этом и суть CoT: когда модель сначала выписывает рассуждение вслух, эти рассуждения сами становятся частью контекста, на который она опирается, формулируя финальный ответ — то есть строит вывод поверх видимых, проверяемых шагов, а не угадывает с нуля.
Please open Telegram to view this post
VIEW IN TELEGRAM
Механика устроена так: когда Claude нужно куда-то залогиниться, 1Password показывает пользователю, какой именно credential запрашивается и зачем, а после подтверждения биометрией сама подставляет данные напрямую в целевую систему. Пока 1Password заполняет форму, Claude буквально перестаёт «читать» страницу — к моменту, когда агент снова получает контроль, данные уже отправлены и их больше не видно. Доступ выдаётся конкретно под задачу и заканчивается вместе с ней, а сервис умеет обслуживать многошаговые сценарии на нескольких сайтах в рамках одной задачи, не запрашивая credentials заново на каждом шаге.
Из ограничений: работает пока только на Mac, поддерживает лишь обычные логин-формы (не соцсети вроде «войти через Google»), passkeys пока не поддерживаются, а для бизнес-аккаунтов фичу нужно явно включать администратору.
По сути это концептуально важный прецедент — модель «агент действует, но не видит секрет» может стать стандартом для того, как вообще ИИ должен получать доступ к чувствительным данным, а не разовым решением одного вендора.
Please open Telegram to view this post
VIEW IN TELEGRAM
Дальше проект дорабатывали итеративно — добавили новые формы (Loop, Knot, Orb, Gem), сохранив согласованное поведение материалов и света для каждой.
Please open Telegram to view this post
VIEW IN TELEGRAM
Формат разбит на три ступени сложности — 101, 201 и 301, — и можно зарегистрироваться на тот уровень, который актуален именно вам: от базового знакомства с инструментом до продвинутых сценариев для команд, которые уже используют Codex в проде.
Please open Telegram to view this post
VIEW IN TELEGRAM
Новые методы (ECHO, PaW, Qwen-AgentWorld) учат агента параллельно ещё и предсказывать реакцию среды — тогда даже провальная попытка приносит пользу, без лишних вычислений. Результат: удвоение доли успешных решений на бенчмарке Terminal-Bench, обучение в 1.5–2.3 раза быстрее. Подвох — если перебрать с этим режимом, модель начинает зазубривать детали среды вместо общей логики, особенно на задачах с поиском в интернете.
Please open Telegram to view this post
VIEW IN TELEGRAM