SPADE: ИИ учится, сам придумывая себе задачи
Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.
SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.
Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.
Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.
https://arxiv.org/abs/2608.19197
Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.
SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.
Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.
Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.
https://arxiv.org/abs/2608.19197
FlashPrefill V2: ускоряем prefill в 47 раз (by Tencent)
Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.
Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).
Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.
Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.
https://arxiv.org/abs/2608.19758
Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.
Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).
Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.
Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.
https://arxiv.org/abs/2608.19758
Точность не врёт — она просто ничего не говорит
Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.
Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.
Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).
Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.
https://arxiv.org/abs/2608.17744
Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.
Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.
Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).
Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.
https://arxiv.org/abs/2608.17744
Google DeepMind представил SIMA 2 — новое поколение игрового ИИ-агента.
Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.
Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.
Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.
https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.
Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.
Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.
https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Google DeepMind
Exploring new frontiers of AI and games research
Google DeepMind partners with game developers to build generalist agents like SIMA 2 and unlock breakthrough gameplay experiences across persistent worlds.
Nvidia Tech: GPU-ускорение кластеризации финансовых инструментов для квантов
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
NVIDIA Technical Blog
GPU-Accelerated Clustering for Financial Instruments at Scale
Use AdaptGrow, a GPU-accelerated matrix factorization algorithm, to turn rolling correlation and tail-dependence matrices into hard clusters, soft factor loadings, and structural-break signals at…
Nvidia выпустила DSX MaxLPS — набор технологий для максимальной эффективности ИИ-фабрик в рамках фиксированного энергобюджета.
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
NVIDIA Technical Blog
Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS
AI factories are power-constrained industrial systems. The question is no longer how many GPUs fit in a data center, but how much AI output each available megawatt can deliver.
Агент улучшает себя сам — но без изменения весов (by HKUST)
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
🤔1
Трансформеры забывают контекст — и вот как это починить без переобучения (by Google DeepMind)
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981
Бенчмарки для world models теперь умеют думать сами
Оценивать видео-генераторы типа world models — боль. Существующие бенчмарки выдают скалярные оценки, которые нельзя ни объяснить, ни проверить. Почему модель провалилась? Непонятно.
Авторы HarnessEval-W предлагают радикальный сдвиг: вместо статичного набора метрик — агентный пайплайн оценки. Идея взята из LLM-экосистемы: evaluation harness, то есть «упряжь» для оценщика.
Как работает: главный агент анализирует контекст каждого тест-кейса, выбирает нужные навыки из библиотеки (физика, геометрия, постоянство объектов) и запускает специализированных суб-агентов с инструментами. Например, при оценке столкновения: трекинг bounding boxes, проверка временного пересечения, оценка скорости. Результат — не просто число, а дерево доказательств с полной цепочкой рассуждений.
Бенчмарк покрывает 3 оси: качество рендера, корректность переходов при действиях и сохранность состояния мира во времени. Протестировано 18 моделей.
https://arxiv.org/abs/2608.16859
Оценивать видео-генераторы типа world models — боль. Существующие бенчмарки выдают скалярные оценки, которые нельзя ни объяснить, ни проверить. Почему модель провалилась? Непонятно.
Авторы HarnessEval-W предлагают радикальный сдвиг: вместо статичного набора метрик — агентный пайплайн оценки. Идея взята из LLM-экосистемы: evaluation harness, то есть «упряжь» для оценщика.
Как работает: главный агент анализирует контекст каждого тест-кейса, выбирает нужные навыки из библиотеки (физика, геометрия, постоянство объектов) и запускает специализированных суб-агентов с инструментами. Например, при оценке столкновения: трекинг bounding boxes, проверка временного пересечения, оценка скорости. Результат — не просто число, а дерево доказательств с полной цепочкой рассуждений.
Бенчмарк покрывает 3 оси: качество рендера, корректность переходов при действиях и сохранность состояния мира во времени. Протестировано 18 моделей.
https://arxiv.org/abs/2608.16859
NVIDIA достигла 100% на ARC-AGI-3
NVIDIA представила архитектуру агентов AVO (Agentic Variation Operators), которая набрала 100 баллов на бенчмарке ARC-AGI-3, пройдя все 183 уровня в 25 средах.
Ключевой момент: базовая модель Claude Opus 5 самостоятельно справляется лишь с 30% заданий. AVO поднимает этот показатель до 100% — не за счёт более мощной модели, а за счёт архитектуры системы вокруг неё.
AVO работает через постоянную память, супервизор для отслеживания прогресса и автономный цикл гипотез-действий-проверки. Та же система ранее оптимизировала GPU-ядра без участия человека 7 дней подряд и превзошла FlashAttention-4 на 10,5%.
Вывод прост: будущее агентного ИИ — не в гонке за мощностью моделей, а в грамотном системном дизайне вокруг них.
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
NVIDIA представила архитектуру агентов AVO (Agentic Variation Operators), которая набрала 100 баллов на бенчмарке ARC-AGI-3, пройдя все 183 уровня в 25 средах.
Ключевой момент: базовая модель Claude Opus 5 самостоятельно справляется лишь с 30% заданий. AVO поднимает этот показатель до 100% — не за счёт более мощной модели, а за счёт архитектуры системы вокруг неё.
AVO работает через постоянную память, супервизор для отслеживания прогресса и автономный цикл гипотез-действий-проверки. Та же система ранее оптимизировала GPU-ядра без участия человека 7 дней подряд и превзошла FlashAttention-4 на 10,5%.
Вывод прост: будущее агентного ИИ — не в гонке за мощностью моделей, а в грамотном системном дизайне вокруг них.
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
NVIDIA Technical Blog
NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents
A frontier language model is only one component of an AI agent. The surrounding agent system—often called a harness—determines how the model receives context, uses tools, maintains state…
PyTorch + IBM: ИИ-агенты ускоряют запуск моделей на новом железе
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
Hydra-0: один интерфейс для управления любым роботом
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Зачем делать backprop через 15-шаговый агент, если можно просто пошуметь по весам?
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Синтез задач для терминальных агентов: как не потерять смысл по дороге
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580
Amazon Science выпустила SOP-Bench — открытый бенчмарк для оценки AI-агентов на реальных бизнес-процедурах.
Большинство существующих тестов проверяют агентов на изолированных задачах с чистыми данными. SOP-Bench идёт дальше: 2000+ задач из 12 отраслей (медицина, логистика, финансы, модерация контента), реальные рабочие инструкции с намеренной неоднозначностью, работающие API-инструменты и эталонные ответы для объективной оценки.
Ключевой вывод из тестирования 11 топовых моделей: новые модели не всегда лучше, больше инструментов иногда снижает успешность, и ни одна модель не побеждает во всех сценариях.
Бенчмарк открытый — команды могут тестировать собственных агентов и добавлять свои процедуры. Это важно для компаний, которые хотят реально оценить AI-агентов перед внедрением в продакшн, а не полагаться на красивые демо.
https://www.amazon.science/blog/sop-bench-a-new-benchmark-for-evaluating-ai-agents-on-real-business-procedures
Большинство существующих тестов проверяют агентов на изолированных задачах с чистыми данными. SOP-Bench идёт дальше: 2000+ задач из 12 отраслей (медицина, логистика, финансы, модерация контента), реальные рабочие инструкции с намеренной неоднозначностью, работающие API-инструменты и эталонные ответы для объективной оценки.
Ключевой вывод из тестирования 11 топовых моделей: новые модели не всегда лучше, больше инструментов иногда снижает успешность, и ни одна модель не побеждает во всех сценариях.
Бенчмарк открытый — команды могут тестировать собственных агентов и добавлять свои процедуры. Это важно для компаний, которые хотят реально оценить AI-агентов перед внедрением в продакшн, а не полагаться на красивые демо.
https://www.amazon.science/blog/sop-bench-a-new-benchmark-for-evaluating-ai-agents-on-real-business-procedures
Amazon Science
SOP-Bench: A new benchmark for evaluating AI agents on real business procedures
Extendable framework enables testing agents on the full set of capabilities required to successfully complete a procedure, not isolated proxy tasks.
Один агент — хорошо, а граф агентов — лучше
Свежий большой survey о том, как строить мультиагентные системы на базе LLM. Авторы вводят понятие Graph Engineering — способ организации агентов не просто в цепочки, а в графы с явной структурой задач, координацией и управлением состоянием.
Иерархия такая: Model Intelligence (один LLM) → Individual Intelligence (агент с инструментами и памятью) → System Intelligence (граф агентов). Каждый уровень решает то, что предыдущий не может.
Ключевые компоненты Graph Engineering: декомпозиция задач в граф подзадач, оптимизация воркфлоу, моделирование возможностей агентов, их командная организация, коммуникация между ними, и — что важно — управление состоянием в рантайме с локализацией и восстановлением после сбоев.
Авторы также смотрят вперёд: следующий уровень после графов — Ontology Engineering, где агенты разделяют общую семантику и выравнивают цели.
https://arxiv.org/abs/2608.21156
Свежий большой survey о том, как строить мультиагентные системы на базе LLM. Авторы вводят понятие Graph Engineering — способ организации агентов не просто в цепочки, а в графы с явной структурой задач, координацией и управлением состоянием.
Иерархия такая: Model Intelligence (один LLM) → Individual Intelligence (агент с инструментами и памятью) → System Intelligence (граф агентов). Каждый уровень решает то, что предыдущий не может.
Ключевые компоненты Graph Engineering: декомпозиция задач в граф подзадач, оптимизация воркфлоу, моделирование возможностей агентов, их командная организация, коммуникация между ними, и — что важно — управление состоянием в рантайме с локализацией и восстановлением после сбоев.
Авторы также смотрят вперёд: следующий уровень после графов — Ontology Engineering, где агенты разделяют общую семантику и выравнивают цели.
https://arxiv.org/abs/2608.21156
Агент, который учится на своих же победах — без дообучения
Обычно LLM-агенты каждый раз заново "изобретают велосипед": решили задачу через workflow — и забыли. FlowEvo от Southeast University ломает этот паттерн.
Идея: когда агент успешно решает задачу, полезная часть workflow компилируется в исполняемый "скилл" и кладётся в персистентный банк. При следующих задачах скиллы либо запускаются напрямую, либо используются как структурный контекст для генерации нового workflow.
Получается петля: workflow → скилл → новый workflow. Причём всё это без обновления весов модели — чисто inference-time эволюция.
Ещё интересная деталь: есть lifecycle-механизм, который отслеживает "пользу" каждого скилла и автоматически подавляет те, что стабильно вредят.
Проверили на 5 бенчмарках (ALFWorld, HumanEval, MBPP, GSM8K, MATH-500) — лучше 8 базелайнов на всех, работает с 10 разными базовыми моделями.
https://arxiv.org/abs/2607.21596
Обычно LLM-агенты каждый раз заново "изобретают велосипед": решили задачу через workflow — и забыли. FlowEvo от Southeast University ломает этот паттерн.
Идея: когда агент успешно решает задачу, полезная часть workflow компилируется в исполняемый "скилл" и кладётся в персистентный банк. При следующих задачах скиллы либо запускаются напрямую, либо используются как структурный контекст для генерации нового workflow.
Получается петля: workflow → скилл → новый workflow. Причём всё это без обновления весов модели — чисто inference-time эволюция.
Ещё интересная деталь: есть lifecycle-механизм, который отслеживает "пользу" каждого скилла и автоматически подавляет те, что стабильно вредят.
Проверили на 5 бенчмарках (ALFWorld, HumanEval, MBPP, GSM8K, MATH-500) — лучше 8 базелайнов на всех, работает с 10 разными базовыми моделями.
https://arxiv.org/abs/2607.21596
ReWorld: мировая модель с долгосрочной памятью (by Alibaba/TongyiLab)
Представьте: вы гуляете по виртуальному миру, уходите далеко, возвращаетесь — и место выглядит точно так же, как вы его оставили. Это и есть задача ReWorld.
Проблема: управление (следить за командами камеры) и память (помнить посещённые места) конфликтуют при совместном обучении. Авторы разделили их через mixed attention windows: одни головы трансформера обучаются на коротких окнах (контроль), другие — на длинных (память). Чтобы это работало на инференсе с ограниченным KV-кешем, используется random head routing — каждый шаг случайно меняется, какие головы "глобальные".
Для долгосрочной памяти: старые чанки сохраняются как "landmarks" по пространственному расстоянию, а при возврате в локацию извлекаются по близости позы камеры. Chunk-drop training учит модель работать с неполной историей.
Результат: стриминговая генерация видео в реальном времени с пространственной консистентностью на длинных роллаутах.
https://arxiv.org/abs/2608.23565
Представьте: вы гуляете по виртуальному миру, уходите далеко, возвращаетесь — и место выглядит точно так же, как вы его оставили. Это и есть задача ReWorld.
Проблема: управление (следить за командами камеры) и память (помнить посещённые места) конфликтуют при совместном обучении. Авторы разделили их через mixed attention windows: одни головы трансформера обучаются на коротких окнах (контроль), другие — на длинных (память). Чтобы это работало на инференсе с ограниченным KV-кешем, используется random head routing — каждый шаг случайно меняется, какие головы "глобальные".
Для долгосрочной памяти: старые чанки сохраняются как "landmarks" по пространственному расстоянию, а при возврате в локацию извлекаются по близости позы камеры. Chunk-drop training учит модель работать с неполной историей.
Результат: стриминговая генерация видео в реальном времени с пространственной консистентностью на длинных роллаутах.
https://arxiv.org/abs/2608.23565
Nvidia представила Spectrum-X Ethernet — сетевую архитектуру нового поколения для гигамасштабных ИИ-кластеров.
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
NVIDIA представила результаты нового бенчмарка AgentX
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA Technical Blog
NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt
AI agents have expanded inference from single-turn interactions into multi-step workflows that reason, invoke tools, coordinate subagents, and carry growing context from one turn to the next.
NVIDIA представила Scale-In — пятый столп сетевой инфраструктуры для ИИ-фабрик
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
NVIDIA Technical Blog
NVIDIA BlueField-4 Powers New Scale-In Network Infrastructure for Agentic AI Factories
Traditional cloud infrastructure was designed for predictable, general-purpose workloads and standard interfaces. Agentic AI factories connect diverse users, agents, applications, data sources…