Nvidia выпустила SkillEvaluator — открытый инструмент для оценки влияния AI-навыков на производительность агентов.
Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.
Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).
Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.
Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.
https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.
Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).
Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.
Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.
https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
NVIDIA Technical Blog
Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
AI agents are only as effective as the context they receive. Even with capable models and well-documented NVIDIA libraries, agents can spend extra steps finding the right tools, burn tokens on dead…
EnvHarness: «прокачай» среду, а не модель (by Google)
Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.
Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.
Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу
Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.
Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.
https://arxiv.org/abs/2608.19880
Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.
Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.
Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу
Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.
Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.
https://arxiv.org/abs/2608.19880
CO-RL: как обучить LLM рассуждать без единого лейбла?
Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!
CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.
Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.
https://arxiv.org/abs/2608.17253
Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!
CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.
Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.
https://arxiv.org/abs/2608.17253
AI-учёный, который смотрит на данные своими глазами
Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.
Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.
Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.
Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.
https://arxiv.org/abs/2608.13558
Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.
Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.
Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.
Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.
https://arxiv.org/abs/2608.13558
Microsoft Research обновила Skala до версии 1.1 — своего ИИ-инструмента для квантовохимических расчётов.
Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.
Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.
Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.
https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.
Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.
Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.
https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Microsoft Research
Broadening access to Skala creates a faster path to predictive DFT
Skala 1.1, the updated deep-learning exchange-correlation functional from Microsoft Research, provides greater accuracy, expanded accessibility across the computational chemistry ecosystem, and a living benchmark to track computational performance.
Nvidia представила новый подход к рекомендательным системам на базе генеративного ИИ.
Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.
Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.
Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.
https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.
Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.
Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.
https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
NVIDIA Technical Blog
How Generative Recommenders Are Redefining RecSys at Scale
Recommender systems (RecSys) are one of the most ubiquitous machine learning problems in the consumer internet industry yet notoriously difficult to train and serve at scale. The advent of LLMs has…
Apple ML опубликовала исследование о многоязычном обучении языковых моделей.
Проблема: для языков с малым количеством данных сложно обучить хорошие языковые модели — знания приходится переносить из английского, но существующие методы требуют больших параллельных корпусов или дополнительных моделей перевода.
Решение — метод LINK: во время предобучения часть английских слов случайно заменяется их переводами на целевой язык. Для этого нужен только двуязычный словарь, который можно получить практически бесплатно для любого языка.
Результаты на 8 языках и 5 размерах моделей: заметный прирост качества на downstream-задачах и до 2x ускорение обучения до эквивалентного уровня производительности.
Почему важно: метод работает без переводчиков, параллельных данных и дополнительных этапов обучения — это реальный шанс сделать AI-технологии доступнее для малоресурсных языков.
https://machinelearning.apple.com/research/multilingual-knowledge-transfer-lexical-interventions
Проблема: для языков с малым количеством данных сложно обучить хорошие языковые модели — знания приходится переносить из английского, но существующие методы требуют больших параллельных корпусов или дополнительных моделей перевода.
Решение — метод LINK: во время предобучения часть английских слов случайно заменяется их переводами на целевой язык. Для этого нужен только двуязычный словарь, который можно получить практически бесплатно для любого языка.
Результаты на 8 языках и 5 размерах моделей: заметный прирост качества на downstream-задачах и до 2x ускорение обучения до эквивалентного уровня производительности.
Почему важно: метод работает без переводчиков, параллельных данных и дополнительных этапов обучения — это реальный шанс сделать AI-технологии доступнее для малоресурсных языков.
https://machinelearning.apple.com/research/multilingual-knowledge-transfer-lexical-interventions
Apple Machine Learning Research
Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions
Cross-lingual knowledge transfer is critical for building high-performing multilingual language models for languages with insufficient…
SPADE: ИИ учится, сам придумывая себе задачи
Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.
SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.
Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.
Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.
https://arxiv.org/abs/2608.19197
Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.
SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.
Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.
Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.
https://arxiv.org/abs/2608.19197
FlashPrefill V2: ускоряем prefill в 47 раз (by Tencent)
Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.
Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).
Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.
Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.
https://arxiv.org/abs/2608.19758
Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.
Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).
Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.
Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.
https://arxiv.org/abs/2608.19758
Точность не врёт — она просто ничего не говорит
Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.
Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.
Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).
Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.
https://arxiv.org/abs/2608.17744
Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.
Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.
Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).
Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.
https://arxiv.org/abs/2608.17744
Google DeepMind представил SIMA 2 — новое поколение игрового ИИ-агента.
Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.
Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.
Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.
https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.
Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.
Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.
https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Google DeepMind
Exploring new frontiers of AI and games research
Google DeepMind partners with game developers to build generalist agents like SIMA 2 and unlock breakthrough gameplay experiences across persistent worlds.
Nvidia Tech: GPU-ускорение кластеризации финансовых инструментов для квантов
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
NVIDIA Technical Blog
GPU-Accelerated Clustering for Financial Instruments at Scale
Use AdaptGrow, a GPU-accelerated matrix factorization algorithm, to turn rolling correlation and tail-dependence matrices into hard clusters, soft factor loadings, and structural-break signals at…
Nvidia выпустила DSX MaxLPS — набор технологий для максимальной эффективности ИИ-фабрик в рамках фиксированного энергобюджета.
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
NVIDIA Technical Blog
Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS
AI factories are power-constrained industrial systems. The question is no longer how many GPUs fit in a data center, but how much AI output each available megawatt can deliver.
Агент улучшает себя сам — но без изменения весов (by HKUST)
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
🤔1
Трансформеры забывают контекст — и вот как это починить без переобучения (by Google DeepMind)
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981
Бенчмарки для world models теперь умеют думать сами
Оценивать видео-генераторы типа world models — боль. Существующие бенчмарки выдают скалярные оценки, которые нельзя ни объяснить, ни проверить. Почему модель провалилась? Непонятно.
Авторы HarnessEval-W предлагают радикальный сдвиг: вместо статичного набора метрик — агентный пайплайн оценки. Идея взята из LLM-экосистемы: evaluation harness, то есть «упряжь» для оценщика.
Как работает: главный агент анализирует контекст каждого тест-кейса, выбирает нужные навыки из библиотеки (физика, геометрия, постоянство объектов) и запускает специализированных суб-агентов с инструментами. Например, при оценке столкновения: трекинг bounding boxes, проверка временного пересечения, оценка скорости. Результат — не просто число, а дерево доказательств с полной цепочкой рассуждений.
Бенчмарк покрывает 3 оси: качество рендера, корректность переходов при действиях и сохранность состояния мира во времени. Протестировано 18 моделей.
https://arxiv.org/abs/2608.16859
Оценивать видео-генераторы типа world models — боль. Существующие бенчмарки выдают скалярные оценки, которые нельзя ни объяснить, ни проверить. Почему модель провалилась? Непонятно.
Авторы HarnessEval-W предлагают радикальный сдвиг: вместо статичного набора метрик — агентный пайплайн оценки. Идея взята из LLM-экосистемы: evaluation harness, то есть «упряжь» для оценщика.
Как работает: главный агент анализирует контекст каждого тест-кейса, выбирает нужные навыки из библиотеки (физика, геометрия, постоянство объектов) и запускает специализированных суб-агентов с инструментами. Например, при оценке столкновения: трекинг bounding boxes, проверка временного пересечения, оценка скорости. Результат — не просто число, а дерево доказательств с полной цепочкой рассуждений.
Бенчмарк покрывает 3 оси: качество рендера, корректность переходов при действиях и сохранность состояния мира во времени. Протестировано 18 моделей.
https://arxiv.org/abs/2608.16859
NVIDIA достигла 100% на ARC-AGI-3
NVIDIA представила архитектуру агентов AVO (Agentic Variation Operators), которая набрала 100 баллов на бенчмарке ARC-AGI-3, пройдя все 183 уровня в 25 средах.
Ключевой момент: базовая модель Claude Opus 5 самостоятельно справляется лишь с 30% заданий. AVO поднимает этот показатель до 100% — не за счёт более мощной модели, а за счёт архитектуры системы вокруг неё.
AVO работает через постоянную память, супервизор для отслеживания прогресса и автономный цикл гипотез-действий-проверки. Та же система ранее оптимизировала GPU-ядра без участия человека 7 дней подряд и превзошла FlashAttention-4 на 10,5%.
Вывод прост: будущее агентного ИИ — не в гонке за мощностью моделей, а в грамотном системном дизайне вокруг них.
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
NVIDIA представила архитектуру агентов AVO (Agentic Variation Operators), которая набрала 100 баллов на бенчмарке ARC-AGI-3, пройдя все 183 уровня в 25 средах.
Ключевой момент: базовая модель Claude Opus 5 самостоятельно справляется лишь с 30% заданий. AVO поднимает этот показатель до 100% — не за счёт более мощной модели, а за счёт архитектуры системы вокруг неё.
AVO работает через постоянную память, супервизор для отслеживания прогресса и автономный цикл гипотез-действий-проверки. Та же система ранее оптимизировала GPU-ядра без участия человека 7 дней подряд и превзошла FlashAttention-4 на 10,5%.
Вывод прост: будущее агентного ИИ — не в гонке за мощностью моделей, а в грамотном системном дизайне вокруг них.
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
NVIDIA Technical Blog
NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents
A frontier language model is only one component of an AI agent. The surrounding agent system—often called a harness—determines how the model receives context, uses tools, maintains state…
PyTorch + IBM: ИИ-агенты ускоряют запуск моделей на новом железе
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
Hydra-0: один интерфейс для управления любым роботом
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Зачем делать backprop через 15-шаговый агент, если можно просто пошуметь по весам?
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Синтез задач для терминальных агентов: как не потерять смысл по дороге
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580