InhumanScience
106 subscribers
722 photos
1.13K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Nvidia выпустила SkillEvaluator — открытый инструмент для оценки влияния AI-навыков на производительность агентов.

Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.

Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).

Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.

Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.

https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
EnvHarness: «прокачай» среду, а не модель (by Google)

Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.

Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.

Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу

Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.

Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.

https://arxiv.org/abs/2608.19880
CO-RL: как обучить LLM рассуждать без единого лейбла?

Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!

CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.

Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.

https://arxiv.org/abs/2608.17253
AI-учёный, который смотрит на данные своими глазами

Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.

Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.

Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.

Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.

https://arxiv.org/abs/2608.13558
Microsoft Research обновила Skala до версии 1.1 — своего ИИ-инструмента для квантовохимических расчётов.

Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.

Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.

Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.

https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Nvidia представила новый подход к рекомендательным системам на базе генеративного ИИ.

Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.

Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.

Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.

https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
Apple ML опубликовала исследование о многоязычном обучении языковых моделей.

Проблема: для языков с малым количеством данных сложно обучить хорошие языковые модели — знания приходится переносить из английского, но существующие методы требуют больших параллельных корпусов или дополнительных моделей перевода.

Решение — метод LINK: во время предобучения часть английских слов случайно заменяется их переводами на целевой язык. Для этого нужен только двуязычный словарь, который можно получить практически бесплатно для любого языка.

Результаты на 8 языках и 5 размерах моделей: заметный прирост качества на downstream-задачах и до 2x ускорение обучения до эквивалентного уровня производительности.

Почему важно: метод работает без переводчиков, параллельных данных и дополнительных этапов обучения — это реальный шанс сделать AI-технологии доступнее для малоресурсных языков.

https://machinelearning.apple.com/research/multilingual-knowledge-transfer-lexical-interventions
SPADE: ИИ учится, сам придумывая себе задачи

Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.

SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.

Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.

Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.

https://arxiv.org/abs/2608.19197
FlashPrefill V2: ускоряем prefill в 47 раз (by Tencent)

Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.

Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).

Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.

Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.

https://arxiv.org/abs/2608.19758
Точность не врёт — она просто ничего не говорит

Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.

Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.

Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).

Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.

https://arxiv.org/abs/2608.17744
Google DeepMind представил SIMA 2 — новое поколение игрового ИИ-агента.

Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.

Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.

Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.

https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Nvidia Tech: GPU-ускорение кластеризации финансовых инструментов для квантов

Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.

Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.

Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.

Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.

https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
Nvidia выпустила DSX MaxLPS — набор технологий для максимальной эффективности ИИ-фабрик в рамках фиксированного энергобюджета.

Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.

MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.

Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.

Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Агент улучшает себя сам — но без изменения весов (by HKUST)

Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).

Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.

Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.

Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.

Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.

https://arxiv.org/abs/2608.08466
🤔1
Трансформеры забывают контекст — и вот как это починить без переобучения (by Google DeepMind)

Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".

Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.

Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.

https://arxiv.org/abs/2608.17981
Бенчмарки для world models теперь умеют думать сами

Оценивать видео-генераторы типа world models — боль. Существующие бенчмарки выдают скалярные оценки, которые нельзя ни объяснить, ни проверить. Почему модель провалилась? Непонятно.

Авторы HarnessEval-W предлагают радикальный сдвиг: вместо статичного набора метрик — агентный пайплайн оценки. Идея взята из LLM-экосистемы: evaluation harness, то есть «упряжь» для оценщика.

Как работает: главный агент анализирует контекст каждого тест-кейса, выбирает нужные навыки из библиотеки (физика, геометрия, постоянство объектов) и запускает специализированных суб-агентов с инструментами. Например, при оценке столкновения: трекинг bounding boxes, проверка временного пересечения, оценка скорости. Результат — не просто число, а дерево доказательств с полной цепочкой рассуждений.

Бенчмарк покрывает 3 оси: качество рендера, корректность переходов при действиях и сохранность состояния мира во времени. Протестировано 18 моделей.

https://arxiv.org/abs/2608.16859
NVIDIA достигла 100% на ARC-AGI-3

NVIDIA представила архитектуру агентов AVO (Agentic Variation Operators), которая набрала 100 баллов на бенчмарке ARC-AGI-3, пройдя все 183 уровня в 25 средах.

Ключевой момент: базовая модель Claude Opus 5 самостоятельно справляется лишь с 30% заданий. AVO поднимает этот показатель до 100% — не за счёт более мощной модели, а за счёт архитектуры системы вокруг неё.

AVO работает через постоянную память, супервизор для отслеживания прогресса и автономный цикл гипотез-действий-проверки. Та же система ранее оптимизировала GPU-ядра без участия человека 7 дней подряд и превзошла FlashAttention-4 на 10,5%.

Вывод прост: будущее агентного ИИ — не в гонке за мощностью моделей, а в грамотном системном дизайне вокруг них.

https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
PyTorch + IBM: ИИ-агенты ускоряют запуск моделей на новом железе

PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.

Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.

Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.

Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.

https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
Hydra-0: один интерфейс для управления любым роботом

Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.

Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.

World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.

Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Зачем делать backprop через 15-шаговый агент, если можно просто пошуметь по весам?

Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.

Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!

Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.

Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.

https://arxiv.org/abs/2608.17310
Синтез задач для терминальных агентов: как не потерять смысл по дороге

Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.

Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.

Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.

В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.

https://arxiv.org/abs/2608.18580