InhumanScience
106 subscribers
722 photos
1.13K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Apple ML — исследование GRPO за пределами английского языка

Команда Apple ML опубликовала масштабное исследование того, как работает метод обучения GRPO (Group Relative Policy Optimization) в многоязычных условиях. До этого почти все работы по RLVR-обучению языковых моделей были сосредоточены исключительно на английском.

Главные выводы: обучение модели рассуждать на родном языке даёт результаты, лишь незначительно уступающие английскому. Более того, тренировка на одном языке часто улучшает показатели сразу в нескольких других — это называют кросслингвальным переносом.

Но есть и подводные камни: в ряде случаев обучение на конкретном языке резко ухудшает работу модели на других языках, особенно за пределами тренировочного домена. Эффект сильно зависит от конкретной модели и языка.

Практический вывод: GRPO можно эффективно применять для многоязычных моделей, но это требует широкого тестирования, чтобы вовремя поймать регрессии. Для пользователей нон-английских приложений — хорошая новость: качественные модели с рассуждением теперь реальнее и на других языках.

https://machinelearning.apple.com/research/grpo-beyond-english
Робот учится на своих ошибках прямо во время работы — без переобучения весов

Обычно embodied-агенты "думают" только после завершения эпизода. Zetta делает иначе: в процессе выполнения задачи работают code-based critics, которые мониторят траекторию в реальном времени и триггерят recovery-скиллы при обнаружении сбоя.

Ключевая идея: три вложенных цикла эволюции. Первый — на частоте действий (critic следит за роботом). Второй — между батчами роллаутов (кластеризация отказов, генерация новых critics). Третий — валидация и добавление в память только тех скиллов, что реально улучшают успех.

Результат: с 34.5% до 90.8% на LIBERO-Pro и с 73.6% до 93.6% на RoboCasa за несколько итераций. Скиллы переносятся zero-shot на похожие задачи. Инфраструктура Z-Infra ускорила роллауты в 20.6× (до 35 эпизодов/мин), что напрямую ускоряет эволюцию агента.

https://arxiv.org/abs/2608.16590
Запускай 284B-модель на домашнем компьютере — это теперь реально

FreeToken от UC Berkeley — система инференса для MoE-моделей на потребительском железе. Идея: у 100+ млн геймерских ПК уже стоят дискретные GPU, которые простаивают. Почему бы не запускать там DeepSeek-V4-Flash (284B) или GLM-5.2 (753B)?

Три ключевых приёма:

1. Bandwidth-adaptive execution: во время prefill эксперты качаются по PCIe параллельно с вычислениями (double-buffering). Во время decode — алгоритм q* делит cache miss'ы между подгрузкой на GPU и прямым выполнением на CPU.

2. Semantic-aware caching: агентские сессии редактируются на семантических границах (tool calls, thinking). FreeToken кэширует KV-состояние в этих точках и не пересчитывает лишнего.

3. Elastic resource management: кэш GPU динамически ресайзится без перезапуска движка.

Результат: на RTX 5090 — 22-25 tok/s на DeepSeek-V4-Flash, на ноутбуке с 8GB RTX 4060 — 39 tok/s на 35B-модели. Это быстрее, чем Codex в продакшне (33 tok/s медиана).

https://arxiv.org/abs/2608.16157
Робот, который думает только когда нужно (by ZJU-OmniAI)

Главная проблема навигационных агентов: если запускать Chain-of-Thought рассуждение на каждом шаге — медленно, если не запускать — тупо. TAMP-Nav решает это элегантно.

Четыре ключевые идеи:

Point: вместо предсказания 3D-координат или угла поворота агент просто тыкает пальцем в пиксель на картинке, а дальше SLAM сам разбирается с геометрией.

Think: CoT запускается только в критических точках маршрута (~30% шагов), остальное — без рассуждений.

Memorize: ключевые узлы хранятся подробно, промежуточные сжимаются в лёгкие Space-Time токены с координатами и временем через RoPE.

Align: обучение через двухуровневый GRPO — одновременно глобальные награды (дошёл/не дошёл) и пошаговые (не врезался, правильно остановился).

Результат: 66.2% success rate на R2R-CE при обучении всего на 90k траекториях.

https://arxiv.org/abs/2608.17512
Nvidia FLARE научился обучать мультимодальные AI-модели в федеративном режиме — без передачи сырых данных между организациями.

Суть: вместо передачи полных весов модели (28,6 ГБ за раунд) система теперь обменивается только лёгкими LoRA-адаптерами — всего 0,094 ГБ. Это в 300 раз меньше трафика при сохранении 97% качества централизованного обучения.

Что под капотом: стриминг тензоров, выгрузка агрегации на диск и новый механизм экстернализации крупных объектов. Всё это решает две главные боли федеративного обучения — сетевой трафик и память сервера.

Зачем это важно: больницы, банки и госструктуры смогут совместно обучать мощные vision-language модели, не передавая чувствительные данные за пределы своей инфраструктуры. FedUMM уже получил награду на TheWebConf 2026.

https://developer.nvidia.com/blog/building-federated-multimodal-ai-workflows-with-nvidia-flare/
👏1
Nvidia выпустила Cosmos 3 Edge — компактную модель для управления роботами прямо на устройстве.

Cosmos 3 Edge — это 4B-модель из семейства Cosmos 3, достаточно лёгкая, чтобы работать на борту робота на чипе NVIDIA Jetson Thor. Модель предобучена на физических данных реального мира и умеет предсказывать действия робота без подключения к облаку.

Ключевые детали: модель весит около 9 ГБ в формате BF16, генерирует чанк действий за ~1,53 секунды при частоте 15 Гц — и успевает просчитать следующий шаг до завершения текущего, обеспечивая непрерывное движение манипулятора. Успешность в закрытых симуляционных тестах RoboLab — 22,9%.

Чекпоинт доступен на HuggingFace, код открыт в репозитории cosmos-framework. Поддерживаются несколько платформ: Franka, UR, WidowX 250, SO101.

https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-edge-for-on-device-robot-control/
Nvidia выпустила SkillEvaluator — открытый инструмент для оценки влияния AI-навыков на производительность агентов.

Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.

Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).

Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.

Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.

https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
EnvHarness: «прокачай» среду, а не модель (by Google)

Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.

Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.

Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу

Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.

Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.

https://arxiv.org/abs/2608.19880
CO-RL: как обучить LLM рассуждать без единого лейбла?

Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!

CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.

Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.

https://arxiv.org/abs/2608.17253
AI-учёный, который смотрит на данные своими глазами

Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.

Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.

Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.

Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.

https://arxiv.org/abs/2608.13558
Microsoft Research обновила Skala до версии 1.1 — своего ИИ-инструмента для квантовохимических расчётов.

Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.

Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.

Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.

https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Nvidia представила новый подход к рекомендательным системам на базе генеративного ИИ.

Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.

Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.

Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.

https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
Apple ML опубликовала исследование о многоязычном обучении языковых моделей.

Проблема: для языков с малым количеством данных сложно обучить хорошие языковые модели — знания приходится переносить из английского, но существующие методы требуют больших параллельных корпусов или дополнительных моделей перевода.

Решение — метод LINK: во время предобучения часть английских слов случайно заменяется их переводами на целевой язык. Для этого нужен только двуязычный словарь, который можно получить практически бесплатно для любого языка.

Результаты на 8 языках и 5 размерах моделей: заметный прирост качества на downstream-задачах и до 2x ускорение обучения до эквивалентного уровня производительности.

Почему важно: метод работает без переводчиков, параллельных данных и дополнительных этапов обучения — это реальный шанс сделать AI-технологии доступнее для малоресурсных языков.

https://machinelearning.apple.com/research/multilingual-knowledge-transfer-lexical-interventions
SPADE: ИИ учится, сам придумывая себе задачи

Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.

SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.

Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.

Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.

https://arxiv.org/abs/2608.19197
FlashPrefill V2: ускоряем prefill в 47 раз (by Tencent)

Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.

Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).

Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.

Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.

https://arxiv.org/abs/2608.19758
Точность не врёт — она просто ничего не говорит

Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.

Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.

Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).

Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.

https://arxiv.org/abs/2608.17744
Google DeepMind представил SIMA 2 — новое поколение игрового ИИ-агента.

Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.

Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.

Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.

https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Nvidia Tech: GPU-ускорение кластеризации финансовых инструментов для квантов

Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.

Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.

Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.

Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.

https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
Nvidia выпустила DSX MaxLPS — набор технологий для максимальной эффективности ИИ-фабрик в рамках фиксированного энергобюджета.

Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.

MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.

Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.

Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.

https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Агент улучшает себя сам — но без изменения весов (by HKUST)

Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).

Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.

Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.

Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.

Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.

https://arxiv.org/abs/2608.08466
🤔1
Трансформеры забывают контекст — и вот как это починить без переобучения (by Google DeepMind)

Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".

Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.

Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.

https://arxiv.org/abs/2608.17981