Apple ML — исследование GRPO за пределами английского языка
Команда Apple ML опубликовала масштабное исследование того, как работает метод обучения GRPO (Group Relative Policy Optimization) в многоязычных условиях. До этого почти все работы по RLVR-обучению языковых моделей были сосредоточены исключительно на английском.
Главные выводы: обучение модели рассуждать на родном языке даёт результаты, лишь незначительно уступающие английскому. Более того, тренировка на одном языке часто улучшает показатели сразу в нескольких других — это называют кросслингвальным переносом.
Но есть и подводные камни: в ряде случаев обучение на конкретном языке резко ухудшает работу модели на других языках, особенно за пределами тренировочного домена. Эффект сильно зависит от конкретной модели и языка.
Практический вывод: GRPO можно эффективно применять для многоязычных моделей, но это требует широкого тестирования, чтобы вовремя поймать регрессии. Для пользователей нон-английских приложений — хорошая новость: качественные модели с рассуждением теперь реальнее и на других языках.
https://machinelearning.apple.com/research/grpo-beyond-english
Команда Apple ML опубликовала масштабное исследование того, как работает метод обучения GRPO (Group Relative Policy Optimization) в многоязычных условиях. До этого почти все работы по RLVR-обучению языковых моделей были сосредоточены исключительно на английском.
Главные выводы: обучение модели рассуждать на родном языке даёт результаты, лишь незначительно уступающие английскому. Более того, тренировка на одном языке часто улучшает показатели сразу в нескольких других — это называют кросслингвальным переносом.
Но есть и подводные камни: в ряде случаев обучение на конкретном языке резко ухудшает работу модели на других языках, особенно за пределами тренировочного домена. Эффект сильно зависит от конкретной модели и языка.
Практический вывод: GRPO можно эффективно применять для многоязычных моделей, но это требует широкого тестирования, чтобы вовремя поймать регрессии. Для пользователей нон-английских приложений — хорошая новость: качественные модели с рассуждением теперь реальнее и на других языках.
https://machinelearning.apple.com/research/grpo-beyond-english
Apple Machine Learning Research
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
Reinforcement Learning with Verifiable Rewards (RLVR), often optimized with Group Relative Policy Optimization (GRPO), has become a central…
Робот учится на своих ошибках прямо во время работы — без переобучения весов
Обычно embodied-агенты "думают" только после завершения эпизода. Zetta делает иначе: в процессе выполнения задачи работают code-based critics, которые мониторят траекторию в реальном времени и триггерят recovery-скиллы при обнаружении сбоя.
Ключевая идея: три вложенных цикла эволюции. Первый — на частоте действий (critic следит за роботом). Второй — между батчами роллаутов (кластеризация отказов, генерация новых critics). Третий — валидация и добавление в память только тех скиллов, что реально улучшают успех.
Результат: с 34.5% до 90.8% на LIBERO-Pro и с 73.6% до 93.6% на RoboCasa за несколько итераций. Скиллы переносятся zero-shot на похожие задачи. Инфраструктура Z-Infra ускорила роллауты в 20.6× (до 35 эпизодов/мин), что напрямую ускоряет эволюцию агента.
https://arxiv.org/abs/2608.16590
Обычно embodied-агенты "думают" только после завершения эпизода. Zetta делает иначе: в процессе выполнения задачи работают code-based critics, которые мониторят траекторию в реальном времени и триггерят recovery-скиллы при обнаружении сбоя.
Ключевая идея: три вложенных цикла эволюции. Первый — на частоте действий (critic следит за роботом). Второй — между батчами роллаутов (кластеризация отказов, генерация новых critics). Третий — валидация и добавление в память только тех скиллов, что реально улучшают успех.
Результат: с 34.5% до 90.8% на LIBERO-Pro и с 73.6% до 93.6% на RoboCasa за несколько итераций. Скиллы переносятся zero-shot на похожие задачи. Инфраструктура Z-Infra ускорила роллауты в 20.6× (до 35 эпизодов/мин), что напрямую ускоряет эволюцию агента.
https://arxiv.org/abs/2608.16590
Запускай 284B-модель на домашнем компьютере — это теперь реально
FreeToken от UC Berkeley — система инференса для MoE-моделей на потребительском железе. Идея: у 100+ млн геймерских ПК уже стоят дискретные GPU, которые простаивают. Почему бы не запускать там DeepSeek-V4-Flash (284B) или GLM-5.2 (753B)?
Три ключевых приёма:
1. Bandwidth-adaptive execution: во время prefill эксперты качаются по PCIe параллельно с вычислениями (double-buffering). Во время decode — алгоритм q* делит cache miss'ы между подгрузкой на GPU и прямым выполнением на CPU.
2. Semantic-aware caching: агентские сессии редактируются на семантических границах (tool calls, thinking). FreeToken кэширует KV-состояние в этих точках и не пересчитывает лишнего.
3. Elastic resource management: кэш GPU динамически ресайзится без перезапуска движка.
Результат: на RTX 5090 — 22-25 tok/s на DeepSeek-V4-Flash, на ноутбуке с 8GB RTX 4060 — 39 tok/s на 35B-модели. Это быстрее, чем Codex в продакшне (33 tok/s медиана).
https://arxiv.org/abs/2608.16157
FreeToken от UC Berkeley — система инференса для MoE-моделей на потребительском железе. Идея: у 100+ млн геймерских ПК уже стоят дискретные GPU, которые простаивают. Почему бы не запускать там DeepSeek-V4-Flash (284B) или GLM-5.2 (753B)?
Три ключевых приёма:
1. Bandwidth-adaptive execution: во время prefill эксперты качаются по PCIe параллельно с вычислениями (double-buffering). Во время decode — алгоритм q* делит cache miss'ы между подгрузкой на GPU и прямым выполнением на CPU.
2. Semantic-aware caching: агентские сессии редактируются на семантических границах (tool calls, thinking). FreeToken кэширует KV-состояние в этих точках и не пересчитывает лишнего.
3. Elastic resource management: кэш GPU динамически ресайзится без перезапуска движка.
Результат: на RTX 5090 — 22-25 tok/s на DeepSeek-V4-Flash, на ноутбуке с 8GB RTX 4060 — 39 tok/s на 35B-модели. Это быстрее, чем Codex в продакшне (33 tok/s медиана).
https://arxiv.org/abs/2608.16157
Робот, который думает только когда нужно (by ZJU-OmniAI)
Главная проблема навигационных агентов: если запускать Chain-of-Thought рассуждение на каждом шаге — медленно, если не запускать — тупо. TAMP-Nav решает это элегантно.
Четыре ключевые идеи:
Point: вместо предсказания 3D-координат или угла поворота агент просто тыкает пальцем в пиксель на картинке, а дальше SLAM сам разбирается с геометрией.
Think: CoT запускается только в критических точках маршрута (~30% шагов), остальное — без рассуждений.
Memorize: ключевые узлы хранятся подробно, промежуточные сжимаются в лёгкие Space-Time токены с координатами и временем через RoPE.
Align: обучение через двухуровневый GRPO — одновременно глобальные награды (дошёл/не дошёл) и пошаговые (не врезался, правильно остановился).
Результат: 66.2% success rate на R2R-CE при обучении всего на 90k траекториях.
https://arxiv.org/abs/2608.17512
Главная проблема навигационных агентов: если запускать Chain-of-Thought рассуждение на каждом шаге — медленно, если не запускать — тупо. TAMP-Nav решает это элегантно.
Четыре ключевые идеи:
Point: вместо предсказания 3D-координат или угла поворота агент просто тыкает пальцем в пиксель на картинке, а дальше SLAM сам разбирается с геометрией.
Think: CoT запускается только в критических точках маршрута (~30% шагов), остальное — без рассуждений.
Memorize: ключевые узлы хранятся подробно, промежуточные сжимаются в лёгкие Space-Time токены с координатами и временем через RoPE.
Align: обучение через двухуровневый GRPO — одновременно глобальные награды (дошёл/не дошёл) и пошаговые (не врезался, правильно остановился).
Результат: 66.2% success rate на R2R-CE при обучении всего на 90k траекториях.
https://arxiv.org/abs/2608.17512
Nvidia FLARE научился обучать мультимодальные AI-модели в федеративном режиме — без передачи сырых данных между организациями.
Суть: вместо передачи полных весов модели (28,6 ГБ за раунд) система теперь обменивается только лёгкими LoRA-адаптерами — всего 0,094 ГБ. Это в 300 раз меньше трафика при сохранении 97% качества централизованного обучения.
Что под капотом: стриминг тензоров, выгрузка агрегации на диск и новый механизм экстернализации крупных объектов. Всё это решает две главные боли федеративного обучения — сетевой трафик и память сервера.
Зачем это важно: больницы, банки и госструктуры смогут совместно обучать мощные vision-language модели, не передавая чувствительные данные за пределы своей инфраструктуры. FedUMM уже получил награду на TheWebConf 2026.
https://developer.nvidia.com/blog/building-federated-multimodal-ai-workflows-with-nvidia-flare/
Суть: вместо передачи полных весов модели (28,6 ГБ за раунд) система теперь обменивается только лёгкими LoRA-адаптерами — всего 0,094 ГБ. Это в 300 раз меньше трафика при сохранении 97% качества централизованного обучения.
Что под капотом: стриминг тензоров, выгрузка агрегации на диск и новый механизм экстернализации крупных объектов. Всё это решает две главные боли федеративного обучения — сетевой трафик и память сервера.
Зачем это важно: больницы, банки и госструктуры смогут совместно обучать мощные vision-language модели, не передавая чувствительные данные за пределы своей инфраструктуры. FedUMM уже получил награду на TheWebConf 2026.
https://developer.nvidia.com/blog/building-federated-multimodal-ai-workflows-with-nvidia-flare/
NVIDIA Technical Blog
Building Federated Multimodal AI Workflows with NVIDIA FLARE
Modern vision-language models (VLMs) can support tasks such as visual question answering, captioning, and image-text reasoning. In practice, however, the data needed to adapt these models may be…
👏1
Nvidia выпустила Cosmos 3 Edge — компактную модель для управления роботами прямо на устройстве.
Cosmos 3 Edge — это 4B-модель из семейства Cosmos 3, достаточно лёгкая, чтобы работать на борту робота на чипе NVIDIA Jetson Thor. Модель предобучена на физических данных реального мира и умеет предсказывать действия робота без подключения к облаку.
Ключевые детали: модель весит около 9 ГБ в формате BF16, генерирует чанк действий за ~1,53 секунды при частоте 15 Гц — и успевает просчитать следующий шаг до завершения текущего, обеспечивая непрерывное движение манипулятора. Успешность в закрытых симуляционных тестах RoboLab — 22,9%.
Чекпоинт доступен на HuggingFace, код открыт в репозитории cosmos-framework. Поддерживаются несколько платформ: Franka, UR, WidowX 250, SO101.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-edge-for-on-device-robot-control/
Cosmos 3 Edge — это 4B-модель из семейства Cosmos 3, достаточно лёгкая, чтобы работать на борту робота на чипе NVIDIA Jetson Thor. Модель предобучена на физических данных реального мира и умеет предсказывать действия робота без подключения к облаку.
Ключевые детали: модель весит около 9 ГБ в формате BF16, генерирует чанк действий за ~1,53 секунды при частоте 15 Гц — и успевает просчитать следующий шаг до завершения текущего, обеспечивая непрерывное движение манипулятора. Успешность в закрытых симуляционных тестах RoboLab — 22,9%.
Чекпоинт доступен на HuggingFace, код открыт в репозитории cosmos-framework. Поддерживаются несколько платформ: Franka, UR, WidowX 250, SO101.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-edge-for-on-device-robot-control/
NVIDIA Technical Blog
Post-Train NVIDIA Cosmos 3 Edge for On-Device Robot Control
Robots need policies that can adapt to their sensors, environments, and tasks while running on onboard computing hardware. World models offer a foundation for learning physical interactions…
Nvidia выпустила SkillEvaluator — открытый инструмент для оценки влияния AI-навыков на производительность агентов.
Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.
Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).
Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.
Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.
https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.
Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).
Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.
Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.
https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
NVIDIA Technical Blog
Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
AI agents are only as effective as the context they receive. Even with capable models and well-documented NVIDIA libraries, agents can spend extra steps finding the right tools, burn tokens on dead…
EnvHarness: «прокачай» среду, а не модель (by Google)
Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.
Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.
Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу
Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.
Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.
https://arxiv.org/abs/2608.19880
Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.
Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.
Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу
Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.
Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.
https://arxiv.org/abs/2608.19880
CO-RL: как обучить LLM рассуждать без единого лейбла?
Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!
CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.
Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.
https://arxiv.org/abs/2608.17253
Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!
CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.
Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.
https://arxiv.org/abs/2608.17253
AI-учёный, который смотрит на данные своими глазами
Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.
Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.
Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.
Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.
https://arxiv.org/abs/2608.13558
Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.
Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.
Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.
Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.
https://arxiv.org/abs/2608.13558
Microsoft Research обновила Skala до версии 1.1 — своего ИИ-инструмента для квантовохимических расчётов.
Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.
Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.
Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.
https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.
Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.
Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.
https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Microsoft Research
Broadening access to Skala creates a faster path to predictive DFT
Skala 1.1, the updated deep-learning exchange-correlation functional from Microsoft Research, provides greater accuracy, expanded accessibility across the computational chemistry ecosystem, and a living benchmark to track computational performance.
Nvidia представила новый подход к рекомендательным системам на базе генеративного ИИ.
Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.
Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.
Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.
https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.
Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.
Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.
https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
NVIDIA Technical Blog
How Generative Recommenders Are Redefining RecSys at Scale
Recommender systems (RecSys) are one of the most ubiquitous machine learning problems in the consumer internet industry yet notoriously difficult to train and serve at scale. The advent of LLMs has…
Apple ML опубликовала исследование о многоязычном обучении языковых моделей.
Проблема: для языков с малым количеством данных сложно обучить хорошие языковые модели — знания приходится переносить из английского, но существующие методы требуют больших параллельных корпусов или дополнительных моделей перевода.
Решение — метод LINK: во время предобучения часть английских слов случайно заменяется их переводами на целевой язык. Для этого нужен только двуязычный словарь, который можно получить практически бесплатно для любого языка.
Результаты на 8 языках и 5 размерах моделей: заметный прирост качества на downstream-задачах и до 2x ускорение обучения до эквивалентного уровня производительности.
Почему важно: метод работает без переводчиков, параллельных данных и дополнительных этапов обучения — это реальный шанс сделать AI-технологии доступнее для малоресурсных языков.
https://machinelearning.apple.com/research/multilingual-knowledge-transfer-lexical-interventions
Проблема: для языков с малым количеством данных сложно обучить хорошие языковые модели — знания приходится переносить из английского, но существующие методы требуют больших параллельных корпусов или дополнительных моделей перевода.
Решение — метод LINK: во время предобучения часть английских слов случайно заменяется их переводами на целевой язык. Для этого нужен только двуязычный словарь, который можно получить практически бесплатно для любого языка.
Результаты на 8 языках и 5 размерах моделей: заметный прирост качества на downstream-задачах и до 2x ускорение обучения до эквивалентного уровня производительности.
Почему важно: метод работает без переводчиков, параллельных данных и дополнительных этапов обучения — это реальный шанс сделать AI-технологии доступнее для малоресурсных языков.
https://machinelearning.apple.com/research/multilingual-knowledge-transfer-lexical-interventions
Apple Machine Learning Research
Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions
Cross-lingual knowledge transfer is critical for building high-performing multilingual language models for languages with insufficient…
SPADE: ИИ учится, сам придумывая себе задачи
Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.
SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.
Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.
Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.
https://arxiv.org/abs/2608.19197
Главная проблема обучения агентов через RL — среды заканчиваются. Агент вырастает из них, и прогресс останавливается. Крупные лабы тратят >$1B в год на создание новых сред — и всё равно это конечный ресурс.
SPADE решает это элегантно: одна LLM играет две роли одновременно. Environment Designer генерирует новые задачи в виде Python-кода с Gym-интерфейсом (reset/step), а Reasoning Agent их решает. Оба обучаются через RL одновременно.
Ключевой трюк — hint-based regret reward: Дизайнер получает награду за разрыв между результатами агента с подсказкой и без. Это автоматически нацеливает на задачи на границе возможностей агента — не слишком лёгкие, не неразрешимые.
Результат: +5.3 балла на игровых бенчмарках, +10.3 на BFCL multi-turn tool-use при 4B параметрах. Качественно: курикулум сам эволюционирует от простых задач к многошаговым сценариям с длинным горизонтом.
https://arxiv.org/abs/2608.19197
FlashPrefill V2: ускоряем prefill в 47 раз (by Tencent)
Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.
Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).
Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.
Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.
https://arxiv.org/abs/2608.19758
Квадратичная сложность attention на длинных контекстах — боль продакшн-систем. FlashPrefill V2 атакует её сразу с трёх сторон.
Ключевая идея: разреженное блочное внимание, где сначала быстро выбираются «важные» блоки K/V через pooling средних, а потом точно считается только по ним. Новинка V2 — mean correction: отброшенные блоки не игнорируются, а вносят суррогатный вклад через свои средние K и V прямо внутри softmax. Это спасает точность при экстремальной разреженности (>90%).
Плюс полностью переписанное ядро под Hopper GPU (H100/H20): warp specialization, pingpong pipelining, PackGQA, FP8 — всё как в FlashAttention-3/4, только разреженное.
Результат: 27× быстрее FlashAttention-2 на 128K контексте (BF16), 47× в FP8. Работает с paged KV cache и continuous batching прямо в SGLang.
https://arxiv.org/abs/2608.19758
Точность не врёт — она просто ничего не говорит
Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.
Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.
Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).
Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.
https://arxiv.org/abs/2608.17744
Исследователи файн-тюнили sparse MoE модели (Qwen, GPT-OSS, NemotronH — все ~4B активных параметров) на греческом языке, чтобы научить их «думать» по-гречески. Спойлер: accuracy на бенчмарке почти не изменилась (76.5 vs 77.2). Авторы несколько недель думали, что проблема в данных, и собрали ещё пять корпусов. Ничего не помогло.
Потом они переобучили ту же конфигурацию, изменив только random seed — и accuracy прыгнула на 7.7 пункта. Все предыдущие «улучшения» были меньше этого шума.
Зато другие метрики оказались стабильными и значимыми: на каком языке модель рассуждает, сколько токенов тратит, умеет ли отличить лёгкий вопрос от сложного. SFT меняет именно это — не accuracy. RL (RLVR) потом исправляет то, что SFT сломал (language lock).
Вывод: для low-resource языков accuracy на переведённом бенчмарке почти бесполезна — она тонет в шуме и не измеряет то, ради чего всё затевалось.
https://arxiv.org/abs/2608.17744
Google DeepMind представил SIMA 2 — новое поколение игрового ИИ-агента.
Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.
Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.
Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.
https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Если первая версия SIMA умела следовать простым инструкциям в 3D-играх, то SIMA 2 идёт дальше: агент не просто выполняет команды, а рассуждает, обучается и взаимодействует с игроком в реальном времени. Он способен действовать в открытых виртуальных мирах — от классических игр до сложных онлайн-вселенных вроде EVE Online.
Это часть 15-летнего пути DeepMind в игровом ИИ: от Atari и AlphaGo до полноценных агентов, которые понимают контекст и адаптируются к ситуации.
Для пользователей это означает новый класс ИИ-компаньонов в играх — не просто ботов по скрипту, а партнёров, которые учатся вместе с тобой. Технология также открывает перспективы для обучения роботов и симуляций реального мира.
https://deepmind.google/blog/from-atari-to-eve-online-building-on-15-years-of-ai-research-in-games/
Google DeepMind
Exploring new frontiers of AI and games research
Google DeepMind partners with game developers to build generalist agents like SIMA 2 and unlock breakthrough gameplay experiences across persistent worlds.
Nvidia Tech: GPU-ускорение кластеризации финансовых инструментов для квантов
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
NVIDIA Technical Blog
GPU-Accelerated Clustering for Financial Instruments at Scale
Use AdaptGrow, a GPU-accelerated matrix factorization algorithm, to turn rolling correlation and tail-dependence matrices into hard clusters, soft factor loadings, and structural-break signals at…
Nvidia выпустила DSX MaxLPS — набор технологий для максимальной эффективности ИИ-фабрик в рамках фиксированного энергобюджета.
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
NVIDIA Technical Blog
Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS
AI factories are power-constrained industrial systems. The question is no longer how many GPUs fit in a data center, but how much AI output each available megawatt can deliver.
Агент улучшает себя сам — но без изменения весов (by HKUST)
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
🤔1
Трансформеры забывают контекст — и вот как это починить без переобучения (by Google DeepMind)
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981