Meta AI удвоила эффективность обучения рекламной ИИ-модели
Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.
Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.
Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.
Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.
Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.
Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.
Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Engineering at Meta
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
Meta’s Generative Ads Recommendation Model (GEM), the foundation model behind ads recommendations across Instagram and Facebook, now trains at LLM scale on several thousand of the latest-gene…
Microsoft Research выпустила Orchard — открытый фреймворк для создания и обучения агентных AI-систем.
Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.
Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.
Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.
https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.
Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.
Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.
https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
Microsoft Research
Orchard: An open framework for scalable agentic AI
Orchard is an open-source framework for the research community to train and evaluate AI agents across task types. It reduces complexity while supporting strong performance from smaller models by enabling researchers to reuse the same infrastructure:
NVIDIA представила бенчмарки процессора Vera BlueField-4 STX для AI-хранилищ.
Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.
Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.
Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.
https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.
Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.
Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.
https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
NVIDIA Technical Blog
NVIDIA Vera Storage Benchmarks: Faster Encryption, Compression, Integrity Checking, and Recovery for AI-Native Storage
Storage is an active part of every agentic AI workflow. As agents retrieve enterprise knowledge, access persistent memory, reuse key-value (KV) cache data, execute tools, and generate new results…
Как обновлять претрейн рекомендаций каждый день без потери качества?
В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:
1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.
2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.
Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.
https://arxiv.org/abs/2608.02738
В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:
1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.
2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.
Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.
https://arxiv.org/abs/2608.02738
DiffusionGemma: 1500 токенов в секунду на одном H100 (by DeepMind)
Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.
DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.
Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.
Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.
https://arxiv.org/abs/2608.00146
Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.
DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.
Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.
Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.
https://arxiv.org/abs/2608.00146
Что если оптимизировать рассуждения LLM прямо в скрытом пространстве трансформера, а не через токены?
Большинство методов латентного рассуждения (например, LatentSeek) работают так: берём латентные переменные, декодируем их в токены, потом обратным проходом обновляем латенты. Проблема: дискретное декодирование создаёт информационное узкое горлышко — непонятно, как именно латент влияет на ответ.
GRADCUIT решает это иначе: латентные переменные вставляются прямо в промежуточный hidden state трансформера. Тогда self-attention сам становится "цепочкой" для передачи градиентов — каждый сгенерированный токен может напрямую "видеть" латенты через attention, и градиент течёт обратно без потерь.
Результат: +6.6 п.п. к точности над CoT, +2.4 п.п. над LatentSeek на 5 моделях и 3 бенчмарках (GPQA, GSM8K, MATH-500). Бонус — интерпретируемость: через якобиан можно посмотреть, какие латенты реально влияют на ответ.
https://arxiv.org/abs/2608.02585
Большинство методов латентного рассуждения (например, LatentSeek) работают так: берём латентные переменные, декодируем их в токены, потом обратным проходом обновляем латенты. Проблема: дискретное декодирование создаёт информационное узкое горлышко — непонятно, как именно латент влияет на ответ.
GRADCUIT решает это иначе: латентные переменные вставляются прямо в промежуточный hidden state трансформера. Тогда self-attention сам становится "цепочкой" для передачи градиентов — каждый сгенерированный токен может напрямую "видеть" латенты через attention, и градиент течёт обратно без потерь.
Результат: +6.6 п.п. к точности над CoT, +2.4 п.п. над LatentSeek на 5 моделях и 3 бенчмарках (GPQA, GSM8K, MATH-500). Бонус — интерпретируемость: через якобиан можно посмотреть, какие латенты реально влияют на ответ.
https://arxiv.org/abs/2608.02585
OpenAI представила GPT-Live — систему для голосового общения с ИИ в реальном времени, которую команда построила всего за шесть месяцев.
Главное отличие от обычных голосовых ассистентов — отсутствие пошагового режима "ты говоришь — я отвечаю". Вместо этого используется бесшовная речевая модель, которая слушает и реагирует непрерывно, как живой собеседник.
Низкая задержка архитектуры делает разговор заметно естественнее: паузы минимальны, а ИИ может перебить или уточнить в нужный момент.
Для пользователей это значит — меньше ощущения "общения с роботом" и больше живого диалога. Особенно это важно для сценариев, где скорость реакции критична: обучение, поддержка, переговорные тренажёры.
https://openai.com/index/continuous-voice-interaction-with-gpt-live
Главное отличие от обычных голосовых ассистентов — отсутствие пошагового режима "ты говоришь — я отвечаю". Вместо этого используется бесшовная речевая модель, которая слушает и реагирует непрерывно, как живой собеседник.
Низкая задержка архитектуры делает разговор заметно естественнее: паузы минимальны, а ИИ может перебить или уточнить в нужный момент.
Для пользователей это значит — меньше ощущения "общения с роботом" и больше живого диалога. Особенно это важно для сценариев, где скорость реакции критична: обучение, поддержка, переговорные тренажёры.
https://openai.com/index/continuous-voice-interaction-with-gpt-live
OpenAI
How we built a realtime system for responsive voice AI in six months
GPT-Live enables continuous voice interaction with AI, using a turnless speech model and low-latency architecture for faster, more natural conversations.
Nvidia Tech выпустила Alpamayo 2 Super — открытую модель на 34 млрд параметров для разработки автономных автомобилей.
Что нового: модель объединяет 32B-рассуждатель Cosmos 3 Super и 2B Action Expert, обученный с помощью reinforcement learning. Один инструмент заменяет целый зоопарк отдельных моделей: генерирует траектории, объясняет решения через цепочки причинно-следственных связей, предсказывает манёвры (перестроение, остановка), отвечает на вопросы о сцене и автоматически размечает данные.
Почему важно: раньше для каждой задачи нужна была отдельная модель. Теперь одна основа покрывает весь цикл разработки — от обучения политики до оценки и сбора данных. На бенчмарке LingoQA модель набрала 79.2, обогнав GPT-4o на 23 балла.
Веса доступны на Hugging Face, ноутбуки — на GitHub. Лицензия OpenMDW-1.1 разрешает коммерческое использование и дообучение без дополнительных согласований с Nvidia.
https://developer.nvidia.com/blog/generate-trajectories-reasoning-traces-and-auto-labels-with-nvidia-alpamayo-2-super/
Что нового: модель объединяет 32B-рассуждатель Cosmos 3 Super и 2B Action Expert, обученный с помощью reinforcement learning. Один инструмент заменяет целый зоопарк отдельных моделей: генерирует траектории, объясняет решения через цепочки причинно-следственных связей, предсказывает манёвры (перестроение, остановка), отвечает на вопросы о сцене и автоматически размечает данные.
Почему важно: раньше для каждой задачи нужна была отдельная модель. Теперь одна основа покрывает весь цикл разработки — от обучения политики до оценки и сбора данных. На бенчмарке LingoQA модель набрала 79.2, обогнав GPT-4o на 23 балла.
Веса доступны на Hugging Face, ноутбуки — на GitHub. Лицензия OpenMDW-1.1 разрешает коммерческое использование и дообучение без дополнительных согласований с Nvidia.
https://developer.nvidia.com/blog/generate-trajectories-reasoning-traces-and-auto-labels-with-nvidia-alpamayo-2-super/
NVIDIA Technical Blog
Generate Trajectories, Reasoning Traces, and Auto-Labels with NVIDIA Alpamayo 2 Super
Autonomous vehicle (AV) development often relies on separate models for trajectory generation, high-level intent prediction, scene understanding, and data labeling. This separation makes it hard to…
Apple ML опубликовала масштабное исследование о выравнивании мультимодальных языковых моделей.
Главная проблема, которую изучали учёные — галлюцинации в мультимодальных LLM. Модели не только выдают неверные факты, но и генерируют ответы, противоречащие содержимому изображений. Команда систематически разобрала, какие именно компоненты alignment-обучения реально влияют на качество.
Ключевые находки: комбинирование офлайн-методов (DPO) и онлайн-методов (online-DPO) улучшает результаты. А главное — исследователи предложили новый способ создания обучающих данных под названием BDHS (Bias-Driven Hallucination Sampling), который не требует ни ручной разметки, ни сторонних моделей. При этом метод показывает конкурентные результаты на стандартных бенчмарках.
Для пользователей это означает прогресс в сторону более точных и надёжных мультимодальных ассистентов — таких, которые меньше "придумывают" то, чего нет на картинке.
https://machinelearning.apple.com/research/alignment-multimodal-llms
Главная проблема, которую изучали учёные — галлюцинации в мультимодальных LLM. Модели не только выдают неверные факты, но и генерируют ответы, противоречащие содержимому изображений. Команда систематически разобрала, какие именно компоненты alignment-обучения реально влияют на качество.
Ключевые находки: комбинирование офлайн-методов (DPO) и онлайн-методов (online-DPO) улучшает результаты. А главное — исследователи предложили новый способ создания обучающих данных под названием BDHS (Bias-Driven Hallucination Sampling), который не требует ни ручной разметки, ни сторонних моделей. При этом метод показывает конкурентные результаты на стандартных бенчмарках.
Для пользователей это означает прогресс в сторону более точных и надёжных мультимодальных ассистентов — таких, которые меньше "придумывают" то, чего нет на картинке.
https://machinelearning.apple.com/research/alignment-multimodal-llms
Apple Machine Learning Research
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in…
Мировые модели устарели — нужны World Proxies (by Shanghai AI Lab)
Классические world models предсказывают следующее физическое состояние среды. Полезно, но узко. Авторы предлагают сменить парадигму: вместо "что будет дальше в мире" — "какую информацию агент получит от действия".
Идея: Agent-Centric World Proxy — это посредник между агентом и реальной средой. Агент спрашивает прокси вместо реального мира, получая дешёвый, безопасный и параллелизуемый фидбек.
Шесть типов прокси: динамики, пространственный, исполнения (что вернёт код/инструмент), памяти/опыта, навыков и верификации/наград.
Три уровня использования: L1 — подсказки при инференсе, L2 — обучение политики на синтетических роллаутах, L3 — совместная эволюция агента и прокси.
По сути это survey + roadmap, переосмысляющий world modeling как инфраструктуру для непрерывного самоулучшения агентов.
https://arxiv.org/abs/2608.02713
Классические world models предсказывают следующее физическое состояние среды. Полезно, но узко. Авторы предлагают сменить парадигму: вместо "что будет дальше в мире" — "какую информацию агент получит от действия".
Идея: Agent-Centric World Proxy — это посредник между агентом и реальной средой. Агент спрашивает прокси вместо реального мира, получая дешёвый, безопасный и параллелизуемый фидбек.
Шесть типов прокси: динамики, пространственный, исполнения (что вернёт код/инструмент), памяти/опыта, навыков и верификации/наград.
Три уровня использования: L1 — подсказки при инференсе, L2 — обучение политики на синтетических роллаутах, L3 — совместная эволюция агента и прокси.
По сути это survey + roadmap, переосмысляющий world modeling как инфраструктуру для непрерывного самоулучшения агентов.
https://arxiv.org/abs/2608.02713
Как сжать видео+аудио токены в 13 раз и почти ничего не потерять?
Omni-LLM (модели, которые понимают видео, аудио и текст одновременно) страдают от огромного числа токенов — видео и аудио генерируют их в разы больше, чем текст. OmniPack предлагает двухэтапное сжатие без дообучения.
Этап 1 (до LLM): каждая модальность сжимается независимо. Для видео считается важность токенов через внимание энкодера + межкадровые изменения + пространственная уникальность. Для аудио — акустические границы. Затем выбираются не только "важные", но и "покрывающие" токены, чтобы не потерять редкие события. Похожие токены мёрджатся.
Этап 2 (внутри LLM): после того как аудио и видео "познакомились" семантически, применяется совместное аудио-визуальное прунинг с учётом текстового запроса.
Результат: 7.5% токенов от исходного числа, ускорение prefill в 4.5×, FLOPs меньше в 10×, при этом 95.6% качества сохраняется на 5 бенчмарках.
https://arxiv.org/abs/2608.03812
Omni-LLM (модели, которые понимают видео, аудио и текст одновременно) страдают от огромного числа токенов — видео и аудио генерируют их в разы больше, чем текст. OmniPack предлагает двухэтапное сжатие без дообучения.
Этап 1 (до LLM): каждая модальность сжимается независимо. Для видео считается важность токенов через внимание энкодера + межкадровые изменения + пространственная уникальность. Для аудио — акустические границы. Затем выбираются не только "важные", но и "покрывающие" токены, чтобы не потерять редкие события. Похожие токены мёрджатся.
Этап 2 (внутри LLM): после того как аудио и видео "познакомились" семантически, применяется совместное аудио-визуальное прунинг с учётом текстового запроса.
Результат: 7.5% токенов от исходного числа, ускорение prefill в 4.5×, FLOPs меньше в 10×, при этом 95.6% качества сохраняется на 5 бенчмарках.
https://arxiv.org/abs/2608.03812
"Физика" мультимодального предобучения (by Meta AI)
Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.
Четыре ключевых вывода:
1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.
2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.
3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.
4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.
https://arxiv.org/abs/2608.05000
Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.
Четыре ключевых вывода:
1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.
2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.
3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.
4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.
https://arxiv.org/abs/2608.05000
Nvidia представила World Action Models (WAM) — новый подход к управлению роботами
Вместо привычных VLA-моделей, которые учат роботов описывать мир, WAM учат его предсказывать. Разница принципиальная: робот понимает физику — как предмет упадёт, согнётся или сдвинется — а не просто распознаёт объекты по тексту.
В основе — открытая модель Cosmos 3 на архитектуре Mixture-of-Transformers. Она обучена на 767 млн изображений, 348 млн видео и 8 млн примеров действий роботов. Модель доступна в трёх размерах: 4B, 16B и 64B.
Главные плюсы WAM перед VLA: меньше данных для обучения, лучшая работа в незнакомых условиях и быстрая адаптация к новым роботам. Тесты показали рост успешности задач с 28,1% до 36,8%.
Развёртывание гибкое: 16B-версия работает на RTX PRO 6000 рядом с роботом, 4B-версия — прямо на борту устройства Jetson Thor.
https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation/
Вместо привычных VLA-моделей, которые учат роботов описывать мир, WAM учат его предсказывать. Разница принципиальная: робот понимает физику — как предмет упадёт, согнётся или сдвинется — а не просто распознаёт объекты по тексту.
В основе — открытая модель Cosmos 3 на архитектуре Mixture-of-Transformers. Она обучена на 767 млн изображений, 348 млн видео и 8 млн примеров действий роботов. Модель доступна в трёх размерах: 4B, 16B и 64B.
Главные плюсы WAM перед VLA: меньше данных для обучения, лучшая работа в незнакомых условиях и быстрая адаптация к новым роботам. Тесты показали рост успешности задач с 28,1% до 36,8%.
Развёртывание гибкое: 16B-версия работает на RTX PRO 6000 рядом с роботом, 4B-версия — прямо на борту устройства Jetson Thor.
https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation/
NVIDIA Technical Blog
Beyond VLAs: How World Action Models Reshape Robot Manipulation
A central challenge in robotics is building policies that generalize beyond the demonstrations they’re trained on. A policy that succeeds in a training scene often fails when object shapes, positions…
Apple ML опубликовала исследование о проблеме "выбросных токенов" в Diffusion Transformers.
Что происходит: при генерации изображений модели DiT создают небольшое число токенов с аномально высокой нормой. Они перетягивают на себя внимание механизма attention, но несут мало полезной информации — это портит качество картинок.
Команда выяснила: простое маскирование таких токенов не помогает. Проблема глубже — в искажённой локальной семантике патчей.
Решение — метод Dual-Stage Registers (DSR): специальные "регистры" встраиваются на двух этапах — в энкодер и в денойзер. Для новых моделей используются обученные регистры, для уже готовых — тест-тайм регистры без дообучения.
Результат: меньше артефактов и лучшее качество генерации на ImageNet и text-to-image задачах.
Почему важно: это фундаментальная проблема архитектур DiT, которая влияет на все современные генеративные модели изображений. DSR — простой и универсальный способ её устранить.
https://machinelearning.apple.com/research/taming-outlier-tokens
Что происходит: при генерации изображений модели DiT создают небольшое число токенов с аномально высокой нормой. Они перетягивают на себя внимание механизма attention, но несут мало полезной информации — это портит качество картинок.
Команда выяснила: простое маскирование таких токенов не помогает. Проблема глубже — в искажённой локальной семантике патчей.
Решение — метод Dual-Stage Registers (DSR): специальные "регистры" встраиваются на двух этапах — в энкодер и в денойзер. Для новых моделей используются обученные регистры, для уже готовых — тест-тайм регистры без дообучения.
Результат: меньше артефактов и лучшее качество генерации на ImageNet и text-to-image задачах.
Почему важно: это фундаментальная проблема архитектур DiT, которая влияет на все современные генеративные модели изображений. DSR — простой и универсальный способ её устранить.
https://machinelearning.apple.com/research/taming-outlier-tokens
Apple Machine Learning Research
Taming Outlier Tokens in Diffusion Transformers
We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can…
RST: как вырастить 37 тысяч сложных задач из 639 семян (by Tencent Hunyuan)
Обучать LLM-агентов на длинных многошаговых задачах дорого — один пример может стоить тысячи долларов. RST решает это рекурсивно: берём простую задачу, расширяем её эталонное решение, обновляем верификатор и инструкцию, проверяем в песочнице. Если работает — задача становится семенем для следующего раунда.
15 раундов из 639 задач → 37 484 верифицированных терминальных задач. Цена: ~$0.05 за задачу. Медианная длина решения выросла в 5.6×, число команд в 6.1×. При этом GPT-5.6 и DeepSeek-V4-Pro на поздних раундах проходят лишь 4–7% задач против 72% в начале.
Файнтюнинг Qwen3.5 на собранных траекториях даёт до +10 пунктов на терминальных бенчмарках, PPO добавляет ещё ~8%. Признаков насыщения через 15 раундов не обнаружено.
https://arxiv.org/abs/2608.05466
Обучать LLM-агентов на длинных многошаговых задачах дорого — один пример может стоить тысячи долларов. RST решает это рекурсивно: берём простую задачу, расширяем её эталонное решение, обновляем верификатор и инструкцию, проверяем в песочнице. Если работает — задача становится семенем для следующего раунда.
15 раундов из 639 задач → 37 484 верифицированных терминальных задач. Цена: ~$0.05 за задачу. Медианная длина решения выросла в 5.6×, число команд в 6.1×. При этом GPT-5.6 и DeepSeek-V4-Pro на поздних раундах проходят лишь 4–7% задач против 72% в начале.
Файнтюнинг Qwen3.5 на собранных траекториях даёт до +10 пунктов на терминальных бенчмарках, PPO добавляет ещё ~8%. Признаков насыщения через 15 раундов не обнаружено.
https://arxiv.org/abs/2608.05466
WorldCycle: физика как бесплатный учитель для видео-симуляторов (by Tencent)
Видео-симуляторы с управлением действиями страдают от накопительных ошибок: чем дольше роллаут, тем сильнее "уплывает" сцена. Проблема — нет ground truth для длинных горизонтов.
WorldCycle использует гениально простой трюк: законы физики. Если камера пошла вперёд, а потом назад — она должна вернуться в исходную точку. Это математически точный, бесплатный сигнал для обучения без разметки!
На этом строятся два RL-reward'а:
1. Spatial closure — промежуточные кадры прямого и обратного пути должны совпадать
2. Temporal consistency — одно действие должно давать одинаковый результат на любом шаге роллаута
Результат: дрейф состояния снижен на 44%, точность на составных действиях выросла в 4 раза. Плюс новый бенчмарк CycleBench для оценки симуляторов на цикл-консистентность.
https://arxiv.org/abs/2608.04964
Видео-симуляторы с управлением действиями страдают от накопительных ошибок: чем дольше роллаут, тем сильнее "уплывает" сцена. Проблема — нет ground truth для длинных горизонтов.
WorldCycle использует гениально простой трюк: законы физики. Если камера пошла вперёд, а потом назад — она должна вернуться в исходную точку. Это математически точный, бесплатный сигнал для обучения без разметки!
На этом строятся два RL-reward'а:
1. Spatial closure — промежуточные кадры прямого и обратного пути должны совпадать
2. Temporal consistency — одно действие должно давать одинаковый результат на любом шаге роллаута
Результат: дрейф состояния снижен на 44%, точность на составных действиях выросла в 4 раза. Плюс новый бенчмарк CycleBench для оценки симуляторов на цикл-консистентность.
https://arxiv.org/abs/2608.04964
Видео с руками человека → 18 000 часов данных для обучения роботов
Главная боль робототехники — нехватка разнообразных демонстраций. Их сбор дорог и медленен. А что если использовать миллионы часов видео, где люди просто что-то делают руками?
Ego2Robot — пайплайн, который превращает egocentric-видео (от первого лица) в синтетические тренировочные данные для роботов. Три ключевых шага: action alignment (поза руки → траектория захвата робота через ретаргетинг), visual alignment (SAM3 вырезает руки, ProPainter дорисовывает фон, рендерится рука робота), и многоуровневая фильтрация качества.
Результат: 18 561 час данных для 15 морфологий роботов из ~1940 часов исходного видео — усиление в 9.6x.
Главный вывод: добавление ego2robot-данных к реальным роботным демонстрациям улучшает обобщение вне распределения — особенно при смене визуального окружения, морфологии робота и семантики задачи.
https://arxiv.org/abs/2608.02580
Главная боль робототехники — нехватка разнообразных демонстраций. Их сбор дорог и медленен. А что если использовать миллионы часов видео, где люди просто что-то делают руками?
Ego2Robot — пайплайн, который превращает egocentric-видео (от первого лица) в синтетические тренировочные данные для роботов. Три ключевых шага: action alignment (поза руки → траектория захвата робота через ретаргетинг), visual alignment (SAM3 вырезает руки, ProPainter дорисовывает фон, рендерится рука робота), и многоуровневая фильтрация качества.
Результат: 18 561 час данных для 15 морфологий роботов из ~1940 часов исходного видео — усиление в 9.6x.
Главный вывод: добавление ego2robot-данных к реальным роботным демонстрациям улучшает обобщение вне распределения — особенно при смене визуального окружения, морфологии робота и семантики задачи.
https://arxiv.org/abs/2608.02580
Google DeepMind представила WeatherNext — новое поколение ИИ-моделей для прогнозирования погоды.
Главный прорыв — точность предсказания циклонов. Модель значительно опережает традиционные численные методы прогнозирования, которые используют метеослужбы по всему миру.
Что это значит на практике: более точные предупреждения об ураганах и тайфунах, больше времени на эвакуацию и подготовку. Для миллионов людей в зонах риска это буквально вопрос жизни и смерти.
WeatherNext продолжает линейку ИИ-разработок DeepMind в метеорологии — ранее компания уже удивила мир моделью GraphCast. Судя по всему, ИИ окончательно вытесняет классические суперкомпьютерные симуляции из этой области.
https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/
Главный прорыв — точность предсказания циклонов. Модель значительно опережает традиционные численные методы прогнозирования, которые используют метеослужбы по всему миру.
Что это значит на практике: более точные предупреждения об ураганах и тайфунах, больше времени на эвакуацию и подготовку. Для миллионов людей в зонах риска это буквально вопрос жизни и смерти.
WeatherNext продолжает линейку ИИ-разработок DeepMind в метеорологии — ранее компания уже удивила мир моделью GraphCast. Судя по всему, ИИ окончательно вытесняет классические суперкомпьютерные симуляции из этой области.
https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/
Google DeepMind
AI model achieves breakthrough in forecasting cyclones
WeatherNext enables accurate cyclone forecasts that can give an extra day of warning. Now we are open sourcing the model.
Apple ML представила метод защиты весов языковых моделей от несанкционированной дообучки.
Исследователи предложили DLR-Lock — способ «заблокировать» открытые веса модели от нежелательного файн-тюнинга. Идея в том, чтобы заменить каждый MLP-блок в модели на глубокую низкоранговую остаточную сеть (DLR-Net). Это создаёт асимметрию между прямым и обратным проходом: инференс работает нормально, а backpropagation требует памяти, которая растёт линейно с глубиной сети — файн-тюнинг становится непрактично дорогим.
Почему важно: открытые модели легко адаптировать под запрещённые сценарии. DLR-Lock усложняет это даже для атакующего, который знает архитектуру и стратегию защиты. При этом качество оригинальной модели сохраняется.
Для рядовых пользователей ничего не меняется — модель работает как обычно. Но для тех, кто хочет её «перекрутить», жизнь станет заметно сложнее.
https://machinelearning.apple.com/research/locking-pretrained-weights
Исследователи предложили DLR-Lock — способ «заблокировать» открытые веса модели от нежелательного файн-тюнинга. Идея в том, чтобы заменить каждый MLP-блок в модели на глубокую низкоранговую остаточную сеть (DLR-Net). Это создаёт асимметрию между прямым и обратным проходом: инференс работает нормально, а backpropagation требует памяти, которая растёт линейно с глубиной сети — файн-тюнинг становится непрактично дорогим.
Почему важно: открытые модели легко адаптировать под запрещённые сценарии. DLR-Lock усложняет это даже для атакующего, который знает архитектуру и стратегию защиты. При этом качество оригинальной модели сохраняется.
Для рядовых пользователей ничего не меняется — модель работает как обычно. Но для тех, кто хочет её «перекрутить», жизнь станет заметно сложнее.
https://machinelearning.apple.com/research/locking-pretrained-weights
Apple Machine Learning Research
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by…
Apple ML выпустила новый бенчмарк DeepAmbigQA для оценки полноты ответов языковых моделей.
Исследователи создали датасет из 3600 вопросов, требующих многошагового рассуждения и разрешения неоднозначности имён — например, "Какой актёр из фильма «Жара» получил Оскар?", где существует несколько фильмов с одинаковым названием.
Главная находка: даже GPT-5 справляется плохо — всего 0.13 точных совпадений на неоднозначных вопросах и 0.21 на обычных. Это показывает, что современные модели с поиском умеют находить ответы, но часто дают неполные или однобокие результаты.
Для генерации данных создан автоматический пайплайн DeepAmbigQAGen, который строит вопросы на основе текстовых корпусов и графов знаний.
Практический вывод: AI-ассистенты пока ненадёжны в задачах, где важна полнота ответа, а не просто его наличие.
https://machinelearning.apple.com/research/deepambigqa-multihop-questions
Исследователи создали датасет из 3600 вопросов, требующих многошагового рассуждения и разрешения неоднозначности имён — например, "Какой актёр из фильма «Жара» получил Оскар?", где существует несколько фильмов с одинаковым названием.
Главная находка: даже GPT-5 справляется плохо — всего 0.13 точных совпадений на неоднозначных вопросах и 0.21 на обычных. Это показывает, что современные модели с поиском умеют находить ответы, но часто дают неполные или однобокие результаты.
Для генерации данных создан автоматический пайплайн DeepAmbigQAGen, который строит вопросы на основе текстовых корпусов и графов знаний.
Практический вывод: AI-ассистенты пока ненадёжны в задачах, где важна полнота ответа, а не просто его наличие.
https://machinelearning.apple.com/research/deepambigqa-multihop-questions
Apple Machine Learning Research
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often…
Как научить агента понимать, какой именно шаг в многоходовой задаче был решающим?
Классическая проблема RL для агентов: получил награду в конце, но какой из 20 ходов реально помог? GRPO просто раздаёт одинаковый сигнал всем токенам траектории.
AgentOPSD решает это байесовски. Идея: запускаем два форварда — обычный и с "подсказкой успеха" (skill prompt). Разница в log-вероятностях на каждом шаге — это и есть байесовское свидетельство того, насколько этот ход приближал к успеху. Накапливаем это свидетельство рекурсивно через траекторию, обновляя байесовское убеждение о вероятности успеха.
Итог: каждый ход получает свой вес advantage — не одинаковый для всей траектории, а пропорциональный реальному вкладу. При этом знак advantage сохраняется (плохая траектория не станет хорошей), а overhead — всего один дополнительный форвард на траекторию.
На ALFWorld, WebShop и Search-QA агент из Tsinghua бьёт GRPO и все аналоги (RLSD, SDAR, StepOPSD).
https://arxiv.org/abs/2608.05987
Классическая проблема RL для агентов: получил награду в конце, но какой из 20 ходов реально помог? GRPO просто раздаёт одинаковый сигнал всем токенам траектории.
AgentOPSD решает это байесовски. Идея: запускаем два форварда — обычный и с "подсказкой успеха" (skill prompt). Разница в log-вероятностях на каждом шаге — это и есть байесовское свидетельство того, насколько этот ход приближал к успеху. Накапливаем это свидетельство рекурсивно через траекторию, обновляя байесовское убеждение о вероятности успеха.
Итог: каждый ход получает свой вес advantage — не одинаковый для всей траектории, а пропорциональный реальному вкладу. При этом знак advantage сохраняется (плохая траектория не станет хорошей), а overhead — всего один дополнительный форвард на траекторию.
На ALFWorld, WebShop и Search-QA агент из Tsinghua бьёт GRPO и все аналоги (RLSD, SDAR, StepOPSD).
https://arxiv.org/abs/2608.05987