"Физика" мультимодального предобучения (by Meta AI)
Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.
Четыре ключевых вывода:
1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.
2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.
3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.
4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.
https://arxiv.org/abs/2608.05000
Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.
Четыре ключевых вывода:
1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.
2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.
3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.
4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.
https://arxiv.org/abs/2608.05000
Nvidia представила World Action Models (WAM) — новый подход к управлению роботами
Вместо привычных VLA-моделей, которые учат роботов описывать мир, WAM учат его предсказывать. Разница принципиальная: робот понимает физику — как предмет упадёт, согнётся или сдвинется — а не просто распознаёт объекты по тексту.
В основе — открытая модель Cosmos 3 на архитектуре Mixture-of-Transformers. Она обучена на 767 млн изображений, 348 млн видео и 8 млн примеров действий роботов. Модель доступна в трёх размерах: 4B, 16B и 64B.
Главные плюсы WAM перед VLA: меньше данных для обучения, лучшая работа в незнакомых условиях и быстрая адаптация к новым роботам. Тесты показали рост успешности задач с 28,1% до 36,8%.
Развёртывание гибкое: 16B-версия работает на RTX PRO 6000 рядом с роботом, 4B-версия — прямо на борту устройства Jetson Thor.
https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation/
Вместо привычных VLA-моделей, которые учат роботов описывать мир, WAM учат его предсказывать. Разница принципиальная: робот понимает физику — как предмет упадёт, согнётся или сдвинется — а не просто распознаёт объекты по тексту.
В основе — открытая модель Cosmos 3 на архитектуре Mixture-of-Transformers. Она обучена на 767 млн изображений, 348 млн видео и 8 млн примеров действий роботов. Модель доступна в трёх размерах: 4B, 16B и 64B.
Главные плюсы WAM перед VLA: меньше данных для обучения, лучшая работа в незнакомых условиях и быстрая адаптация к новым роботам. Тесты показали рост успешности задач с 28,1% до 36,8%.
Развёртывание гибкое: 16B-версия работает на RTX PRO 6000 рядом с роботом, 4B-версия — прямо на борту устройства Jetson Thor.
https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation/
NVIDIA Technical Blog
Beyond VLAs: How World Action Models Reshape Robot Manipulation
A central challenge in robotics is building policies that generalize beyond the demonstrations they’re trained on. A policy that succeeds in a training scene often fails when object shapes, positions…
Apple ML опубликовала исследование о проблеме "выбросных токенов" в Diffusion Transformers.
Что происходит: при генерации изображений модели DiT создают небольшое число токенов с аномально высокой нормой. Они перетягивают на себя внимание механизма attention, но несут мало полезной информации — это портит качество картинок.
Команда выяснила: простое маскирование таких токенов не помогает. Проблема глубже — в искажённой локальной семантике патчей.
Решение — метод Dual-Stage Registers (DSR): специальные "регистры" встраиваются на двух этапах — в энкодер и в денойзер. Для новых моделей используются обученные регистры, для уже готовых — тест-тайм регистры без дообучения.
Результат: меньше артефактов и лучшее качество генерации на ImageNet и text-to-image задачах.
Почему важно: это фундаментальная проблема архитектур DiT, которая влияет на все современные генеративные модели изображений. DSR — простой и универсальный способ её устранить.
https://machinelearning.apple.com/research/taming-outlier-tokens
Что происходит: при генерации изображений модели DiT создают небольшое число токенов с аномально высокой нормой. Они перетягивают на себя внимание механизма attention, но несут мало полезной информации — это портит качество картинок.
Команда выяснила: простое маскирование таких токенов не помогает. Проблема глубже — в искажённой локальной семантике патчей.
Решение — метод Dual-Stage Registers (DSR): специальные "регистры" встраиваются на двух этапах — в энкодер и в денойзер. Для новых моделей используются обученные регистры, для уже готовых — тест-тайм регистры без дообучения.
Результат: меньше артефактов и лучшее качество генерации на ImageNet и text-to-image задачах.
Почему важно: это фундаментальная проблема архитектур DiT, которая влияет на все современные генеративные модели изображений. DSR — простой и универсальный способ её устранить.
https://machinelearning.apple.com/research/taming-outlier-tokens
Apple Machine Learning Research
Taming Outlier Tokens in Diffusion Transformers
We study outlier tokens in Diffusion Transformers (DiTs) for image generation. Prior work has shown that Vision Transformers (ViTs) can…
RST: как вырастить 37 тысяч сложных задач из 639 семян (by Tencent Hunyuan)
Обучать LLM-агентов на длинных многошаговых задачах дорого — один пример может стоить тысячи долларов. RST решает это рекурсивно: берём простую задачу, расширяем её эталонное решение, обновляем верификатор и инструкцию, проверяем в песочнице. Если работает — задача становится семенем для следующего раунда.
15 раундов из 639 задач → 37 484 верифицированных терминальных задач. Цена: ~$0.05 за задачу. Медианная длина решения выросла в 5.6×, число команд в 6.1×. При этом GPT-5.6 и DeepSeek-V4-Pro на поздних раундах проходят лишь 4–7% задач против 72% в начале.
Файнтюнинг Qwen3.5 на собранных траекториях даёт до +10 пунктов на терминальных бенчмарках, PPO добавляет ещё ~8%. Признаков насыщения через 15 раундов не обнаружено.
https://arxiv.org/abs/2608.05466
Обучать LLM-агентов на длинных многошаговых задачах дорого — один пример может стоить тысячи долларов. RST решает это рекурсивно: берём простую задачу, расширяем её эталонное решение, обновляем верификатор и инструкцию, проверяем в песочнице. Если работает — задача становится семенем для следующего раунда.
15 раундов из 639 задач → 37 484 верифицированных терминальных задач. Цена: ~$0.05 за задачу. Медианная длина решения выросла в 5.6×, число команд в 6.1×. При этом GPT-5.6 и DeepSeek-V4-Pro на поздних раундах проходят лишь 4–7% задач против 72% в начале.
Файнтюнинг Qwen3.5 на собранных траекториях даёт до +10 пунктов на терминальных бенчмарках, PPO добавляет ещё ~8%. Признаков насыщения через 15 раундов не обнаружено.
https://arxiv.org/abs/2608.05466
WorldCycle: физика как бесплатный учитель для видео-симуляторов (by Tencent)
Видео-симуляторы с управлением действиями страдают от накопительных ошибок: чем дольше роллаут, тем сильнее "уплывает" сцена. Проблема — нет ground truth для длинных горизонтов.
WorldCycle использует гениально простой трюк: законы физики. Если камера пошла вперёд, а потом назад — она должна вернуться в исходную точку. Это математически точный, бесплатный сигнал для обучения без разметки!
На этом строятся два RL-reward'а:
1. Spatial closure — промежуточные кадры прямого и обратного пути должны совпадать
2. Temporal consistency — одно действие должно давать одинаковый результат на любом шаге роллаута
Результат: дрейф состояния снижен на 44%, точность на составных действиях выросла в 4 раза. Плюс новый бенчмарк CycleBench для оценки симуляторов на цикл-консистентность.
https://arxiv.org/abs/2608.04964
Видео-симуляторы с управлением действиями страдают от накопительных ошибок: чем дольше роллаут, тем сильнее "уплывает" сцена. Проблема — нет ground truth для длинных горизонтов.
WorldCycle использует гениально простой трюк: законы физики. Если камера пошла вперёд, а потом назад — она должна вернуться в исходную точку. Это математически точный, бесплатный сигнал для обучения без разметки!
На этом строятся два RL-reward'а:
1. Spatial closure — промежуточные кадры прямого и обратного пути должны совпадать
2. Temporal consistency — одно действие должно давать одинаковый результат на любом шаге роллаута
Результат: дрейф состояния снижен на 44%, точность на составных действиях выросла в 4 раза. Плюс новый бенчмарк CycleBench для оценки симуляторов на цикл-консистентность.
https://arxiv.org/abs/2608.04964
Видео с руками человека → 18 000 часов данных для обучения роботов
Главная боль робототехники — нехватка разнообразных демонстраций. Их сбор дорог и медленен. А что если использовать миллионы часов видео, где люди просто что-то делают руками?
Ego2Robot — пайплайн, который превращает egocentric-видео (от первого лица) в синтетические тренировочные данные для роботов. Три ключевых шага: action alignment (поза руки → траектория захвата робота через ретаргетинг), visual alignment (SAM3 вырезает руки, ProPainter дорисовывает фон, рендерится рука робота), и многоуровневая фильтрация качества.
Результат: 18 561 час данных для 15 морфологий роботов из ~1940 часов исходного видео — усиление в 9.6x.
Главный вывод: добавление ego2robot-данных к реальным роботным демонстрациям улучшает обобщение вне распределения — особенно при смене визуального окружения, морфологии робота и семантики задачи.
https://arxiv.org/abs/2608.02580
Главная боль робототехники — нехватка разнообразных демонстраций. Их сбор дорог и медленен. А что если использовать миллионы часов видео, где люди просто что-то делают руками?
Ego2Robot — пайплайн, который превращает egocentric-видео (от первого лица) в синтетические тренировочные данные для роботов. Три ключевых шага: action alignment (поза руки → траектория захвата робота через ретаргетинг), visual alignment (SAM3 вырезает руки, ProPainter дорисовывает фон, рендерится рука робота), и многоуровневая фильтрация качества.
Результат: 18 561 час данных для 15 морфологий роботов из ~1940 часов исходного видео — усиление в 9.6x.
Главный вывод: добавление ego2robot-данных к реальным роботным демонстрациям улучшает обобщение вне распределения — особенно при смене визуального окружения, морфологии робота и семантики задачи.
https://arxiv.org/abs/2608.02580
Google DeepMind представила WeatherNext — новое поколение ИИ-моделей для прогнозирования погоды.
Главный прорыв — точность предсказания циклонов. Модель значительно опережает традиционные численные методы прогнозирования, которые используют метеослужбы по всему миру.
Что это значит на практике: более точные предупреждения об ураганах и тайфунах, больше времени на эвакуацию и подготовку. Для миллионов людей в зонах риска это буквально вопрос жизни и смерти.
WeatherNext продолжает линейку ИИ-разработок DeepMind в метеорологии — ранее компания уже удивила мир моделью GraphCast. Судя по всему, ИИ окончательно вытесняет классические суперкомпьютерные симуляции из этой области.
https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/
Главный прорыв — точность предсказания циклонов. Модель значительно опережает традиционные численные методы прогнозирования, которые используют метеослужбы по всему миру.
Что это значит на практике: более точные предупреждения об ураганах и тайфунах, больше времени на эвакуацию и подготовку. Для миллионов людей в зонах риска это буквально вопрос жизни и смерти.
WeatherNext продолжает линейку ИИ-разработок DeepMind в метеорологии — ранее компания уже удивила мир моделью GraphCast. Судя по всему, ИИ окончательно вытесняет классические суперкомпьютерные симуляции из этой области.
https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/
Google DeepMind
AI model achieves breakthrough in forecasting cyclones
WeatherNext enables accurate cyclone forecasts that can give an extra day of warning. Now we are open sourcing the model.
Apple ML представила метод защиты весов языковых моделей от несанкционированной дообучки.
Исследователи предложили DLR-Lock — способ «заблокировать» открытые веса модели от нежелательного файн-тюнинга. Идея в том, чтобы заменить каждый MLP-блок в модели на глубокую низкоранговую остаточную сеть (DLR-Net). Это создаёт асимметрию между прямым и обратным проходом: инференс работает нормально, а backpropagation требует памяти, которая растёт линейно с глубиной сети — файн-тюнинг становится непрактично дорогим.
Почему важно: открытые модели легко адаптировать под запрещённые сценарии. DLR-Lock усложняет это даже для атакующего, который знает архитектуру и стратегию защиты. При этом качество оригинальной модели сохраняется.
Для рядовых пользователей ничего не меняется — модель работает как обычно. Но для тех, кто хочет её «перекрутить», жизнь станет заметно сложнее.
https://machinelearning.apple.com/research/locking-pretrained-weights
Исследователи предложили DLR-Lock — способ «заблокировать» открытые веса модели от нежелательного файн-тюнинга. Идея в том, чтобы заменить каждый MLP-блок в модели на глубокую низкоранговую остаточную сеть (DLR-Net). Это создаёт асимметрию между прямым и обратным проходом: инференс работает нормально, а backpropagation требует памяти, которая растёт линейно с глубиной сети — файн-тюнинг становится непрактично дорогим.
Почему важно: открытые модели легко адаптировать под запрещённые сценарии. DLR-Lock усложняет это даже для атакующего, который знает архитектуру и стратегию защиты. При этом качество оригинальной модели сохраняется.
Для рядовых пользователей ничего не меняется — модель работает как обычно. Но для тех, кто хочет её «перекрутить», жизнь станет заметно сложнее.
https://machinelearning.apple.com/research/locking-pretrained-weights
Apple Machine Learning Research
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by…
Apple ML выпустила новый бенчмарк DeepAmbigQA для оценки полноты ответов языковых моделей.
Исследователи создали датасет из 3600 вопросов, требующих многошагового рассуждения и разрешения неоднозначности имён — например, "Какой актёр из фильма «Жара» получил Оскар?", где существует несколько фильмов с одинаковым названием.
Главная находка: даже GPT-5 справляется плохо — всего 0.13 точных совпадений на неоднозначных вопросах и 0.21 на обычных. Это показывает, что современные модели с поиском умеют находить ответы, но часто дают неполные или однобокие результаты.
Для генерации данных создан автоматический пайплайн DeepAmbigQAGen, который строит вопросы на основе текстовых корпусов и графов знаний.
Практический вывод: AI-ассистенты пока ненадёжны в задачах, где важна полнота ответа, а не просто его наличие.
https://machinelearning.apple.com/research/deepambigqa-multihop-questions
Исследователи создали датасет из 3600 вопросов, требующих многошагового рассуждения и разрешения неоднозначности имён — например, "Какой актёр из фильма «Жара» получил Оскар?", где существует несколько фильмов с одинаковым названием.
Главная находка: даже GPT-5 справляется плохо — всего 0.13 точных совпадений на неоднозначных вопросах и 0.21 на обычных. Это показывает, что современные модели с поиском умеют находить ответы, но часто дают неполные или однобокие результаты.
Для генерации данных создан автоматический пайплайн DeepAmbigQAGen, который строит вопросы на основе текстовых корпусов и графов знаний.
Практический вывод: AI-ассистенты пока ненадёжны в задачах, где важна полнота ответа, а не просто его наличие.
https://machinelearning.apple.com/research/deepambigqa-multihop-questions
Apple Machine Learning Research
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often…
Как научить агента понимать, какой именно шаг в многоходовой задаче был решающим?
Классическая проблема RL для агентов: получил награду в конце, но какой из 20 ходов реально помог? GRPO просто раздаёт одинаковый сигнал всем токенам траектории.
AgentOPSD решает это байесовски. Идея: запускаем два форварда — обычный и с "подсказкой успеха" (skill prompt). Разница в log-вероятностях на каждом шаге — это и есть байесовское свидетельство того, насколько этот ход приближал к успеху. Накапливаем это свидетельство рекурсивно через траекторию, обновляя байесовское убеждение о вероятности успеха.
Итог: каждый ход получает свой вес advantage — не одинаковый для всей траектории, а пропорциональный реальному вкладу. При этом знак advantage сохраняется (плохая траектория не станет хорошей), а overhead — всего один дополнительный форвард на траекторию.
На ALFWorld, WebShop и Search-QA агент из Tsinghua бьёт GRPO и все аналоги (RLSD, SDAR, StepOPSD).
https://arxiv.org/abs/2608.05987
Классическая проблема RL для агентов: получил награду в конце, но какой из 20 ходов реально помог? GRPO просто раздаёт одинаковый сигнал всем токенам траектории.
AgentOPSD решает это байесовски. Идея: запускаем два форварда — обычный и с "подсказкой успеха" (skill prompt). Разница в log-вероятностях на каждом шаге — это и есть байесовское свидетельство того, насколько этот ход приближал к успеху. Накапливаем это свидетельство рекурсивно через траекторию, обновляя байесовское убеждение о вероятности успеха.
Итог: каждый ход получает свой вес advantage — не одинаковый для всей траектории, а пропорциональный реальному вкладу. При этом знак advantage сохраняется (плохая траектория не станет хорошей), а overhead — всего один дополнительный форвард на траекторию.
На ALFWorld, WebShop и Search-QA агент из Tsinghua бьёт GRPO и все аналоги (RLSD, SDAR, StepOPSD).
https://arxiv.org/abs/2608.05987
Агент наконец узнает, чем ты занимался весь день — без единого LLM в пайплайне
LLM-агенты помнят только разговоры, но не то, что ты реально делал: 40 переключений контекста после обеда, брошенный черновик письма в 16:40. Сырые логи экрана — это ~126k токенов за день, LLM-суммаризация — галлюцинации и недетерминизм.
Автор предлагает детерминистическую компиляцию: поток снапшотов экрана → "activity frames" (эпизоды с приложением, временем, активными минутами, ссылками на сырые строки). Никакой модели в пайплайне — одинаковые входные данные всегда дают байт-в-байт одинаковый результат.
Результат: сжатие в 86 раз, компиляция за 68 мс, агент отвечает точнее на вопросы о дне по сравнению с сырыми логами или LLM-суммари. Средний тир модели догоняет фронтирный.
Реализация — Python без зависимостей + MCP-сервер для любого агента.
https://arxiv.org/abs/2608.05784
LLM-агенты помнят только разговоры, но не то, что ты реально делал: 40 переключений контекста после обеда, брошенный черновик письма в 16:40. Сырые логи экрана — это ~126k токенов за день, LLM-суммаризация — галлюцинации и недетерминизм.
Автор предлагает детерминистическую компиляцию: поток снапшотов экрана → "activity frames" (эпизоды с приложением, временем, активными минутами, ссылками на сырые строки). Никакой модели в пайплайне — одинаковые входные данные всегда дают байт-в-байт одинаковый результат.
Результат: сжатие в 86 раз, компиляция за 68 мс, агент отвечает точнее на вопросы о дне по сравнению с сырыми логами или LLM-суммари. Средний тир модели догоняет фронтирный.
Реализация — Python без зависимостей + MCP-сервер для любого агента.
https://arxiv.org/abs/2608.05784
Видеомодель как мозг робота: 3x ускорение без потери качества (by Huawei)
World Action Models (WAM) — роботы, управляемые видеомоделями физической динамики — круто работают, но медленно: 211 мс на чанк действий против 71 мс у VLA-моделей. Авторы решили это архитектурно.
Идея: зачем делать глубокий action-трансформер, если видеомодель уже выучила физику? Пусть action head будет лёгким, но "докнется" ко всем слоям видеобэкбона сразу.
Так появился Dock of Transformers (DoT): видео-DiT — центральный хаб, а task-specific головы подключаются через docking interface. Конкретно — KV-Fusion собирает ключи и значения со всех L слоёв видеобэкбона и отдаёт их в единственный слой action DiT.
Результат — Faster-WAM: 66.5 мс на чанк (3.2x быстрее Fast-WAM, быстрее π0 и π0.5), при этом 98.5% на LIBERO и +23.5 п.п. над Fast-WAM на LIBERO-Plus.
https://arxiv.org/abs/2608.02365
World Action Models (WAM) — роботы, управляемые видеомоделями физической динамики — круто работают, но медленно: 211 мс на чанк действий против 71 мс у VLA-моделей. Авторы решили это архитектурно.
Идея: зачем делать глубокий action-трансформер, если видеомодель уже выучила физику? Пусть action head будет лёгким, но "докнется" ко всем слоям видеобэкбона сразу.
Так появился Dock of Transformers (DoT): видео-DiT — центральный хаб, а task-specific головы подключаются через docking interface. Конкретно — KV-Fusion собирает ключи и значения со всех L слоёв видеобэкбона и отдаёт их в единственный слой action DiT.
Результат — Faster-WAM: 66.5 мс на чанк (3.2x быстрее Fast-WAM, быстрее π0 и π0.5), при этом 98.5% на LIBERO и +23.5 п.п. над Fast-WAM на LIBERO-Plus.
https://arxiv.org/abs/2608.02365
Apple ML представила масштабируемую альтернативу авторегрессионным языковым моделям.
Исследователи обучили модель на 1,7 млрд параметров и 2,1 трлн токенов, используя подход Categorical Flow Maps (CFM) — метод генерации текста через непрерывные потоки вместо привычного пошагового предсказания токенов.
Главный результат: модель генерирует качественный текст всего за 4 шага вместо сотен итераций у классических диффузионных моделей. При этом сохраняется разнообразие и естественность текста.
Почему важно: до этого CFM тестировали только на моделях меньше 1 млрд параметров — оставалось неясным, работает ли подход в реальных масштабах. Теперь ответ есть: работает. Это открывает путь к более быстрым и дешёвым языковым моделям без потери качества.
Для пользователей это может означать более отзывчивые AI-ассистенты с меньшими вычислительными затратами в будущем.
https://machinelearning.apple.com/research/scaling-categorical-flow-maps
Исследователи обучили модель на 1,7 млрд параметров и 2,1 трлн токенов, используя подход Categorical Flow Maps (CFM) — метод генерации текста через непрерывные потоки вместо привычного пошагового предсказания токенов.
Главный результат: модель генерирует качественный текст всего за 4 шага вместо сотен итераций у классических диффузионных моделей. При этом сохраняется разнообразие и естественность текста.
Почему важно: до этого CFM тестировали только на моделях меньше 1 млрд параметров — оставалось неясным, работает ли подход в реальных масштабах. Теперь ответ есть: работает. Это открывает путь к более быстрым и дешёвым языковым моделям без потери качества.
Для пользователей это может означать более отзывчивые AI-ассистенты с меньшими вычислительными затратами в будущем.
https://machinelearning.apple.com/research/scaling-categorical-flow-maps
Apple Machine Learning Research
Scaling Categorical Flow Maps
Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling…
Apple ML сравнила диффузионные и авторегрессионные языковые модели
Исследователи Apple ML опубликовали работу, в которой детально сравнили два подхода к генерации текста: привычные авторегрессионные модели (ARM) и диффузионные языковые модели (DLM).
Ключевые выводы: DLM генерируют токены параллельно, что даёт им преимущество по вычислительной интенсивности — но только на коротких контекстах. При длинных текстах они плохо масштабируются. ARM же при батчевом инференсе показывают лучшую пропускную способность, эффективнее используя параллелизм по запросам.
Авторы предлагают блочное декодирование для DLM — это отвязывает вычислительную интенсивность от длины контекста и улучшает масштабируемость. Также подчёркивается: главный путь к ускорению DLM — сокращение числа шагов сэмплирования.
Почему это важно: диффузионные модели считаются перспективной альтернативой GPT-подобным архитектурам, но до реального превосходства им ещё далеко. Apple системно обозначила узкие места — это дорожная карта для всей индустрии.
https://machinelearning.apple.com/research/diffusion-autoregressive-performance
Исследователи Apple ML опубликовали работу, в которой детально сравнили два подхода к генерации текста: привычные авторегрессионные модели (ARM) и диффузионные языковые модели (DLM).
Ключевые выводы: DLM генерируют токены параллельно, что даёт им преимущество по вычислительной интенсивности — но только на коротких контекстах. При длинных текстах они плохо масштабируются. ARM же при батчевом инференсе показывают лучшую пропускную способность, эффективнее используя параллелизм по запросам.
Авторы предлагают блочное декодирование для DLM — это отвязывает вычислительную интенсивность от длины контекста и улучшает масштабируемость. Также подчёркивается: главный путь к ускорению DLM — сокращение числа шагов сэмплирования.
Почему это важно: диффузионные модели считаются перспективной альтернативой GPT-подобным архитектурам, но до реального превосходства им ещё далеко. Apple системно обозначила узкие места — это дорожная карта для всей индустрии.
https://machinelearning.apple.com/research/diffusion-autoregressive-performance
Apple Machine Learning Research
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks…
Apple ML представила ARBITRAGE — новый фреймворк для ускорения инференса языковых моделей с длинными цепочками рассуждений.
Проблема: стандартное Speculative Decoding (быстрая черновая модель предлагает токены, мощная модель проверяет) плохо работает в задачах рассуждения — слишком много лишних отклонений из-за семантически эквивалентных, но текстуально разных шагов.
Что нового: ARBITRAGE работает на уровне шагов рассуждения, а не отдельных токенов. Лёгкий роутер предсказывает, когда большая модель даст реально лучший результат, и только тогда к ней обращается. Это приближается к "идеальному оракулу", который всегда выбирает лучший шаг.
Результат: до 2x снижение задержки при сохранении точности на математических бенчмарках.
Почему важно: эффективный инференс — ключ к удешевлению AI-сервисов. Такие техники напрямую влияют на то, сколько стоит запустить умную модель на устройстве или в облаке.
https://machinelearning.apple.com/research/arbitrage-efficient-reasoning
Проблема: стандартное Speculative Decoding (быстрая черновая модель предлагает токены, мощная модель проверяет) плохо работает в задачах рассуждения — слишком много лишних отклонений из-за семантически эквивалентных, но текстуально разных шагов.
Что нового: ARBITRAGE работает на уровне шагов рассуждения, а не отдельных токенов. Лёгкий роутер предсказывает, когда большая модель даст реально лучший результат, и только тогда к ней обращается. Это приближается к "идеальному оракулу", который всегда выбирает лучший шаг.
Результат: до 2x снижение задержки при сохранении точности на математических бенчмарках.
Почему важно: эффективный инференс — ключ к удешевлению AI-сервисов. Такие техники напрямую влияют на то, сколько стоит запустить умную модель на устройстве или в облаке.
https://machinelearning.apple.com/research/arbitrage-efficient-reasoning
Apple Machine Learning Research
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational…
Редактирование видео в реальном времени на 30 FPS — больше не фантастика
Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.
Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:
1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"
2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа
3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок
Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.
Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:
1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"
2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа
3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок
Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Модель учит саму себя без учителя и без правильных ответов
Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.
U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.
Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.
Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.
https://arxiv.org/abs/2608.06296
Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.
U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.
Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.
Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.
https://arxiv.org/abs/2608.06296
Coding-агент для роботов: один шаг — одно действие — новое наблюдение
Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.
Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.
Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.
https://arxiv.org/abs/2608.03924
Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.
Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.
Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.
https://arxiv.org/abs/2608.03924
FactorJEPA: мировые модели наконец-то учатся понимать хаотичный городской трафик (by Apple/Meta)
Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?
Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.
Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.
Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?
Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.
Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.
Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Argus: агент, который умеет менять цель — и это не баг, а фича
В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.
Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.
На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.
Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.
https://arxiv.org/abs/2608.05144
В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.
Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.
На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.
Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.
https://arxiv.org/abs/2608.05144
Судьи-VLM для компьютерных агентов врут в четверти случаев — и мы это наконец измерили
Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?
Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.
Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.
https://arxiv.org/abs/2607.28609
Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?
Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.
Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.
https://arxiv.org/abs/2607.28609