Видео на всю длину истории, а не только один клип
Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.
Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.
Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.
Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.
https://arxiv.org/abs/2608.23383
Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.
Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.
Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.
Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.
https://arxiv.org/abs/2608.23383
Дистилляция из нескольких учителей сломана — и вот почему (by ByteDance & Tsinghua)
Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.
Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.
Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness
Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.
Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.
Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness
Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Nvidia представила TensorRT Model Connect — инструмент для развёртывания открытых моделей в нативных C++ приложениях всего двумя командами.
Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.
Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.
Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.
Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect
https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.
Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.
Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.
Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect
https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
GitHub
GitHub - NVIDIA/TensorRT-Model-Connect: From PyTorch model to end-to-end TensorRT inference experience in two commands—AI-native…
From PyTorch model to end-to-end TensorRT inference experience in two commands—AI-native, cross-platform, and built for the best possible user experience. - NVIDIA/TensorRT-Model-Connect
Apple ML опубликовала исследование о том, насколько последовательно языковые модели обновляют свои убеждения при получении новых данных.
Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.
Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".
Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.
https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.
Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".
Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.
https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Apple Machine Learning Research
LLMs Are Not (Consistently) Bayesian: Quantifying Internal (In)consistencies of LLMs’ Probabilistic Beliefs
Modern AI systems are being deployed in complex domains such as medicine, science, and law, where there is often not a single correct answer…
Apple ML представила Agent Seer — систему для автоматической генерации тестовых сценариев для AI-агентов.
Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.
Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.
Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.
Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.
https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.
Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.
Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.
Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.
https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
Apple Machine Learning Research
Agent Seer: Synthesizing Scenarios from Specification Understanding
Evaluating AI agents that use external tools requires realistic test scenarios that capture how practitioners compose tools and iterate…
LLM пишет 3D-модели как программу — и получает чёткие грани, именованные детали и редактируемость
Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).
Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.
Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.
https://arxiv.org/abs/2608.26238
Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).
Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.
Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.
https://arxiv.org/abs/2608.26238
LLM как мозг игрового мира: Code World Model
Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.
Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.
Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.
Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.
https://arxiv.org/abs/2608.25927
Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.
Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.
Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.
Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.
https://arxiv.org/abs/2608.25927
Бесплатное ускорение reasoning-моделей в 3 раза без переобучения
Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.
Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.
Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).
Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.
https://arxiv.org/abs/2608.26070
Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.
Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.
Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).
Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.
https://arxiv.org/abs/2608.26070
PyTorch: vLLM займёт центральное место на конференции 2026 года
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
Что если представить физический мир как исполняемый код?
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549
Больше данных — не всегда ответ для роботов
Хочешь научить робота новым задачам? Обычно говорят: собери больше траекторий. Но авторы VLAct утверждают: дело не в количестве данных, а в том, как они формируют представления в backbone.
Проблема: при наивном дообучении VLM на роботных данных происходит три беды. Узкие траектории разрушают полезные vision-language признаки. Один action head "переспециализирует" backbone под свою геометрию. Разные embodiment-ы не делятся общими знаниями.
Решение VLAct: защита мелких слоёв LLM от перезаписи + микс caption-данных + обучение сразу с несколькими action heads + унифицированное пространство действий для разных роботов.
Результат: +7.6–21.4 пункта на бенчмарках только за счёт лучшего backbone — при том же action head, тех же данных и том же бюджете дообучения. 82.6% на LIBERO-Plus, 92.5% на RoboTwin 2.0. Всё на 16 GPU и открытых данных.
https://arxiv.org/abs/2608.27550
Хочешь научить робота новым задачам? Обычно говорят: собери больше траекторий. Но авторы VLAct утверждают: дело не в количестве данных, а в том, как они формируют представления в backbone.
Проблема: при наивном дообучении VLM на роботных данных происходит три беды. Узкие траектории разрушают полезные vision-language признаки. Один action head "переспециализирует" backbone под свою геометрию. Разные embodiment-ы не делятся общими знаниями.
Решение VLAct: защита мелких слоёв LLM от перезаписи + микс caption-данных + обучение сразу с несколькими action heads + унифицированное пространство действий для разных роботов.
Результат: +7.6–21.4 пункта на бенчмарках только за счёт лучшего backbone — при том же action head, тех же данных и том же бюджете дообучения. 82.6% на LIBERO-Plus, 92.5% на RoboTwin 2.0. Всё на 16 GPU и открытых данных.
https://arxiv.org/abs/2608.27550
Робот учится по видео с людьми — без единой совместной записи
Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.
Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.
Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.
Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.
https://arxiv.org/abs/2608.26103
Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.
Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.
Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.
Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.
https://arxiv.org/abs/2608.26103
DART-SD: как научить агента чинить только сломанное (by ByteDance)
Когда LLM-агент использует инструменты в несколько шагов, стандартные подходы страдают от одной проблемы: SFT штрафует модель за нормальные шаги, а RL размазывает награду равномерно по всей траектории. Оба метода не понимают, что пространство решений — это не линейная цепочка, а граф с «ромбовидной» топологией, где разные пути пересекаются в одних и тех же состояниях.
DART-SD строит граф переходов (ISTG) из траекторий учителя, находит точку Critical Topological Breakpoint — первый момент, где студент сходит с успешного пути — и обучает модель только на шагах восстановления после этой точки. Всё, что было до CTB, не трогается градиентами.
Результат: меньше лишних вызовов инструментов, лучше качество на 5 бенчмарках, и модель постепенно сдвигает границу своей компетентности с каждым раундом само-дистилляции.
https://arxiv.org/abs/2608.18524
Когда LLM-агент использует инструменты в несколько шагов, стандартные подходы страдают от одной проблемы: SFT штрафует модель за нормальные шаги, а RL размазывает награду равномерно по всей траектории. Оба метода не понимают, что пространство решений — это не линейная цепочка, а граф с «ромбовидной» топологией, где разные пути пересекаются в одних и тех же состояниях.
DART-SD строит граф переходов (ISTG) из траекторий учителя, находит точку Critical Topological Breakpoint — первый момент, где студент сходит с успешного пути — и обучает модель только на шагах восстановления после этой точки. Всё, что было до CTB, не трогается градиентами.
Результат: меньше лишних вызовов инструментов, лучше качество на 5 бенчмарках, и модель постепенно сдвигает границу своей компетентности с каждым раундом само-дистилляции.
https://arxiv.org/abs/2608.18524
Находить объекты в видео параллельно, а не по очереди
Задача spatio-temporal video grounding — найти объект в видео по текстовому запросу: определить временной интервал и нарисовать bounding box в каждом кадре. Проблема: стандартные MLLM генерируют боксы один за другим, и чем длиннее видео — тем медленнее и хуже (ошибки накапливаются).
Авторы из MBZUAI предлагают Parallel Tube Decoding (PTD): вместо того чтобы генерировать боксы последовательно, модель сначала за один шаг предсказывает временной интервал, а затем параллельно генерирует все боксы сразу. Итого всегда ровно два декодирующих раунда, независимо от длины трубки.
Чтобы это работало, вводят Decoupled Block Attention — каждый бокс видит общий видео-контекст, но не видит другие боксы. Плюс RL-оптимизация с пространственными и временными наградами.
Результат: ускорение латентности в 79 раз, пропускная способность выросла в 92 раза по сравнению с базовым текстовым декодингом, при этом качество локализации улучшилось.
https://arxiv.org/abs/2608.28192
Задача spatio-temporal video grounding — найти объект в видео по текстовому запросу: определить временной интервал и нарисовать bounding box в каждом кадре. Проблема: стандартные MLLM генерируют боксы один за другим, и чем длиннее видео — тем медленнее и хуже (ошибки накапливаются).
Авторы из MBZUAI предлагают Parallel Tube Decoding (PTD): вместо того чтобы генерировать боксы последовательно, модель сначала за один шаг предсказывает временной интервал, а затем параллельно генерирует все боксы сразу. Итого всегда ровно два декодирующих раунда, независимо от длины трубки.
Чтобы это работало, вводят Decoupled Block Attention — каждый бокс видит общий видео-контекст, но не видит другие боксы. Плюс RL-оптимизация с пространственными и временными наградами.
Результат: ускорение латентности в 79 раз, пропускная способность выросла в 92 раза по сравнению с базовым текстовым декодингом, при этом качество локализации улучшилось.
https://arxiv.org/abs/2608.28192
Модель учится без правильных ответов — и обгоняет ту, у которой они были
Представьте: у вас есть сложные олимпиадные задачи, и вы не знаете правильных ответов. Можно ли всё равно улучшить модель? TTPO говорит — да.
Ключевое наблюдение: на задачах уровня AIME псевдо-метки (majority vote по K роллаутам) ошибаются в ~85% случаев. Казалось бы, учиться на таком шуме бессмысленно. Но вот хитрость: даже когда псевдо-метка неверна, ~79% "несогласных" роллаутов тоже неверны. Значит, штрафовать несогласных — правильно почти всегда, независимо от качества метки.
Отсюда асимметричный дизайн:
- Роллауты, согласные с псевдо-меткой → дистилляция (OPSD) с токен-уровневыми весами
- Несогласные роллауты → GRPO-штраф с маскировкой аномальных токенов
Результат: Qwen3-1.7B без единого правильного ответа вырастает с 38.0% до 45.2% на олимпиадных бенчмарках — обгоняя TTRL и даже label-supervised OPSD.
https://arxiv.org/abs/2608.27448
Представьте: у вас есть сложные олимпиадные задачи, и вы не знаете правильных ответов. Можно ли всё равно улучшить модель? TTPO говорит — да.
Ключевое наблюдение: на задачах уровня AIME псевдо-метки (majority vote по K роллаутам) ошибаются в ~85% случаев. Казалось бы, учиться на таком шуме бессмысленно. Но вот хитрость: даже когда псевдо-метка неверна, ~79% "несогласных" роллаутов тоже неверны. Значит, штрафовать несогласных — правильно почти всегда, независимо от качества метки.
Отсюда асимметричный дизайн:
- Роллауты, согласные с псевдо-меткой → дистилляция (OPSD) с токен-уровневыми весами
- Несогласные роллауты → GRPO-штраф с маскировкой аномальных токенов
Результат: Qwen3-1.7B без единого правильного ответа вырастает с 38.0% до 45.2% на олимпиадных бенчмарках — обгоняя TTRL и даже label-supervised OPSD.
https://arxiv.org/abs/2608.27448
Microsoft Research выпустила GigaPath-Flash и GigaTIME-Flash — ускоренные версии своих ИИ-моделей для анализа патологических снимков.
Суть: оригинальные модели GigaPath и GigaTIME умели анализировать гигапиксельные срезы тканей и строить карты опухолевого микроокружения, но требовали огромных вычислительных ресурсов. Flash-версии решают эту проблему — через дистилляцию знаний из миллиардной модели в компактную архитектуру.
Цифры говорят сами за себя: GigaPath-Flash работает в 50 раз дешевле при сохранении 97% точности. GigaTIME-Flash — в 6 раз быстрее и потребляет в 8 раз меньше памяти, при этом показывая лучшее качество на новых данных.
Практически это означает: анализ миллиона слайдов теперь занимает 70 GPU-дней вместо 300. Исследователи смогут изучать десятки тысяч пациентов, тестировать гипотезы и искать биомаркеры рака в реальном масштабе.
Модели открыты под лицензией Apache 2.0 и доступны на HuggingFace. Для клинического применения не предназначены.
https://www.microsoft.com/en-us/research/blog/gigapath-flash-and-gigatime-flash-toward-population-scale-discovery-with-efficient-pathology-foundation-models/
Суть: оригинальные модели GigaPath и GigaTIME умели анализировать гигапиксельные срезы тканей и строить карты опухолевого микроокружения, но требовали огромных вычислительных ресурсов. Flash-версии решают эту проблему — через дистилляцию знаний из миллиардной модели в компактную архитектуру.
Цифры говорят сами за себя: GigaPath-Flash работает в 50 раз дешевле при сохранении 97% точности. GigaTIME-Flash — в 6 раз быстрее и потребляет в 8 раз меньше памяти, при этом показывая лучшее качество на новых данных.
Практически это означает: анализ миллиона слайдов теперь занимает 70 GPU-дней вместо 300. Исследователи смогут изучать десятки тысяч пациентов, тестировать гипотезы и искать биомаркеры рака в реальном масштабе.
Модели открыты под лицензией Apache 2.0 и доступны на HuggingFace. Для клинического применения не предназначены.
https://www.microsoft.com/en-us/research/blog/gigapath-flash-and-gigatime-flash-toward-population-scale-discovery-with-efficient-pathology-foundation-models/
Microsoft Research
Making pathology foundation models practical at scale
What if pathology foundation models could do more with less? GigaPath-Flash and GigaTIME-Flash cut computational demands while maintaining strong performance, opening the door to larger studies and broader exploration.
Nvidia Tech — BioNeMo Agent Toolkit теперь работает с Claude Science
NVIDIA интегрировала BioNeMo Agent Toolkit в Claude Science — научную платформу Anthropic. Результат: ИИ-агент может самостоятельно запускать NIM-микросервисы для предсказания структуры белков прямо внутри исследовательской среды.
Что это даёт? Агент берёт белковые последовательности, строит множественные выравнивания (MSA), запускает сразу две модели — OpenFold3 и Boltz-2 — и сравнивает результаты. Без MSA точность предсказания комплексов рушится (iPTM падает с 0.85 до 0.14), с ним — обе модели независимо воспроизводят одну и ту же структуру.
На внутренних тестах BioNeMo-навыки подняли корректность задач с 60% до 100% и вдвое снизили расход токенов.
Для кого важно: исследователям в биологии, химии, геномике и разработке лекарств — теперь не нужно вручную настраивать окружения и API для каждой модели. Агент делает это сам.
https://developer.nvidia.com/blog/run-nvidia-bionemo-nim-microservices-for-protein-structure-prediction-in-claude-science/
NVIDIA интегрировала BioNeMo Agent Toolkit в Claude Science — научную платформу Anthropic. Результат: ИИ-агент может самостоятельно запускать NIM-микросервисы для предсказания структуры белков прямо внутри исследовательской среды.
Что это даёт? Агент берёт белковые последовательности, строит множественные выравнивания (MSA), запускает сразу две модели — OpenFold3 и Boltz-2 — и сравнивает результаты. Без MSA точность предсказания комплексов рушится (iPTM падает с 0.85 до 0.14), с ним — обе модели независимо воспроизводят одну и ту же структуру.
На внутренних тестах BioNeMo-навыки подняли корректность задач с 60% до 100% и вдвое снизили расход токенов.
Для кого важно: исследователям в биологии, химии, геномике и разработке лекарств — теперь не нужно вручную настраивать окружения и API для каждой модели. Агент делает это сам.
https://developer.nvidia.com/blog/run-nvidia-bionemo-nim-microservices-for-protein-structure-prediction-in-claude-science/
NVIDIA Technical Blog
Run NVIDIA BioNeMo NIM Microservices for Protein Structure Prediction in Claude Science
Agentic AI is changing how research is done. AI scientists can read papers, propose hypotheses, call models, and determine which experiments to prioritize next. First proving their value in software…
Nvidia — новый инструмент для обучения автопилота без реального автомобиля
NVIDIA выпустила Omniverse NuRec — систему, которая позволяет адаптировать восприятие автономного вождения к новым моделям автомобилей без сбора реальных данных с нуля.
Как это работает: NuRec берёт записи реальных поездок, реконструирует сцены с помощью 3D Gaussian splatting и рендерит их с точки зрения камер другого автомобиля. Например, данные с SUV можно «пересчитать» под конфигурацию седана.
В открытом доступе на Hugging Face уже лежит датасет из 1500+ нейронно-реконструированных сцен по ~20 секунд каждая.
Почему это важно: разработка нового автомобиля занимает годы, а обучать восприятие нужно заранее. NuRec позволяет готовить модели до того, как реальный флот вообще существует — экономя время и деньги на разметку данных.
https://developer.nvidia.com/blog/scale-av-perception-across-vehicle-platforms-with-nvidia-omniverse-nurec/
NVIDIA выпустила Omniverse NuRec — систему, которая позволяет адаптировать восприятие автономного вождения к новым моделям автомобилей без сбора реальных данных с нуля.
Как это работает: NuRec берёт записи реальных поездок, реконструирует сцены с помощью 3D Gaussian splatting и рендерит их с точки зрения камер другого автомобиля. Например, данные с SUV можно «пересчитать» под конфигурацию седана.
В открытом доступе на Hugging Face уже лежит датасет из 1500+ нейронно-реконструированных сцен по ~20 секунд каждая.
Почему это важно: разработка нового автомобиля занимает годы, а обучать восприятие нужно заранее. NuRec позволяет готовить модели до того, как реальный флот вообще существует — экономя время и деньги на разметку данных.
https://developer.nvidia.com/blog/scale-av-perception-across-vehicle-platforms-with-nvidia-omniverse-nurec/
NVIDIA Technical Blog
Scale AV Perception Across Vehicle Platforms with NVIDIA Omniverse NuRec
A perception stack is shaped by the vehicle that carries it. Move the same software to a new carline—for example, from an SUV to a sedan or another vehicle variant in the portfolio—and its perception…
Qwen3.8-Flash-Next: мощь 397B-модели за 1/9 вычислительных затрат (by Qwen)
Команда Qwen выкатила техотчёт о новой архитектуре: 125B параметров, но активируется лишь 6B на токен. При этом модель обходит предшественника на 8 из 14 бенчмарков, тратя в 9 раз меньше FLOPs на обучение.
Ключевые архитектурные решения:
1. Гибрид GDN + Sparse Attention: вместо полного attention везде — 3 слоя рекуррентного Gated DeltaNet на 1 слой разреженного attention. Линейная стоимость для длинных контекстов, при 1M токенов QSA в 7.6× быстрее dense attention.
2. Gated Residual (GR): расширение residual stream на 4 ветки с elementwise gate. Побочный эффект — стабильность обучения без единого loss spike на полном масштабе.
3. N-gram embedding таблицы (51B параметров) хранятся в CPU памяти и подгружаются по мере нужды — почти бесплатные дополнительные параметры.
4. Оптимизатор Muon вместо AdamW для 2D-весов.
Интересный вывод: loss и accuracy на бенчмарках расходятся — минимум loss ≠ максимум качества.
Команда Qwen выкатила техотчёт о новой архитектуре: 125B параметров, но активируется лишь 6B на токен. При этом модель обходит предшественника на 8 из 14 бенчмарков, тратя в 9 раз меньше FLOPs на обучение.
Ключевые архитектурные решения:
1. Гибрид GDN + Sparse Attention: вместо полного attention везде — 3 слоя рекуррентного Gated DeltaNet на 1 слой разреженного attention. Линейная стоимость для длинных контекстов, при 1M токенов QSA в 7.6× быстрее dense attention.
2. Gated Residual (GR): расширение residual stream на 4 ветки с elementwise gate. Побочный эффект — стабильность обучения без единого loss spike на полном масштабе.
3. N-gram embedding таблицы (51B параметров) хранятся в CPU памяти и подгружаются по мере нужды — почти бесплатные дополнительные параметры.
4. Оптимизатор Muon вместо AdamW для 2D-весов.
Интересный вывод: loss и accuracy на бенчмарках расходятся — минимум loss ≠ максимум качества.
Хочешь научить робота новым трюкам без миллионов размеченных демонстраций? Смотри видео!
ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.
Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!
Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.
https://arxiv.org/abs/2609.00188
ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.
Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!
Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.
https://arxiv.org/abs/2609.00188
Evolution Strategies против GRPO: кто лучше для дообучения LLM на рассуждениях?
GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?
ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.
Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.
Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.
https://arxiv.org/abs/2608.27351
GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?
ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.
Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.
Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.
https://arxiv.org/abs/2608.27351