(by Adobe) Как применить Chinchilla-scaling к диффузионным моделям?
Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.
Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).
Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.
Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).
Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
OpenAI опубликовала результаты работы своих моделей над давними нерешёнными задачами в математике и теоретической информатике. В числе достижений — прорывы в геометрии, криптографии и теории сложности вычислений.
Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.
Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.
https://openai.com/index/ten-advances-in-mathematics
Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.
Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.
https://openai.com/index/ten-advances-in-mathematics
OpenAI
Ten advances in mathematics and theoretical computer science
OpenAI shares new results on long-standing open problems in mathematics and theoretical computer science, including advances in geometry, cryptography, and complexity.
Google DeepMind запустила Gemini Robotics ER 2 — новую модель, которая работает как "мозг высшего уровня" для роботов.
Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.
Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.
Доступно уже сейчас через Gemini API и Google AI Studio.
https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.
Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.
Доступно уже сейчас через Gemini API и Google AI Studio.
https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Google
Introducing Gemini Robotics ER 2
Gemini Robotics ER 2 is a step change in video understanding, tool orchestration, and multi-robot collaboration for robotic applications.
Nvidia опубликовала технический гайд по co-design архитектуры внимания (attention) для ускорения LLM-инференса на GPU.
Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.
Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.
Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.
Nvidia выпустит отдельный материал по sparse attention — следим.
https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/
Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.
Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.
Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.
Nvidia выпустит отдельный материал по sparse attention — следим.
https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/
NVIDIA Technical Blog
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference
As agentic and long-context workloads become common, the context lengths increase and attention consumes a larger share of inference time (Figure 1). Because attention now dominates that cost…
Третья ось масштабирования генеративных моделей
Все знают две оси масштабирования LLM и диффузионок: больше параметров и больше данных. Авторы из UIUC предлагают третью — Explorative Modeling (XM).
Идея простая: диффузионки и авторегрессионные модели не end-to-end, потому что на инференсе делают сотни шагов, а обучались предсказывать один. XM вместо этого факторизует не генерацию, а сам тренировочный цикл: на каждом шаге модель генерирует K кандидатов и обучается только на ближайшем к реальным данным. Так модель не усредняет моды, а фиксируется на конкретной.
Результаты: 4.1× эффективность по FLOPs, 6.2× по сэмплам, FID 1.43 на ImageNet без guidance. Причём выигрыш растёт с масштабом, а не насыщается. Бонус: end-to-end XM заменяет Diffusion Policy на задачах управления, делая 16–256× меньше шагов на инференсе.
https://arxiv.org/abs/2607.27372
Все знают две оси масштабирования LLM и диффузионок: больше параметров и больше данных. Авторы из UIUC предлагают третью — Explorative Modeling (XM).
Идея простая: диффузионки и авторегрессионные модели не end-to-end, потому что на инференсе делают сотни шагов, а обучались предсказывать один. XM вместо этого факторизует не генерацию, а сам тренировочный цикл: на каждом шаге модель генерирует K кандидатов и обучается только на ближайшем к реальным данным. Так модель не усредняет моды, а фиксируется на конкретной.
Результаты: 4.1× эффективность по FLOPs, 6.2× по сэмплам, FID 1.43 на ImageNet без guidance. Причём выигрыш растёт с масштабом, а не насыщается. Бонус: end-to-end XM заменяет Diffusion Policy на задачах управления, делая 16–256× меньше шагов на инференсе.
https://arxiv.org/abs/2607.27372
LedgerMind: как заставить агента не врать в промежуточных шагах
Модель может дать правильный ответ, но прийти к нему через цепочку галлюцинаций — это никто не замечает, если смотреть только на финальную точность. Авторы называют это "Phantom Grounding": агент цитирует реальные источники, но тихо подставляет в вывод сущности и числа, которых в источнике нет.
Решение — Structured Evidence Ledger: каждый вызов инструмента порождает структурированную запись с источником, типом, уверенностью и статусом. Делать выводы можно только из активных записей в леджере. Трёхуровневый протокол проверяет, что конкретные числа и сущности в утверждении реально есть в процитированном источнике.
Плюс адаптивный диспетчер: простые вопросы идут по короткому пути без лишних рассуждений (Over-Reasoning Paradox реален). А repair работает только через типизированные операторы — нельзя добавить новую запись без tool-провенанса.
Результат: рост и по точности ответов, и по faithfulness промежуточных шагов на нескольких бенчмарках.
Модель может дать правильный ответ, но прийти к нему через цепочку галлюцинаций — это никто не замечает, если смотреть только на финальную точность. Авторы называют это "Phantom Grounding": агент цитирует реальные источники, но тихо подставляет в вывод сущности и числа, которых в источнике нет.
Решение — Structured Evidence Ledger: каждый вызов инструмента порождает структурированную запись с источником, типом, уверенностью и статусом. Делать выводы можно только из активных записей в леджере. Трёхуровневый протокол проверяет, что конкретные числа и сущности в утверждении реально есть в процитированном источнике.
Плюс адаптивный диспетчер: простые вопросы идут по короткому пути без лишних рассуждений (Over-Reasoning Paradox реален). А repair работает только через типизированные операторы — нельзя добавить новую запись без tool-провенанса.
Результат: рост и по точности ответов, и по faithfulness промежуточных шагов на нескольких бенчмарках.
Данные для роботов: как собрать всё и не запутаться
Обучение embodied AI упирается в один вопрос: откуда брать данные? Авторы систематизируют весь зоопарк источников через "пирамиду данных" с двумя осями: масштабируемость (легко ли собрать много) и robot alignment (насколько данные полезны реальному роботу). Эти оси в постоянном конфликте.
Пирамида снизу вверх: общие видео и VLM-данные (много, дёшево, слабо aligned) → эгоцентричные записи людей → симуляция → UMI-демонстрации без робота → реальные роботы (мало, дорого, максимально aligned).
Авторы разбирают, как каждый тип данных применяется в embodied foundation models: для "мозга" (рассуждения, планирование), VLA-моделей и world models. Отдельно — открытые проблемы: тактильные данные, данные об ошибках и восстановлении, выравнивание action spaces разных embodiment.
Хороший survey для тех, кто хочет понять, почему robotics-данные — это не просто "больше видео с YouTube".
https://arxiv.org/abs/2607.24744
Обучение embodied AI упирается в один вопрос: откуда брать данные? Авторы систематизируют весь зоопарк источников через "пирамиду данных" с двумя осями: масштабируемость (легко ли собрать много) и robot alignment (насколько данные полезны реальному роботу). Эти оси в постоянном конфликте.
Пирамида снизу вверх: общие видео и VLM-данные (много, дёшево, слабо aligned) → эгоцентричные записи людей → симуляция → UMI-демонстрации без робота → реальные роботы (мало, дорого, максимально aligned).
Авторы разбирают, как каждый тип данных применяется в embodied foundation models: для "мозга" (рассуждения, планирование), VLA-моделей и world models. Отдельно — открытые проблемы: тактильные данные, данные об ошибках и восстановлении, выравнивание action spaces разных embodiment.
Хороший survey для тех, кто хочет понять, почему robotics-данные — это не просто "больше видео с YouTube".
https://arxiv.org/abs/2607.24744
Nvidia опубликовала практическое руководство по безопасному развёртыванию AI-агентов.
Команда NVIDIA AI Red Team проверила десятки агентов в реальных корпоративных средах и выявила четыре критических уязвимости: отсутствие контроля доступа, произвольное выполнение кода через инструменты агента, отсутствие ограничений на исходящий трафик и утечка секретных ключей в открытом виде.
Главный вывод: защита на уровне LLM не работает. Фильтры на основе моделей обходятся через социальную инженерию и скрытые инъекции в промпты. Нужны архитектурные решения вне зоны контроля модели — изолированные контейнеры, строгие сетевые политики, минимальные права доступа.
Почему важно: корпоративные агенты имеют доступ к реальным инструментам и данным. Скомпрометированный агент — это привилегированное ПО с плохо понятной поверхностью атаки. Рекомендации Nvidia уже применимы сегодня для любого фреймворка.
https://developer.nvidia.com/blog/four-ways-to-deploy-more-secure-ai-agents/
Команда NVIDIA AI Red Team проверила десятки агентов в реальных корпоративных средах и выявила четыре критических уязвимости: отсутствие контроля доступа, произвольное выполнение кода через инструменты агента, отсутствие ограничений на исходящий трафик и утечка секретных ключей в открытом виде.
Главный вывод: защита на уровне LLM не работает. Фильтры на основе моделей обходятся через социальную инженерию и скрытые инъекции в промпты. Нужны архитектурные решения вне зоны контроля модели — изолированные контейнеры, строгие сетевые политики, минимальные права доступа.
Почему важно: корпоративные агенты имеют доступ к реальным инструментам и данным. Скомпрометированный агент — это привилегированное ПО с плохо понятной поверхностью атаки. Рекомендации Nvidia уже применимы сегодня для любого фреймворка.
https://developer.nvidia.com/blog/four-ways-to-deploy-more-secure-ai-agents/
NVIDIA Technical Blog
Four Ways to Deploy More Secure AI Agents
Knowledge workers are increasingly integrating AI agents into their workflows. Agents that function as “digital coworkers” offer clear benefits. For example, they can review a bug report…
NVIDIA рассказала, почему одинаковые кластеры на H100 и GB200 работают по-разному
Инженеры NVIDIA разобрали четыре реальных случая, когда партнёрские кластеры из идентичного железа показывали на 8–12% хуже производительности, чем эталонная архитектура. Причина — не в железе, а в конфигурации.
Главные виновники: неправильная настройка SMMU на Grace CPU в виртуальных машинах (съедала 24% циклов CPU), кривые C-state и NUMA-биндинг на x86 (ядра не выходили на нужную частоту), неверные настройки очередей NCCL на 1.6 Тбит/с сетях, и топологические файлы, которые просто не попадали внутрь контейнеров.
Каждый из этих багов отнимал несколько процентов — вместе они давали провал ниже порога 95%, необходимого для сертификации Exemplar Cloud.
Для диагностики использовались perf, Nsight Systems и nccl-tests. Гайд полезен всем, кто строит AI-инфраструктуру на NVIDIA и хочет выжать из неё максимум.
https://developer.nvidia.com/blog/nvidia-exemplar-cloud-lessons-for-unlocking-full-performance-on-ai-infrastructure/
Инженеры NVIDIA разобрали четыре реальных случая, когда партнёрские кластеры из идентичного железа показывали на 8–12% хуже производительности, чем эталонная архитектура. Причина — не в железе, а в конфигурации.
Главные виновники: неправильная настройка SMMU на Grace CPU в виртуальных машинах (съедала 24% циклов CPU), кривые C-state и NUMA-биндинг на x86 (ядра не выходили на нужную частоту), неверные настройки очередей NCCL на 1.6 Тбит/с сетях, и топологические файлы, которые просто не попадали внутрь контейнеров.
Каждый из этих багов отнимал несколько процентов — вместе они давали провал ниже порога 95%, необходимого для сертификации Exemplar Cloud.
Для диагностики использовались perf, Nsight Systems и nccl-tests. Гайд полезен всем, кто строит AI-инфраструктуру на NVIDIA и хочет выжать из неё максимум.
https://developer.nvidia.com/blog/nvidia-exemplar-cloud-lessons-for-unlocking-full-performance-on-ai-infrastructure/
NVIDIA Technical Blog
NVIDIA Exemplar Cloud: Lessons for Unlocking Full Performance on AI Infrastructure
Two AI computing clusters built from identical NVIDIA H100, GB200 NVL72, or GB300 NVL72 systems can deliver materially different training throughput. We routinely see 8% to 12%
Amazon Science представила ControlG — фреймворк для обучения нейросетей с несколькими целями одновременно.
Проблема: когда модель учится решать несколько задач сразу, их цели конфликтуют. Стандартный подход — смешивать все градиенты на каждом шаге — приводит к «перетягиванию каната»: одни задачи мешают другим, некоторые и вовсе выпадают из обучения.
Решение неожиданное: ControlG заимствует PID-контроллеры из промышленных систем (те самые, что управляют круиз-контролем в машине). Вместо того чтобы смешивать цели, фреймворк выделяет вычислительный ресурс каждой задаче по очереди — и динамически решает, какой уделить внимание следующей.
Результат: три типичных провала многозадачного обучения устранены. Даже случайное расписание задач обходит сложные методы вроде PCGrad и CAGrad — просто за счёт временного разделения.
Работа представлена на ICML 2026. Пока фокус на графовых нейросетях, но подход потенциально применим шире.
https://www.amazon.science/blog/how-controllers-from-industrial-machinery-can-coordinate-multitask-machine-learning
Проблема: когда модель учится решать несколько задач сразу, их цели конфликтуют. Стандартный подход — смешивать все градиенты на каждом шаге — приводит к «перетягиванию каната»: одни задачи мешают другим, некоторые и вовсе выпадают из обучения.
Решение неожиданное: ControlG заимствует PID-контроллеры из промышленных систем (те самые, что управляют круиз-контролем в машине). Вместо того чтобы смешивать цели, фреймворк выделяет вычислительный ресурс каждой задаче по очереди — и динамически решает, какой уделить внимание следующей.
Результат: три типичных провала многозадачного обучения устранены. Даже случайное расписание задач обходит сложные методы вроде PCGrad и CAGrad — просто за счёт временного разделения.
Работа представлена на ICML 2026. Пока фокус на графовых нейросетях, но подход потенциально применим шире.
https://www.amazon.science/blog/how-controllers-from-industrial-machinery-can-coordinate-multitask-machine-learning
Amazon Science
How controllers from industrial machinery can coordinate multitask machine learning
Instead of compromising among parameter updates dictated by different training objectives, ControlG allocates computational capacity to objectives sequentially and dynamically.
(by NeoteAI) Тактильные ощущения для роботов — предсказывай будущее, а не читай прошлое
VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.
N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.
Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).
VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.
N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.
Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).
Wonder: видеомодель для исследования мира в реальном времени
Хотите дать пользователю возможность "зайти" внутрь картинки и свободно двигать камерой — в реальном времени? Именно это делает Wonder. Система берёт одно изображение или видео и превращает его в интерактивный мир, по которому можно перемещаться с точным управлением камерой.
Ключевая идея — совместный дизайн трёх компонентов:
1. Управление: вместо абстрактных Plücker-координат рендерится синтетический 3D-скаффолд вдоль траектории камеры — визуальные подсказки напрямую кодируют движение и параллакс.
2. Память: разреженный механизм внимания с пулингом ключей — полная история хранится, но на каждом шаге выбирается фиксированный набор чанков, поэтому latency не растёт с длиной роллаута.
3. Дистилляция: mixture-of-students + adversarial регуляризатор на основе камеры — чтобы few-step студент не терял качество и точность управления.
Результат: 16 FPS, стабильная задержка на роллаутах длиной в минуты.
https://arxiv.org/abs/2607.26037
Хотите дать пользователю возможность "зайти" внутрь картинки и свободно двигать камерой — в реальном времени? Именно это делает Wonder. Система берёт одно изображение или видео и превращает его в интерактивный мир, по которому можно перемещаться с точным управлением камерой.
Ключевая идея — совместный дизайн трёх компонентов:
1. Управление: вместо абстрактных Plücker-координат рендерится синтетический 3D-скаффолд вдоль траектории камеры — визуальные подсказки напрямую кодируют движение и параллакс.
2. Память: разреженный механизм внимания с пулингом ключей — полная история хранится, но на каждом шаге выбирается фиксированный набор чанков, поэтому latency не растёт с длиной роллаута.
3. Дистилляция: mixture-of-students + adversarial регуляризатор на основе камеры — чтобы few-step студент не терял качество и точность управления.
Результат: 16 FPS, стабильная задержка на роллаутах длиной в минуты.
https://arxiv.org/abs/2607.26037
Слабые учат сильных: дистилляция знаний без учителя-эксперта (by Microsoft Research)
Классическая дистилляция знаний требует учителя сильнее ученика. Но что делать, когда ты уже на фронтире и сильнее тебя никого нет?
Авторы предлагают W2S-OPD: берём пару слабых моделей — "позитивную" (например, после RL) и "негативную" (до RL) — и вычитаем их логиты. Разница изолирует направление полезного навыка, очищенное от общей слабости обеих моделей. Это направление добавляется к логитам сильной базовой модели студента — получается "прокси-учитель", который одновременно несёт нужный навык и остаётся дистрибутивно близким к студенту.
Дальше — on-policy дистилляция: студент генерирует свои траектории и минимизирует KL-дивергенцию к прокси-учителю.
Результат: Qwen3-8B обучается у Qwen3-4B и превосходит его! Причём даже два базовых офф-шелф слабых модели без дополнительного обучения дают прирост студенту выше уровня обоих источников.
https://arxiv.org/abs/2607.26246
Классическая дистилляция знаний требует учителя сильнее ученика. Но что делать, когда ты уже на фронтире и сильнее тебя никого нет?
Авторы предлагают W2S-OPD: берём пару слабых моделей — "позитивную" (например, после RL) и "негативную" (до RL) — и вычитаем их логиты. Разница изолирует направление полезного навыка, очищенное от общей слабости обеих моделей. Это направление добавляется к логитам сильной базовой модели студента — получается "прокси-учитель", который одновременно несёт нужный навык и остаётся дистрибутивно близким к студенту.
Дальше — on-policy дистилляция: студент генерирует свои траектории и минимизирует KL-дивергенцию к прокси-учителю.
Результат: Qwen3-8B обучается у Qwen3-4B и превосходит его! Причём даже два базовых офф-шелф слабых модели без дополнительного обучения дают прирост студенту выше уровня обоих источников.
https://arxiv.org/abs/2607.26246
Что если научить ИИ моделировать не только физический мир, но и чужие мысли?
Все современные world models — Dreamer, JEPA, Sora — моделируют физику: объекты, движение, пространство. Но человеческое поведение определяется не только тем, что происходит, но и тем, что люди думают, чувствуют и во что верят.
Авторы предлагают Mental World Modeling (MWM) — фреймворк, где состояние мира = физика + ментальные переменные (убеждения, желания, намерения, социальные нормы). Формально это POMDP, где агент наблюдает только частичную проекцию совместного состояния.
Они реализовали MENTIS — training-free систему, которая парсит сцену, строит ментальное состояние целевого агента, симулирует ветки развития событий и выбирает действие по физической правдоподобности + ментальной консистентности.
Ключевой результат: убери ментальный канал — качество падает у всех 8 протестированных LLM. Главный bottleneck — симуляция переходов (как мир меняется после действия).
https://arxiv.org/abs/2607.27201
Все современные world models — Dreamer, JEPA, Sora — моделируют физику: объекты, движение, пространство. Но человеческое поведение определяется не только тем, что происходит, но и тем, что люди думают, чувствуют и во что верят.
Авторы предлагают Mental World Modeling (MWM) — фреймворк, где состояние мира = физика + ментальные переменные (убеждения, желания, намерения, социальные нормы). Формально это POMDP, где агент наблюдает только частичную проекцию совместного состояния.
Они реализовали MENTIS — training-free систему, которая парсит сцену, строит ментальное состояние целевого агента, симулирует ветки развития событий и выбирает действие по физической правдоподобности + ментальной консистентности.
Ключевой результат: убери ментальный канал — качество падает у всех 8 протестированных LLM. Главный bottleneck — симуляция переходов (как мир меняется после действия).
https://arxiv.org/abs/2607.27201
Агент, который не теряет нить задачи на 100-м шаге
Главная проблема долгих агентных задач — не сложность каждого шага, а накопление ошибок и "забывание" цели. Контекст разрастается, агент путается в том, что уже сделано, и всё рушится.
LongHorizon-Harness решает это через цикл Manage-Execute-Audit (MEA). Менеджер хранит явный task state вне контекста выполнения. Исполнитель работает в свежем контексте на одном подзадании. Аудитор независимо проверяет среду и обновляет state только верифицированными фактами. После каждого раунда история исполнителя выбрасывается — остаётся только компактный проверенный state.
Результат: на WeaveBench PassRate вырос с 51.8% до 80.7% (лучший официальный результат был 41.2%). На OSWorld 2.0 — с 2.8% до 8.3%. Фреймворк работает поверх Claude Code, Codex CLI и других harness-ов через лёгкий AgentAdapter.
https://arxiv.org/abs/2608.01964
Главная проблема долгих агентных задач — не сложность каждого шага, а накопление ошибок и "забывание" цели. Контекст разрастается, агент путается в том, что уже сделано, и всё рушится.
LongHorizon-Harness решает это через цикл Manage-Execute-Audit (MEA). Менеджер хранит явный task state вне контекста выполнения. Исполнитель работает в свежем контексте на одном подзадании. Аудитор независимо проверяет среду и обновляет state только верифицированными фактами. После каждого раунда история исполнителя выбрасывается — остаётся только компактный проверенный state.
Результат: на WeaveBench PassRate вырос с 51.8% до 80.7% (лучший официальный результат был 41.2%). На OSWorld 2.0 — с 2.8% до 8.3%. Фреймворк работает поверх Claude Code, Codex CLI и других harness-ов через лёгкий AgentAdapter.
https://arxiv.org/abs/2608.01964
Робот учится чувствовать пальцами до того, как прикоснётся (by NeoteAI)
Большинство роботов "видят" манипуляцию, но не "чувствуют" её заранее. N0-TWAM меняет это: модель не просто получает тактильные данные как входной сигнал — она предсказывает будущие ощущения от прикосновения вместе с видео, в одном forward pass.
Архитектура — Mixture-of-Transformers с тремя экспертами (видео, тактиль, действие), которые общаются только через общий self-attention. Ключевая идея: тактильный эксперт генерирует предсказанный контакт параллельно с видео, а action-эксперт уже читает это предсказание при выборе действия. Плюс — наблюдаемый тактильный сигнал подаётся отдельно через cross-attention.
Результат: 46.3% на реальных роботах против 30.0% у лучшего VLA-baseline. Обучено на 30 000+ часах данных с синхронизированными тактильными потоками, 6 embodiments, 450 задач.
https://arxiv.org/abs/2607.23783
Большинство роботов "видят" манипуляцию, но не "чувствуют" её заранее. N0-TWAM меняет это: модель не просто получает тактильные данные как входной сигнал — она предсказывает будущие ощущения от прикосновения вместе с видео, в одном forward pass.
Архитектура — Mixture-of-Transformers с тремя экспертами (видео, тактиль, действие), которые общаются только через общий self-attention. Ключевая идея: тактильный эксперт генерирует предсказанный контакт параллельно с видео, а action-эксперт уже читает это предсказание при выборе действия. Плюс — наблюдаемый тактильный сигнал подаётся отдельно через cross-attention.
Результат: 46.3% на реальных роботах против 30.0% у лучшего VLA-baseline. Обучено на 30 000+ часах данных с синхронизированными тактильными потоками, 6 embodiments, 450 задач.
https://arxiv.org/abs/2607.23783
Meta AI удвоила эффективность обучения рекламной ИИ-модели
Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.
Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.
Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.
Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.
Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.
Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.
Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Engineering at Meta
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
Meta’s Generative Ads Recommendation Model (GEM), the foundation model behind ads recommendations across Instagram and Facebook, now trains at LLM scale on several thousand of the latest-gene…
Microsoft Research выпустила Orchard — открытый фреймворк для создания и обучения агентных AI-систем.
Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.
Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.
Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.
https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.
Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.
Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.
https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
Microsoft Research
Orchard: An open framework for scalable agentic AI
Orchard is an open-source framework for the research community to train and evaluate AI agents across task types. It reduces complexity while supporting strong performance from smaller models by enabling researchers to reuse the same infrastructure:
NVIDIA представила бенчмарки процессора Vera BlueField-4 STX для AI-хранилищ.
Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.
Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.
Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.
https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.
Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.
Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.
https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
NVIDIA Technical Blog
NVIDIA Vera Storage Benchmarks: Faster Encryption, Compression, Integrity Checking, and Recovery for AI-Native Storage
Storage is an active part of every agentic AI workflow. As agents retrieve enterprise knowledge, access persistent memory, reuse key-value (KV) cache data, execute tools, and generate new results…
Как обновлять претрейн рекомендаций каждый день без потери качества?
В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:
1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.
2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.
Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.
https://arxiv.org/abs/2608.02738
В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:
1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.
2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.
Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.
https://arxiv.org/abs/2608.02738
DiffusionGemma: 1500 токенов в секунду на одном H100 (by DeepMind)
Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.
DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.
Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.
Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.
https://arxiv.org/abs/2608.00146
Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.
DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.
Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.
Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.
https://arxiv.org/abs/2608.00146