Nvidia опубликовала практическое руководство по безопасному развёртыванию AI-агентов.
Команда NVIDIA AI Red Team проверила десятки агентов в реальных корпоративных средах и выявила четыре критических уязвимости: отсутствие контроля доступа, произвольное выполнение кода через инструменты агента, отсутствие ограничений на исходящий трафик и утечка секретных ключей в открытом виде.
Главный вывод: защита на уровне LLM не работает. Фильтры на основе моделей обходятся через социальную инженерию и скрытые инъекции в промпты. Нужны архитектурные решения вне зоны контроля модели — изолированные контейнеры, строгие сетевые политики, минимальные права доступа.
Почему важно: корпоративные агенты имеют доступ к реальным инструментам и данным. Скомпрометированный агент — это привилегированное ПО с плохо понятной поверхностью атаки. Рекомендации Nvidia уже применимы сегодня для любого фреймворка.
https://developer.nvidia.com/blog/four-ways-to-deploy-more-secure-ai-agents/
Команда NVIDIA AI Red Team проверила десятки агентов в реальных корпоративных средах и выявила четыре критических уязвимости: отсутствие контроля доступа, произвольное выполнение кода через инструменты агента, отсутствие ограничений на исходящий трафик и утечка секретных ключей в открытом виде.
Главный вывод: защита на уровне LLM не работает. Фильтры на основе моделей обходятся через социальную инженерию и скрытые инъекции в промпты. Нужны архитектурные решения вне зоны контроля модели — изолированные контейнеры, строгие сетевые политики, минимальные права доступа.
Почему важно: корпоративные агенты имеют доступ к реальным инструментам и данным. Скомпрометированный агент — это привилегированное ПО с плохо понятной поверхностью атаки. Рекомендации Nvidia уже применимы сегодня для любого фреймворка.
https://developer.nvidia.com/blog/four-ways-to-deploy-more-secure-ai-agents/
NVIDIA Technical Blog
Four Ways to Deploy More Secure AI Agents
Knowledge workers are increasingly integrating AI agents into their workflows. Agents that function as “digital coworkers” offer clear benefits. For example, they can review a bug report…
NVIDIA рассказала, почему одинаковые кластеры на H100 и GB200 работают по-разному
Инженеры NVIDIA разобрали четыре реальных случая, когда партнёрские кластеры из идентичного железа показывали на 8–12% хуже производительности, чем эталонная архитектура. Причина — не в железе, а в конфигурации.
Главные виновники: неправильная настройка SMMU на Grace CPU в виртуальных машинах (съедала 24% циклов CPU), кривые C-state и NUMA-биндинг на x86 (ядра не выходили на нужную частоту), неверные настройки очередей NCCL на 1.6 Тбит/с сетях, и топологические файлы, которые просто не попадали внутрь контейнеров.
Каждый из этих багов отнимал несколько процентов — вместе они давали провал ниже порога 95%, необходимого для сертификации Exemplar Cloud.
Для диагностики использовались perf, Nsight Systems и nccl-tests. Гайд полезен всем, кто строит AI-инфраструктуру на NVIDIA и хочет выжать из неё максимум.
https://developer.nvidia.com/blog/nvidia-exemplar-cloud-lessons-for-unlocking-full-performance-on-ai-infrastructure/
Инженеры NVIDIA разобрали четыре реальных случая, когда партнёрские кластеры из идентичного железа показывали на 8–12% хуже производительности, чем эталонная архитектура. Причина — не в железе, а в конфигурации.
Главные виновники: неправильная настройка SMMU на Grace CPU в виртуальных машинах (съедала 24% циклов CPU), кривые C-state и NUMA-биндинг на x86 (ядра не выходили на нужную частоту), неверные настройки очередей NCCL на 1.6 Тбит/с сетях, и топологические файлы, которые просто не попадали внутрь контейнеров.
Каждый из этих багов отнимал несколько процентов — вместе они давали провал ниже порога 95%, необходимого для сертификации Exemplar Cloud.
Для диагностики использовались perf, Nsight Systems и nccl-tests. Гайд полезен всем, кто строит AI-инфраструктуру на NVIDIA и хочет выжать из неё максимум.
https://developer.nvidia.com/blog/nvidia-exemplar-cloud-lessons-for-unlocking-full-performance-on-ai-infrastructure/
NVIDIA Technical Blog
NVIDIA Exemplar Cloud: Lessons for Unlocking Full Performance on AI Infrastructure
Two AI computing clusters built from identical NVIDIA H100, GB200 NVL72, or GB300 NVL72 systems can deliver materially different training throughput. We routinely see 8% to 12%
Amazon Science представила ControlG — фреймворк для обучения нейросетей с несколькими целями одновременно.
Проблема: когда модель учится решать несколько задач сразу, их цели конфликтуют. Стандартный подход — смешивать все градиенты на каждом шаге — приводит к «перетягиванию каната»: одни задачи мешают другим, некоторые и вовсе выпадают из обучения.
Решение неожиданное: ControlG заимствует PID-контроллеры из промышленных систем (те самые, что управляют круиз-контролем в машине). Вместо того чтобы смешивать цели, фреймворк выделяет вычислительный ресурс каждой задаче по очереди — и динамически решает, какой уделить внимание следующей.
Результат: три типичных провала многозадачного обучения устранены. Даже случайное расписание задач обходит сложные методы вроде PCGrad и CAGrad — просто за счёт временного разделения.
Работа представлена на ICML 2026. Пока фокус на графовых нейросетях, но подход потенциально применим шире.
https://www.amazon.science/blog/how-controllers-from-industrial-machinery-can-coordinate-multitask-machine-learning
Проблема: когда модель учится решать несколько задач сразу, их цели конфликтуют. Стандартный подход — смешивать все градиенты на каждом шаге — приводит к «перетягиванию каната»: одни задачи мешают другим, некоторые и вовсе выпадают из обучения.
Решение неожиданное: ControlG заимствует PID-контроллеры из промышленных систем (те самые, что управляют круиз-контролем в машине). Вместо того чтобы смешивать цели, фреймворк выделяет вычислительный ресурс каждой задаче по очереди — и динамически решает, какой уделить внимание следующей.
Результат: три типичных провала многозадачного обучения устранены. Даже случайное расписание задач обходит сложные методы вроде PCGrad и CAGrad — просто за счёт временного разделения.
Работа представлена на ICML 2026. Пока фокус на графовых нейросетях, но подход потенциально применим шире.
https://www.amazon.science/blog/how-controllers-from-industrial-machinery-can-coordinate-multitask-machine-learning
Amazon Science
How controllers from industrial machinery can coordinate multitask machine learning
Instead of compromising among parameter updates dictated by different training objectives, ControlG allocates computational capacity to objectives sequentially and dynamically.
(by NeoteAI) Тактильные ощущения для роботов — предсказывай будущее, а не читай прошлое
VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.
N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.
Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).
VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.
N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.
Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).
Wonder: видеомодель для исследования мира в реальном времени
Хотите дать пользователю возможность "зайти" внутрь картинки и свободно двигать камерой — в реальном времени? Именно это делает Wonder. Система берёт одно изображение или видео и превращает его в интерактивный мир, по которому можно перемещаться с точным управлением камерой.
Ключевая идея — совместный дизайн трёх компонентов:
1. Управление: вместо абстрактных Plücker-координат рендерится синтетический 3D-скаффолд вдоль траектории камеры — визуальные подсказки напрямую кодируют движение и параллакс.
2. Память: разреженный механизм внимания с пулингом ключей — полная история хранится, но на каждом шаге выбирается фиксированный набор чанков, поэтому latency не растёт с длиной роллаута.
3. Дистилляция: mixture-of-students + adversarial регуляризатор на основе камеры — чтобы few-step студент не терял качество и точность управления.
Результат: 16 FPS, стабильная задержка на роллаутах длиной в минуты.
https://arxiv.org/abs/2607.26037
Хотите дать пользователю возможность "зайти" внутрь картинки и свободно двигать камерой — в реальном времени? Именно это делает Wonder. Система берёт одно изображение или видео и превращает его в интерактивный мир, по которому можно перемещаться с точным управлением камерой.
Ключевая идея — совместный дизайн трёх компонентов:
1. Управление: вместо абстрактных Plücker-координат рендерится синтетический 3D-скаффолд вдоль траектории камеры — визуальные подсказки напрямую кодируют движение и параллакс.
2. Память: разреженный механизм внимания с пулингом ключей — полная история хранится, но на каждом шаге выбирается фиксированный набор чанков, поэтому latency не растёт с длиной роллаута.
3. Дистилляция: mixture-of-students + adversarial регуляризатор на основе камеры — чтобы few-step студент не терял качество и точность управления.
Результат: 16 FPS, стабильная задержка на роллаутах длиной в минуты.
https://arxiv.org/abs/2607.26037
Слабые учат сильных: дистилляция знаний без учителя-эксперта (by Microsoft Research)
Классическая дистилляция знаний требует учителя сильнее ученика. Но что делать, когда ты уже на фронтире и сильнее тебя никого нет?
Авторы предлагают W2S-OPD: берём пару слабых моделей — "позитивную" (например, после RL) и "негативную" (до RL) — и вычитаем их логиты. Разница изолирует направление полезного навыка, очищенное от общей слабости обеих моделей. Это направление добавляется к логитам сильной базовой модели студента — получается "прокси-учитель", который одновременно несёт нужный навык и остаётся дистрибутивно близким к студенту.
Дальше — on-policy дистилляция: студент генерирует свои траектории и минимизирует KL-дивергенцию к прокси-учителю.
Результат: Qwen3-8B обучается у Qwen3-4B и превосходит его! Причём даже два базовых офф-шелф слабых модели без дополнительного обучения дают прирост студенту выше уровня обоих источников.
https://arxiv.org/abs/2607.26246
Классическая дистилляция знаний требует учителя сильнее ученика. Но что делать, когда ты уже на фронтире и сильнее тебя никого нет?
Авторы предлагают W2S-OPD: берём пару слабых моделей — "позитивную" (например, после RL) и "негативную" (до RL) — и вычитаем их логиты. Разница изолирует направление полезного навыка, очищенное от общей слабости обеих моделей. Это направление добавляется к логитам сильной базовой модели студента — получается "прокси-учитель", который одновременно несёт нужный навык и остаётся дистрибутивно близким к студенту.
Дальше — on-policy дистилляция: студент генерирует свои траектории и минимизирует KL-дивергенцию к прокси-учителю.
Результат: Qwen3-8B обучается у Qwen3-4B и превосходит его! Причём даже два базовых офф-шелф слабых модели без дополнительного обучения дают прирост студенту выше уровня обоих источников.
https://arxiv.org/abs/2607.26246
Что если научить ИИ моделировать не только физический мир, но и чужие мысли?
Все современные world models — Dreamer, JEPA, Sora — моделируют физику: объекты, движение, пространство. Но человеческое поведение определяется не только тем, что происходит, но и тем, что люди думают, чувствуют и во что верят.
Авторы предлагают Mental World Modeling (MWM) — фреймворк, где состояние мира = физика + ментальные переменные (убеждения, желания, намерения, социальные нормы). Формально это POMDP, где агент наблюдает только частичную проекцию совместного состояния.
Они реализовали MENTIS — training-free систему, которая парсит сцену, строит ментальное состояние целевого агента, симулирует ветки развития событий и выбирает действие по физической правдоподобности + ментальной консистентности.
Ключевой результат: убери ментальный канал — качество падает у всех 8 протестированных LLM. Главный bottleneck — симуляция переходов (как мир меняется после действия).
https://arxiv.org/abs/2607.27201
Все современные world models — Dreamer, JEPA, Sora — моделируют физику: объекты, движение, пространство. Но человеческое поведение определяется не только тем, что происходит, но и тем, что люди думают, чувствуют и во что верят.
Авторы предлагают Mental World Modeling (MWM) — фреймворк, где состояние мира = физика + ментальные переменные (убеждения, желания, намерения, социальные нормы). Формально это POMDP, где агент наблюдает только частичную проекцию совместного состояния.
Они реализовали MENTIS — training-free систему, которая парсит сцену, строит ментальное состояние целевого агента, симулирует ветки развития событий и выбирает действие по физической правдоподобности + ментальной консистентности.
Ключевой результат: убери ментальный канал — качество падает у всех 8 протестированных LLM. Главный bottleneck — симуляция переходов (как мир меняется после действия).
https://arxiv.org/abs/2607.27201
Агент, который не теряет нить задачи на 100-м шаге
Главная проблема долгих агентных задач — не сложность каждого шага, а накопление ошибок и "забывание" цели. Контекст разрастается, агент путается в том, что уже сделано, и всё рушится.
LongHorizon-Harness решает это через цикл Manage-Execute-Audit (MEA). Менеджер хранит явный task state вне контекста выполнения. Исполнитель работает в свежем контексте на одном подзадании. Аудитор независимо проверяет среду и обновляет state только верифицированными фактами. После каждого раунда история исполнителя выбрасывается — остаётся только компактный проверенный state.
Результат: на WeaveBench PassRate вырос с 51.8% до 80.7% (лучший официальный результат был 41.2%). На OSWorld 2.0 — с 2.8% до 8.3%. Фреймворк работает поверх Claude Code, Codex CLI и других harness-ов через лёгкий AgentAdapter.
https://arxiv.org/abs/2608.01964
Главная проблема долгих агентных задач — не сложность каждого шага, а накопление ошибок и "забывание" цели. Контекст разрастается, агент путается в том, что уже сделано, и всё рушится.
LongHorizon-Harness решает это через цикл Manage-Execute-Audit (MEA). Менеджер хранит явный task state вне контекста выполнения. Исполнитель работает в свежем контексте на одном подзадании. Аудитор независимо проверяет среду и обновляет state только верифицированными фактами. После каждого раунда история исполнителя выбрасывается — остаётся только компактный проверенный state.
Результат: на WeaveBench PassRate вырос с 51.8% до 80.7% (лучший официальный результат был 41.2%). На OSWorld 2.0 — с 2.8% до 8.3%. Фреймворк работает поверх Claude Code, Codex CLI и других harness-ов через лёгкий AgentAdapter.
https://arxiv.org/abs/2608.01964
Робот учится чувствовать пальцами до того, как прикоснётся (by NeoteAI)
Большинство роботов "видят" манипуляцию, но не "чувствуют" её заранее. N0-TWAM меняет это: модель не просто получает тактильные данные как входной сигнал — она предсказывает будущие ощущения от прикосновения вместе с видео, в одном forward pass.
Архитектура — Mixture-of-Transformers с тремя экспертами (видео, тактиль, действие), которые общаются только через общий self-attention. Ключевая идея: тактильный эксперт генерирует предсказанный контакт параллельно с видео, а action-эксперт уже читает это предсказание при выборе действия. Плюс — наблюдаемый тактильный сигнал подаётся отдельно через cross-attention.
Результат: 46.3% на реальных роботах против 30.0% у лучшего VLA-baseline. Обучено на 30 000+ часах данных с синхронизированными тактильными потоками, 6 embodiments, 450 задач.
https://arxiv.org/abs/2607.23783
Большинство роботов "видят" манипуляцию, но не "чувствуют" её заранее. N0-TWAM меняет это: модель не просто получает тактильные данные как входной сигнал — она предсказывает будущие ощущения от прикосновения вместе с видео, в одном forward pass.
Архитектура — Mixture-of-Transformers с тремя экспертами (видео, тактиль, действие), которые общаются только через общий self-attention. Ключевая идея: тактильный эксперт генерирует предсказанный контакт параллельно с видео, а action-эксперт уже читает это предсказание при выборе действия. Плюс — наблюдаемый тактильный сигнал подаётся отдельно через cross-attention.
Результат: 46.3% на реальных роботах против 30.0% у лучшего VLA-baseline. Обучено на 30 000+ часах данных с синхронизированными тактильными потоками, 6 embodiments, 450 задач.
https://arxiv.org/abs/2607.23783
Meta AI удвоила эффективность обучения рекламной ИИ-модели
Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.
Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.
Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.
Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.
Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.
Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.
Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.
https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Engineering at Meta
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
Meta’s Generative Ads Recommendation Model (GEM), the foundation model behind ads recommendations across Instagram and Facebook, now trains at LLM scale on several thousand of the latest-gene…
Microsoft Research выпустила Orchard — открытый фреймворк для создания и обучения агентных AI-систем.
Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.
Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.
Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.
https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.
Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.
Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.
https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
Microsoft Research
Orchard: An open framework for scalable agentic AI
Orchard is an open-source framework for the research community to train and evaluate AI agents across task types. It reduces complexity while supporting strong performance from smaller models by enabling researchers to reuse the same infrastructure:
NVIDIA представила бенчмарки процессора Vera BlueField-4 STX для AI-хранилищ.
Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.
Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.
Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.
https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.
Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.
Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.
https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
NVIDIA Technical Blog
NVIDIA Vera Storage Benchmarks: Faster Encryption, Compression, Integrity Checking, and Recovery for AI-Native Storage
Storage is an active part of every agentic AI workflow. As agents retrieve enterprise knowledge, access persistent memory, reuse key-value (KV) cache data, execute tools, and generate new results…
Как обновлять претрейн рекомендаций каждый день без потери качества?
В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:
1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.
2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.
Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.
https://arxiv.org/abs/2608.02738
В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:
1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.
2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.
Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.
https://arxiv.org/abs/2608.02738
DiffusionGemma: 1500 токенов в секунду на одном H100 (by DeepMind)
Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.
DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.
Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.
Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.
https://arxiv.org/abs/2608.00146
Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.
DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.
Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.
Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.
https://arxiv.org/abs/2608.00146
Что если оптимизировать рассуждения LLM прямо в скрытом пространстве трансформера, а не через токены?
Большинство методов латентного рассуждения (например, LatentSeek) работают так: берём латентные переменные, декодируем их в токены, потом обратным проходом обновляем латенты. Проблема: дискретное декодирование создаёт информационное узкое горлышко — непонятно, как именно латент влияет на ответ.
GRADCUIT решает это иначе: латентные переменные вставляются прямо в промежуточный hidden state трансформера. Тогда self-attention сам становится "цепочкой" для передачи градиентов — каждый сгенерированный токен может напрямую "видеть" латенты через attention, и градиент течёт обратно без потерь.
Результат: +6.6 п.п. к точности над CoT, +2.4 п.п. над LatentSeek на 5 моделях и 3 бенчмарках (GPQA, GSM8K, MATH-500). Бонус — интерпретируемость: через якобиан можно посмотреть, какие латенты реально влияют на ответ.
https://arxiv.org/abs/2608.02585
Большинство методов латентного рассуждения (например, LatentSeek) работают так: берём латентные переменные, декодируем их в токены, потом обратным проходом обновляем латенты. Проблема: дискретное декодирование создаёт информационное узкое горлышко — непонятно, как именно латент влияет на ответ.
GRADCUIT решает это иначе: латентные переменные вставляются прямо в промежуточный hidden state трансформера. Тогда self-attention сам становится "цепочкой" для передачи градиентов — каждый сгенерированный токен может напрямую "видеть" латенты через attention, и градиент течёт обратно без потерь.
Результат: +6.6 п.п. к точности над CoT, +2.4 п.п. над LatentSeek на 5 моделях и 3 бенчмарках (GPQA, GSM8K, MATH-500). Бонус — интерпретируемость: через якобиан можно посмотреть, какие латенты реально влияют на ответ.
https://arxiv.org/abs/2608.02585
OpenAI представила GPT-Live — систему для голосового общения с ИИ в реальном времени, которую команда построила всего за шесть месяцев.
Главное отличие от обычных голосовых ассистентов — отсутствие пошагового режима "ты говоришь — я отвечаю". Вместо этого используется бесшовная речевая модель, которая слушает и реагирует непрерывно, как живой собеседник.
Низкая задержка архитектуры делает разговор заметно естественнее: паузы минимальны, а ИИ может перебить или уточнить в нужный момент.
Для пользователей это значит — меньше ощущения "общения с роботом" и больше живого диалога. Особенно это важно для сценариев, где скорость реакции критична: обучение, поддержка, переговорные тренажёры.
https://openai.com/index/continuous-voice-interaction-with-gpt-live
Главное отличие от обычных голосовых ассистентов — отсутствие пошагового режима "ты говоришь — я отвечаю". Вместо этого используется бесшовная речевая модель, которая слушает и реагирует непрерывно, как живой собеседник.
Низкая задержка архитектуры делает разговор заметно естественнее: паузы минимальны, а ИИ может перебить или уточнить в нужный момент.
Для пользователей это значит — меньше ощущения "общения с роботом" и больше живого диалога. Особенно это важно для сценариев, где скорость реакции критична: обучение, поддержка, переговорные тренажёры.
https://openai.com/index/continuous-voice-interaction-with-gpt-live
OpenAI
How we built a realtime system for responsive voice AI in six months
GPT-Live enables continuous voice interaction with AI, using a turnless speech model and low-latency architecture for faster, more natural conversations.
Nvidia Tech выпустила Alpamayo 2 Super — открытую модель на 34 млрд параметров для разработки автономных автомобилей.
Что нового: модель объединяет 32B-рассуждатель Cosmos 3 Super и 2B Action Expert, обученный с помощью reinforcement learning. Один инструмент заменяет целый зоопарк отдельных моделей: генерирует траектории, объясняет решения через цепочки причинно-следственных связей, предсказывает манёвры (перестроение, остановка), отвечает на вопросы о сцене и автоматически размечает данные.
Почему важно: раньше для каждой задачи нужна была отдельная модель. Теперь одна основа покрывает весь цикл разработки — от обучения политики до оценки и сбора данных. На бенчмарке LingoQA модель набрала 79.2, обогнав GPT-4o на 23 балла.
Веса доступны на Hugging Face, ноутбуки — на GitHub. Лицензия OpenMDW-1.1 разрешает коммерческое использование и дообучение без дополнительных согласований с Nvidia.
https://developer.nvidia.com/blog/generate-trajectories-reasoning-traces-and-auto-labels-with-nvidia-alpamayo-2-super/
Что нового: модель объединяет 32B-рассуждатель Cosmos 3 Super и 2B Action Expert, обученный с помощью reinforcement learning. Один инструмент заменяет целый зоопарк отдельных моделей: генерирует траектории, объясняет решения через цепочки причинно-следственных связей, предсказывает манёвры (перестроение, остановка), отвечает на вопросы о сцене и автоматически размечает данные.
Почему важно: раньше для каждой задачи нужна была отдельная модель. Теперь одна основа покрывает весь цикл разработки — от обучения политики до оценки и сбора данных. На бенчмарке LingoQA модель набрала 79.2, обогнав GPT-4o на 23 балла.
Веса доступны на Hugging Face, ноутбуки — на GitHub. Лицензия OpenMDW-1.1 разрешает коммерческое использование и дообучение без дополнительных согласований с Nvidia.
https://developer.nvidia.com/blog/generate-trajectories-reasoning-traces-and-auto-labels-with-nvidia-alpamayo-2-super/
NVIDIA Technical Blog
Generate Trajectories, Reasoning Traces, and Auto-Labels with NVIDIA Alpamayo 2 Super
Autonomous vehicle (AV) development often relies on separate models for trajectory generation, high-level intent prediction, scene understanding, and data labeling. This separation makes it hard to…
Apple ML опубликовала масштабное исследование о выравнивании мультимодальных языковых моделей.
Главная проблема, которую изучали учёные — галлюцинации в мультимодальных LLM. Модели не только выдают неверные факты, но и генерируют ответы, противоречащие содержимому изображений. Команда систематически разобрала, какие именно компоненты alignment-обучения реально влияют на качество.
Ключевые находки: комбинирование офлайн-методов (DPO) и онлайн-методов (online-DPO) улучшает результаты. А главное — исследователи предложили новый способ создания обучающих данных под названием BDHS (Bias-Driven Hallucination Sampling), который не требует ни ручной разметки, ни сторонних моделей. При этом метод показывает конкурентные результаты на стандартных бенчмарках.
Для пользователей это означает прогресс в сторону более точных и надёжных мультимодальных ассистентов — таких, которые меньше "придумывают" то, чего нет на картинке.
https://machinelearning.apple.com/research/alignment-multimodal-llms
Главная проблема, которую изучали учёные — галлюцинации в мультимодальных LLM. Модели не только выдают неверные факты, но и генерируют ответы, противоречащие содержимому изображений. Команда систематически разобрала, какие именно компоненты alignment-обучения реально влияют на качество.
Ключевые находки: комбинирование офлайн-методов (DPO) и онлайн-методов (online-DPO) улучшает результаты. А главное — исследователи предложили новый способ создания обучающих данных под названием BDHS (Bias-Driven Hallucination Sampling), который не требует ни ручной разметки, ни сторонних моделей. При этом метод показывает конкурентные результаты на стандартных бенчмарках.
Для пользователей это означает прогресс в сторону более точных и надёжных мультимодальных ассистентов — таких, которые меньше "придумывают" то, чего нет на картинке.
https://machinelearning.apple.com/research/alignment-multimodal-llms
Apple Machine Learning Research
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
Preference alignment has become a crucial component in enhancing the performance of Large Language Models (LLMs), yet its impact in…
Мировые модели устарели — нужны World Proxies (by Shanghai AI Lab)
Классические world models предсказывают следующее физическое состояние среды. Полезно, но узко. Авторы предлагают сменить парадигму: вместо "что будет дальше в мире" — "какую информацию агент получит от действия".
Идея: Agent-Centric World Proxy — это посредник между агентом и реальной средой. Агент спрашивает прокси вместо реального мира, получая дешёвый, безопасный и параллелизуемый фидбек.
Шесть типов прокси: динамики, пространственный, исполнения (что вернёт код/инструмент), памяти/опыта, навыков и верификации/наград.
Три уровня использования: L1 — подсказки при инференсе, L2 — обучение политики на синтетических роллаутах, L3 — совместная эволюция агента и прокси.
По сути это survey + roadmap, переосмысляющий world modeling как инфраструктуру для непрерывного самоулучшения агентов.
https://arxiv.org/abs/2608.02713
Классические world models предсказывают следующее физическое состояние среды. Полезно, но узко. Авторы предлагают сменить парадигму: вместо "что будет дальше в мире" — "какую информацию агент получит от действия".
Идея: Agent-Centric World Proxy — это посредник между агентом и реальной средой. Агент спрашивает прокси вместо реального мира, получая дешёвый, безопасный и параллелизуемый фидбек.
Шесть типов прокси: динамики, пространственный, исполнения (что вернёт код/инструмент), памяти/опыта, навыков и верификации/наград.
Три уровня использования: L1 — подсказки при инференсе, L2 — обучение политики на синтетических роллаутах, L3 — совместная эволюция агента и прокси.
По сути это survey + roadmap, переосмысляющий world modeling как инфраструктуру для непрерывного самоулучшения агентов.
https://arxiv.org/abs/2608.02713
Как сжать видео+аудио токены в 13 раз и почти ничего не потерять?
Omni-LLM (модели, которые понимают видео, аудио и текст одновременно) страдают от огромного числа токенов — видео и аудио генерируют их в разы больше, чем текст. OmniPack предлагает двухэтапное сжатие без дообучения.
Этап 1 (до LLM): каждая модальность сжимается независимо. Для видео считается важность токенов через внимание энкодера + межкадровые изменения + пространственная уникальность. Для аудио — акустические границы. Затем выбираются не только "важные", но и "покрывающие" токены, чтобы не потерять редкие события. Похожие токены мёрджатся.
Этап 2 (внутри LLM): после того как аудио и видео "познакомились" семантически, применяется совместное аудио-визуальное прунинг с учётом текстового запроса.
Результат: 7.5% токенов от исходного числа, ускорение prefill в 4.5×, FLOPs меньше в 10×, при этом 95.6% качества сохраняется на 5 бенчмарках.
https://arxiv.org/abs/2608.03812
Omni-LLM (модели, которые понимают видео, аудио и текст одновременно) страдают от огромного числа токенов — видео и аудио генерируют их в разы больше, чем текст. OmniPack предлагает двухэтапное сжатие без дообучения.
Этап 1 (до LLM): каждая модальность сжимается независимо. Для видео считается важность токенов через внимание энкодера + межкадровые изменения + пространственная уникальность. Для аудио — акустические границы. Затем выбираются не только "важные", но и "покрывающие" токены, чтобы не потерять редкие события. Похожие токены мёрджатся.
Этап 2 (внутри LLM): после того как аудио и видео "познакомились" семантически, применяется совместное аудио-визуальное прунинг с учётом текстового запроса.
Результат: 7.5% токенов от исходного числа, ускорение prefill в 4.5×, FLOPs меньше в 10×, при этом 95.6% качества сохраняется на 5 бенчмарках.
https://arxiv.org/abs/2608.03812
"Физика" мультимодального предобучения (by Meta AI)
Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.
Четыре ключевых вывода:
1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.
2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.
3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.
4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.
https://arxiv.org/abs/2608.05000
Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.
Четыре ключевых вывода:
1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.
2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.
3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.
4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.
https://arxiv.org/abs/2608.05000