Nvidia Tech запустила туториал по развёртыванию собственного AI-ассистента для кода с защитой через NeMo Guardrails.
Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.
Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.
Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.
https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.
Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.
Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.
https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
NVIDIA Technical Blog
How to Self-Host a Validated AI Coding Assistant with NVIDIA NeMo Guardrails
Deploying an AI coding assistant in a regulated, sovereign, or source-sensitive environment, often comes with challenges. Three common issues are: the source cannot leave the network…
Apple ML представила архитектуру синтеза речи для Siri Expressive Voices, которая работает прямо на устройстве.
Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.
Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.
Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.
Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.
https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.
Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.
Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.
Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.
https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
Apple Machine Learning Research
Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Siri Expressive Voices synthesize rich, configurable speech in real time and entirely on device, powered by AFM 3 Core Advanced, Apple’s…
ИИ, который улучшает ИИ — и учится делать это лучше
Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.
Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).
Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.
Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.
https://arxiv.org/abs/2607.28568
Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.
Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).
Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.
Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.
https://arxiv.org/abs/2607.28568
Память прямо в весах модели — без RAG, без внешних баз
Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.
Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.
Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.
Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.
Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.
Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.
Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Датасет для воплощённого ИИ: записали 150 часов домашней жизни со всех сторон
Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.
Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.
На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.
Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.
Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.
На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.
Microsoft Research выпустила Echoverse — систему тренировочных сред для AI-агентов, работающих с компьютером.
Суть: вместо сотен поверхностных симуляций — 12 глубоких миров, точно воспроизводящих логику реальных приложений (почта, банкинг, внутренние консоли). Каждый мир хранит настоящее состояние базы данных, которое меняется от действий агента.
Результат впечатляет: модель на 9B параметров подняла точность с 36.5% до 67.1% — почти вдвое, отставая от GPT-5.4 всего на 14 пунктов.
Ключевой вывод: качество среды важнее количества. Мелкие, «поверхностные» миры не просто не помогают — они ухудшают результат.
Четыре среды с кодом, данными и верификаторами уже открыты на GitHub и Hugging Face.
https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/
Суть: вместо сотен поверхностных симуляций — 12 глубоких миров, точно воспроизводящих логику реальных приложений (почта, банкинг, внутренние консоли). Каждый мир хранит настоящее состояние базы данных, которое меняется от действий агента.
Результат впечатляет: модель на 9B параметров подняла точность с 36.5% до 67.1% — почти вдвое, отставая от GPT-5.4 всего на 14 пунктов.
Ключевой вывод: качество среды важнее количества. Мелкие, «поверхностные» миры не просто не помогают — они ухудшают результат.
Четыре среды с кодом, данными и верификаторами уже открыты на GitHub и Hugging Face.
https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/
Microsoft Research
Deep, evolving environments for computer-use agents
Computer-use AI agents struggle with multi-step workflows like email and customer support. Echoverse trains agents in realistic environments rather than simply providing more training tasks, helping them improve as the tasks, tests, and environments evolve.
Microsoft Research представила EvoLib — систему, которая учит ИИ накапливать знания из опыта без переобучения модели.
Суть проста: обычная память ИИ — это архив прошлых диалогов и действий. EvoLib идёт дальше: он извлекает из опыта переиспользуемые навыки и выводы, а затем постоянно их уточняет и обобщает. Как человек, который помнит не каждую деталь, а то, что реально работает.
Главное: система не требует обновления весов модели и работает с любыми LLM через API, включая закрытые.
На тестах — математика, написание кода, принятие решений — EvoLib стабильно обходит конкурирующие подходы на основе памяти и эффективнее конвертирует вычисления в рост качества.
Код уже открыт на GitHub.
https://www.microsoft.com/en-us/research/blog/evolib-turning-experience-into-evolving-knowledge/
Суть проста: обычная память ИИ — это архив прошлых диалогов и действий. EvoLib идёт дальше: он извлекает из опыта переиспользуемые навыки и выводы, а затем постоянно их уточняет и обобщает. Как человек, который помнит не каждую деталь, а то, что реально работает.
Главное: система не требует обновления весов модели и работает с любыми LLM через API, включая закрытые.
На тестах — математика, написание кода, принятие решений — EvoLib стабильно обходит конкурирующие подходы на основе памяти и эффективнее конвертирует вычисления в рост качества.
Код уже открыт на GitHub.
https://www.microsoft.com/en-us/research/blog/evolib-turning-experience-into-evolving-knowledge/
Microsoft Research
EvoLib: Teaching LLMs to learn from experience
LLMs do not get smarter just by remembering more. EvoLib turns experience into evolving knowledge, taking reusable skills and insights that help models learn and adapt across tasks long after deployment.
Nvidia выпустила nvmath-python v1.0 — библиотеку, которая открывает Python-разработчикам доступ к мощи CUDA-X математических библиотек (cuFFT, cuBLASLt, cuSPARSE и другим) без написания C/C++ кода.
Что важно: библиотека работает с NumPy, CuPy и PyTorch, поддерживает CPU, GPU и распределённые многоузловые системы. Можно буквально написать три строки кода и получить GPU-ускоренное матричное умножение.
Главные фишки: универсальные разреженные тензоры (UST) с кастомными форматами через DSL, два типа API — универсальные и специализированные для максимальной производительности, JIT-компиляция через numba-cuda, интеграция с Python logging для трассировки вычислений.
Устанавливается через pip, conda или uv. Для кого это важно: исследователи, ML-инженеры и все, кто занимается научными вычислениями и хочет выжать максимум из железа NVIDIA без погружения в низкоуровневые интерфейсы.
https://developer.nvidia.com/blog/run-high-performance-core-math-at-scale-with-nvidia-nvmath-python/
Что важно: библиотека работает с NumPy, CuPy и PyTorch, поддерживает CPU, GPU и распределённые многоузловые системы. Можно буквально написать три строки кода и получить GPU-ускоренное матричное умножение.
Главные фишки: универсальные разреженные тензоры (UST) с кастомными форматами через DSL, два типа API — универсальные и специализированные для максимальной производительности, JIT-компиляция через numba-cuda, интеграция с Python logging для трассировки вычислений.
Устанавливается через pip, conda или uv. Для кого это важно: исследователи, ML-инженеры и все, кто занимается научными вычислениями и хочет выжать максимум из железа NVIDIA без погружения в низкоуровневые интерфейсы.
https://developer.nvidia.com/blog/run-high-performance-core-math-at-scale-with-nvidia-nvmath-python/
NVIDIA Technical Blog
Run High-Performance Core Math at Scale with NVIDIA nvmath-python
NVIDIA nvmath-python is a library designed to bridge the gap between the Python scientific community and NVIDIA CUDA-X math libraries. It gives Python users access to CUDA-X performance for common…
GUI-агент от Alibaba, который реально работает на телефоне, а не только в симуляторе (by TongyiLab / Alibaba)
Большинство GUI-агентов хорошо выглядят на бенчмарках, но ломаются на реальных устройствах. Qwen-UI-Agent строился вокруг одной идеи: настоящая польза, а не симуляция.
Что внутри:
— 100+ физических Android-устройств для сбора данных и обучения
— Гибридное пространство действий: GUI + bash CLI + батчинг (40%+ шагов батчатся)
— Online RL на траекториях длиной 100+ шагов, 10 000 параллельных сред
— AutoResearch: агенты сами генерируют задачи, анализируют ошибки, предлагают следующую итерацию
— Проактивный режим: агент видит уведомление о рейсе и сам предлагает план переезда
Результаты: 92.2% на реальном бенчмарке MobileWorld-Real, обгоняет Claude Opus 4.8, GPT-5.6 Sol и Gemini 3.1 Pro.
https://arxiv.org/abs/2607.28227
Большинство GUI-агентов хорошо выглядят на бенчмарках, но ломаются на реальных устройствах. Qwen-UI-Agent строился вокруг одной идеи: настоящая польза, а не симуляция.
Что внутри:
— 100+ физических Android-устройств для сбора данных и обучения
— Гибридное пространство действий: GUI + bash CLI + батчинг (40%+ шагов батчатся)
— Online RL на траекториях длиной 100+ шагов, 10 000 параллельных сред
— AutoResearch: агенты сами генерируют задачи, анализируют ошибки, предлагают следующую итерацию
— Проактивный режим: агент видит уведомление о рейсе и сам предлагает план переезда
Результаты: 92.2% на реальном бенчмарке MobileWorld-Real, обгоняет Claude Opus 4.8, GPT-5.6 Sol и Gemini 3.1 Pro.
https://arxiv.org/abs/2607.28227
Код как цепочка рассуждений для физически корректных видео
Главная проблема генерации видео — "каузальная непрозрачность": промпт описывает событие сжато, а модель должна сама восстановить полный физический процесс. VideoCoCo решает это радикально: вместо того чтобы генерировать видео напрямую, агент сначала пишет программу на Blender, которая явно кодирует сцену и её эволюцию во времени.
Система работает в два этапа. Сначала Executable Simulation Engine генерирует низкокачественный, но физически корректный черновик через симуляцию. Затем Generative Video Engine превращает этот черновик в фотореалистичное видео через draft-conditioned editing. Физика — за симулятором, внешний вид — за диффузионной моделью.
Для обучения второго движка авторы собрали датасет VideoCoCo-3K из троек (черновик, инструкция, целевое видео). На бенчмарках PhyGenBench и VBench-2.0 метод показывает SOTA, особенно в термодинамике и свойствах материалов.
https://arxiv.org/abs/2607.27380
Главная проблема генерации видео — "каузальная непрозрачность": промпт описывает событие сжато, а модель должна сама восстановить полный физический процесс. VideoCoCo решает это радикально: вместо того чтобы генерировать видео напрямую, агент сначала пишет программу на Blender, которая явно кодирует сцену и её эволюцию во времени.
Система работает в два этапа. Сначала Executable Simulation Engine генерирует низкокачественный, но физически корректный черновик через симуляцию. Затем Generative Video Engine превращает этот черновик в фотореалистичное видео через draft-conditioned editing. Физика — за симулятором, внешний вид — за диффузионной моделью.
Для обучения второго движка авторы собрали датасет VideoCoCo-3K из троек (черновик, инструкция, целевое видео). На бенчмарках PhyGenBench и VBench-2.0 метод показывает SOTA, особенно в термодинамике и свойствах материалов.
https://arxiv.org/abs/2607.27380
(by Adobe) Как применить Chinchilla-scaling к диффузионным моделям?
Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.
Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).
Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.
Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).
Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
OpenAI опубликовала результаты работы своих моделей над давними нерешёнными задачами в математике и теоретической информатике. В числе достижений — прорывы в геометрии, криптографии и теории сложности вычислений.
Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.
Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.
https://openai.com/index/ten-advances-in-mathematics
Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.
Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.
https://openai.com/index/ten-advances-in-mathematics
OpenAI
Ten advances in mathematics and theoretical computer science
OpenAI shares new results on long-standing open problems in mathematics and theoretical computer science, including advances in geometry, cryptography, and complexity.
Google DeepMind запустила Gemini Robotics ER 2 — новую модель, которая работает как "мозг высшего уровня" для роботов.
Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.
Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.
Доступно уже сейчас через Gemini API и Google AI Studio.
https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.
Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.
Доступно уже сейчас через Gemini API и Google AI Studio.
https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Google
Introducing Gemini Robotics ER 2
Gemini Robotics ER 2 is a step change in video understanding, tool orchestration, and multi-robot collaboration for robotic applications.
Nvidia опубликовала технический гайд по co-design архитектуры внимания (attention) для ускорения LLM-инференса на GPU.
Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.
Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.
Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.
Nvidia выпустит отдельный материал по sparse attention — следим.
https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/
Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.
Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.
Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.
Nvidia выпустит отдельный материал по sparse attention — следим.
https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/
NVIDIA Technical Blog
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference
As agentic and long-context workloads become common, the context lengths increase and attention consumes a larger share of inference time (Figure 1). Because attention now dominates that cost…
Третья ось масштабирования генеративных моделей
Все знают две оси масштабирования LLM и диффузионок: больше параметров и больше данных. Авторы из UIUC предлагают третью — Explorative Modeling (XM).
Идея простая: диффузионки и авторегрессионные модели не end-to-end, потому что на инференсе делают сотни шагов, а обучались предсказывать один. XM вместо этого факторизует не генерацию, а сам тренировочный цикл: на каждом шаге модель генерирует K кандидатов и обучается только на ближайшем к реальным данным. Так модель не усредняет моды, а фиксируется на конкретной.
Результаты: 4.1× эффективность по FLOPs, 6.2× по сэмплам, FID 1.43 на ImageNet без guidance. Причём выигрыш растёт с масштабом, а не насыщается. Бонус: end-to-end XM заменяет Diffusion Policy на задачах управления, делая 16–256× меньше шагов на инференсе.
https://arxiv.org/abs/2607.27372
Все знают две оси масштабирования LLM и диффузионок: больше параметров и больше данных. Авторы из UIUC предлагают третью — Explorative Modeling (XM).
Идея простая: диффузионки и авторегрессионные модели не end-to-end, потому что на инференсе делают сотни шагов, а обучались предсказывать один. XM вместо этого факторизует не генерацию, а сам тренировочный цикл: на каждом шаге модель генерирует K кандидатов и обучается только на ближайшем к реальным данным. Так модель не усредняет моды, а фиксируется на конкретной.
Результаты: 4.1× эффективность по FLOPs, 6.2× по сэмплам, FID 1.43 на ImageNet без guidance. Причём выигрыш растёт с масштабом, а не насыщается. Бонус: end-to-end XM заменяет Diffusion Policy на задачах управления, делая 16–256× меньше шагов на инференсе.
https://arxiv.org/abs/2607.27372
LedgerMind: как заставить агента не врать в промежуточных шагах
Модель может дать правильный ответ, но прийти к нему через цепочку галлюцинаций — это никто не замечает, если смотреть только на финальную точность. Авторы называют это "Phantom Grounding": агент цитирует реальные источники, но тихо подставляет в вывод сущности и числа, которых в источнике нет.
Решение — Structured Evidence Ledger: каждый вызов инструмента порождает структурированную запись с источником, типом, уверенностью и статусом. Делать выводы можно только из активных записей в леджере. Трёхуровневый протокол проверяет, что конкретные числа и сущности в утверждении реально есть в процитированном источнике.
Плюс адаптивный диспетчер: простые вопросы идут по короткому пути без лишних рассуждений (Over-Reasoning Paradox реален). А repair работает только через типизированные операторы — нельзя добавить новую запись без tool-провенанса.
Результат: рост и по точности ответов, и по faithfulness промежуточных шагов на нескольких бенчмарках.
Модель может дать правильный ответ, но прийти к нему через цепочку галлюцинаций — это никто не замечает, если смотреть только на финальную точность. Авторы называют это "Phantom Grounding": агент цитирует реальные источники, но тихо подставляет в вывод сущности и числа, которых в источнике нет.
Решение — Structured Evidence Ledger: каждый вызов инструмента порождает структурированную запись с источником, типом, уверенностью и статусом. Делать выводы можно только из активных записей в леджере. Трёхуровневый протокол проверяет, что конкретные числа и сущности в утверждении реально есть в процитированном источнике.
Плюс адаптивный диспетчер: простые вопросы идут по короткому пути без лишних рассуждений (Over-Reasoning Paradox реален). А repair работает только через типизированные операторы — нельзя добавить новую запись без tool-провенанса.
Результат: рост и по точности ответов, и по faithfulness промежуточных шагов на нескольких бенчмарках.
Данные для роботов: как собрать всё и не запутаться
Обучение embodied AI упирается в один вопрос: откуда брать данные? Авторы систематизируют весь зоопарк источников через "пирамиду данных" с двумя осями: масштабируемость (легко ли собрать много) и robot alignment (насколько данные полезны реальному роботу). Эти оси в постоянном конфликте.
Пирамида снизу вверх: общие видео и VLM-данные (много, дёшево, слабо aligned) → эгоцентричные записи людей → симуляция → UMI-демонстрации без робота → реальные роботы (мало, дорого, максимально aligned).
Авторы разбирают, как каждый тип данных применяется в embodied foundation models: для "мозга" (рассуждения, планирование), VLA-моделей и world models. Отдельно — открытые проблемы: тактильные данные, данные об ошибках и восстановлении, выравнивание action spaces разных embodiment.
Хороший survey для тех, кто хочет понять, почему robotics-данные — это не просто "больше видео с YouTube".
https://arxiv.org/abs/2607.24744
Обучение embodied AI упирается в один вопрос: откуда брать данные? Авторы систематизируют весь зоопарк источников через "пирамиду данных" с двумя осями: масштабируемость (легко ли собрать много) и robot alignment (насколько данные полезны реальному роботу). Эти оси в постоянном конфликте.
Пирамида снизу вверх: общие видео и VLM-данные (много, дёшево, слабо aligned) → эгоцентричные записи людей → симуляция → UMI-демонстрации без робота → реальные роботы (мало, дорого, максимально aligned).
Авторы разбирают, как каждый тип данных применяется в embodied foundation models: для "мозга" (рассуждения, планирование), VLA-моделей и world models. Отдельно — открытые проблемы: тактильные данные, данные об ошибках и восстановлении, выравнивание action spaces разных embodiment.
Хороший survey для тех, кто хочет понять, почему robotics-данные — это не просто "больше видео с YouTube".
https://arxiv.org/abs/2607.24744
Nvidia опубликовала практическое руководство по безопасному развёртыванию AI-агентов.
Команда NVIDIA AI Red Team проверила десятки агентов в реальных корпоративных средах и выявила четыре критических уязвимости: отсутствие контроля доступа, произвольное выполнение кода через инструменты агента, отсутствие ограничений на исходящий трафик и утечка секретных ключей в открытом виде.
Главный вывод: защита на уровне LLM не работает. Фильтры на основе моделей обходятся через социальную инженерию и скрытые инъекции в промпты. Нужны архитектурные решения вне зоны контроля модели — изолированные контейнеры, строгие сетевые политики, минимальные права доступа.
Почему важно: корпоративные агенты имеют доступ к реальным инструментам и данным. Скомпрометированный агент — это привилегированное ПО с плохо понятной поверхностью атаки. Рекомендации Nvidia уже применимы сегодня для любого фреймворка.
https://developer.nvidia.com/blog/four-ways-to-deploy-more-secure-ai-agents/
Команда NVIDIA AI Red Team проверила десятки агентов в реальных корпоративных средах и выявила четыре критических уязвимости: отсутствие контроля доступа, произвольное выполнение кода через инструменты агента, отсутствие ограничений на исходящий трафик и утечка секретных ключей в открытом виде.
Главный вывод: защита на уровне LLM не работает. Фильтры на основе моделей обходятся через социальную инженерию и скрытые инъекции в промпты. Нужны архитектурные решения вне зоны контроля модели — изолированные контейнеры, строгие сетевые политики, минимальные права доступа.
Почему важно: корпоративные агенты имеют доступ к реальным инструментам и данным. Скомпрометированный агент — это привилегированное ПО с плохо понятной поверхностью атаки. Рекомендации Nvidia уже применимы сегодня для любого фреймворка.
https://developer.nvidia.com/blog/four-ways-to-deploy-more-secure-ai-agents/
NVIDIA Technical Blog
Four Ways to Deploy More Secure AI Agents
Knowledge workers are increasingly integrating AI agents into their workflows. Agents that function as “digital coworkers” offer clear benefits. For example, they can review a bug report…
NVIDIA рассказала, почему одинаковые кластеры на H100 и GB200 работают по-разному
Инженеры NVIDIA разобрали четыре реальных случая, когда партнёрские кластеры из идентичного железа показывали на 8–12% хуже производительности, чем эталонная архитектура. Причина — не в железе, а в конфигурации.
Главные виновники: неправильная настройка SMMU на Grace CPU в виртуальных машинах (съедала 24% циклов CPU), кривые C-state и NUMA-биндинг на x86 (ядра не выходили на нужную частоту), неверные настройки очередей NCCL на 1.6 Тбит/с сетях, и топологические файлы, которые просто не попадали внутрь контейнеров.
Каждый из этих багов отнимал несколько процентов — вместе они давали провал ниже порога 95%, необходимого для сертификации Exemplar Cloud.
Для диагностики использовались perf, Nsight Systems и nccl-tests. Гайд полезен всем, кто строит AI-инфраструктуру на NVIDIA и хочет выжать из неё максимум.
https://developer.nvidia.com/blog/nvidia-exemplar-cloud-lessons-for-unlocking-full-performance-on-ai-infrastructure/
Инженеры NVIDIA разобрали четыре реальных случая, когда партнёрские кластеры из идентичного железа показывали на 8–12% хуже производительности, чем эталонная архитектура. Причина — не в железе, а в конфигурации.
Главные виновники: неправильная настройка SMMU на Grace CPU в виртуальных машинах (съедала 24% циклов CPU), кривые C-state и NUMA-биндинг на x86 (ядра не выходили на нужную частоту), неверные настройки очередей NCCL на 1.6 Тбит/с сетях, и топологические файлы, которые просто не попадали внутрь контейнеров.
Каждый из этих багов отнимал несколько процентов — вместе они давали провал ниже порога 95%, необходимого для сертификации Exemplar Cloud.
Для диагностики использовались perf, Nsight Systems и nccl-tests. Гайд полезен всем, кто строит AI-инфраструктуру на NVIDIA и хочет выжать из неё максимум.
https://developer.nvidia.com/blog/nvidia-exemplar-cloud-lessons-for-unlocking-full-performance-on-ai-infrastructure/
NVIDIA Technical Blog
NVIDIA Exemplar Cloud: Lessons for Unlocking Full Performance on AI Infrastructure
Two AI computing clusters built from identical NVIDIA H100, GB200 NVL72, or GB300 NVL72 systems can deliver materially different training throughput. We routinely see 8% to 12%
Amazon Science представила ControlG — фреймворк для обучения нейросетей с несколькими целями одновременно.
Проблема: когда модель учится решать несколько задач сразу, их цели конфликтуют. Стандартный подход — смешивать все градиенты на каждом шаге — приводит к «перетягиванию каната»: одни задачи мешают другим, некоторые и вовсе выпадают из обучения.
Решение неожиданное: ControlG заимствует PID-контроллеры из промышленных систем (те самые, что управляют круиз-контролем в машине). Вместо того чтобы смешивать цели, фреймворк выделяет вычислительный ресурс каждой задаче по очереди — и динамически решает, какой уделить внимание следующей.
Результат: три типичных провала многозадачного обучения устранены. Даже случайное расписание задач обходит сложные методы вроде PCGrad и CAGrad — просто за счёт временного разделения.
Работа представлена на ICML 2026. Пока фокус на графовых нейросетях, но подход потенциально применим шире.
https://www.amazon.science/blog/how-controllers-from-industrial-machinery-can-coordinate-multitask-machine-learning
Проблема: когда модель учится решать несколько задач сразу, их цели конфликтуют. Стандартный подход — смешивать все градиенты на каждом шаге — приводит к «перетягиванию каната»: одни задачи мешают другим, некоторые и вовсе выпадают из обучения.
Решение неожиданное: ControlG заимствует PID-контроллеры из промышленных систем (те самые, что управляют круиз-контролем в машине). Вместо того чтобы смешивать цели, фреймворк выделяет вычислительный ресурс каждой задаче по очереди — и динамически решает, какой уделить внимание следующей.
Результат: три типичных провала многозадачного обучения устранены. Даже случайное расписание задач обходит сложные методы вроде PCGrad и CAGrad — просто за счёт временного разделения.
Работа представлена на ICML 2026. Пока фокус на графовых нейросетях, но подход потенциально применим шире.
https://www.amazon.science/blog/how-controllers-from-industrial-machinery-can-coordinate-multitask-machine-learning
Amazon Science
How controllers from industrial machinery can coordinate multitask machine learning
Instead of compromising among parameter updates dictated by different training objectives, ControlG allocates computational capacity to objectives sequentially and dynamically.
(by NeoteAI) Тактильные ощущения для роботов — предсказывай будущее, а не читай прошлое
VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.
N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.
Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).
VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.
N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.
Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).