NVIDIA представила процессор Vera CPU для AI-фабрик
NVIDIA анонсировала процессор Vera CPU, разработанный специально для агентных AI-систем. Ключевые цифры: производительность на ядро в 1,8 раза выше при полной нагрузке, пиковая задержка ниже на 40%, пропускная способность памяти более чем в 3 раза выше — и всё это при вдвое меньшем энергопотреблении по сравнению с x86-процессорами.
Vera построен на 88 ядрах Olympus в монолитном кристалле — без многочиплетной архитектуры, которая создаёт задержки при переходе между блоками. Это критично для агентных систем, где GPU постоянно ждёт CPU: выполнения инструментов, кода, обработки данных.
Для пользователей это означает более быстрые ответы AI-агентов, лучшее качество обучения с подкреплением и более высокую утилизацию GPU. Проще говоря — больше полезной работы за тот же бюджет на железо.
https://developer.nvidia.com/blog/nvidia-vera-cpu-boosts-ai-factory-throughput-to-accelerate-agentic-workloads/
NVIDIA анонсировала процессор Vera CPU, разработанный специально для агентных AI-систем. Ключевые цифры: производительность на ядро в 1,8 раза выше при полной нагрузке, пиковая задержка ниже на 40%, пропускная способность памяти более чем в 3 раза выше — и всё это при вдвое меньшем энергопотреблении по сравнению с x86-процессорами.
Vera построен на 88 ядрах Olympus в монолитном кристалле — без многочиплетной архитектуры, которая создаёт задержки при переходе между блоками. Это критично для агентных систем, где GPU постоянно ждёт CPU: выполнения инструментов, кода, обработки данных.
Для пользователей это означает более быстрые ответы AI-агентов, лучшее качество обучения с подкреплением и более высокую утилизацию GPU. Проще говоря — больше полезной работы за тот же бюджет на железо.
https://developer.nvidia.com/blog/nvidia-vera-cpu-boosts-ai-factory-throughput-to-accelerate-agentic-workloads/
NVIDIA Technical Blog
NVIDIA Vera CPU Boosts AI Factory Throughput to Accelerate Agentic Workloads
Agentic systems turn model reasoning into action through multi-step workflows that combine inference, tool use, code execution, retrieval, orchestration, and result handling. As these systems scale…
Amazon Science выпустила Turnstile — небольшой прокси-сервер на Rust для обучения языковых моделей с подкреплением (RL).
Проблема: при агентных задачах (написание кода, веб-навигация) модель работает через «обвязку» — harness. Текстовые транскрипты взаимодействий выглядят корректно, но теряют точные токен-ID, которые нужны тренеру. Даже пробел или другой формат JSON меняет токены — и модель обучается против «другого прошлого», чем то, что реально видела.
Turnstile встаёт между harness и бэкендом, перехватывает каждый запрос и записывает точные токен-ID, логарифмические вероятности и маски потерь прямо в момент генерации.
Главное: harness менять не нужно — он продолжает говорить стандартный OpenAI Chat Completions API. Amazon уже использует Turnstile в реальных RL-тренировках двух агентов — текстового и мультимодального.
Turnstile открыт и доступен прямо сейчас.
https://www.amazon.science/blog/capturing-token-ids-during-agentic-interactions-for-better-reinforcement-learning
Проблема: при агентных задачах (написание кода, веб-навигация) модель работает через «обвязку» — harness. Текстовые транскрипты взаимодействий выглядят корректно, но теряют точные токен-ID, которые нужны тренеру. Даже пробел или другой формат JSON меняет токены — и модель обучается против «другого прошлого», чем то, что реально видела.
Turnstile встаёт между harness и бэкендом, перехватывает каждый запрос и записывает точные токен-ID, логарифмические вероятности и маски потерь прямо в момент генерации.
Главное: harness менять не нужно — он продолжает говорить стандартный OpenAI Chat Completions API. Amazon уже использует Turnstile в реальных RL-тренировках двух агентов — текстового и мультимодального.
Turnstile открыт и доступен прямо сейчас.
https://www.amazon.science/blog/capturing-token-ids-during-agentic-interactions-for-better-reinforcement-learning
Amazon Science
Capturing token IDs during agentic interactions for better reinforcement learning
A new Rust proxy called Turnstile sits between the model backend and the agent harness to capture information lost in mere text transcripts.
IBM Research предлагает заменить «скелет» трансформеров
Исследователи IBM Research представили CoFrGeNets — новый тип архитектуры нейросетей, который может заменить базовую структуру трансформерных моделей. По сути, это как поменять кости в теле ИИ, сохранив всё остальное.
Главная идея: стандартные трансформеры обучаются в условиях, которые могут закреплять нежелательное поведение модели. CoFrGeNets предлагают более предсказуемую и объяснимую основу — что особенно важно для планирования и генеративного ИИ.
Для пользователей это значит потенциально более надёжные и прозрачные модели, которые реже «галлюцинируют» и лучше поддаются контролю. IBM делает ставку на explainable AI — и это направление становится всё актуальнее по мере роста регуляторного давления на индустрию.
https://research.ibm.com/blog/cofrgenets-replace-the-bones-of-transformer-based-models?utm_medium=rss&utm_source=rss
Исследователи IBM Research представили CoFrGeNets — новый тип архитектуры нейросетей, который может заменить базовую структуру трансформерных моделей. По сути, это как поменять кости в теле ИИ, сохранив всё остальное.
Главная идея: стандартные трансформеры обучаются в условиях, которые могут закреплять нежелательное поведение модели. CoFrGeNets предлагают более предсказуемую и объяснимую основу — что особенно важно для планирования и генеративного ИИ.
Для пользователей это значит потенциально более надёжные и прозрачные модели, которые реже «галлюцинируют» и лучше поддаются контролю. IBM делает ставку на explainable AI — и это направление становится всё актуальнее по мере роста регуляторного давления на индустрию.
https://research.ibm.com/blog/cofrgenets-replace-the-bones-of-transformer-based-models?utm_medium=rss&utm_source=rss
IBM Research
CoFrGeNets replace the ‘bones’ of transformer-based models
This new approach, a practical and conceptual shift, points to lighter-weight generative AI models that perform competitively, and in many cases even better.
Ускорить LLM-инференс на 60–85% — без потери качества
Speculative decoding — популярный трюк: маленькая черновая модель предлагает токены, большая проверяет их все за один проход. Проблема: параллельные черновики генерируют токены независимо, поэтому качество хвоста блока резко падает. Авторегрессионные черновики точнее, но медленнее.
DSpark решает это двумя способами. Во-первых, semi-autoregressive генерация: тяжёлый параллельный backbone + лёгкая последовательная голова, которая добавляет зависимости между токенами. Во-вторых, confidence-scheduled verification: специальная голова оценивает вероятность принятия каждого токена, и hardware-aware планировщик отбрасывает низкоуверенные хвосты — не тратя ресурсы целевой модели впустую.
Результат: +30% к принятой длине блока по сравнению с Eagle3, +18% по сравнению с DFlash. В продакшне DeepSeek-V4 — ускорение генерации для пользователей на 60–85% при том же throughput.
https://arxiv.org/abs/2607.05147
Speculative decoding — популярный трюк: маленькая черновая модель предлагает токены, большая проверяет их все за один проход. Проблема: параллельные черновики генерируют токены независимо, поэтому качество хвоста блока резко падает. Авторегрессионные черновики точнее, но медленнее.
DSpark решает это двумя способами. Во-первых, semi-autoregressive генерация: тяжёлый параллельный backbone + лёгкая последовательная голова, которая добавляет зависимости между токенами. Во-вторых, confidence-scheduled verification: специальная голова оценивает вероятность принятия каждого токена, и hardware-aware планировщик отбрасывает низкоуверенные хвосты — не тратя ресурсы целевой модели впустую.
Результат: +30% к принятой длине блока по сравнению с Eagle3, +18% по сравнению с DFlash. В продакшне DeepSeek-V4 — ускорение генерации для пользователей на 60–85% при том же throughput.
https://arxiv.org/abs/2607.05147
LLM-как-верификатор: новая ось масштабирования
Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.
Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.
Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)
Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.
Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.
https://arxiv.org/abs/2607.05391
Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.
Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.
Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)
Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.
Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.
https://arxiv.org/abs/2607.05391
Как честно сравнить 30 роботов-манипуляторов сразу в симуляции и реальном мире?
Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.
Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.
Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.
Сайт: robodojo-benchmark.com
https://arxiv.org/abs/2607.04434
Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.
Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.
Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.
Сайт: robodojo-benchmark.com
https://arxiv.org/abs/2607.04434
Microsoft Research выпустила Aurora 1.5 — крупное обновление своей AI-модели для прогнозирования погоды и анализа состояния Земли.
Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.
Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.
Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.
https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.
Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.
Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.
https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
Microsoft Research
Aurora 1.5: Extending open foundation models for weather and Earth-system applications - Microsoft Research
Aurora 1.5 adds 22 more variables, hourly temporal resolution, and probabilistic ensemble forecasting to the Aurora foundation model, making it more useful for real-world weather, climate, and energy applications.
👍1
Nvidia Tech: хост-оффлоадинг активаций ускоряет обучение LLM на 57%
Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.
Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.
Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок
Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.
https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.
Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.
Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок
Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.
https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
NVIDIA Technical Blog
Reducing High-Bandwidth Memory Bottlenecks in JAX-Based LLM Training with Host Offloading
Large language model (LLM) training workloads increasingly run into GPU memory limits before compute is fully used. Model weights, gradients, optimizer states, communication buffers…
Nvidia Tech обновила документацию и инструменты CUDA: вышел подробный гайд по kernel fusion — технике объединения нескольких GPU-операций в одно ядро.
Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.
На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.
Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.
Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.
https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.
На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.
Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.
Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.
https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
NVIDIA Technical Blog
Kernel Fusion in NVIDIA CUDA: Optimizing Memory Traffic and Launch Overhead
There are many ways to optimize code for GPUs. In this post, you’ll learn how kernel fusion can improve memory bandwidth and reduce kernel launch overhead, along with multiple ways to apply it in…
Jet-Long: расширяем контекст LLM до 128K без дообучения (by NVIDIA)
Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.
Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.
Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.
Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.
https://arxiv.org/abs/2607.07740
Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.
Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.
Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.
Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.
https://arxiv.org/abs/2607.07740
👍1
Линейное внимание: как не потерять качество в погоне за скоростью? (by ETH Zurich)
Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.
Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.
Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.
https://arxiv.org/abs/2607.07953
Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.
Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.
Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.
https://arxiv.org/abs/2607.07953
👍1
Sparse Delta Memory: RNN с памятью в миллион слотов (by Meta AI)
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Nvidia Research представила RoboLab — платформу для оценки роботизированных AI-систем.
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
NVIDIA Technical Blog
How to Evaluate General-Purpose Robot Policies for Real-World Deployment
Robotics foundation models have made remarkable progress. Today’s best systems can follow natural language instructions to pick, place, sort, and manipulate a wide variety of objects.
Nvidia Tech рассказала, как правильно проектировать LLM-модели под железо, чтобы выжать максимум из GPU.
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
NVIDIA Technical Blog
AI Model Co-Design: Hardware-Friendly LLM Design
AI performance comes down to three dimensions: Deployments must balance all three: High accuracy is wasted if responses are slow, and raw throughput means little if each user’s experience is laggy.
Nvidia Tech обновила BioNeMo Agent Toolkit — набор инструментов для ускорения предсказания биомолекулярных структур.
Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.
Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.
Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.
https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.
Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.
Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.
https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
NVIDIA Technical Blog
Accelerating End-to-End Co-Folding Performance with NVIDIA BioNeMo Agent Toolkit
Biomolecular structure prediction and co-folding with models like OpenFold3 are now mainstream, large-scale workloads powering drug discovery and protein design. Increasingly, they’re driven end-to…
Video генерация — это новый ImageNet (by Google DeepMind)
В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.
Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.
Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.
https://arxiv.org/abs/2607.09024
В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.
Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.
Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.
https://arxiv.org/abs/2607.09024
Remember When It Matters: Proactive Memory Agent (by Meta Research)
LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.
Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?
Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.
https://arxiv.org/abs/2607.08716
LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.
Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?
Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.
https://arxiv.org/abs/2607.08716
Границы объектов как основа предобучения vision-моделей
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Amazon Science совместно с Университетом Мичигана научили роботов чувствовать прикосновения.
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Amazon Science
Amazon and University of Michigan give robots a sense of touch
HydroShear, a new physics-based simulator, teaches robots how to use their sense of touch to perform complex manipulation tasks, in a way that transfers seamlessly to the real world.
PyTorch (Meta): скрытая стоимость нормализации в нейросетях
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
ABot-N1: один мозг для всех задач навигации (by Alibaba)
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383