Sparse Delta Memory: RNN с памятью в миллион слотов (by Meta AI)
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Nvidia Research представила RoboLab — платформу для оценки роботизированных AI-систем.
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
NVIDIA Technical Blog
How to Evaluate General-Purpose Robot Policies for Real-World Deployment
Robotics foundation models have made remarkable progress. Today’s best systems can follow natural language instructions to pick, place, sort, and manipulate a wide variety of objects.
Nvidia Tech рассказала, как правильно проектировать LLM-модели под железо, чтобы выжать максимум из GPU.
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
NVIDIA Technical Blog
AI Model Co-Design: Hardware-Friendly LLM Design
AI performance comes down to three dimensions: Deployments must balance all three: High accuracy is wasted if responses are slow, and raw throughput means little if each user’s experience is laggy.
Nvidia Tech обновила BioNeMo Agent Toolkit — набор инструментов для ускорения предсказания биомолекулярных структур.
Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.
Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.
Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.
https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.
Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.
Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.
https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
NVIDIA Technical Blog
Accelerating End-to-End Co-Folding Performance with NVIDIA BioNeMo Agent Toolkit
Biomolecular structure prediction and co-folding with models like OpenFold3 are now mainstream, large-scale workloads powering drug discovery and protein design. Increasingly, they’re driven end-to…
Video генерация — это новый ImageNet (by Google DeepMind)
В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.
Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.
Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.
https://arxiv.org/abs/2607.09024
В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.
Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.
Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.
https://arxiv.org/abs/2607.09024
Remember When It Matters: Proactive Memory Agent (by Meta Research)
LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.
Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?
Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.
https://arxiv.org/abs/2607.08716
LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.
Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?
Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.
https://arxiv.org/abs/2607.08716
Границы объектов как основа предобучения vision-моделей
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Amazon Science совместно с Университетом Мичигана научили роботов чувствовать прикосновения.
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Amazon Science
Amazon and University of Michigan give robots a sense of touch
HydroShear, a new physics-based simulator, teaches robots how to use their sense of touch to perform complex manipulation tasks, in a way that transfers seamlessly to the real world.
PyTorch (Meta): скрытая стоимость нормализации в нейросетях
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
ABot-N1: один мозг для всех задач навигации (by Alibaba)
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383
Зачем генерировать, если можно просто считать?
Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.
Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.
Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.
Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.
Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.
https://arxiv.org/abs/2607.06553
Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.
Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.
Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.
Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.
Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.
https://arxiv.org/abs/2607.06553
RL для LLM-агентов без ожидания "отстающих" траекторий
Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.
Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.
Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.
Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.
https://arxiv.org/abs/2607.07508
Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.
Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.
Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.
Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.
https://arxiv.org/abs/2607.07508
Microsoft Research выпустила верифицированную криптографию для SymCrypt — библиотеки, которая работает в Windows и Azure.
Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.
Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.
Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.
https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.
Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.
Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.
https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
Microsoft Research
Scaling cryptographic verification to boost computer security
Cryptographic code supports vital protections in modern computing systems. Learn how a new method helps verify code as developers write it while preserving speed and adaptability as it gets implemented and evolves:
NVIDIA улучшила квантовые вычисления
NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.
Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.
Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.
Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.
https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.
Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.
Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.
Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.
https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
NVIDIA Technical Blog
NVIDIA Ising Decoding Cuts Color Code Logical Error Rates by Over 300x
Useful quantum computers will require fault tolerant logical operations. Researchers are actively exploring many different quantum error correction (QEC) codes to enable this…
Nvidia Tech представила метод оценки вероятности экстремальных погодных событий с помощью диффузионных моделей.
Проблема: редкие события вроде тропических циклонов требуют миллионов симуляций для статистически значимой оценки риска — это дорого и долго.
Решение: модель cBottle направленно генерирует именно редкие сценарии (например, ураган у берегов Флориды), а специальный коэффициент «отношения шансов» пересчитывает, насколько вероятен такой сценарий в реальном климате. Это importance sampling — меньше расчётов, точнее результат.
Ключевой момент: метод требует производных второго порядка через нейросеть, но даёт резкое снижение погрешности по сравнению с классическим Монте-Карло.
Реализация уже доступна в открытой библиотеке NVIDIA Earth2Studio. Применения: страхование, инфраструктурное планирование, климатические исследования.
https://developer.nvidia.com/blog/extreme-event-likelihoods-with-guided-generative-models/
Проблема: редкие события вроде тропических циклонов требуют миллионов симуляций для статистически значимой оценки риска — это дорого и долго.
Решение: модель cBottle направленно генерирует именно редкие сценарии (например, ураган у берегов Флориды), а специальный коэффициент «отношения шансов» пересчитывает, насколько вероятен такой сценарий в реальном климате. Это importance sampling — меньше расчётов, точнее результат.
Ключевой момент: метод требует производных второго порядка через нейросеть, но даёт резкое снижение погрешности по сравнению с классическим Монте-Карло.
Реализация уже доступна в открытой библиотеке NVIDIA Earth2Studio. Применения: страхование, инфраструктурное планирование, климатические исследования.
https://developer.nvidia.com/blog/extreme-event-likelihoods-with-guided-generative-models/
NVIDIA Technical Blog
Extreme Event Likelihoods with Guided Generative Models
Across science, engineering, and finance, many of the most important risks come from low-likelihood, high-impact events. Estimating the probability of these events with brute-force Monte Carlo…
Зачем гонять дорогой RL на большой модели, если можно на маленькой?
(by Bytedance + Tsinghua)
Идея Direct-OPD проста и элегантна: запускаем RL на дешёвой слабой модели (1.5B), а потом переносим не саму модель, а разницу в поведении до и после RL на сильную модель (7B+).
Ключевой инсайт: если скопировать финальную политику слабой модели, сильная модель деградирует — она уже умеет больше. Нужно передать только то, чему научил RL, то есть сдвиг log πT − log πTref. Это и есть неявная награда слабой модели!
Результат: Qwen3-1.7B вырастает с 48.3 до 58.3 на AIME 2024 за 4 часа на 8 A100. Прямой RL на той же модели требует 32 A100 и неделю. Работает даже если студент изначально сильнее учителя.
По духу похоже на DPO, только наоборот: не учим политику из предпочтений, а извлекаем награду из политики.
https://arxiv.org/abs/2607.05394
(by Bytedance + Tsinghua)
Идея Direct-OPD проста и элегантна: запускаем RL на дешёвой слабой модели (1.5B), а потом переносим не саму модель, а разницу в поведении до и после RL на сильную модель (7B+).
Ключевой инсайт: если скопировать финальную политику слабой модели, сильная модель деградирует — она уже умеет больше. Нужно передать только то, чему научил RL, то есть сдвиг log πT − log πTref. Это и есть неявная награда слабой модели!
Результат: Qwen3-1.7B вырастает с 48.3 до 58.3 на AIME 2024 за 4 часа на 8 A100. Прямой RL на той же модели требует 32 A100 и неделю. Работает даже если студент изначально сильнее учителя.
По духу похоже на DPO, только наоборот: не учим политику из предпочтений, а извлекаем награду из политики.
https://arxiv.org/abs/2607.05394
Роботы теперь учатся управлять собой из YouTube, а не только из дорогих демонстраций
LingBot-VA 2.0 — это попытка переосмыслить, как видео-модели используются в робототехнике. Раньше брали готовый видеогенератор (обученный на реконструкцию пикселей), прикручивали к нему модуль действий и дообучали на дорогих роботизированных данных. Проблемы: медленный инференс, слабое понимание динамики, плохая генерализация.
Авторы предлагают нативный подход: обучить весь стек с нуля под задачи управления. Ключевые идеи:
1. Семантический токенайзер — выравнивает латентное пространство видео и действий в одно общее, используя self-supervision на нелейбленном видео из интернета.
2. Causal DiT с MoE — причинный трансформер с разреженными экспертами для быстрого инференса.
3. Foresight Reasoning — асинхронное предсказание: робот действует, пока модель параллельно предсказывает будущее, корректируясь на реальных наблюдениях.
LingBot-VA 2.0 — это попытка переосмыслить, как видео-модели используются в робототехнике. Раньше брали готовый видеогенератор (обученный на реконструкцию пикселей), прикручивали к нему модуль действий и дообучали на дорогих роботизированных данных. Проблемы: медленный инференс, слабое понимание динамики, плохая генерализация.
Авторы предлагают нативный подход: обучить весь стек с нуля под задачи управления. Ключевые идеи:
1. Семантический токенайзер — выравнивает латентное пространство видео и действий в одно общее, используя self-supervision на нелейбленном видео из интернета.
2. Causal DiT с MoE — причинный трансформер с разреженными экспертами для быстрого инференса.
3. Foresight Reasoning — асинхронное предсказание: робот действует, пока модель параллельно предсказывает будущее, корректируясь на реальных наблюдениях.
Игровой мир без конца — буквально
LingBot-World-Infinity — это интерактивная world model, которая генерирует игровой мир в реальном времени бесконечно долго без деградации качества. Авторы провели непрерывную сессию длиной больше часа — и визуального распада не заметили.
Две главные проблемы прошлых подходов: накопление ошибок (через минуты мир "плывёт") и дороговизна высококачественного рендера. Решение: сначала обучают стабильную causal video модель, затем дистиллируют её в быстрый студент-вариант, который выдаёт 720p/60fps.
Поверх генератора — агентский слой: pilot agent управляет персонажем, director agent подсевает новый контент по мере исследования. Поддерживаются бой, лучная стрельба, магия, смена погоды.
Модель открытая, что редкость среди конкурентов (Genie 3, HappyOyster закрыты).
https://arxiv.org/abs/2607.07534
LingBot-World-Infinity — это интерактивная world model, которая генерирует игровой мир в реальном времени бесконечно долго без деградации качества. Авторы провели непрерывную сессию длиной больше часа — и визуального распада не заметили.
Две главные проблемы прошлых подходов: накопление ошибок (через минуты мир "плывёт") и дороговизна высококачественного рендера. Решение: сначала обучают стабильную causal video модель, затем дистиллируют её в быстрый студент-вариант, который выдаёт 720p/60fps.
Поверх генератора — агентский слой: pilot agent управляет персонажем, director agent подсевает новый контент по мере исследования. Поддерживаются бой, лучная стрельба, магия, смена погоды.
Модель открытая, что редкость среди конкурентов (Genie 3, HappyOyster закрыты).
https://arxiv.org/abs/2607.07534
Nvidia Tech запускает автономный RL-исследовательский воркфлоу
Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.
Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.
Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).
Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.
Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.
Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).
Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
NVIDIA Technical Blog
How to Run an Autoresearch Workflow with RL Agent Skills and NVIDIA NeMo
Coding AI agents are becoming practical operators for long-running machine learning (ML) workflows. They can inspect repositories, set up runtimes, resolve build issues, launch experiments…
Nvidia выпустила инструкцию по дообучению Cosmos 3 за один день
Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.
Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.
TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.
Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.
Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.
TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.
Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
NVIDIA Technical Blog
Post-Train NVIDIA Cosmos 3 in One Day Using Agent Skills
What if autonomous coding AI agents could push your vision reasoning models above 90% accuracy with almost no manual effort? When adapting vision reasoning models to production video tasks…
Apple ML представила PARE — фреймворк для оценки проактивных ИИ-ассистентов.
Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.
В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.
Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.
https://machinelearning.apple.com/research/proactive-agent-research-environment
Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.
В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.
Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.
https://machinelearning.apple.com/research/proactive-agent-research-environment
Apple Machine Learning Research
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
Proactive agents that anticipate user needs and autonomously execute tasks hold great promise as digital assistants, yet the lack of…