Границы объектов как основа предобучения vision-моделей
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Amazon Science совместно с Университетом Мичигана научили роботов чувствовать прикосновения.
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Amazon Science
Amazon and University of Michigan give robots a sense of touch
HydroShear, a new physics-based simulator, teaches robots how to use their sense of touch to perform complex manipulation tasks, in a way that transfers seamlessly to the real world.
PyTorch (Meta): скрытая стоимость нормализации в нейросетях
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
ABot-N1: один мозг для всех задач навигации (by Alibaba)
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383
Зачем генерировать, если можно просто считать?
Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.
Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.
Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.
Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.
Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.
https://arxiv.org/abs/2607.06553
Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.
Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.
Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.
Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.
Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.
https://arxiv.org/abs/2607.06553
RL для LLM-агентов без ожидания "отстающих" траекторий
Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.
Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.
Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.
Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.
https://arxiv.org/abs/2607.07508
Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.
Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.
Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.
Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.
https://arxiv.org/abs/2607.07508
Microsoft Research выпустила верифицированную криптографию для SymCrypt — библиотеки, которая работает в Windows и Azure.
Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.
Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.
Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.
https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.
Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.
Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.
https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
Microsoft Research
Scaling cryptographic verification to boost computer security
Cryptographic code supports vital protections in modern computing systems. Learn how a new method helps verify code as developers write it while preserving speed and adaptability as it gets implemented and evolves:
NVIDIA улучшила квантовые вычисления
NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.
Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.
Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.
Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.
https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.
Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.
Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.
Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.
https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
NVIDIA Technical Blog
NVIDIA Ising Decoding Cuts Color Code Logical Error Rates by Over 300x
Useful quantum computers will require fault tolerant logical operations. Researchers are actively exploring many different quantum error correction (QEC) codes to enable this…
Nvidia Tech представила метод оценки вероятности экстремальных погодных событий с помощью диффузионных моделей.
Проблема: редкие события вроде тропических циклонов требуют миллионов симуляций для статистически значимой оценки риска — это дорого и долго.
Решение: модель cBottle направленно генерирует именно редкие сценарии (например, ураган у берегов Флориды), а специальный коэффициент «отношения шансов» пересчитывает, насколько вероятен такой сценарий в реальном климате. Это importance sampling — меньше расчётов, точнее результат.
Ключевой момент: метод требует производных второго порядка через нейросеть, но даёт резкое снижение погрешности по сравнению с классическим Монте-Карло.
Реализация уже доступна в открытой библиотеке NVIDIA Earth2Studio. Применения: страхование, инфраструктурное планирование, климатические исследования.
https://developer.nvidia.com/blog/extreme-event-likelihoods-with-guided-generative-models/
Проблема: редкие события вроде тропических циклонов требуют миллионов симуляций для статистически значимой оценки риска — это дорого и долго.
Решение: модель cBottle направленно генерирует именно редкие сценарии (например, ураган у берегов Флориды), а специальный коэффициент «отношения шансов» пересчитывает, насколько вероятен такой сценарий в реальном климате. Это importance sampling — меньше расчётов, точнее результат.
Ключевой момент: метод требует производных второго порядка через нейросеть, но даёт резкое снижение погрешности по сравнению с классическим Монте-Карло.
Реализация уже доступна в открытой библиотеке NVIDIA Earth2Studio. Применения: страхование, инфраструктурное планирование, климатические исследования.
https://developer.nvidia.com/blog/extreme-event-likelihoods-with-guided-generative-models/
NVIDIA Technical Blog
Extreme Event Likelihoods with Guided Generative Models
Across science, engineering, and finance, many of the most important risks come from low-likelihood, high-impact events. Estimating the probability of these events with brute-force Monte Carlo…
Зачем гонять дорогой RL на большой модели, если можно на маленькой?
(by Bytedance + Tsinghua)
Идея Direct-OPD проста и элегантна: запускаем RL на дешёвой слабой модели (1.5B), а потом переносим не саму модель, а разницу в поведении до и после RL на сильную модель (7B+).
Ключевой инсайт: если скопировать финальную политику слабой модели, сильная модель деградирует — она уже умеет больше. Нужно передать только то, чему научил RL, то есть сдвиг log πT − log πTref. Это и есть неявная награда слабой модели!
Результат: Qwen3-1.7B вырастает с 48.3 до 58.3 на AIME 2024 за 4 часа на 8 A100. Прямой RL на той же модели требует 32 A100 и неделю. Работает даже если студент изначально сильнее учителя.
По духу похоже на DPO, только наоборот: не учим политику из предпочтений, а извлекаем награду из политики.
https://arxiv.org/abs/2607.05394
(by Bytedance + Tsinghua)
Идея Direct-OPD проста и элегантна: запускаем RL на дешёвой слабой модели (1.5B), а потом переносим не саму модель, а разницу в поведении до и после RL на сильную модель (7B+).
Ключевой инсайт: если скопировать финальную политику слабой модели, сильная модель деградирует — она уже умеет больше. Нужно передать только то, чему научил RL, то есть сдвиг log πT − log πTref. Это и есть неявная награда слабой модели!
Результат: Qwen3-1.7B вырастает с 48.3 до 58.3 на AIME 2024 за 4 часа на 8 A100. Прямой RL на той же модели требует 32 A100 и неделю. Работает даже если студент изначально сильнее учителя.
По духу похоже на DPO, только наоборот: не учим политику из предпочтений, а извлекаем награду из политики.
https://arxiv.org/abs/2607.05394
Роботы теперь учатся управлять собой из YouTube, а не только из дорогих демонстраций
LingBot-VA 2.0 — это попытка переосмыслить, как видео-модели используются в робототехнике. Раньше брали готовый видеогенератор (обученный на реконструкцию пикселей), прикручивали к нему модуль действий и дообучали на дорогих роботизированных данных. Проблемы: медленный инференс, слабое понимание динамики, плохая генерализация.
Авторы предлагают нативный подход: обучить весь стек с нуля под задачи управления. Ключевые идеи:
1. Семантический токенайзер — выравнивает латентное пространство видео и действий в одно общее, используя self-supervision на нелейбленном видео из интернета.
2. Causal DiT с MoE — причинный трансформер с разреженными экспертами для быстрого инференса.
3. Foresight Reasoning — асинхронное предсказание: робот действует, пока модель параллельно предсказывает будущее, корректируясь на реальных наблюдениях.
LingBot-VA 2.0 — это попытка переосмыслить, как видео-модели используются в робототехнике. Раньше брали готовый видеогенератор (обученный на реконструкцию пикселей), прикручивали к нему модуль действий и дообучали на дорогих роботизированных данных. Проблемы: медленный инференс, слабое понимание динамики, плохая генерализация.
Авторы предлагают нативный подход: обучить весь стек с нуля под задачи управления. Ключевые идеи:
1. Семантический токенайзер — выравнивает латентное пространство видео и действий в одно общее, используя self-supervision на нелейбленном видео из интернета.
2. Causal DiT с MoE — причинный трансформер с разреженными экспертами для быстрого инференса.
3. Foresight Reasoning — асинхронное предсказание: робот действует, пока модель параллельно предсказывает будущее, корректируясь на реальных наблюдениях.
Игровой мир без конца — буквально
LingBot-World-Infinity — это интерактивная world model, которая генерирует игровой мир в реальном времени бесконечно долго без деградации качества. Авторы провели непрерывную сессию длиной больше часа — и визуального распада не заметили.
Две главные проблемы прошлых подходов: накопление ошибок (через минуты мир "плывёт") и дороговизна высококачественного рендера. Решение: сначала обучают стабильную causal video модель, затем дистиллируют её в быстрый студент-вариант, который выдаёт 720p/60fps.
Поверх генератора — агентский слой: pilot agent управляет персонажем, director agent подсевает новый контент по мере исследования. Поддерживаются бой, лучная стрельба, магия, смена погоды.
Модель открытая, что редкость среди конкурентов (Genie 3, HappyOyster закрыты).
https://arxiv.org/abs/2607.07534
LingBot-World-Infinity — это интерактивная world model, которая генерирует игровой мир в реальном времени бесконечно долго без деградации качества. Авторы провели непрерывную сессию длиной больше часа — и визуального распада не заметили.
Две главные проблемы прошлых подходов: накопление ошибок (через минуты мир "плывёт") и дороговизна высококачественного рендера. Решение: сначала обучают стабильную causal video модель, затем дистиллируют её в быстрый студент-вариант, который выдаёт 720p/60fps.
Поверх генератора — агентский слой: pilot agent управляет персонажем, director agent подсевает новый контент по мере исследования. Поддерживаются бой, лучная стрельба, магия, смена погоды.
Модель открытая, что редкость среди конкурентов (Genie 3, HappyOyster закрыты).
https://arxiv.org/abs/2607.07534
Nvidia Tech запускает автономный RL-исследовательский воркфлоу
Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.
Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.
Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).
Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.
Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.
Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).
Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
NVIDIA Technical Blog
How to Run an Autoresearch Workflow with RL Agent Skills and NVIDIA NeMo
Coding AI agents are becoming practical operators for long-running machine learning (ML) workflows. They can inspect repositories, set up runtimes, resolve build issues, launch experiments…
Nvidia выпустила инструкцию по дообучению Cosmos 3 за один день
Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.
Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.
TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.
Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.
Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.
TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.
Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
NVIDIA Technical Blog
Post-Train NVIDIA Cosmos 3 in One Day Using Agent Skills
What if autonomous coding AI agents could push your vision reasoning models above 90% accuracy with almost no manual effort? When adapting vision reasoning models to production video tasks…
Apple ML представила PARE — фреймворк для оценки проактивных ИИ-ассистентов.
Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.
В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.
Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.
https://machinelearning.apple.com/research/proactive-agent-research-environment
Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.
В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.
Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.
https://machinelearning.apple.com/research/proactive-agent-research-environment
Apple Machine Learning Research
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
Proactive agents that anticipate user needs and autonomously execute tasks hold great promise as digital assistants, yet the lack of…
Поисковик для генератора картинок — когда нейросеть не знает, как выглядит талисман Экспо-2025
Современные генераторы изображений отлично рисуют, но плохо знают мир: свежие персонажи, нишевые символы, исторические артефакты — всё это за пределами их обучающей выборки. Авторы из TIGER-Lab собрали 20к реальных промптов с production-платформ и обнаружили: топовые open-source генераторы набирают лишь 21–28 из 100 на их бенчмарке.
Казалось бы — добавь поиск и всё! Но наивный поиск ломает генерацию: лишние детали, стилистический шум, "copy effects". Авторы предлагают систему gate–filter–integrate: агент сначала решает, нужен ли поиск вообще, затем фильтрует шум из результатов, и только потом интегрирует знания в генерацию.
Ключевая идея — совместное обучение агента-поисковика и генератора через DPO: генератор учится усваивать то, что можно выучить, а агент — искать только то, что выучить нельзя. Граница между ними динамическая и специфична для каждой модели.
https://arxiv.org/abs/2607.05382
Современные генераторы изображений отлично рисуют, но плохо знают мир: свежие персонажи, нишевые символы, исторические артефакты — всё это за пределами их обучающей выборки. Авторы из TIGER-Lab собрали 20к реальных промптов с production-платформ и обнаружили: топовые open-source генераторы набирают лишь 21–28 из 100 на их бенчмарке.
Казалось бы — добавь поиск и всё! Но наивный поиск ломает генерацию: лишние детали, стилистический шум, "copy effects". Авторы предлагают систему gate–filter–integrate: агент сначала решает, нужен ли поиск вообще, затем фильтрует шум из результатов, и только потом интегрирует знания в генерацию.
Ключевая идея — совместное обучение агента-поисковика и генератора через DPO: генератор учится усваивать то, что можно выучить, а агент — искать только то, что выучить нельзя. Граница между ними динамическая и специфична для каждой модели.
https://arxiv.org/abs/2607.05382
Zero RL на триллион параметров — и мозг модели начал работать сам по себе
Почти все исследования zero RL (обучение с подкреплением прямо с базовой модели, без SFT) ограничены небольшими моделями. inclusionAI решили проверить: что будет, если масштабировать до 1T параметров?
Результат: Ring-2.5-1T-Zero обучили через трёхступенчатый пайплайн — сначала RL для пробуждения рассуждений, затем self-distillation для сжатия CoT-трейсов, потом адаптивное обучение под разную глубину мышления. Никаких человеческих аннотаций.
Главный сюрприз — спонтанно возникшие когнитивные стратегии: структурированное форматирование, самопроверка, параллельное рассуждение, "context anxiety" (модель сама признаёт неопределённость). Никто это не программировал — появилось само.
Авторы также предложили новый фреймворк оценки качества CoT по трём осям: читаемость, воспроизводимость и эффективность — вместо привычной точности ответа.
Горький урок Саттона подтверждён ещё раз: масштаб бьёт инженерные эвристики.
Почти все исследования zero RL (обучение с подкреплением прямо с базовой модели, без SFT) ограничены небольшими моделями. inclusionAI решили проверить: что будет, если масштабировать до 1T параметров?
Результат: Ring-2.5-1T-Zero обучили через трёхступенчатый пайплайн — сначала RL для пробуждения рассуждений, затем self-distillation для сжатия CoT-трейсов, потом адаптивное обучение под разную глубину мышления. Никаких человеческих аннотаций.
Главный сюрприз — спонтанно возникшие когнитивные стратегии: структурированное форматирование, самопроверка, параллельное рассуждение, "context anxiety" (модель сама признаёт неопределённость). Никто это не программировал — появилось само.
Авторы также предложили новый фреймворк оценки качества CoT по трём осям: читаемость, воспроизводимость и эффективность — вместо привычной точности ответа.
Горький урок Саттона подтверждён ещё раз: масштаб бьёт инженерные эвристики.
🔥2
LLM запомнил факт — но не умеет им пользоваться. Почему?
Феномен "Knowing-Using Gap": модель после файнтюнинга отлично воспроизводит новый факт ("Сидней находится в Австралии"), но проваливается на многошаговых вопросах ("Какая столица страны, где Сидней?"). Авторы разобрались в механике этого провала.
Ключевой инструмент — self-patching: берём скрытое представление нужного токена из одного прогона и "вставляем" его в другой прогон на нужный слой. Сканируя все слои и шаги обучения, можно буквально видеть, где "застряло" знание и когда оно начинает участвовать в рассуждениях.
Гипотеза: знание есть в активациях, но не попадает в нужную цепочку вычислений (knowledge-circuit misalignment). Принудительная "переброска" представлений даёт немедленный прирост точности — даже после полной сходимости обучения. Простая эвристика без оракула восстанавливает 58–75% потенциального улучшения.
https://arxiv.org/abs/2607.08393
Феномен "Knowing-Using Gap": модель после файнтюнинга отлично воспроизводит новый факт ("Сидней находится в Австралии"), но проваливается на многошаговых вопросах ("Какая столица страны, где Сидней?"). Авторы разобрались в механике этого провала.
Ключевой инструмент — self-patching: берём скрытое представление нужного токена из одного прогона и "вставляем" его в другой прогон на нужный слой. Сканируя все слои и шаги обучения, можно буквально видеть, где "застряло" знание и когда оно начинает участвовать в рассуждениях.
Гипотеза: знание есть в активациях, но не попадает в нужную цепочку вычислений (knowledge-circuit misalignment). Принудительная "переброска" представлений даёт немедленный прирост точности — даже после полной сходимости обучения. Простая эвристика без оракула восстанавливает 58–75% потенциального улучшения.
https://arxiv.org/abs/2607.08393
OpenAI представила GPT-Red — автоматизированную систему красного тиминга на основе самоигры.
Суть простая: модель сама атакует себя, генерирует сложные сценарии и учится на них становиться устойчивее. Без участия человека на каждом шаге.
Что это даёт? Система находит уязвимости в безопасности, проблемы с выравниванием и слабые места к prompt injection — и всё это в автоматическом режиме. Раньше такую работу делали команды людей вручную, что дорого и медленно.
Для пользователей это значит: модели OpenAI будут лучше сопротивляться манипуляциям и джейлbreakам, а обновления безопасности станут выходить быстрее. GPT-Red — шаг к тому, чтобы AI сам следил за своей надёжностью.
https://openai.com/index/unlocking-self-improvement-gpt-red
Суть простая: модель сама атакует себя, генерирует сложные сценарии и учится на них становиться устойчивее. Без участия человека на каждом шаге.
Что это даёт? Система находит уязвимости в безопасности, проблемы с выравниванием и слабые места к prompt injection — и всё это в автоматическом режиме. Раньше такую работу делали команды людей вручную, что дорого и медленно.
Для пользователей это значит: модели OpenAI будут лучше сопротивляться манипуляциям и джейлbreakам, а обновления безопасности станут выходить быстрее. GPT-Red — шаг к тому, чтобы AI сам следил за своей надёжностью.
https://openai.com/index/unlocking-self-improvement-gpt-red
OpenAI
GPT-Red: Unlocking Self-Improvement for Robustness
Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
👍1
Meta AI представила Hierarchical Interest Representation — новую систему для оптимизации рекламы в глубокой воронке.
Что это такое: слой представлений на основе трансформеров и графового обучения, который связывает скрытые интересы пользователей с предложениями рекламодателей. Система обучена на миллиардах взаимодействий из реальных данных Meta.
Ключевые фишки: граф из пользователей, рекламодателей и продуктов обогащается мультимодальным контентом через LLM — текст, изображения, видео. Это помогает понять не только как пользователь взаимодействует с рекламой, но и что из себя представляет сам продукт.
Зачем это важно: реклама в глубокой воронке страдает от нехватки сигналов — мало кликов, мало покупок. Новая система извлекает устойчивые интересы даже из разреженных данных и работает с новыми, ранее невиданными объектами.
Система будет интегрирована в экосистему Meta: GEM, Andromeda и Adaptive Ranking Model. Для пользователей — потенциально более релевантная реклама, для бизнеса — лучшая конверсия.
https://engineering.fb.com/2026/07/15/ai-research/exploring-hierarchical-interest-representation-for-meta-ads-deep-funnel-optimization/
Что это такое: слой представлений на основе трансформеров и графового обучения, который связывает скрытые интересы пользователей с предложениями рекламодателей. Система обучена на миллиардах взаимодействий из реальных данных Meta.
Ключевые фишки: граф из пользователей, рекламодателей и продуктов обогащается мультимодальным контентом через LLM — текст, изображения, видео. Это помогает понять не только как пользователь взаимодействует с рекламой, но и что из себя представляет сам продукт.
Зачем это важно: реклама в глубокой воронке страдает от нехватки сигналов — мало кликов, мало покупок. Новая система извлекает устойчивые интересы даже из разреженных данных и работает с новыми, ранее невиданными объектами.
Система будет интегрирована в экосистему Meta: GEM, Andromeda и Adaptive Ranking Model. Для пользователей — потенциально более релевантная реклама, для бизнеса — лучшая конверсия.
https://engineering.fb.com/2026/07/15/ai-research/exploring-hierarchical-interest-representation-for-meta-ads-deep-funnel-optimization/
Engineering at Meta
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization
Hierarchical Interest Representation is a research area for Meta Ads. We’re exploring an upstream representation layer over the universe of Ads entities – users, advertisers, products, services – l…
🌚1
Nvidia Tech обновила DeepStream до версии 9.1 с двумя ключевыми фичами для видеоаналитики.
AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры.
Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D.
Версия также включает 13 агентных навыков, поддержку Claude Code и Codex для развёртывания пайплайнов через текстовые промпты, а также совместимость с NVIDIA JetPack 7.2 для edge-устройств Jetson.
Полезно для складской безопасности, ритейл-аналитики и умных зданий. Код открыт на GitHub.
https://developer.nvidia.com/blog/build-a-multi-camera-3d-tracking-application-with-nvidia-deepstream-9-1-skills/
AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры.
Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D.
Версия также включает 13 агентных навыков, поддержку Claude Code и Codex для развёртывания пайплайнов через текстовые промпты, а также совместимость с NVIDIA JetPack 7.2 для edge-устройств Jetson.
Полезно для складской безопасности, ритейл-аналитики и умных зданий. Код открыт на GitHub.
https://developer.nvidia.com/blog/build-a-multi-camera-3d-tracking-application-with-nvidia-deepstream-9-1-skills/
NVIDIA Technical Blog
Build a Multi-Camera 3D Tracking Application with NVIDIA DeepStream 9.1 Skills
Developers building video analytics applications across large spaces must track the same object as it moves between camera views. Single-camera 2D tracking lacks reliable depth information and…
👍1