Nvidia Tech запускает автономный RL-исследовательский воркфлоу
Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.
Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.
Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).
Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.
Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.
Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).
Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.
https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
NVIDIA Technical Blog
How to Run an Autoresearch Workflow with RL Agent Skills and NVIDIA NeMo
Coding AI agents are becoming practical operators for long-running machine learning (ML) workflows. They can inspect repositories, set up runtimes, resolve build issues, launch experiments…
Nvidia выпустила инструкцию по дообучению Cosmos 3 за один день
Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.
Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.
TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.
Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.
Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.
TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.
Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
NVIDIA Technical Blog
Post-Train NVIDIA Cosmos 3 in One Day Using Agent Skills
What if autonomous coding AI agents could push your vision reasoning models above 90% accuracy with almost no manual effort? When adapting vision reasoning models to production video tasks…
Apple ML представила PARE — фреймворк для оценки проактивных ИИ-ассистентов.
Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.
В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.
Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.
https://machinelearning.apple.com/research/proactive-agent-research-environment
Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.
В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.
Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.
https://machinelearning.apple.com/research/proactive-agent-research-environment
Apple Machine Learning Research
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
Proactive agents that anticipate user needs and autonomously execute tasks hold great promise as digital assistants, yet the lack of…
Поисковик для генератора картинок — когда нейросеть не знает, как выглядит талисман Экспо-2025
Современные генераторы изображений отлично рисуют, но плохо знают мир: свежие персонажи, нишевые символы, исторические артефакты — всё это за пределами их обучающей выборки. Авторы из TIGER-Lab собрали 20к реальных промптов с production-платформ и обнаружили: топовые open-source генераторы набирают лишь 21–28 из 100 на их бенчмарке.
Казалось бы — добавь поиск и всё! Но наивный поиск ломает генерацию: лишние детали, стилистический шум, "copy effects". Авторы предлагают систему gate–filter–integrate: агент сначала решает, нужен ли поиск вообще, затем фильтрует шум из результатов, и только потом интегрирует знания в генерацию.
Ключевая идея — совместное обучение агента-поисковика и генератора через DPO: генератор учится усваивать то, что можно выучить, а агент — искать только то, что выучить нельзя. Граница между ними динамическая и специфична для каждой модели.
https://arxiv.org/abs/2607.05382
Современные генераторы изображений отлично рисуют, но плохо знают мир: свежие персонажи, нишевые символы, исторические артефакты — всё это за пределами их обучающей выборки. Авторы из TIGER-Lab собрали 20к реальных промптов с production-платформ и обнаружили: топовые open-source генераторы набирают лишь 21–28 из 100 на их бенчмарке.
Казалось бы — добавь поиск и всё! Но наивный поиск ломает генерацию: лишние детали, стилистический шум, "copy effects". Авторы предлагают систему gate–filter–integrate: агент сначала решает, нужен ли поиск вообще, затем фильтрует шум из результатов, и только потом интегрирует знания в генерацию.
Ключевая идея — совместное обучение агента-поисковика и генератора через DPO: генератор учится усваивать то, что можно выучить, а агент — искать только то, что выучить нельзя. Граница между ними динамическая и специфична для каждой модели.
https://arxiv.org/abs/2607.05382
Zero RL на триллион параметров — и мозг модели начал работать сам по себе
Почти все исследования zero RL (обучение с подкреплением прямо с базовой модели, без SFT) ограничены небольшими моделями. inclusionAI решили проверить: что будет, если масштабировать до 1T параметров?
Результат: Ring-2.5-1T-Zero обучили через трёхступенчатый пайплайн — сначала RL для пробуждения рассуждений, затем self-distillation для сжатия CoT-трейсов, потом адаптивное обучение под разную глубину мышления. Никаких человеческих аннотаций.
Главный сюрприз — спонтанно возникшие когнитивные стратегии: структурированное форматирование, самопроверка, параллельное рассуждение, "context anxiety" (модель сама признаёт неопределённость). Никто это не программировал — появилось само.
Авторы также предложили новый фреймворк оценки качества CoT по трём осям: читаемость, воспроизводимость и эффективность — вместо привычной точности ответа.
Горький урок Саттона подтверждён ещё раз: масштаб бьёт инженерные эвристики.
Почти все исследования zero RL (обучение с подкреплением прямо с базовой модели, без SFT) ограничены небольшими моделями. inclusionAI решили проверить: что будет, если масштабировать до 1T параметров?
Результат: Ring-2.5-1T-Zero обучили через трёхступенчатый пайплайн — сначала RL для пробуждения рассуждений, затем self-distillation для сжатия CoT-трейсов, потом адаптивное обучение под разную глубину мышления. Никаких человеческих аннотаций.
Главный сюрприз — спонтанно возникшие когнитивные стратегии: структурированное форматирование, самопроверка, параллельное рассуждение, "context anxiety" (модель сама признаёт неопределённость). Никто это не программировал — появилось само.
Авторы также предложили новый фреймворк оценки качества CoT по трём осям: читаемость, воспроизводимость и эффективность — вместо привычной точности ответа.
Горький урок Саттона подтверждён ещё раз: масштаб бьёт инженерные эвристики.
🔥2
LLM запомнил факт — но не умеет им пользоваться. Почему?
Феномен "Knowing-Using Gap": модель после файнтюнинга отлично воспроизводит новый факт ("Сидней находится в Австралии"), но проваливается на многошаговых вопросах ("Какая столица страны, где Сидней?"). Авторы разобрались в механике этого провала.
Ключевой инструмент — self-patching: берём скрытое представление нужного токена из одного прогона и "вставляем" его в другой прогон на нужный слой. Сканируя все слои и шаги обучения, можно буквально видеть, где "застряло" знание и когда оно начинает участвовать в рассуждениях.
Гипотеза: знание есть в активациях, но не попадает в нужную цепочку вычислений (knowledge-circuit misalignment). Принудительная "переброска" представлений даёт немедленный прирост точности — даже после полной сходимости обучения. Простая эвристика без оракула восстанавливает 58–75% потенциального улучшения.
https://arxiv.org/abs/2607.08393
Феномен "Knowing-Using Gap": модель после файнтюнинга отлично воспроизводит новый факт ("Сидней находится в Австралии"), но проваливается на многошаговых вопросах ("Какая столица страны, где Сидней?"). Авторы разобрались в механике этого провала.
Ключевой инструмент — self-patching: берём скрытое представление нужного токена из одного прогона и "вставляем" его в другой прогон на нужный слой. Сканируя все слои и шаги обучения, можно буквально видеть, где "застряло" знание и когда оно начинает участвовать в рассуждениях.
Гипотеза: знание есть в активациях, но не попадает в нужную цепочку вычислений (knowledge-circuit misalignment). Принудительная "переброска" представлений даёт немедленный прирост точности — даже после полной сходимости обучения. Простая эвристика без оракула восстанавливает 58–75% потенциального улучшения.
https://arxiv.org/abs/2607.08393
OpenAI представила GPT-Red — автоматизированную систему красного тиминга на основе самоигры.
Суть простая: модель сама атакует себя, генерирует сложные сценарии и учится на них становиться устойчивее. Без участия человека на каждом шаге.
Что это даёт? Система находит уязвимости в безопасности, проблемы с выравниванием и слабые места к prompt injection — и всё это в автоматическом режиме. Раньше такую работу делали команды людей вручную, что дорого и медленно.
Для пользователей это значит: модели OpenAI будут лучше сопротивляться манипуляциям и джейлbreakам, а обновления безопасности станут выходить быстрее. GPT-Red — шаг к тому, чтобы AI сам следил за своей надёжностью.
https://openai.com/index/unlocking-self-improvement-gpt-red
Суть простая: модель сама атакует себя, генерирует сложные сценарии и учится на них становиться устойчивее. Без участия человека на каждом шаге.
Что это даёт? Система находит уязвимости в безопасности, проблемы с выравниванием и слабые места к prompt injection — и всё это в автоматическом режиме. Раньше такую работу делали команды людей вручную, что дорого и медленно.
Для пользователей это значит: модели OpenAI будут лучше сопротивляться манипуляциям и джейлbreakам, а обновления безопасности станут выходить быстрее. GPT-Red — шаг к тому, чтобы AI сам следил за своей надёжностью.
https://openai.com/index/unlocking-self-improvement-gpt-red
OpenAI
GPT-Red: Unlocking Self-Improvement for Robustness
Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
👍1
Meta AI представила Hierarchical Interest Representation — новую систему для оптимизации рекламы в глубокой воронке.
Что это такое: слой представлений на основе трансформеров и графового обучения, который связывает скрытые интересы пользователей с предложениями рекламодателей. Система обучена на миллиардах взаимодействий из реальных данных Meta.
Ключевые фишки: граф из пользователей, рекламодателей и продуктов обогащается мультимодальным контентом через LLM — текст, изображения, видео. Это помогает понять не только как пользователь взаимодействует с рекламой, но и что из себя представляет сам продукт.
Зачем это важно: реклама в глубокой воронке страдает от нехватки сигналов — мало кликов, мало покупок. Новая система извлекает устойчивые интересы даже из разреженных данных и работает с новыми, ранее невиданными объектами.
Система будет интегрирована в экосистему Meta: GEM, Andromeda и Adaptive Ranking Model. Для пользователей — потенциально более релевантная реклама, для бизнеса — лучшая конверсия.
https://engineering.fb.com/2026/07/15/ai-research/exploring-hierarchical-interest-representation-for-meta-ads-deep-funnel-optimization/
Что это такое: слой представлений на основе трансформеров и графового обучения, который связывает скрытые интересы пользователей с предложениями рекламодателей. Система обучена на миллиардах взаимодействий из реальных данных Meta.
Ключевые фишки: граф из пользователей, рекламодателей и продуктов обогащается мультимодальным контентом через LLM — текст, изображения, видео. Это помогает понять не только как пользователь взаимодействует с рекламой, но и что из себя представляет сам продукт.
Зачем это важно: реклама в глубокой воронке страдает от нехватки сигналов — мало кликов, мало покупок. Новая система извлекает устойчивые интересы даже из разреженных данных и работает с новыми, ранее невиданными объектами.
Система будет интегрирована в экосистему Meta: GEM, Andromeda и Adaptive Ranking Model. Для пользователей — потенциально более релевантная реклама, для бизнеса — лучшая конверсия.
https://engineering.fb.com/2026/07/15/ai-research/exploring-hierarchical-interest-representation-for-meta-ads-deep-funnel-optimization/
Engineering at Meta
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization
Hierarchical Interest Representation is a research area for Meta Ads. We’re exploring an upstream representation layer over the universe of Ads entities – users, advertisers, products, services – l…
🌚1
Nvidia Tech обновила DeepStream до версии 9.1 с двумя ключевыми фичами для видеоаналитики.
AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры.
Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D.
Версия также включает 13 агентных навыков, поддержку Claude Code и Codex для развёртывания пайплайнов через текстовые промпты, а также совместимость с NVIDIA JetPack 7.2 для edge-устройств Jetson.
Полезно для складской безопасности, ритейл-аналитики и умных зданий. Код открыт на GitHub.
https://developer.nvidia.com/blog/build-a-multi-camera-3d-tracking-application-with-nvidia-deepstream-9-1-skills/
AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры.
Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D.
Версия также включает 13 агентных навыков, поддержку Claude Code и Codex для развёртывания пайплайнов через текстовые промпты, а также совместимость с NVIDIA JetPack 7.2 для edge-устройств Jetson.
Полезно для складской безопасности, ритейл-аналитики и умных зданий. Код открыт на GitHub.
https://developer.nvidia.com/blog/build-a-multi-camera-3d-tracking-application-with-nvidia-deepstream-9-1-skills/
NVIDIA Technical Blog
Build a Multi-Camera 3D Tracking Application with NVIDIA DeepStream 9.1 Skills
Developers building video analytics applications across large spaces must track the same object as it moves between camera views. Single-camera 2D tracking lacks reliable depth information and…
👍1
Между pretraining и agent fine-tuning есть дыра — и её можно заполнить (by TIGER-Lab)
Когда обучают coding-агентов, берут базовую code LLM и сразу гонят agent-trajectory fine-tuning. Но между pretraining и post-training — структурный зазор: базовая модель не умеет рассуждать в стиле "контекст → действие → наблюдение → продолжение".
Авторы заметили: вызов функции — это ровно та же структура! Предвызывный код = история агента, сам вызов = действие, возвращаемое значение = наблюдение, код после = продолжение.
Решение: mid-training на function-aware FIM. Вместо случайных span'ов маскируются конкретные функции, отобранные по программному графу зависимостей с двойным критерием сложности и инферабельности. Внутрь FIM-спана встраивается CoT-рассуждение.
Результат: +2.8/+3.0 на SWE-Bench-Verified для 7B/14B, а в паре с SWE-Smith — вообще +5.3. Бонус: восстанавливает деградацию на LiveCodeBench (+11.1) и τ-bench, хотя корпус — чистый Python без tool-use данных.
Корпус (400K сэмплов, 2.6B токенов) открыт.
Когда обучают coding-агентов, берут базовую code LLM и сразу гонят agent-trajectory fine-tuning. Но между pretraining и post-training — структурный зазор: базовая модель не умеет рассуждать в стиле "контекст → действие → наблюдение → продолжение".
Авторы заметили: вызов функции — это ровно та же структура! Предвызывный код = история агента, сам вызов = действие, возвращаемое значение = наблюдение, код после = продолжение.
Решение: mid-training на function-aware FIM. Вместо случайных span'ов маскируются конкретные функции, отобранные по программному графу зависимостей с двойным критерием сложности и инферабельности. Внутрь FIM-спана встраивается CoT-рассуждение.
Результат: +2.8/+3.0 на SWE-Bench-Verified для 7B/14B, а в паре с SWE-Smith — вообще +5.3. Бонус: восстанавливает деградацию на LiveCodeBench (+11.1) и τ-bench, хотя корпус — чистый Python без tool-use данных.
Корпус (400K сэмплов, 2.6B токенов) открыт.
Текст и картинка рождаются вместе: SC-CMJP (by Google)
Обычные мультимодальные модели генерируют текст и изображение последовательно — сначала текст, потом картинка. Проблема: ошибки в тексте уже не исправить, когда рисуешь.
Google предлагает SC-CMJP — фреймворк, где текст и изображение генерируются параллельно и постоянно корректируют друг друга. Ключевая идея: скорость "раскрытия" токенов одной модальности зависит от уверенности другой через cross-modal attention. Если картинка не уверена в каком-то фрагменте — текст может "передумать" и замаскировать токен обратно.
Сэмплер CO2Jump работает на замороженной MDM без изменений архитектуры: один forward pass, два прыжка — Death (remask неуверенных токенов) и Birth (раскрыть уверенные). Проверено на редактировании изображений и визуальных головоломках (лабиринты, нонограммы).
https://arxiv.org/abs/2607.13188
Обычные мультимодальные модели генерируют текст и изображение последовательно — сначала текст, потом картинка. Проблема: ошибки в тексте уже не исправить, когда рисуешь.
Google предлагает SC-CMJP — фреймворк, где текст и изображение генерируются параллельно и постоянно корректируют друг друга. Ключевая идея: скорость "раскрытия" токенов одной модальности зависит от уверенности другой через cross-modal attention. Если картинка не уверена в каком-то фрагменте — текст может "передумать" и замаскировать токен обратно.
Сэмплер CO2Jump работает на замороженной MDM без изменений архитектуры: один forward pass, два прыжка — Death (remask неуверенных токенов) и Birth (раскрыть уверенные). Проверено на редактировании изображений и визуальных головоломках (лабиринты, нонограммы).
https://arxiv.org/abs/2607.13188
👍1
Как 0.58% параметров сохраняют всю мощь RL-обучения?
RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции).
Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели.
Результат — компактная "матрица перекоммутации" M, где внедиагональные элементы отвечают за настоящее рассуждение (многопремиссный вывод), а мусор за пределами подпространства выбрасывается.
Что даёт SAR:
- сохраняет Pass@1 при использовании лишь ~0.58% параметров
- улучшает Pass@k (больше разнообразия при сэмплинге)
- снижает конфликты доменов в Mix-RL
- при мёрдже экспертов превосходит каждого из них по отдельности
https://arxiv.org/abs/2607.03065
RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции).
Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели.
Результат — компактная "матрица перекоммутации" M, где внедиагональные элементы отвечают за настоящее рассуждение (многопремиссный вывод), а мусор за пределами подпространства выбрасывается.
Что даёт SAR:
- сохраняет Pass@1 при использовании лишь ~0.58% параметров
- улучшает Pass@k (больше разнообразия при сэмплинге)
- снижает конфликты доменов в Mix-RL
- при мёрдже экспертов превосходит каждого из них по отдельности
https://arxiv.org/abs/2607.03065
Nvidia представила NemoClaw — инструмент для интеграции видеоаналитики с корпоративными системами.
Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного.
Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с временными метками и рекомендациями.
Для кого важно: предприятия с большими объёмами видеоданных — склады, производства, ритейл. Вместо просмотра записей вручную система сама фиксирует нарушения и ставит задачи ответственным.
Nvidia позиционирует это как переход от вопроса «что показывает видео?» к «что нужно сделать и как это автоматизировать».
https://developer.nvidia.com/blog/integrating-context-aware-video-ai-agents-into-enterprise-workflows/
Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного.
Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с временными метками и рекомендациями.
Для кого важно: предприятия с большими объёмами видеоданных — склады, производства, ритейл. Вместо просмотра записей вручную система сама фиксирует нарушения и ставит задачи ответственным.
Nvidia позиционирует это как переход от вопроса «что показывает видео?» к «что нужно сделать и как это автоматизировать».
https://developer.nvidia.com/blog/integrating-context-aware-video-ai-agents-into-enterprise-workflows/
NVIDIA Technical Blog
Integrating Context-Aware Video AI Agents Into Enterprise Workflows
A video analytics AI agent that can perceive, reason, and act based on massive amounts of video footage must be integrated with existing workflows and applications to be useful.
Nvidia представила BlueField-4 — новое поколение инфраструктурных процессоров для агентного ИИ.
Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU.
BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных.
Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на борту, PCIe Gen6, в 6 раз больше вычислительной мощности по сравнению с BlueField-3.
Для пользователей это означает меньшую стоимость токена, более предсказуемую задержку и лучшую изоляцию между арендаторами в облаке.
https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU.
BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных.
Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на борту, PCIe Gen6, в 6 раз больше вычислительной мощности по сравнению с BlueField-3.
Для пользователей это означает меньшую стоимость токена, более предсказуемую задержку и лучшую изоляцию между арендаторами в облаке.
https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
NVIDIA Technical Blog
Scaling Agentic AI Factories Through Extreme Co-Design with NVIDIA BlueField
Agentic AI changes the infrastructure pattern for AI factories. One request can trigger many model calls, tool calls, memory lookups, policy checks, storage accesses, and network transfers before a…
Nvidia Tech запускает nanousd-labs — инструмент для быстрой генерации лёгких USD-рантаймов с помощью ИИ-агентов.
Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту.
Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями.
Результат — лёгкий C ABI-слой, который встраивается в существующие OpenUSD-стеки и позволяет менять бэкенды без изменения API.
Проект опубликован в рамках Nvidia Omniverse Labs как открытый эксперимент.
https://developer.nvidia.com/blog/develop-lightweight-usd-runtimes-faster-with-ai-agents/
Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту.
Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями.
Результат — лёгкий C ABI-слой, который встраивается в существующие OpenUSD-стеки и позволяет менять бэкенды без изменения API.
Проект опубликован в рамках Nvidia Omniverse Labs как открытый эксперимент.
https://developer.nvidia.com/blog/develop-lightweight-usd-runtimes-faster-with-ai-agents/
NVIDIA Technical Blog
Develop Lightweight USD Runtimes Faster with AI Agents
OpenUSD is an open, extensible framework that provides a common scene description language for physical AI. It enables teams to bring CAD data, simulation assets, and real-world telemetry into a…
RL на 2M+ токенах с фиксированным бюджетом GPU — это возможно?
Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет.
Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно.
Реализовано для двух архитектур: Qwen (гибрид рекуррентных и attention слоёв) на 8 GPU H20 — контекст до 4.25M токенов, и GLM с MoE на 32 GPU H20 — с выгрузкой состояния промпта на CPU и пословным чекпоинтингом слоёв.
Честный момент: авторы прямо указывают, что распределённые градиенты пока не полностью корректны — это execution probe, а не финальный обученный агент.
https://arxiv.org/abs/2607.14952
Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет.
Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно.
Реализовано для двух архитектур: Qwen (гибрид рекуррентных и attention слоёв) на 8 GPU H20 — контекст до 4.25M токенов, и GLM с MoE на 32 GPU H20 — с выгрузкой состояния промпта на CPU и пословным чекпоинтингом слоёв.
Честный момент: авторы прямо указывают, что распределённые градиенты пока не полностью корректны — это execution probe, а не финальный обученный агент.
https://arxiv.org/abs/2607.14952
UniVR: модель, которая думает картинками, а не словами (by ByteDance)
Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?
Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).
Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.
Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.
https://arxiv.org/abs/2607.12800
Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?
Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).
Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.
Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.
https://arxiv.org/abs/2607.12800
Робот, который не просто думает словами, но и «воображает» картинку будущего
Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.
RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.
Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.
Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.
RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.
Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.
Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека.
Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.
Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.
Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.
После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.
https://deepmind.google/blog/our-approach-to-bioresilience/
Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.
Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.
Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.
После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.
https://deepmind.google/blog/our-approach-to-bioresilience/
Google DeepMind
Google DeepMind and Isomorphic Labs approach to bioresilience
Google DeepMind and Isomorphic Labs approach to bioresilience, using AI models to support prevention, detection and response.
Nvidia Tech — ускорение криптографии в CUDA 13.3
В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.
Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография
Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.
https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.
Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография
Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.
https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
NVIDIA Technical Blog
Building Faster Cryptography with Carryless Multiplication in NVIDIA CUDA 13.3
For over fifteen years, x86 CPUs have shipped with a dedicated hardware instruction for carryless multiplication. It’s a small but stubborn primitive that sits underneath authenticated encryption…
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей.
Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.
Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.
Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.
Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.
https://machinelearning.apple.com/research/simple-self-distillation
Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.
Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.
Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.
Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.
https://machinelearning.apple.com/research/simple-self-distillation
Apple Machine Learning Research
Embarrassingly Simple Self-Distillation Improves Code Generation
Can a large language model (LLM) improve at code generation using only its own raw outputs, without a verifier, a teacher model, or…
👍1