Хочешь научить робота новым трюкам без миллионов размеченных демонстраций? Смотри видео!
ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.
Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!
Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.
https://arxiv.org/abs/2609.00188
ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.
Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!
Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.
https://arxiv.org/abs/2609.00188
Evolution Strategies против GRPO: кто лучше для дообучения LLM на рассуждениях?
GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?
ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.
Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.
Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.
https://arxiv.org/abs/2608.27351
GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?
ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.
Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.
Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.
https://arxiv.org/abs/2608.27351
Google Gemini запустил агентное понимание видео — и это серьёзный апгрейд для разработчиков.
Новая функция доступна в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо того чтобы тупо обрабатывать видео кадр за кадром с фиксированной скоростью, модель теперь сама решает — что смотреть, с какой скоростью и через какую модальность (кадры, аудио или транскрипт).
Результат: потребление токенов падает до 88%, стоимость анализа — до 66%, а точность растёт на 7%. Особенно ощутимо на длинных видео — лекциях, записях совещаний, многочасовых трансляциях.
Что умеет: точный поиск момента с точностью до секунды, поиск иголки в стоге сена в многочасовых видео, детекция аномалий и подсчёт объектов.
Включается одной строкой в API: processing: "agentic". Доступно в Google AI Studio уже сейчас, без доплаты.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
Новая функция доступна в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо того чтобы тупо обрабатывать видео кадр за кадром с фиксированной скоростью, модель теперь сама решает — что смотреть, с какой скоростью и через какую модальность (кадры, аудио или транскрипт).
Результат: потребление токенов падает до 88%, стоимость анализа — до 66%, а точность растёт на 7%. Особенно ощутимо на длинных видео — лекциях, записях совещаний, многочасовых трансляциях.
Что умеет: точный поиск момента с точностью до секунды, поиск иголки в стоге сена в многочасовых видео, детекция аномалий и подсчёт объектов.
Включается одной строкой в API: processing: "agentic". Доступно в Google AI Studio уже сейчас, без доплаты.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
Google
Introducing agentic video understanding with Gemini
We’re launching agentic video understanding across our latest Gemini models for improved accuracy and lower costs and token usage.
Nvidia Tech совместно с CrowdStrike создали замкнутую систему кибербезопасности на базе моделей Nemotron, где ИИ-агенты атакуют и защищают инфраструктуру в автоматическом режиме без участия человека.
Как это работает: красный агент запускает атаку, синий анализирует телеметрию и генерирует правила обнаружения, затем красный адаптирует тактику — и цикл повторяется на машинной скорости.
Результаты впечатляют: оптимизированная связка Nemotron 3 Ultra + дообученный Nemotron 3 Super показала 41,9% среднего обнаружения атак — это в 2,5 раза лучше базовой конфигурации. При тестировании на 8 новых атаках открытые модели обобщили 45% обнаружений против 29% у проприетарных систем.
Почему важно: традиционные red/blue team учения занимают недели из-за ручных итераций. Здесь весь цикл работает автономно, а стоимость — на 99% ниже топовых проприетарных моделей по данным CrowdStrike.
https://developer.nvidia.com/blog/building-an-adaptive-agentic-cybersecurity-system-with-nvidia-nemotron/
Как это работает: красный агент запускает атаку, синий анализирует телеметрию и генерирует правила обнаружения, затем красный адаптирует тактику — и цикл повторяется на машинной скорости.
Результаты впечатляют: оптимизированная связка Nemotron 3 Ultra + дообученный Nemotron 3 Super показала 41,9% среднего обнаружения атак — это в 2,5 раза лучше базовой конфигурации. При тестировании на 8 новых атаках открытые модели обобщили 45% обнаружений против 29% у проприетарных систем.
Почему важно: традиционные red/blue team учения занимают недели из-за ручных итераций. Здесь весь цикл работает автономно, а стоимость — на 99% ниже топовых проприетарных моделей по данным CrowdStrike.
https://developer.nvidia.com/blog/building-an-adaptive-agentic-cybersecurity-system-with-nvidia-nemotron/
NVIDIA Technical Blog
Building an Adaptive Agentic Cybersecurity System with NVIDIA Nemotron
AI is changing the pace of cybersecurity. Agentic systems can coordinate work and pursue complex objectives over long horizons. Security teams are beginning to apply agents across security operations…
Хочешь обучить видео-модель мира на часы вперёд, потренировав её лишь на 5-секундных клипах?
SolarWM — полностью открытый фреймворк для обучения интерактивных video world models. Авторы собрали 1.43 млн клипов из 10 датасетов (реальный мир, синтетика, игры) и привели их к единому формату с согласованной геометрией камеры, семантикой и метаданными качества.
Главная идея: разделить тяжёлую предобработку данных и конструирование обучающей смеси. Хочешь поменять фильтрацию или веса источников — просто меняешь конфиг, не перезапуская всё с нуля.
Обучение — три стадии: bidirectional training → autoregressive адаптация → distribution matching distillation. Причём большую часть оптимизации нужно делать на первом этапе, остальные сходятся быстро.
Результат: семейство моделей от 5B до 33B параметров (WAN, LTX, MiniMax бэкбоны), которые после обучения на 5-секундных видео генерируют роллауты длиной от минут до часов без дополнительного файнтюнинга.
https://arxiv.org/abs/2609.02886
SolarWM — полностью открытый фреймворк для обучения интерактивных video world models. Авторы собрали 1.43 млн клипов из 10 датасетов (реальный мир, синтетика, игры) и привели их к единому формату с согласованной геометрией камеры, семантикой и метаданными качества.
Главная идея: разделить тяжёлую предобработку данных и конструирование обучающей смеси. Хочешь поменять фильтрацию или веса источников — просто меняешь конфиг, не перезапуская всё с нуля.
Обучение — три стадии: bidirectional training → autoregressive адаптация → distribution matching distillation. Причём большую часть оптимизации нужно делать на первом этапе, остальные сходятся быстро.
Результат: семейство моделей от 5B до 33B параметров (WAN, LTX, MiniMax бэкбоны), которые после обучения на 5-секундных видео генерируют роллауты длиной от минут до часов без дополнительного файнтюнинга.
https://arxiv.org/abs/2609.02886
SMELT: как получить бесплатные вычисления в трансформере (by ByteDance)
Что если прогнать часть слоёв трансформера дважды, не платя за это дополнительными параметрами? Идея looped transformers известна давно, но всегда был подвох: extra FLOPs никто не контролировал.
SMELT закрывает этот вопрос честно — фиксируют сразу три бюджета: FLOPs, параметры и KV-кэш. Трюк возможен благодаря MoE: средние 50% слоёв прогоняются дважды, скрытое измерение сужается, а потерянную ёмкость восстанавливают добавлением экспертов.
Результат: на 1021 FLOPs SMELT достигает того же лосса на 14.7% дешевле. Выигрыш растёт со scale. Особенно хорошо работает на коде и задачах in-context learning — второй проход по слоям усиливает первый, а не перезаписывает его.
https://arxiv.org/abs/2609.01343
Что если прогнать часть слоёв трансформера дважды, не платя за это дополнительными параметрами? Идея looped transformers известна давно, но всегда был подвох: extra FLOPs никто не контролировал.
SMELT закрывает этот вопрос честно — фиксируют сразу три бюджета: FLOPs, параметры и KV-кэш. Трюк возможен благодаря MoE: средние 50% слоёв прогоняются дважды, скрытое измерение сужается, а потерянную ёмкость восстанавливают добавлением экспертов.
Результат: на 1021 FLOPs SMELT достигает того же лосса на 14.7% дешевле. Выигрыш растёт со scale. Особенно хорошо работает на коде и задачах in-context learning — второй проход по слоям усиливает первый, а не перезаписывает его.
https://arxiv.org/abs/2609.01343
WikiSkill: агент, который учится как Википедия
Обычные AI-агенты накапливают опыт в параметрах модели или разрозненных логах. WikiSkill предлагает другой путь: между сырыми трейсами выполнения и процедурными инструкциями (skills) добавляется отдельный слой — постоянная база знаний в духе вики.
Архитектура трёхуровневая: Raw Layer (неизменяемые трейсы), Wiki Layer (структурированные паттерны и история эволюции), Skill Layer (процедурные инструкции). На каждой итерации Wiki Maintainer анализирует трейсы и обновляет вики, Skill Proposer предлагает улучшения навыков, а Gating механизм откатывает плохие обновления. Вики при этом никогда не сбрасывается.
Результаты впечатляют: Qwen-3.5-9B со скиллами WikiSkill бьёт Qwen-3.6-27B без скиллов (47.4% vs 39.4%). А скиллы, выученные большой моделью, переносятся на маленькую — и та работает лучше, чем со своими собственными скиллами.
https://arxiv.org/abs/2608.27454
Обычные AI-агенты накапливают опыт в параметрах модели или разрозненных логах. WikiSkill предлагает другой путь: между сырыми трейсами выполнения и процедурными инструкциями (skills) добавляется отдельный слой — постоянная база знаний в духе вики.
Архитектура трёхуровневая: Raw Layer (неизменяемые трейсы), Wiki Layer (структурированные паттерны и история эволюции), Skill Layer (процедурные инструкции). На каждой итерации Wiki Maintainer анализирует трейсы и обновляет вики, Skill Proposer предлагает улучшения навыков, а Gating механизм откатывает плохие обновления. Вики при этом никогда не сбрасывается.
Результаты впечатляют: Qwen-3.5-9B со скиллами WikiSkill бьёт Qwen-3.6-27B без скиллов (47.4% vs 39.4%). А скиллы, выученные большой моделью, переносятся на маленькую — и та работает лучше, чем со своими собственными скиллами.
https://arxiv.org/abs/2608.27454
Google DeepMind представила Gemini 3.8 Flash и 3.8 Flash Cyber — уже третий релиз Flash за шесть недель.
Gemini 3.8 Flash — новый флагман для агентных задач и сложного кода. На бенчмарке DeepSWE он обходит большинство более крупных и дорогих моделей, при этом сохраняет цену 3.7 Flash: $0,75 за млн входящих токенов. Модель работает усерднее — делает больше шагов рассуждения и итеративно вызывает инструменты.
Gemini 3.8 Flash Cyber заточен под кибербезопасность: находит уязвимости в коде на 20 языках программирования с точностью выше 70%, патчит баги на уровне лучших frontier-моделей, но дешевле. Chrome Security Team получила в 2,6 раза больше корректных патчей, чем от коммерческих аналогов. Доступ — только через программу Fairwind для доверенных организаций.
Оба варианта уже доступны через Google AI Studio, Gemini API и приложение Gemini.
https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/
Gemini 3.8 Flash — новый флагман для агентных задач и сложного кода. На бенчмарке DeepSWE он обходит большинство более крупных и дорогих моделей, при этом сохраняет цену 3.7 Flash: $0,75 за млн входящих токенов. Модель работает усерднее — делает больше шагов рассуждения и итеративно вызывает инструменты.
Gemini 3.8 Flash Cyber заточен под кибербезопасность: находит уязвимости в коде на 20 языках программирования с точностью выше 70%, патчит баги на уровне лучших frontier-моделей, но дешевле. Chrome Security Team получила в 2,6 раза больше корректных патчей, чем от коммерческих аналогов. Доступ — только через программу Fairwind для доверенных организаций.
Оба варианта уже доступны через Google AI Studio, Gemini API и приложение Gemini.
https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/
Google
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Gemini 3.8 Flash and 3.8 Flash Cyber deliver next-generation intelligence for agentic workflows and cybersecurity.
Meta AI разработала корпоративный "второй мозг" — AI-агент, который накапливает экспертные знания организации и делает их доступными для всех сотрудников.
Главная идея: большинство ценных знаний живёт в головах специалистов, а не в документах. Агент меняет это — он структурирует, как именно эксперты рассуждают, а не просто хранит факты.
Что внутри: система из 200+ файлов с позициями компании, глоссариями и логикой принятия решений. Плюс — петля самообучения: когда эксперт исправляет агента, правка автоматически проходит тесты и навсегда встраивается в базу знаний. Без переобучения модели.
Зачем это важно: эксперты в Meta теперь тратят меньше времени на рутинные вопросы и больше — на действительно сложные задачи. Паттерн универсален: compliance, финансы, безопасность, инженерия — любая область с накопленной экспертизой.
По сути, Meta создала способ превратить уходящих сотрудников и их опыт в постоянный актив компании.
https://engineering.fb.com/2026/09/02/ml-applications/organizational-second-brain-ai-learns-from-experts/
Главная идея: большинство ценных знаний живёт в головах специалистов, а не в документах. Агент меняет это — он структурирует, как именно эксперты рассуждают, а не просто хранит факты.
Что внутри: система из 200+ файлов с позициями компании, глоссариями и логикой принятия решений. Плюс — петля самообучения: когда эксперт исправляет агента, правка автоматически проходит тесты и навсегда встраивается в базу знаний. Без переобучения модели.
Зачем это важно: эксперты в Meta теперь тратят меньше времени на рутинные вопросы и больше — на действительно сложные задачи. Паттерн универсален: compliance, финансы, безопасность, инженерия — любая область с накопленной экспертизой.
По сути, Meta создала способ превратить уходящих сотрудников и их опыт в постоянный актив компании.
https://engineering.fb.com/2026/09/02/ml-applications/organizational-second-brain-ai-learns-from-experts/
Engineering at Meta
An Organizational Second Brain: Building an AI That Learns From Experts
We’ve built an AI agent that acts as a secondary expert for a given domain, making deep specialist knowledge readily available and preserved for anyone in an organization to access, share, and buil…
🔥1
Nvidia Tech обновила CUDA-инструментарий и опубликовала подробный гайд по оптимизации GPU-кода.
Разработчики показали, как за шесть шагов ускорить типичный пайплайн обработки изображений в 300 раз — с 6,8 секунд до 23 миллисекунд.
Что конкретно даёт прирост: замена ручных ядер на библиотеку CUB ускоряет вычисление медианы в 2717 раз. Pooled-буферы cuda::device_buffer сокращают накладные расходы на аллокацию памяти вдвое. Pinned-память для хоста ускоряет передачу данных CPU→GPU в 10 раз. Асинхронные потоки на каждый OpenMP-поток перекрывают вычисления и передачи данных.
Почему это важно: современные AI-модели и научные симуляции упираются именно в эффективность GPU-кода. Теперь у разработчиков есть пошаговый рецепт с конкретными цифрами и готовыми примерами на Google Colab.
https://developer.nvidia.com/blog/the-modern-cuda-toolbox-in-practice-a-step-by-step-optimization-walkthrough/
Разработчики показали, как за шесть шагов ускорить типичный пайплайн обработки изображений в 300 раз — с 6,8 секунд до 23 миллисекунд.
Что конкретно даёт прирост: замена ручных ядер на библиотеку CUB ускоряет вычисление медианы в 2717 раз. Pooled-буферы cuda::device_buffer сокращают накладные расходы на аллокацию памяти вдвое. Pinned-память для хоста ускоряет передачу данных CPU→GPU в 10 раз. Асинхронные потоки на каждый OpenMP-поток перекрывают вычисления и передачи данных.
Почему это важно: современные AI-модели и научные симуляции упираются именно в эффективность GPU-кода. Теперь у разработчиков есть пошаговый рецепт с конкретными цифрами и готовыми примерами на Google Colab.
https://developer.nvidia.com/blog/the-modern-cuda-toolbox-in-practice-a-step-by-step-optimization-walkthrough/
NVIDIA Technical Blog
The Modern CUDA Toolbox in Practice: A Step-by-Step Optimization Walkthrough
NVIDIA CUDA remains the foundation of GPU-accelerated computing, powering everything from scientific simulations to large-scale AI training. But writing correct, maintainable, and performant CUDA code…
Как научить AI-агента делать ML-исследования, не тратя бюджет на пробы и ошибки? (by BAAI)
Авторы заметили: у автономных research-агентов есть модель и оркестратор, но нет третьего слоя — операционных знаний. Это разница между "знать про метод" и "уметь его запустить": какой API, какой конфиг, какие подводные камни.
Решение — система DisCo. Она берёт GitHub-репозитории и статьи, и автоматически дистиллирует их в "скиллы": компактные SKILL.md файлы с описанием что делать, когда применять и как использовать. Скилл верифицируется перед добавлением в библиотеку.
Результат — AREX-Skill Library: 5000+ скиллов из 1000 ML-репозиториев. Агент с этой библиотекой показал +134% на MLE-bench, +34% на PaperBench при том же backbone (GPT-5.5) и том же бюджете выполнения.
https://arxiv.org/abs/2609.02749
Авторы заметили: у автономных research-агентов есть модель и оркестратор, но нет третьего слоя — операционных знаний. Это разница между "знать про метод" и "уметь его запустить": какой API, какой конфиг, какие подводные камни.
Решение — система DisCo. Она берёт GitHub-репозитории и статьи, и автоматически дистиллирует их в "скиллы": компактные SKILL.md файлы с описанием что делать, когда применять и как использовать. Скилл верифицируется перед добавлением в библиотеку.
Результат — AREX-Skill Library: 5000+ скиллов из 1000 ML-репозиториев. Агент с этой библиотекой показал +134% на MLE-bench, +34% на PaperBench при том же backbone (GPT-5.5) и том же бюджете выполнения.
https://arxiv.org/abs/2609.02749
Random Attention: зачем вообще считать важность токенов? (by Salesforce AI)
KV cache у reasoning-моделей растёт на десятки тысяч токенов. Все методы сжатия соревнуются в том, какой токен "важнее" — накопленное внимание, норма значений, позиционная статистика...
Авторы спрашивают: а что если просто выкидывать случайно?
Random Attention: защищаем промпт целиком, остальное — равномерно случайная выборка, независимо в каждой голове. Никакого скоринга вообще.
Результат: на 4× сжатии точность не хуже лучших конкурентов, а throughput на 32–43% выше (нет прохода скоринга).
Почему это работает? Два механизма: 1) reasoning-трасса сама себя защищает — модель переформулирует то, что ещё нужно; 2) каждая голова хранит свою копию токена, случайная выборка сохраняет достаточно копий нужного факта.
Вывод: сигнал отбора почти ничего не даёт сверх случайного. Важно что защищать, а не как ранжировать остальное.
https://arxiv.org/abs/2609.03430
KV cache у reasoning-моделей растёт на десятки тысяч токенов. Все методы сжатия соревнуются в том, какой токен "важнее" — накопленное внимание, норма значений, позиционная статистика...
Авторы спрашивают: а что если просто выкидывать случайно?
Random Attention: защищаем промпт целиком, остальное — равномерно случайная выборка, независимо в каждой голове. Никакого скоринга вообще.
Результат: на 4× сжатии точность не хуже лучших конкурентов, а throughput на 32–43% выше (нет прохода скоринга).
Почему это работает? Два механизма: 1) reasoning-трасса сама себя защищает — модель переформулирует то, что ещё нужно; 2) каждая голова хранит свою копию токена, случайная выборка сохраняет достаточно копий нужного факта.
Вывод: сигнал отбора почти ничего не даёт сверх случайного. Важно что защищать, а не как ранжировать остальное.
https://arxiv.org/abs/2609.03430
Гибридная LLM: зачем защищать то, что и так безопасно?
В гибридной Qwen3.8-27B 48 из 64 слоёв — это Gated DeltaNet (рекуррентные слои), а не обычный attention. Все публичные 4-битные квантизации держат гейты GDN в 8-16 бит, считая их "хрупкими": ошибка в рекуррентном состоянии накапливается через тысячи токенов. Авторы из Minima AI показали, что интуиция неверна.
Они заквантизировали все 496 линейных слоёв модели в NVFP4 W4A4, включая гейты — и точность не упала. Почему? Цепочка из четырёх причин: блочное масштабирование NVFP4 изолирует выбросы, нелинейности в гейтах (exp + softplus) сжимают ошибку, дельта-правило активно стирает ошибки состояния, а длинный контекст дополнительно "размывает" остаточный gap.
Бонус: модель на 2.9× меньше по VRAM, на 14-19% быстрее prefill — при том же качестве на бенчмарках.
https://arxiv.org/abs/2609.04098
В гибридной Qwen3.8-27B 48 из 64 слоёв — это Gated DeltaNet (рекуррентные слои), а не обычный attention. Все публичные 4-битные квантизации держат гейты GDN в 8-16 бит, считая их "хрупкими": ошибка в рекуррентном состоянии накапливается через тысячи токенов. Авторы из Minima AI показали, что интуиция неверна.
Они заквантизировали все 496 линейных слоёв модели в NVFP4 W4A4, включая гейты — и точность не упала. Почему? Цепочка из четырёх причин: блочное масштабирование NVFP4 изолирует выбросы, нелинейности в гейтах (exp + softplus) сжимают ошибку, дельта-правило активно стирает ошибки состояния, а длинный контекст дополнительно "размывает" остаточный gap.
Бонус: модель на 2.9× меньше по VRAM, на 14-19% быстрее prefill — при том же качестве на бенчмарках.
https://arxiv.org/abs/2609.04098
Google DeepMind представил WeatherNext 3 — самую точную AI-модель прогноза погоды на сегодняшний день.
Что нового: модель обновляет прогнозы каждый час, используя данные со спутников в реальном времени. Разрешение выросло в 5 раз по сравнению с предыдущей версией — до 5 км. Добавили точные прогнозы осадков и специальные переменные для солнечной и ветровой энергетики (скорость ветра на высоте турбин, уровень солнечного излучения).
Почему важно: прежние модели работали с шестичасовой задержкой и размытыми предсказаниями. WeatherNext 3 учится напрямую на реальных данных, а не на физических симуляциях — это меняет точность прогнозов для быстро меняющейся погоды.
Для пользователей: улучшенные прогнозы уже доступны в Google Search, Maps и Gemini. Разработчики могут подключить данные через Google Cloud.
https://deepmind.google/blog/introducing-weathernext-3-our-most-advanced-and-accurate-global-weather-ai-model/
Что нового: модель обновляет прогнозы каждый час, используя данные со спутников в реальном времени. Разрешение выросло в 5 раз по сравнению с предыдущей версией — до 5 км. Добавили точные прогнозы осадков и специальные переменные для солнечной и ветровой энергетики (скорость ветра на высоте турбин, уровень солнечного излучения).
Почему важно: прежние модели работали с шестичасовой задержкой и размытыми предсказаниями. WeatherNext 3 учится напрямую на реальных данных, а не на физических симуляциях — это меняет точность прогнозов для быстро меняющейся погоды.
Для пользователей: улучшенные прогнозы уже доступны в Google Search, Maps и Gemini. Разработчики могут подключить данные через Google Cloud.
https://deepmind.google/blog/introducing-weathernext-3-our-most-advanced-and-accurate-global-weather-ai-model/
Google
Introducing WeatherNext 3, our most advanced and accurate global weather AI model
WeatherNext 3, our most advanced global weather AI model, is now in Search, Gemini, Maps, Google Maps Platform, and Cloud.
Nvidia Tech ускорила вывод LLM через speculative decoding
Nvidia опубликовала третью часть серии по co-design AI-моделей — на этот раз про speculative decoding. Суть техники: маленькая черновая модель предлагает несколько токенов, большая целевая модель проверяет их параллельно за один проход. Итог — меньше итераций, выше скорость, качество не страдает.
Команда сформулировала 5 практических правил выбора длины черновика. Например, оптимальная длина при доминировании attention-слоёв считается по формуле 128/G − 1, где G — число query-голов на один KV-голову.
Для бенчмаркинга выпущен SPEED-Bench с реалистичными задачами (код, саммаризация). Готовые примеры обучения для EAGLE-3, DFlash и DSpark доступны в репозитории NVIDIA/Model-Optimizer.
Для разработчиков это конкретный инструментарий: меньше гадать с гиперпараметрами, больше опираться на измеримые метрики при деплое быстрых LLM.
https://developer.nvidia.com/blog/co-designing-ai-models-using-speculative-decoding-for-faster-llm-inference/
Nvidia опубликовала третью часть серии по co-design AI-моделей — на этот раз про speculative decoding. Суть техники: маленькая черновая модель предлагает несколько токенов, большая целевая модель проверяет их параллельно за один проход. Итог — меньше итераций, выше скорость, качество не страдает.
Команда сформулировала 5 практических правил выбора длины черновика. Например, оптимальная длина при доминировании attention-слоёв считается по формуле 128/G − 1, где G — число query-голов на один KV-голову.
Для бенчмаркинга выпущен SPEED-Bench с реалистичными задачами (код, саммаризация). Готовые примеры обучения для EAGLE-3, DFlash и DSpark доступны в репозитории NVIDIA/Model-Optimizer.
Для разработчиков это конкретный инструментарий: меньше гадать с гиперпараметрами, больше опираться на измеримые метрики при деплое быстрых LLM.
https://developer.nvidia.com/blog/co-designing-ai-models-using-speculative-decoding-for-faster-llm-inference/
NVIDIA Technical Blog
Co-Designing AI Models Using Speculative Decoding for Faster LLM Inference
This post is the third in a series on AI model co-design. It explores how to accelerate LLM inference while maintaining accuracy using speculative decoding and offers five guidelines for selecting…
Apple ML представила REFACTOR-VLA — систему, которая учит роботов переиспользовать навыки.
Проблема существующих VLA-моделей (OpenVLA, RT-2 и др.) — они «монолитны»: генерируют сырые команды без структуры, из-за чего плохо справляются с длинными многошаговыми задачами.
REFACTOR-VLA работает по принципу «сон/бодрствование»: в фазе сна система кластеризует фрагменты моторных программ через специальное ядро поведенческой эквивалентности (BEK), опираясь на латентную модель мира. В фазе бодрствования — генерирует структурированные программы-навыки и использует их для управления роботом.
Ключевые находки на бенчмарке LIBERO: просто увеличить модель мира (с 188М до 430М параметров) — не помогает, а добавление InfoNCE-лосса резко улучшает качество кластеризации навыков (NMI до 0.915 на Goal suite).
Работа опубликована в сентябре 2026 года.
https://machinelearning.apple.com/research/refactor-vla-motor-programs
Проблема существующих VLA-моделей (OpenVLA, RT-2 и др.) — они «монолитны»: генерируют сырые команды без структуры, из-за чего плохо справляются с длинными многошаговыми задачами.
REFACTOR-VLA работает по принципу «сон/бодрствование»: в фазе сна система кластеризует фрагменты моторных программ через специальное ядро поведенческой эквивалентности (BEK), опираясь на латентную модель мира. В фазе бодрствования — генерирует структурированные программы-навыки и использует их для управления роботом.
Ключевые находки на бенчмарке LIBERO: просто увеличить модель мира (с 188М до 430М параметров) — не помогает, а добавление InfoNCE-лосса резко улучшает качество кластеризации навыков (NMI до 0.915 на Goal suite).
Работа опубликована в сентябре 2026 года.
https://machinelearning.apple.com/research/refactor-vla-motor-programs
Apple Machine Learning Research
REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
Most current vision-language-action (VLA) models—such as OpenVLA, π0, RT-2, and RDT-1B—are “monolithic.” This means they generate raw motor…
Terminal-Universe: как превратить логи агентов в среды для обучения (by Qwen/Alibaba)
Есть парадокс: агентных траекторий накопилось море, а реалистичных исполняемых сред для обучения — дефицит. Авторы предлагают инвертировать процесс: не среда → траектория, а траектория → среда.
Идея: в логах агента уже спрятана вся информация о рабочем пространстве. Read-вызовы показывают содержимое файлов, Write/Edit — что менялось. Значит, можно откатить правки агента и восстановить исходное состояние задачи!
Пайплайн Terminal-Universe:
1. Детерминированный replay файловых операций — получаем частичный workspace
2. Агент-дополнитель восстанавливает недостающие файлы без утечки решения
Затем на каждой среде генерируют новые задачи: одиночные, кросс-репозиторные и многораундовые. Из публичных траекторий получили 37.3k сред. Файн-тюнинг Qwen3.5-27B дал +11.9 на Terminal-Bench и +13.8 на EvoCode-Bench.
https://arxiv.org/abs/2609.04148
Есть парадокс: агентных траекторий накопилось море, а реалистичных исполняемых сред для обучения — дефицит. Авторы предлагают инвертировать процесс: не среда → траектория, а траектория → среда.
Идея: в логах агента уже спрятана вся информация о рабочем пространстве. Read-вызовы показывают содержимое файлов, Write/Edit — что менялось. Значит, можно откатить правки агента и восстановить исходное состояние задачи!
Пайплайн Terminal-Universe:
1. Детерминированный replay файловых операций — получаем частичный workspace
2. Агент-дополнитель восстанавливает недостающие файлы без утечки решения
Затем на каждой среде генерируют новые задачи: одиночные, кросс-репозиторные и многораундовые. Из публичных траекторий получили 37.3k сред. Файн-тюнинг Qwen3.5-27B дал +11.9 на Terminal-Bench и +13.8 на EvoCode-Bench.
https://arxiv.org/abs/2609.04148
LLaDA-Image: открытый рецепт для генерации изображений на базе диффузионных LLM
Что если взять диффузионную языковую модель (dLLM) вместо классического текстового энкодера и построить на ней генератор изображений? Именно это сделали в inclusionAI с LLaDA-Image — 6B DiT, обученный с нуля и полностью открытый.
Ключевая идея: сначала учим визуальный prior на изображениях БЕЗ подписей (>90% данных — image-only), а языковое выравнивание добавляем позже. Это экономит данные и улучшает реализм на длинном горизонте.
Архитектура: dLLM-based VLM понимает промпты и визуальный контекст, коннектор передаёт это в single-stream DiT, а для редактирования референсное изображение подаётся напрямую в DiT, минуя VLM.
Плюс TwinFlow-дистилляция даёт Turbo-версию на 2–4 шага.
Выпущены веса, код и полные рецепты обучения — включая FP8-варианты.
https://arxiv.org/abs/2609.03796
Что если взять диффузионную языковую модель (dLLM) вместо классического текстового энкодера и построить на ней генератор изображений? Именно это сделали в inclusionAI с LLaDA-Image — 6B DiT, обученный с нуля и полностью открытый.
Ключевая идея: сначала учим визуальный prior на изображениях БЕЗ подписей (>90% данных — image-only), а языковое выравнивание добавляем позже. Это экономит данные и улучшает реализм на длинном горизонте.
Архитектура: dLLM-based VLM понимает промпты и визуальный контекст, коннектор передаёт это в single-stream DiT, а для редактирования референсное изображение подаётся напрямую в DiT, минуя VLM.
Плюс TwinFlow-дистилляция даёт Turbo-версию на 2–4 шага.
Выпущены веса, код и полные рецепты обучения — включая FP8-варианты.
https://arxiv.org/abs/2609.03796
Одна модель — и физика, и геометрия, и внешний вид мира сразу
Большинство генеративных world models работают только с пикселями, игнорируя, где именно в пространстве стоит камера и как устроена геометрия сцены. Puffin-World от ACE Robotics предлагает другой подход: моделировать мир через три нативных состояния одновременно — физику (гравитация, ориентация), геометрию (глубина) и внешний вид (RGB).
Ключевая идея — Omni-Camera representation: плотное представление камеры, которое совмещает абсолютную физическую ориентацию (привязанную к гравитации) с относительными лучевыми полями. Это позволяет избежать дрейфа ориентации при длинных траекториях. Добавляется механизм physics propagation — знания о физике из воспринятых кадров распространяются на будущие.
Обучали на Puffin-16M: 15M триплетов изображение-текст-камера и 1M сложных траекторий. Результат — SOTA на camera-to-world понимании на 4 бенчмарках, плюс controllable 3D-генерация и реконструкция в одной модели. Код, веса и датасет открыты.
Большинство генеративных world models работают только с пикселями, игнорируя, где именно в пространстве стоит камера и как устроена геометрия сцены. Puffin-World от ACE Robotics предлагает другой подход: моделировать мир через три нативных состояния одновременно — физику (гравитация, ориентация), геометрию (глубина) и внешний вид (RGB).
Ключевая идея — Omni-Camera representation: плотное представление камеры, которое совмещает абсолютную физическую ориентацию (привязанную к гравитации) с относительными лучевыми полями. Это позволяет избежать дрейфа ориентации при длинных траекториях. Добавляется механизм physics propagation — знания о физике из воспринятых кадров распространяются на будущие.
Обучали на Puffin-16M: 15M триплетов изображение-текст-камера и 1M сложных траекторий. Результат — SOTA на camera-to-world понимании на 4 бенчмарках, плюс controllable 3D-генерация и реконструкция в одной модели. Код, веса и датасет открыты.
Nvidia представила NemoClaw — фреймворк для создания агентов с долгосрочной памятью.
На его основе разработан агент Chief of Staff, который ведёт структурированную «модель себя»: хранит данные о людях, проектах, приоритетах и рабочих паттернах. Знания записываются в Markdown-страницы, а решения и корректировки — в отдельную SQLite-базу. Это позволяет агенту не путать факты с суждениями.
Ключевая фишка — приоритет реальных целей пользователя над сиюминутной срочностью. Агент учится на поправках: каждое исправление попадает в аудит-журнал и обновляет политику предпочтений, которую можно читать и редактировать вручную.
Результаты впечатляют: общая точность выросла с 82,8% до 90,9%, а отслеживание изменившихся фактов — с 60% до 100% по сравнению с обычным RAG-агентом.
Безопасность обеспечивает NVIDIA OpenShell — изолированная среда с контролем доступа к файлам, процессам и сети.
https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw/
На его основе разработан агент Chief of Staff, который ведёт структурированную «модель себя»: хранит данные о людях, проектах, приоритетах и рабочих паттернах. Знания записываются в Markdown-страницы, а решения и корректировки — в отдельную SQLite-базу. Это позволяет агенту не путать факты с суждениями.
Ключевая фишка — приоритет реальных целей пользователя над сиюминутной срочностью. Агент учится на поправках: каждое исправление попадает в аудит-журнал и обновляет политику предпочтений, которую можно читать и редактировать вручную.
Результаты впечатляют: общая точность выросла с 82,8% до 90,9%, а отслеживание изменившихся фактов — с 60% до 100% по сравнению с обычным RAG-агентом.
Безопасность обеспечивает NVIDIA OpenShell — изолированная среда с контролем доступа к файлам, процессам и сети.
https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw/
NVIDIA Technical Blog
Building a Memory-Driven Agent with NVIDIA NemoClaw
Enterprise work spans messages, decisions, projects, and obligations that change over time. An AI agent that starts without this context must reconstruct it before contributing. To provide agents with…
Nvidia Tech запускает мощный AI на устройствах без интернета.
Компания показала, как запускать современные reasoning-модели прямо на Jetson — компактных edge-устройствах. Раньше многошаговые рассуждения требовали дата-центра, теперь это работает локально.
Протестированы две модели: Nemotron 3.5 Lightning (MoE, 30B параметров, активирует только 3B) и Qwen3.8-27B (dense, все 27B). Первая быстрее генерирует токены, вторая лучше для сложных решений.
Ключевые оптимизации — NVFP4-квантизация и speculative decoding — вместе дают до 6.28x прироста скорости по сравнению с BF16.
Зачем это важно: роботы, бортовые ассистенты, промышленный мониторинг — всё это теперь работает без облака. Меньше задержек, ниже стоимость, данные остаются на устройстве.
https://developer.nvidia.com/blog/frontier-reasoning-reaches-the-edge-how-to-deploy-and-optimize-models-on-nvidia-jetson/
Компания показала, как запускать современные reasoning-модели прямо на Jetson — компактных edge-устройствах. Раньше многошаговые рассуждения требовали дата-центра, теперь это работает локально.
Протестированы две модели: Nemotron 3.5 Lightning (MoE, 30B параметров, активирует только 3B) и Qwen3.8-27B (dense, все 27B). Первая быстрее генерирует токены, вторая лучше для сложных решений.
Ключевые оптимизации — NVFP4-квантизация и speculative decoding — вместе дают до 6.28x прироста скорости по сравнению с BF16.
Зачем это важно: роботы, бортовые ассистенты, промышленный мониторинг — всё это теперь работает без облака. Меньше задержек, ниже стоимость, данные остаются на устройстве.
https://developer.nvidia.com/blog/frontier-reasoning-reaches-the-edge-how-to-deploy-and-optimize-models-on-nvidia-jetson/
NVIDIA Technical Blog
Frontier Reasoning Reaches the Edge: How to Deploy and Optimize Models on NVIDIA Jetson
Running reasoning and agentic AI at the edge has been harder than it needs to be. Until recently, models capable of multi-step reasoning were too large to run locally on edge hardware.