PyTorch: vLLM займёт центральное место на конференции 2026 года
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
Что если представить физический мир как исполняемый код?
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549
Больше данных — не всегда ответ для роботов
Хочешь научить робота новым задачам? Обычно говорят: собери больше траекторий. Но авторы VLAct утверждают: дело не в количестве данных, а в том, как они формируют представления в backbone.
Проблема: при наивном дообучении VLM на роботных данных происходит три беды. Узкие траектории разрушают полезные vision-language признаки. Один action head "переспециализирует" backbone под свою геометрию. Разные embodiment-ы не делятся общими знаниями.
Решение VLAct: защита мелких слоёв LLM от перезаписи + микс caption-данных + обучение сразу с несколькими action heads + унифицированное пространство действий для разных роботов.
Результат: +7.6–21.4 пункта на бенчмарках только за счёт лучшего backbone — при том же action head, тех же данных и том же бюджете дообучения. 82.6% на LIBERO-Plus, 92.5% на RoboTwin 2.0. Всё на 16 GPU и открытых данных.
https://arxiv.org/abs/2608.27550
Хочешь научить робота новым задачам? Обычно говорят: собери больше траекторий. Но авторы VLAct утверждают: дело не в количестве данных, а в том, как они формируют представления в backbone.
Проблема: при наивном дообучении VLM на роботных данных происходит три беды. Узкие траектории разрушают полезные vision-language признаки. Один action head "переспециализирует" backbone под свою геометрию. Разные embodiment-ы не делятся общими знаниями.
Решение VLAct: защита мелких слоёв LLM от перезаписи + микс caption-данных + обучение сразу с несколькими action heads + унифицированное пространство действий для разных роботов.
Результат: +7.6–21.4 пункта на бенчмарках только за счёт лучшего backbone — при том же action head, тех же данных и том же бюджете дообучения. 82.6% на LIBERO-Plus, 92.5% на RoboTwin 2.0. Всё на 16 GPU и открытых данных.
https://arxiv.org/abs/2608.27550
Робот учится по видео с людьми — без единой совместной записи
Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.
Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.
Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.
Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.
https://arxiv.org/abs/2608.26103
Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.
Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.
Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.
Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.
https://arxiv.org/abs/2608.26103
DART-SD: как научить агента чинить только сломанное (by ByteDance)
Когда LLM-агент использует инструменты в несколько шагов, стандартные подходы страдают от одной проблемы: SFT штрафует модель за нормальные шаги, а RL размазывает награду равномерно по всей траектории. Оба метода не понимают, что пространство решений — это не линейная цепочка, а граф с «ромбовидной» топологией, где разные пути пересекаются в одних и тех же состояниях.
DART-SD строит граф переходов (ISTG) из траекторий учителя, находит точку Critical Topological Breakpoint — первый момент, где студент сходит с успешного пути — и обучает модель только на шагах восстановления после этой точки. Всё, что было до CTB, не трогается градиентами.
Результат: меньше лишних вызовов инструментов, лучше качество на 5 бенчмарках, и модель постепенно сдвигает границу своей компетентности с каждым раундом само-дистилляции.
https://arxiv.org/abs/2608.18524
Когда LLM-агент использует инструменты в несколько шагов, стандартные подходы страдают от одной проблемы: SFT штрафует модель за нормальные шаги, а RL размазывает награду равномерно по всей траектории. Оба метода не понимают, что пространство решений — это не линейная цепочка, а граф с «ромбовидной» топологией, где разные пути пересекаются в одних и тех же состояниях.
DART-SD строит граф переходов (ISTG) из траекторий учителя, находит точку Critical Topological Breakpoint — первый момент, где студент сходит с успешного пути — и обучает модель только на шагах восстановления после этой точки. Всё, что было до CTB, не трогается градиентами.
Результат: меньше лишних вызовов инструментов, лучше качество на 5 бенчмарках, и модель постепенно сдвигает границу своей компетентности с каждым раундом само-дистилляции.
https://arxiv.org/abs/2608.18524
Находить объекты в видео параллельно, а не по очереди
Задача spatio-temporal video grounding — найти объект в видео по текстовому запросу: определить временной интервал и нарисовать bounding box в каждом кадре. Проблема: стандартные MLLM генерируют боксы один за другим, и чем длиннее видео — тем медленнее и хуже (ошибки накапливаются).
Авторы из MBZUAI предлагают Parallel Tube Decoding (PTD): вместо того чтобы генерировать боксы последовательно, модель сначала за один шаг предсказывает временной интервал, а затем параллельно генерирует все боксы сразу. Итого всегда ровно два декодирующих раунда, независимо от длины трубки.
Чтобы это работало, вводят Decoupled Block Attention — каждый бокс видит общий видео-контекст, но не видит другие боксы. Плюс RL-оптимизация с пространственными и временными наградами.
Результат: ускорение латентности в 79 раз, пропускная способность выросла в 92 раза по сравнению с базовым текстовым декодингом, при этом качество локализации улучшилось.
https://arxiv.org/abs/2608.28192
Задача spatio-temporal video grounding — найти объект в видео по текстовому запросу: определить временной интервал и нарисовать bounding box в каждом кадре. Проблема: стандартные MLLM генерируют боксы один за другим, и чем длиннее видео — тем медленнее и хуже (ошибки накапливаются).
Авторы из MBZUAI предлагают Parallel Tube Decoding (PTD): вместо того чтобы генерировать боксы последовательно, модель сначала за один шаг предсказывает временной интервал, а затем параллельно генерирует все боксы сразу. Итого всегда ровно два декодирующих раунда, независимо от длины трубки.
Чтобы это работало, вводят Decoupled Block Attention — каждый бокс видит общий видео-контекст, но не видит другие боксы. Плюс RL-оптимизация с пространственными и временными наградами.
Результат: ускорение латентности в 79 раз, пропускная способность выросла в 92 раза по сравнению с базовым текстовым декодингом, при этом качество локализации улучшилось.
https://arxiv.org/abs/2608.28192
Модель учится без правильных ответов — и обгоняет ту, у которой они были
Представьте: у вас есть сложные олимпиадные задачи, и вы не знаете правильных ответов. Можно ли всё равно улучшить модель? TTPO говорит — да.
Ключевое наблюдение: на задачах уровня AIME псевдо-метки (majority vote по K роллаутам) ошибаются в ~85% случаев. Казалось бы, учиться на таком шуме бессмысленно. Но вот хитрость: даже когда псевдо-метка неверна, ~79% "несогласных" роллаутов тоже неверны. Значит, штрафовать несогласных — правильно почти всегда, независимо от качества метки.
Отсюда асимметричный дизайн:
- Роллауты, согласные с псевдо-меткой → дистилляция (OPSD) с токен-уровневыми весами
- Несогласные роллауты → GRPO-штраф с маскировкой аномальных токенов
Результат: Qwen3-1.7B без единого правильного ответа вырастает с 38.0% до 45.2% на олимпиадных бенчмарках — обгоняя TTRL и даже label-supervised OPSD.
https://arxiv.org/abs/2608.27448
Представьте: у вас есть сложные олимпиадные задачи, и вы не знаете правильных ответов. Можно ли всё равно улучшить модель? TTPO говорит — да.
Ключевое наблюдение: на задачах уровня AIME псевдо-метки (majority vote по K роллаутам) ошибаются в ~85% случаев. Казалось бы, учиться на таком шуме бессмысленно. Но вот хитрость: даже когда псевдо-метка неверна, ~79% "несогласных" роллаутов тоже неверны. Значит, штрафовать несогласных — правильно почти всегда, независимо от качества метки.
Отсюда асимметричный дизайн:
- Роллауты, согласные с псевдо-меткой → дистилляция (OPSD) с токен-уровневыми весами
- Несогласные роллауты → GRPO-штраф с маскировкой аномальных токенов
Результат: Qwen3-1.7B без единого правильного ответа вырастает с 38.0% до 45.2% на олимпиадных бенчмарках — обгоняя TTRL и даже label-supervised OPSD.
https://arxiv.org/abs/2608.27448
Microsoft Research выпустила GigaPath-Flash и GigaTIME-Flash — ускоренные версии своих ИИ-моделей для анализа патологических снимков.
Суть: оригинальные модели GigaPath и GigaTIME умели анализировать гигапиксельные срезы тканей и строить карты опухолевого микроокружения, но требовали огромных вычислительных ресурсов. Flash-версии решают эту проблему — через дистилляцию знаний из миллиардной модели в компактную архитектуру.
Цифры говорят сами за себя: GigaPath-Flash работает в 50 раз дешевле при сохранении 97% точности. GigaTIME-Flash — в 6 раз быстрее и потребляет в 8 раз меньше памяти, при этом показывая лучшее качество на новых данных.
Практически это означает: анализ миллиона слайдов теперь занимает 70 GPU-дней вместо 300. Исследователи смогут изучать десятки тысяч пациентов, тестировать гипотезы и искать биомаркеры рака в реальном масштабе.
Модели открыты под лицензией Apache 2.0 и доступны на HuggingFace. Для клинического применения не предназначены.
https://www.microsoft.com/en-us/research/blog/gigapath-flash-and-gigatime-flash-toward-population-scale-discovery-with-efficient-pathology-foundation-models/
Суть: оригинальные модели GigaPath и GigaTIME умели анализировать гигапиксельные срезы тканей и строить карты опухолевого микроокружения, но требовали огромных вычислительных ресурсов. Flash-версии решают эту проблему — через дистилляцию знаний из миллиардной модели в компактную архитектуру.
Цифры говорят сами за себя: GigaPath-Flash работает в 50 раз дешевле при сохранении 97% точности. GigaTIME-Flash — в 6 раз быстрее и потребляет в 8 раз меньше памяти, при этом показывая лучшее качество на новых данных.
Практически это означает: анализ миллиона слайдов теперь занимает 70 GPU-дней вместо 300. Исследователи смогут изучать десятки тысяч пациентов, тестировать гипотезы и искать биомаркеры рака в реальном масштабе.
Модели открыты под лицензией Apache 2.0 и доступны на HuggingFace. Для клинического применения не предназначены.
https://www.microsoft.com/en-us/research/blog/gigapath-flash-and-gigatime-flash-toward-population-scale-discovery-with-efficient-pathology-foundation-models/
Microsoft Research
Making pathology foundation models practical at scale
What if pathology foundation models could do more with less? GigaPath-Flash and GigaTIME-Flash cut computational demands while maintaining strong performance, opening the door to larger studies and broader exploration.
Nvidia Tech — BioNeMo Agent Toolkit теперь работает с Claude Science
NVIDIA интегрировала BioNeMo Agent Toolkit в Claude Science — научную платформу Anthropic. Результат: ИИ-агент может самостоятельно запускать NIM-микросервисы для предсказания структуры белков прямо внутри исследовательской среды.
Что это даёт? Агент берёт белковые последовательности, строит множественные выравнивания (MSA), запускает сразу две модели — OpenFold3 и Boltz-2 — и сравнивает результаты. Без MSA точность предсказания комплексов рушится (iPTM падает с 0.85 до 0.14), с ним — обе модели независимо воспроизводят одну и ту же структуру.
На внутренних тестах BioNeMo-навыки подняли корректность задач с 60% до 100% и вдвое снизили расход токенов.
Для кого важно: исследователям в биологии, химии, геномике и разработке лекарств — теперь не нужно вручную настраивать окружения и API для каждой модели. Агент делает это сам.
https://developer.nvidia.com/blog/run-nvidia-bionemo-nim-microservices-for-protein-structure-prediction-in-claude-science/
NVIDIA интегрировала BioNeMo Agent Toolkit в Claude Science — научную платформу Anthropic. Результат: ИИ-агент может самостоятельно запускать NIM-микросервисы для предсказания структуры белков прямо внутри исследовательской среды.
Что это даёт? Агент берёт белковые последовательности, строит множественные выравнивания (MSA), запускает сразу две модели — OpenFold3 и Boltz-2 — и сравнивает результаты. Без MSA точность предсказания комплексов рушится (iPTM падает с 0.85 до 0.14), с ним — обе модели независимо воспроизводят одну и ту же структуру.
На внутренних тестах BioNeMo-навыки подняли корректность задач с 60% до 100% и вдвое снизили расход токенов.
Для кого важно: исследователям в биологии, химии, геномике и разработке лекарств — теперь не нужно вручную настраивать окружения и API для каждой модели. Агент делает это сам.
https://developer.nvidia.com/blog/run-nvidia-bionemo-nim-microservices-for-protein-structure-prediction-in-claude-science/
NVIDIA Technical Blog
Run NVIDIA BioNeMo NIM Microservices for Protein Structure Prediction in Claude Science
Agentic AI is changing how research is done. AI scientists can read papers, propose hypotheses, call models, and determine which experiments to prioritize next. First proving their value in software…
Nvidia — новый инструмент для обучения автопилота без реального автомобиля
NVIDIA выпустила Omniverse NuRec — систему, которая позволяет адаптировать восприятие автономного вождения к новым моделям автомобилей без сбора реальных данных с нуля.
Как это работает: NuRec берёт записи реальных поездок, реконструирует сцены с помощью 3D Gaussian splatting и рендерит их с точки зрения камер другого автомобиля. Например, данные с SUV можно «пересчитать» под конфигурацию седана.
В открытом доступе на Hugging Face уже лежит датасет из 1500+ нейронно-реконструированных сцен по ~20 секунд каждая.
Почему это важно: разработка нового автомобиля занимает годы, а обучать восприятие нужно заранее. NuRec позволяет готовить модели до того, как реальный флот вообще существует — экономя время и деньги на разметку данных.
https://developer.nvidia.com/blog/scale-av-perception-across-vehicle-platforms-with-nvidia-omniverse-nurec/
NVIDIA выпустила Omniverse NuRec — систему, которая позволяет адаптировать восприятие автономного вождения к новым моделям автомобилей без сбора реальных данных с нуля.
Как это работает: NuRec берёт записи реальных поездок, реконструирует сцены с помощью 3D Gaussian splatting и рендерит их с точки зрения камер другого автомобиля. Например, данные с SUV можно «пересчитать» под конфигурацию седана.
В открытом доступе на Hugging Face уже лежит датасет из 1500+ нейронно-реконструированных сцен по ~20 секунд каждая.
Почему это важно: разработка нового автомобиля занимает годы, а обучать восприятие нужно заранее. NuRec позволяет готовить модели до того, как реальный флот вообще существует — экономя время и деньги на разметку данных.
https://developer.nvidia.com/blog/scale-av-perception-across-vehicle-platforms-with-nvidia-omniverse-nurec/
NVIDIA Technical Blog
Scale AV Perception Across Vehicle Platforms with NVIDIA Omniverse NuRec
A perception stack is shaped by the vehicle that carries it. Move the same software to a new carline—for example, from an SUV to a sedan or another vehicle variant in the portfolio—and its perception…
Qwen3.8-Flash-Next: мощь 397B-модели за 1/9 вычислительных затрат (by Qwen)
Команда Qwen выкатила техотчёт о новой архитектуре: 125B параметров, но активируется лишь 6B на токен. При этом модель обходит предшественника на 8 из 14 бенчмарков, тратя в 9 раз меньше FLOPs на обучение.
Ключевые архитектурные решения:
1. Гибрид GDN + Sparse Attention: вместо полного attention везде — 3 слоя рекуррентного Gated DeltaNet на 1 слой разреженного attention. Линейная стоимость для длинных контекстов, при 1M токенов QSA в 7.6× быстрее dense attention.
2. Gated Residual (GR): расширение residual stream на 4 ветки с elementwise gate. Побочный эффект — стабильность обучения без единого loss spike на полном масштабе.
3. N-gram embedding таблицы (51B параметров) хранятся в CPU памяти и подгружаются по мере нужды — почти бесплатные дополнительные параметры.
4. Оптимизатор Muon вместо AdamW для 2D-весов.
Интересный вывод: loss и accuracy на бенчмарках расходятся — минимум loss ≠ максимум качества.
Команда Qwen выкатила техотчёт о новой архитектуре: 125B параметров, но активируется лишь 6B на токен. При этом модель обходит предшественника на 8 из 14 бенчмарков, тратя в 9 раз меньше FLOPs на обучение.
Ключевые архитектурные решения:
1. Гибрид GDN + Sparse Attention: вместо полного attention везде — 3 слоя рекуррентного Gated DeltaNet на 1 слой разреженного attention. Линейная стоимость для длинных контекстов, при 1M токенов QSA в 7.6× быстрее dense attention.
2. Gated Residual (GR): расширение residual stream на 4 ветки с elementwise gate. Побочный эффект — стабильность обучения без единого loss spike на полном масштабе.
3. N-gram embedding таблицы (51B параметров) хранятся в CPU памяти и подгружаются по мере нужды — почти бесплатные дополнительные параметры.
4. Оптимизатор Muon вместо AdamW для 2D-весов.
Интересный вывод: loss и accuracy на бенчмарках расходятся — минимум loss ≠ максимум качества.
Хочешь научить робота новым трюкам без миллионов размеченных демонстраций? Смотри видео!
ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.
Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!
Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.
https://arxiv.org/abs/2609.00188
ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.
Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!
Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.
https://arxiv.org/abs/2609.00188
Evolution Strategies против GRPO: кто лучше для дообучения LLM на рассуждениях?
GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?
ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.
Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.
Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.
https://arxiv.org/abs/2608.27351
GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?
ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.
Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.
Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.
https://arxiv.org/abs/2608.27351
Google Gemini запустил агентное понимание видео — и это серьёзный апгрейд для разработчиков.
Новая функция доступна в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо того чтобы тупо обрабатывать видео кадр за кадром с фиксированной скоростью, модель теперь сама решает — что смотреть, с какой скоростью и через какую модальность (кадры, аудио или транскрипт).
Результат: потребление токенов падает до 88%, стоимость анализа — до 66%, а точность растёт на 7%. Особенно ощутимо на длинных видео — лекциях, записях совещаний, многочасовых трансляциях.
Что умеет: точный поиск момента с точностью до секунды, поиск иголки в стоге сена в многочасовых видео, детекция аномалий и подсчёт объектов.
Включается одной строкой в API: processing: "agentic". Доступно в Google AI Studio уже сейчас, без доплаты.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
Новая функция доступна в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо того чтобы тупо обрабатывать видео кадр за кадром с фиксированной скоростью, модель теперь сама решает — что смотреть, с какой скоростью и через какую модальность (кадры, аудио или транскрипт).
Результат: потребление токенов падает до 88%, стоимость анализа — до 66%, а точность растёт на 7%. Особенно ощутимо на длинных видео — лекциях, записях совещаний, многочасовых трансляциях.
Что умеет: точный поиск момента с точностью до секунды, поиск иголки в стоге сена в многочасовых видео, детекция аномалий и подсчёт объектов.
Включается одной строкой в API: processing: "agentic". Доступно в Google AI Studio уже сейчас, без доплаты.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
Google
Introducing agentic video understanding with Gemini
We’re launching agentic video understanding across our latest Gemini models for improved accuracy and lower costs and token usage.
Nvidia Tech совместно с CrowdStrike создали замкнутую систему кибербезопасности на базе моделей Nemotron, где ИИ-агенты атакуют и защищают инфраструктуру в автоматическом режиме без участия человека.
Как это работает: красный агент запускает атаку, синий анализирует телеметрию и генерирует правила обнаружения, затем красный адаптирует тактику — и цикл повторяется на машинной скорости.
Результаты впечатляют: оптимизированная связка Nemotron 3 Ultra + дообученный Nemotron 3 Super показала 41,9% среднего обнаружения атак — это в 2,5 раза лучше базовой конфигурации. При тестировании на 8 новых атаках открытые модели обобщили 45% обнаружений против 29% у проприетарных систем.
Почему важно: традиционные red/blue team учения занимают недели из-за ручных итераций. Здесь весь цикл работает автономно, а стоимость — на 99% ниже топовых проприетарных моделей по данным CrowdStrike.
https://developer.nvidia.com/blog/building-an-adaptive-agentic-cybersecurity-system-with-nvidia-nemotron/
Как это работает: красный агент запускает атаку, синий анализирует телеметрию и генерирует правила обнаружения, затем красный адаптирует тактику — и цикл повторяется на машинной скорости.
Результаты впечатляют: оптимизированная связка Nemotron 3 Ultra + дообученный Nemotron 3 Super показала 41,9% среднего обнаружения атак — это в 2,5 раза лучше базовой конфигурации. При тестировании на 8 новых атаках открытые модели обобщили 45% обнаружений против 29% у проприетарных систем.
Почему важно: традиционные red/blue team учения занимают недели из-за ручных итераций. Здесь весь цикл работает автономно, а стоимость — на 99% ниже топовых проприетарных моделей по данным CrowdStrike.
https://developer.nvidia.com/blog/building-an-adaptive-agentic-cybersecurity-system-with-nvidia-nemotron/
NVIDIA Technical Blog
Building an Adaptive Agentic Cybersecurity System with NVIDIA Nemotron
AI is changing the pace of cybersecurity. Agentic systems can coordinate work and pursue complex objectives over long horizons. Security teams are beginning to apply agents across security operations…
Хочешь обучить видео-модель мира на часы вперёд, потренировав её лишь на 5-секундных клипах?
SolarWM — полностью открытый фреймворк для обучения интерактивных video world models. Авторы собрали 1.43 млн клипов из 10 датасетов (реальный мир, синтетика, игры) и привели их к единому формату с согласованной геометрией камеры, семантикой и метаданными качества.
Главная идея: разделить тяжёлую предобработку данных и конструирование обучающей смеси. Хочешь поменять фильтрацию или веса источников — просто меняешь конфиг, не перезапуская всё с нуля.
Обучение — три стадии: bidirectional training → autoregressive адаптация → distribution matching distillation. Причём большую часть оптимизации нужно делать на первом этапе, остальные сходятся быстро.
Результат: семейство моделей от 5B до 33B параметров (WAN, LTX, MiniMax бэкбоны), которые после обучения на 5-секундных видео генерируют роллауты длиной от минут до часов без дополнительного файнтюнинга.
https://arxiv.org/abs/2609.02886
SolarWM — полностью открытый фреймворк для обучения интерактивных video world models. Авторы собрали 1.43 млн клипов из 10 датасетов (реальный мир, синтетика, игры) и привели их к единому формату с согласованной геометрией камеры, семантикой и метаданными качества.
Главная идея: разделить тяжёлую предобработку данных и конструирование обучающей смеси. Хочешь поменять фильтрацию или веса источников — просто меняешь конфиг, не перезапуская всё с нуля.
Обучение — три стадии: bidirectional training → autoregressive адаптация → distribution matching distillation. Причём большую часть оптимизации нужно делать на первом этапе, остальные сходятся быстро.
Результат: семейство моделей от 5B до 33B параметров (WAN, LTX, MiniMax бэкбоны), которые после обучения на 5-секундных видео генерируют роллауты длиной от минут до часов без дополнительного файнтюнинга.
https://arxiv.org/abs/2609.02886
SMELT: как получить бесплатные вычисления в трансформере (by ByteDance)
Что если прогнать часть слоёв трансформера дважды, не платя за это дополнительными параметрами? Идея looped transformers известна давно, но всегда был подвох: extra FLOPs никто не контролировал.
SMELT закрывает этот вопрос честно — фиксируют сразу три бюджета: FLOPs, параметры и KV-кэш. Трюк возможен благодаря MoE: средние 50% слоёв прогоняются дважды, скрытое измерение сужается, а потерянную ёмкость восстанавливают добавлением экспертов.
Результат: на 1021 FLOPs SMELT достигает того же лосса на 14.7% дешевле. Выигрыш растёт со scale. Особенно хорошо работает на коде и задачах in-context learning — второй проход по слоям усиливает первый, а не перезаписывает его.
https://arxiv.org/abs/2609.01343
Что если прогнать часть слоёв трансформера дважды, не платя за это дополнительными параметрами? Идея looped transformers известна давно, но всегда был подвох: extra FLOPs никто не контролировал.
SMELT закрывает этот вопрос честно — фиксируют сразу три бюджета: FLOPs, параметры и KV-кэш. Трюк возможен благодаря MoE: средние 50% слоёв прогоняются дважды, скрытое измерение сужается, а потерянную ёмкость восстанавливают добавлением экспертов.
Результат: на 1021 FLOPs SMELT достигает того же лосса на 14.7% дешевле. Выигрыш растёт со scale. Особенно хорошо работает на коде и задачах in-context learning — второй проход по слоям усиливает первый, а не перезаписывает его.
https://arxiv.org/abs/2609.01343
WikiSkill: агент, который учится как Википедия
Обычные AI-агенты накапливают опыт в параметрах модели или разрозненных логах. WikiSkill предлагает другой путь: между сырыми трейсами выполнения и процедурными инструкциями (skills) добавляется отдельный слой — постоянная база знаний в духе вики.
Архитектура трёхуровневая: Raw Layer (неизменяемые трейсы), Wiki Layer (структурированные паттерны и история эволюции), Skill Layer (процедурные инструкции). На каждой итерации Wiki Maintainer анализирует трейсы и обновляет вики, Skill Proposer предлагает улучшения навыков, а Gating механизм откатывает плохие обновления. Вики при этом никогда не сбрасывается.
Результаты впечатляют: Qwen-3.5-9B со скиллами WikiSkill бьёт Qwen-3.6-27B без скиллов (47.4% vs 39.4%). А скиллы, выученные большой моделью, переносятся на маленькую — и та работает лучше, чем со своими собственными скиллами.
https://arxiv.org/abs/2608.27454
Обычные AI-агенты накапливают опыт в параметрах модели или разрозненных логах. WikiSkill предлагает другой путь: между сырыми трейсами выполнения и процедурными инструкциями (skills) добавляется отдельный слой — постоянная база знаний в духе вики.
Архитектура трёхуровневая: Raw Layer (неизменяемые трейсы), Wiki Layer (структурированные паттерны и история эволюции), Skill Layer (процедурные инструкции). На каждой итерации Wiki Maintainer анализирует трейсы и обновляет вики, Skill Proposer предлагает улучшения навыков, а Gating механизм откатывает плохие обновления. Вики при этом никогда не сбрасывается.
Результаты впечатляют: Qwen-3.5-9B со скиллами WikiSkill бьёт Qwen-3.6-27B без скиллов (47.4% vs 39.4%). А скиллы, выученные большой моделью, переносятся на маленькую — и та работает лучше, чем со своими собственными скиллами.
https://arxiv.org/abs/2608.27454
Google DeepMind представила Gemini 3.8 Flash и 3.8 Flash Cyber — уже третий релиз Flash за шесть недель.
Gemini 3.8 Flash — новый флагман для агентных задач и сложного кода. На бенчмарке DeepSWE он обходит большинство более крупных и дорогих моделей, при этом сохраняет цену 3.7 Flash: $0,75 за млн входящих токенов. Модель работает усерднее — делает больше шагов рассуждения и итеративно вызывает инструменты.
Gemini 3.8 Flash Cyber заточен под кибербезопасность: находит уязвимости в коде на 20 языках программирования с точностью выше 70%, патчит баги на уровне лучших frontier-моделей, но дешевле. Chrome Security Team получила в 2,6 раза больше корректных патчей, чем от коммерческих аналогов. Доступ — только через программу Fairwind для доверенных организаций.
Оба варианта уже доступны через Google AI Studio, Gemini API и приложение Gemini.
https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/
Gemini 3.8 Flash — новый флагман для агентных задач и сложного кода. На бенчмарке DeepSWE он обходит большинство более крупных и дорогих моделей, при этом сохраняет цену 3.7 Flash: $0,75 за млн входящих токенов. Модель работает усерднее — делает больше шагов рассуждения и итеративно вызывает инструменты.
Gemini 3.8 Flash Cyber заточен под кибербезопасность: находит уязвимости в коде на 20 языках программирования с точностью выше 70%, патчит баги на уровне лучших frontier-моделей, но дешевле. Chrome Security Team получила в 2,6 раза больше корректных патчей, чем от коммерческих аналогов. Доступ — только через программу Fairwind для доверенных организаций.
Оба варианта уже доступны через Google AI Studio, Gemini API и приложение Gemini.
https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/
Google
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Gemini 3.8 Flash and 3.8 Flash Cyber deliver next-generation intelligence for agentic workflows and cybersecurity.
Meta AI разработала корпоративный "второй мозг" — AI-агент, который накапливает экспертные знания организации и делает их доступными для всех сотрудников.
Главная идея: большинство ценных знаний живёт в головах специалистов, а не в документах. Агент меняет это — он структурирует, как именно эксперты рассуждают, а не просто хранит факты.
Что внутри: система из 200+ файлов с позициями компании, глоссариями и логикой принятия решений. Плюс — петля самообучения: когда эксперт исправляет агента, правка автоматически проходит тесты и навсегда встраивается в базу знаний. Без переобучения модели.
Зачем это важно: эксперты в Meta теперь тратят меньше времени на рутинные вопросы и больше — на действительно сложные задачи. Паттерн универсален: compliance, финансы, безопасность, инженерия — любая область с накопленной экспертизой.
По сути, Meta создала способ превратить уходящих сотрудников и их опыт в постоянный актив компании.
https://engineering.fb.com/2026/09/02/ml-applications/organizational-second-brain-ai-learns-from-experts/
Главная идея: большинство ценных знаний живёт в головах специалистов, а не в документах. Агент меняет это — он структурирует, как именно эксперты рассуждают, а не просто хранит факты.
Что внутри: система из 200+ файлов с позициями компании, глоссариями и логикой принятия решений. Плюс — петля самообучения: когда эксперт исправляет агента, правка автоматически проходит тесты и навсегда встраивается в базу знаний. Без переобучения модели.
Зачем это важно: эксперты в Meta теперь тратят меньше времени на рутинные вопросы и больше — на действительно сложные задачи. Паттерн универсален: compliance, финансы, безопасность, инженерия — любая область с накопленной экспертизой.
По сути, Meta создала способ превратить уходящих сотрудников и их опыт в постоянный актив компании.
https://engineering.fb.com/2026/09/02/ml-applications/organizational-second-brain-ai-learns-from-experts/
Engineering at Meta
An Organizational Second Brain: Building an AI That Learns From Experts
We’ve built an AI agent that acts as a secondary expert for a given domain, making deep specialist knowledge readily available and preserved for anyone in an organization to access, share, and buil…
🔥1
Nvidia Tech обновила CUDA-инструментарий и опубликовала подробный гайд по оптимизации GPU-кода.
Разработчики показали, как за шесть шагов ускорить типичный пайплайн обработки изображений в 300 раз — с 6,8 секунд до 23 миллисекунд.
Что конкретно даёт прирост: замена ручных ядер на библиотеку CUB ускоряет вычисление медианы в 2717 раз. Pooled-буферы cuda::device_buffer сокращают накладные расходы на аллокацию памяти вдвое. Pinned-память для хоста ускоряет передачу данных CPU→GPU в 10 раз. Асинхронные потоки на каждый OpenMP-поток перекрывают вычисления и передачи данных.
Почему это важно: современные AI-модели и научные симуляции упираются именно в эффективность GPU-кода. Теперь у разработчиков есть пошаговый рецепт с конкретными цифрами и готовыми примерами на Google Colab.
https://developer.nvidia.com/blog/the-modern-cuda-toolbox-in-practice-a-step-by-step-optimization-walkthrough/
Разработчики показали, как за шесть шагов ускорить типичный пайплайн обработки изображений в 300 раз — с 6,8 секунд до 23 миллисекунд.
Что конкретно даёт прирост: замена ручных ядер на библиотеку CUB ускоряет вычисление медианы в 2717 раз. Pooled-буферы cuda::device_buffer сокращают накладные расходы на аллокацию памяти вдвое. Pinned-память для хоста ускоряет передачу данных CPU→GPU в 10 раз. Асинхронные потоки на каждый OpenMP-поток перекрывают вычисления и передачи данных.
Почему это важно: современные AI-модели и научные симуляции упираются именно в эффективность GPU-кода. Теперь у разработчиков есть пошаговый рецепт с конкретными цифрами и готовыми примерами на Google Colab.
https://developer.nvidia.com/blog/the-modern-cuda-toolbox-in-practice-a-step-by-step-optimization-walkthrough/
NVIDIA Technical Blog
The Modern CUDA Toolbox in Practice: A Step-by-Step Optimization Walkthrough
NVIDIA CUDA remains the foundation of GPU-accelerated computing, powering everything from scientific simulations to large-scale AI training. But writing correct, maintainable, and performant CUDA code…