Nvidia представила COMPASS — фреймворк для обучения роботов навигации сразу под разные типы корпусов.
Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.
В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.
Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.
Код и инструкции доступны в репозитории COMPASS на GitHub.
https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.
В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.
Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.
Код и инструкции доступны в репозитории COMPASS на GitHub.
https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
NVIDIA Technical Blog
How to Train a Cross-Embodiment Robot Navigation Policy with AI Agents
Navigation enables a robot to turn perception and motion into purposeful autonomy. Unlike locomotion, which produces stable movement, navigation must be used to continuously localize the robot…
Nvidia + Alibaba: Qwen3.8-Flash-Next на GB300 NVL72 для агентного кодинга
Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.
Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.
На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.
Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.
Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.
На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.
Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
NVIDIA Technical Blog
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
Alibaba released the model weights for Qwen3.8-Flash-Next as a preview of the upcoming Qwen4 architecture for developers to experiment with and evaluate. It’s a multimodal mixture-of-experts (MoE)…
Управляй инструментами LLM без переобучения — одним вектором в пространстве активаций
Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».
Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.
Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.
https://arxiv.org/abs/2608.25198
Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».
Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.
Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.
https://arxiv.org/abs/2608.25198
👍1
Как правильно подключать и отключать плагины без перезапуска всей системы? (by DeepSeek)
Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.
DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:
Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.
Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.
Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.
DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:
Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.
Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.
Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Агентный ИИ: единица измерения — выполненная работа, а не ответ на вопрос
Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.
Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов
Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.
https://arxiv.org/abs/2608.23283
Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.
Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов
Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.
https://arxiv.org/abs/2608.23283
Google DeepMind запустила первые в мире двойные слепые оценки AI-моделей.
Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.
Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.
Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.
Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.
Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Google DeepMind
Piloting the world's first double-blind AI evaluations
Building trust in proprietary model benchmarks using cryptographically secure environments
Amazon Science предупреждает: не доверяйте слепо консенсусу AI-судей
Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.
Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.
Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.
https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.
Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.
Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.
https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
Amazon Science
When LLM judges agree, should we believe them?
Discounting the opinions of LLM judges with highly correlated outputs ensures that panels of judges reflect a true diversity of perspectives.
👍1
Apple ML опубликовала исследование о новом подходе к обучению AI-ответам на вопросы.
Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.
Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.
Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.
Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.
https://machinelearning.apple.com/research/rubric-based-alignment
Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.
Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.
Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.
Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.
https://machinelearning.apple.com/research/rubric-based-alignment
Apple Machine Learning Research
From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
Designing effective reward signals for open-domain question answering is challenging because high-quality responses must simultaneously…
AI-учёный от Google: от идеи до синтеза материалов в реальной лаборатории (by Google)
Co-Scientist — мультиагентная система на базе Gemini, которая теперь не просто генерирует гипотезы, но и доводит их до физически верифицированных результатов. Три домена, три уровня автономности:
Материаловедение: система спроектировала безопасный CVD-протокол синтеза 2D-материалов (MoS2, MoSe2, WS2) — с первой попытки.
Биология: предсказала морфологию роёв E. coli по градиенту концентрации индуктора, результаты совпали с мокрыми экспериментами.
CS: полностью автономно нашла архитектуру агента, обогнавшую шесть фронтирных моделей на HealthBench Hard.
Пайплайн: эволюционная генерация гипотез с UCB-отбором → итеративная генерация кода → написание статьи с проверкой на галлюцинации. Двойное слепое исследование (30 экспертов, 450 ревью) подтвердило: модули верификации реально снижают галлюцинации и плагиат.
https://arxiv.org/abs/2608.26701
Co-Scientist — мультиагентная система на базе Gemini, которая теперь не просто генерирует гипотезы, но и доводит их до физически верифицированных результатов. Три домена, три уровня автономности:
Материаловедение: система спроектировала безопасный CVD-протокол синтеза 2D-материалов (MoS2, MoSe2, WS2) — с первой попытки.
Биология: предсказала морфологию роёв E. coli по градиенту концентрации индуктора, результаты совпали с мокрыми экспериментами.
CS: полностью автономно нашла архитектуру агента, обогнавшую шесть фронтирных моделей на HealthBench Hard.
Пайплайн: эволюционная генерация гипотез с UCB-отбором → итеративная генерация кода → написание статьи с проверкой на галлюцинации. Двойное слепое исследование (30 экспертов, 450 ревью) подтвердило: модули верификации реально снижают галлюцинации и плагиат.
https://arxiv.org/abs/2608.26701
Видео на всю длину истории, а не только один клип
Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.
Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.
Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.
Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.
https://arxiv.org/abs/2608.23383
Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.
Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.
Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.
Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.
https://arxiv.org/abs/2608.23383
Дистилляция из нескольких учителей сломана — и вот почему (by ByteDance & Tsinghua)
Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.
Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.
Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness
Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.
Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.
Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness
Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Nvidia представила TensorRT Model Connect — инструмент для развёртывания открытых моделей в нативных C++ приложениях всего двумя командами.
Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.
Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.
Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.
Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect
https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.
Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.
Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.
Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect
https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
GitHub
GitHub - NVIDIA/TensorRT-Model-Connect: From PyTorch model to end-to-end TensorRT inference experience in two commands—AI-native…
From PyTorch model to end-to-end TensorRT inference experience in two commands—AI-native, cross-platform, and built for the best possible user experience. - NVIDIA/TensorRT-Model-Connect
Apple ML опубликовала исследование о том, насколько последовательно языковые модели обновляют свои убеждения при получении новых данных.
Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.
Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".
Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.
https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.
Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".
Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.
https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Apple Machine Learning Research
LLMs Are Not (Consistently) Bayesian: Quantifying Internal (In)consistencies of LLMs’ Probabilistic Beliefs
Modern AI systems are being deployed in complex domains such as medicine, science, and law, where there is often not a single correct answer…
Apple ML представила Agent Seer — систему для автоматической генерации тестовых сценариев для AI-агентов.
Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.
Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.
Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.
Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.
https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.
Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.
Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.
Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.
https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
Apple Machine Learning Research
Agent Seer: Synthesizing Scenarios from Specification Understanding
Evaluating AI agents that use external tools requires realistic test scenarios that capture how practitioners compose tools and iterate…
LLM пишет 3D-модели как программу — и получает чёткие грани, именованные детали и редактируемость
Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).
Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.
Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.
https://arxiv.org/abs/2608.26238
Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).
Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.
Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.
https://arxiv.org/abs/2608.26238
LLM как мозг игрового мира: Code World Model
Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.
Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.
Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.
Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.
https://arxiv.org/abs/2608.25927
Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.
Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.
Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.
Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.
https://arxiv.org/abs/2608.25927
Бесплатное ускорение reasoning-моделей в 3 раза без переобучения
Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.
Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.
Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).
Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.
https://arxiv.org/abs/2608.26070
Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.
Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.
Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).
Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.
https://arxiv.org/abs/2608.26070
PyTorch: vLLM займёт центральное место на конференции 2026 года
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
Что если представить физический мир как исполняемый код?
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549
Больше данных — не всегда ответ для роботов
Хочешь научить робота новым задачам? Обычно говорят: собери больше траекторий. Но авторы VLAct утверждают: дело не в количестве данных, а в том, как они формируют представления в backbone.
Проблема: при наивном дообучении VLM на роботных данных происходит три беды. Узкие траектории разрушают полезные vision-language признаки. Один action head "переспециализирует" backbone под свою геометрию. Разные embodiment-ы не делятся общими знаниями.
Решение VLAct: защита мелких слоёв LLM от перезаписи + микс caption-данных + обучение сразу с несколькими action heads + унифицированное пространство действий для разных роботов.
Результат: +7.6–21.4 пункта на бенчмарках только за счёт лучшего backbone — при том же action head, тех же данных и том же бюджете дообучения. 82.6% на LIBERO-Plus, 92.5% на RoboTwin 2.0. Всё на 16 GPU и открытых данных.
https://arxiv.org/abs/2608.27550
Хочешь научить робота новым задачам? Обычно говорят: собери больше траекторий. Но авторы VLAct утверждают: дело не в количестве данных, а в том, как они формируют представления в backbone.
Проблема: при наивном дообучении VLM на роботных данных происходит три беды. Узкие траектории разрушают полезные vision-language признаки. Один action head "переспециализирует" backbone под свою геометрию. Разные embodiment-ы не делятся общими знаниями.
Решение VLAct: защита мелких слоёв LLM от перезаписи + микс caption-данных + обучение сразу с несколькими action heads + унифицированное пространство действий для разных роботов.
Результат: +7.6–21.4 пункта на бенчмарках только за счёт лучшего backbone — при том же action head, тех же данных и том же бюджете дообучения. 82.6% на LIBERO-Plus, 92.5% на RoboTwin 2.0. Всё на 16 GPU и открытых данных.
https://arxiv.org/abs/2608.27550
Робот учится по видео с людьми — без единой совместной записи
Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.
Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.
Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.
Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.
https://arxiv.org/abs/2608.26103
Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.
Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.
Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.
Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.
https://arxiv.org/abs/2608.26103