Агент, который учится на своих ошибках — но точечно, а не переписывая всё с нуля (by Princeton University)
Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.
Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.
Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.
Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.
https://arxiv.org/abs/2608.24876
Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.
Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.
Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.
Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.
https://arxiv.org/abs/2608.24876
Nvidia Tech — NVLink Fusion и новая память NVHBM для ИИ-инфраструктуры
Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.
Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.
Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.
Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.
Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
NVIDIA Technical Blog
NVIDIA NVLink Fusion Brings NVHBM to Next-Generation AI Infrastructure
AI factories must support increasingly large models and more complex reasoning workloads. To keep up with the insatiable compute demands of AI workloads, hyperscalers and AI-native companies are…
Nvidia представила COMPASS — фреймворк для обучения роботов навигации сразу под разные типы корпусов.
Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.
В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.
Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.
Код и инструкции доступны в репозитории COMPASS на GitHub.
https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.
В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.
Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.
Код и инструкции доступны в репозитории COMPASS на GitHub.
https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
NVIDIA Technical Blog
How to Train a Cross-Embodiment Robot Navigation Policy with AI Agents
Navigation enables a robot to turn perception and motion into purposeful autonomy. Unlike locomotion, which produces stable movement, navigation must be used to continuously localize the robot…
Nvidia + Alibaba: Qwen3.8-Flash-Next на GB300 NVL72 для агентного кодинга
Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.
Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.
На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.
Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.
Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.
На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.
Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
NVIDIA Technical Blog
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
Alibaba released the model weights for Qwen3.8-Flash-Next as a preview of the upcoming Qwen4 architecture for developers to experiment with and evaluate. It’s a multimodal mixture-of-experts (MoE)…
Управляй инструментами LLM без переобучения — одним вектором в пространстве активаций
Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».
Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.
Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.
https://arxiv.org/abs/2608.25198
Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».
Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.
Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.
https://arxiv.org/abs/2608.25198
👍1
Как правильно подключать и отключать плагины без перезапуска всей системы? (by DeepSeek)
Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.
DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:
Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.
Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.
Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.
DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:
Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.
Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.
Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Агентный ИИ: единица измерения — выполненная работа, а не ответ на вопрос
Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.
Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов
Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.
https://arxiv.org/abs/2608.23283
Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.
Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов
Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.
https://arxiv.org/abs/2608.23283
Google DeepMind запустила первые в мире двойные слепые оценки AI-моделей.
Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.
Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.
Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.
Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.
Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Google DeepMind
Piloting the world's first double-blind AI evaluations
Building trust in proprietary model benchmarks using cryptographically secure environments
Amazon Science предупреждает: не доверяйте слепо консенсусу AI-судей
Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.
Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.
Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.
https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.
Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.
Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.
https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
Amazon Science
When LLM judges agree, should we believe them?
Discounting the opinions of LLM judges with highly correlated outputs ensures that panels of judges reflect a true diversity of perspectives.
👍1
Apple ML опубликовала исследование о новом подходе к обучению AI-ответам на вопросы.
Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.
Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.
Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.
Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.
https://machinelearning.apple.com/research/rubric-based-alignment
Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.
Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.
Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.
Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.
https://machinelearning.apple.com/research/rubric-based-alignment
Apple Machine Learning Research
From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
Designing effective reward signals for open-domain question answering is challenging because high-quality responses must simultaneously…
AI-учёный от Google: от идеи до синтеза материалов в реальной лаборатории (by Google)
Co-Scientist — мультиагентная система на базе Gemini, которая теперь не просто генерирует гипотезы, но и доводит их до физически верифицированных результатов. Три домена, три уровня автономности:
Материаловедение: система спроектировала безопасный CVD-протокол синтеза 2D-материалов (MoS2, MoSe2, WS2) — с первой попытки.
Биология: предсказала морфологию роёв E. coli по градиенту концентрации индуктора, результаты совпали с мокрыми экспериментами.
CS: полностью автономно нашла архитектуру агента, обогнавшую шесть фронтирных моделей на HealthBench Hard.
Пайплайн: эволюционная генерация гипотез с UCB-отбором → итеративная генерация кода → написание статьи с проверкой на галлюцинации. Двойное слепое исследование (30 экспертов, 450 ревью) подтвердило: модули верификации реально снижают галлюцинации и плагиат.
https://arxiv.org/abs/2608.26701
Co-Scientist — мультиагентная система на базе Gemini, которая теперь не просто генерирует гипотезы, но и доводит их до физически верифицированных результатов. Три домена, три уровня автономности:
Материаловедение: система спроектировала безопасный CVD-протокол синтеза 2D-материалов (MoS2, MoSe2, WS2) — с первой попытки.
Биология: предсказала морфологию роёв E. coli по градиенту концентрации индуктора, результаты совпали с мокрыми экспериментами.
CS: полностью автономно нашла архитектуру агента, обогнавшую шесть фронтирных моделей на HealthBench Hard.
Пайплайн: эволюционная генерация гипотез с UCB-отбором → итеративная генерация кода → написание статьи с проверкой на галлюцинации. Двойное слепое исследование (30 экспертов, 450 ревью) подтвердило: модули верификации реально снижают галлюцинации и плагиат.
https://arxiv.org/abs/2608.26701
Видео на всю длину истории, а не только один клип
Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.
Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.
Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.
Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.
https://arxiv.org/abs/2608.23383
Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.
Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.
Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.
Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.
https://arxiv.org/abs/2608.23383
Дистилляция из нескольких учителей сломана — и вот почему (by ByteDance & Tsinghua)
Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.
Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.
Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness
Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.
Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.
Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness
Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Nvidia представила TensorRT Model Connect — инструмент для развёртывания открытых моделей в нативных C++ приложениях всего двумя командами.
Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.
Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.
Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.
Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect
https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.
Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.
Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.
Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect
https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
GitHub
GitHub - NVIDIA/TensorRT-Model-Connect: From PyTorch model to end-to-end TensorRT inference experience in two commands—AI-native…
From PyTorch model to end-to-end TensorRT inference experience in two commands—AI-native, cross-platform, and built for the best possible user experience. - NVIDIA/TensorRT-Model-Connect
Apple ML опубликовала исследование о том, насколько последовательно языковые модели обновляют свои убеждения при получении новых данных.
Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.
Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".
Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.
https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.
Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".
Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.
https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Apple Machine Learning Research
LLMs Are Not (Consistently) Bayesian: Quantifying Internal (In)consistencies of LLMs’ Probabilistic Beliefs
Modern AI systems are being deployed in complex domains such as medicine, science, and law, where there is often not a single correct answer…
Apple ML представила Agent Seer — систему для автоматической генерации тестовых сценариев для AI-агентов.
Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.
Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.
Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.
Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.
https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.
Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.
Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.
Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.
https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
Apple Machine Learning Research
Agent Seer: Synthesizing Scenarios from Specification Understanding
Evaluating AI agents that use external tools requires realistic test scenarios that capture how practitioners compose tools and iterate…
LLM пишет 3D-модели как программу — и получает чёткие грани, именованные детали и редактируемость
Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).
Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.
Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.
https://arxiv.org/abs/2608.26238
Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).
Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.
Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.
https://arxiv.org/abs/2608.26238
LLM как мозг игрового мира: Code World Model
Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.
Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.
Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.
Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.
https://arxiv.org/abs/2608.25927
Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.
Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.
Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.
Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.
https://arxiv.org/abs/2608.25927
Бесплатное ускорение reasoning-моделей в 3 раза без переобучения
Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.
Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.
Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).
Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.
https://arxiv.org/abs/2608.26070
Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.
Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.
Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).
Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.
https://arxiv.org/abs/2608.26070
PyTorch: vLLM займёт центральное место на конференции 2026 года
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.
Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.
Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.
Регистрация уже открыта.
https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
Что если представить физический мир как исполняемый код?
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549
VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?
Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.
Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.
На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.
https://arxiv.org/abs/2608.27549