PyTorch + IBM: ИИ-агенты ускоряют запуск моделей на новом железе
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
Hydra-0: один интерфейс для управления любым роботом
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Зачем делать backprop через 15-шаговый агент, если можно просто пошуметь по весам?
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Синтез задач для терминальных агентов: как не потерять смысл по дороге
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580
Amazon Science выпустила SOP-Bench — открытый бенчмарк для оценки AI-агентов на реальных бизнес-процедурах.
Большинство существующих тестов проверяют агентов на изолированных задачах с чистыми данными. SOP-Bench идёт дальше: 2000+ задач из 12 отраслей (медицина, логистика, финансы, модерация контента), реальные рабочие инструкции с намеренной неоднозначностью, работающие API-инструменты и эталонные ответы для объективной оценки.
Ключевой вывод из тестирования 11 топовых моделей: новые модели не всегда лучше, больше инструментов иногда снижает успешность, и ни одна модель не побеждает во всех сценариях.
Бенчмарк открытый — команды могут тестировать собственных агентов и добавлять свои процедуры. Это важно для компаний, которые хотят реально оценить AI-агентов перед внедрением в продакшн, а не полагаться на красивые демо.
https://www.amazon.science/blog/sop-bench-a-new-benchmark-for-evaluating-ai-agents-on-real-business-procedures
Большинство существующих тестов проверяют агентов на изолированных задачах с чистыми данными. SOP-Bench идёт дальше: 2000+ задач из 12 отраслей (медицина, логистика, финансы, модерация контента), реальные рабочие инструкции с намеренной неоднозначностью, работающие API-инструменты и эталонные ответы для объективной оценки.
Ключевой вывод из тестирования 11 топовых моделей: новые модели не всегда лучше, больше инструментов иногда снижает успешность, и ни одна модель не побеждает во всех сценариях.
Бенчмарк открытый — команды могут тестировать собственных агентов и добавлять свои процедуры. Это важно для компаний, которые хотят реально оценить AI-агентов перед внедрением в продакшн, а не полагаться на красивые демо.
https://www.amazon.science/blog/sop-bench-a-new-benchmark-for-evaluating-ai-agents-on-real-business-procedures
Amazon Science
SOP-Bench: A new benchmark for evaluating AI agents on real business procedures
Extendable framework enables testing agents on the full set of capabilities required to successfully complete a procedure, not isolated proxy tasks.
Один агент — хорошо, а граф агентов — лучше
Свежий большой survey о том, как строить мультиагентные системы на базе LLM. Авторы вводят понятие Graph Engineering — способ организации агентов не просто в цепочки, а в графы с явной структурой задач, координацией и управлением состоянием.
Иерархия такая: Model Intelligence (один LLM) → Individual Intelligence (агент с инструментами и памятью) → System Intelligence (граф агентов). Каждый уровень решает то, что предыдущий не может.
Ключевые компоненты Graph Engineering: декомпозиция задач в граф подзадач, оптимизация воркфлоу, моделирование возможностей агентов, их командная организация, коммуникация между ними, и — что важно — управление состоянием в рантайме с локализацией и восстановлением после сбоев.
Авторы также смотрят вперёд: следующий уровень после графов — Ontology Engineering, где агенты разделяют общую семантику и выравнивают цели.
https://arxiv.org/abs/2608.21156
Свежий большой survey о том, как строить мультиагентные системы на базе LLM. Авторы вводят понятие Graph Engineering — способ организации агентов не просто в цепочки, а в графы с явной структурой задач, координацией и управлением состоянием.
Иерархия такая: Model Intelligence (один LLM) → Individual Intelligence (агент с инструментами и памятью) → System Intelligence (граф агентов). Каждый уровень решает то, что предыдущий не может.
Ключевые компоненты Graph Engineering: декомпозиция задач в граф подзадач, оптимизация воркфлоу, моделирование возможностей агентов, их командная организация, коммуникация между ними, и — что важно — управление состоянием в рантайме с локализацией и восстановлением после сбоев.
Авторы также смотрят вперёд: следующий уровень после графов — Ontology Engineering, где агенты разделяют общую семантику и выравнивают цели.
https://arxiv.org/abs/2608.21156
Агент, который учится на своих же победах — без дообучения
Обычно LLM-агенты каждый раз заново "изобретают велосипед": решили задачу через workflow — и забыли. FlowEvo от Southeast University ломает этот паттерн.
Идея: когда агент успешно решает задачу, полезная часть workflow компилируется в исполняемый "скилл" и кладётся в персистентный банк. При следующих задачах скиллы либо запускаются напрямую, либо используются как структурный контекст для генерации нового workflow.
Получается петля: workflow → скилл → новый workflow. Причём всё это без обновления весов модели — чисто inference-time эволюция.
Ещё интересная деталь: есть lifecycle-механизм, который отслеживает "пользу" каждого скилла и автоматически подавляет те, что стабильно вредят.
Проверили на 5 бенчмарках (ALFWorld, HumanEval, MBPP, GSM8K, MATH-500) — лучше 8 базелайнов на всех, работает с 10 разными базовыми моделями.
https://arxiv.org/abs/2607.21596
Обычно LLM-агенты каждый раз заново "изобретают велосипед": решили задачу через workflow — и забыли. FlowEvo от Southeast University ломает этот паттерн.
Идея: когда агент успешно решает задачу, полезная часть workflow компилируется в исполняемый "скилл" и кладётся в персистентный банк. При следующих задачах скиллы либо запускаются напрямую, либо используются как структурный контекст для генерации нового workflow.
Получается петля: workflow → скилл → новый workflow. Причём всё это без обновления весов модели — чисто inference-time эволюция.
Ещё интересная деталь: есть lifecycle-механизм, который отслеживает "пользу" каждого скилла и автоматически подавляет те, что стабильно вредят.
Проверили на 5 бенчмарках (ALFWorld, HumanEval, MBPP, GSM8K, MATH-500) — лучше 8 базелайнов на всех, работает с 10 разными базовыми моделями.
https://arxiv.org/abs/2607.21596
ReWorld: мировая модель с долгосрочной памятью (by Alibaba/TongyiLab)
Представьте: вы гуляете по виртуальному миру, уходите далеко, возвращаетесь — и место выглядит точно так же, как вы его оставили. Это и есть задача ReWorld.
Проблема: управление (следить за командами камеры) и память (помнить посещённые места) конфликтуют при совместном обучении. Авторы разделили их через mixed attention windows: одни головы трансформера обучаются на коротких окнах (контроль), другие — на длинных (память). Чтобы это работало на инференсе с ограниченным KV-кешем, используется random head routing — каждый шаг случайно меняется, какие головы "глобальные".
Для долгосрочной памяти: старые чанки сохраняются как "landmarks" по пространственному расстоянию, а при возврате в локацию извлекаются по близости позы камеры. Chunk-drop training учит модель работать с неполной историей.
Результат: стриминговая генерация видео в реальном времени с пространственной консистентностью на длинных роллаутах.
https://arxiv.org/abs/2608.23565
Представьте: вы гуляете по виртуальному миру, уходите далеко, возвращаетесь — и место выглядит точно так же, как вы его оставили. Это и есть задача ReWorld.
Проблема: управление (следить за командами камеры) и память (помнить посещённые места) конфликтуют при совместном обучении. Авторы разделили их через mixed attention windows: одни головы трансформера обучаются на коротких окнах (контроль), другие — на длинных (память). Чтобы это работало на инференсе с ограниченным KV-кешем, используется random head routing — каждый шаг случайно меняется, какие головы "глобальные".
Для долгосрочной памяти: старые чанки сохраняются как "landmarks" по пространственному расстоянию, а при возврате в локацию извлекаются по близости позы камеры. Chunk-drop training учит модель работать с неполной историей.
Результат: стриминговая генерация видео в реальном времени с пространственной консистентностью на длинных роллаутах.
https://arxiv.org/abs/2608.23565
Nvidia представила Spectrum-X Ethernet — сетевую архитектуру нового поколения для гигамасштабных ИИ-кластеров.
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
NVIDIA представила результаты нового бенчмарка AgentX
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA Technical Blog
NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt
AI agents have expanded inference from single-turn interactions into multi-step workflows that reason, invoke tools, coordinate subagents, and carry growing context from one turn to the next.
NVIDIA представила Scale-In — пятый столп сетевой инфраструктуры для ИИ-фабрик
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
NVIDIA Technical Blog
NVIDIA BlueField-4 Powers New Scale-In Network Infrastructure for Agentic AI Factories
Traditional cloud infrastructure was designed for predictable, general-purpose workloads and standard interfaces. Agentic AI factories connect diverse users, agents, applications, data sources…
Зайди в сгенерированный мир — с видео, звуком и речью (by JD.com)
Большинство world models генерируют только видео, без звука и без нормального управления. EchoWM решает сразу три проблемы: генерирует 720p видео + звуки окружения + речь персонажей, поддерживает и вид от первого, и от третьего лица, и позволяет непрерывно "ходить" по сцене через 6-DoF траектории камеры.
Ключевая идея — единый интерфейс camera intent: и дискретные команды (WASD), и непрерывные позы камеры приводятся к одному относительному 6-DoF представлению. Модель сама учится, как одна траектория управляет и наблюдателем от первого лица, и персонажем + камерой от третьего.
Обучение — 4 стадии: сначала аудио-визуальный pretraining, потом заморозка backbone и обучение только trajectory pathway, потом joint fine-tuning, потом авторегрессионный post-training на собственных роллаутах для долгосрочной генерации.
https://arxiv.org/abs/2608.23189
Большинство world models генерируют только видео, без звука и без нормального управления. EchoWM решает сразу три проблемы: генерирует 720p видео + звуки окружения + речь персонажей, поддерживает и вид от первого, и от третьего лица, и позволяет непрерывно "ходить" по сцене через 6-DoF траектории камеры.
Ключевая идея — единый интерфейс camera intent: и дискретные команды (WASD), и непрерывные позы камеры приводятся к одному относительному 6-DoF представлению. Модель сама учится, как одна траектория управляет и наблюдателем от первого лица, и персонажем + камерой от третьего.
Обучение — 4 стадии: сначала аудио-визуальный pretraining, потом заморозка backbone и обучение только trajectory pathway, потом joint fine-tuning, потом авторегрессионный post-training на собственных роллаутах для долгосрочной генерации.
https://arxiv.org/abs/2608.23189
Аннотации как роллауты: новый способ учить видео-модели
Обучение видеомоделей через RL страдает от одной проблемы: когда модель сэмплирует несколько ответов и сравнивает их по наградам, хорошие ответы встречаются редко. Авторы предлагают простую идею: добавлять саму аннотацию (ground truth) в группу роллаутов как "оракульный" ответ с гарантированно высокой наградой.
Проблема: если просто добавить GT в группу, он сдвигает среднее вверх, и нормально хорошие on-policy роллауты получают отрицательный advantage (авторы называют это advantage inversion). Итог — модель учится имитировать GT и подавляет исследование.
Решение — OraRL: GT исключается из вычисления baseline, но остаётся целью оптимизации. Advantages считаются только по on-policy роллаутам, а gap до оракула кодируется отдельно. Плюс sign-balanced pruning даёт 1.48× ускорение.
Результат: Video-ORA-9B без chain-of-thought бьёт специализированные модели по 7 задачам (temporal grounding, tracking, segmentation и др.) и быстрее в инференсе.
Обучение видеомоделей через RL страдает от одной проблемы: когда модель сэмплирует несколько ответов и сравнивает их по наградам, хорошие ответы встречаются редко. Авторы предлагают простую идею: добавлять саму аннотацию (ground truth) в группу роллаутов как "оракульный" ответ с гарантированно высокой наградой.
Проблема: если просто добавить GT в группу, он сдвигает среднее вверх, и нормально хорошие on-policy роллауты получают отрицательный advantage (авторы называют это advantage inversion). Итог — модель учится имитировать GT и подавляет исследование.
Решение — OraRL: GT исключается из вычисления baseline, но остаётся целью оптимизации. Advantages считаются только по on-policy роллаутам, а gap до оракула кодируется отдельно. Плюс sign-balanced pruning даёт 1.48× ускорение.
Результат: Video-ORA-9B без chain-of-thought бьёт специализированные модели по 7 задачам (temporal grounding, tracking, segmentation и др.) и быстрее в инференсе.
Prime Agent: агент, который сам себя улучшает (by Prime Intellect)
Что если агентный фреймворк сам по себе мог бы учиться и улучшаться в ходе работы? Именно это делает Prime Agent — открытый harness для долгосрочных задач.
Ключевая идея: иерархия состояний L0–L3. L0 — веса модели, L1 — активный контекст, L2 — персистентный REPL и рекурсивные субагенты, L3 — история, память и переиспользуемые навыки на диске. Агент сам управляет потоком информации между уровнями.
Фишки: рекурсивные вызовы rlm() создают параллельные субагенты, "Continual Harness" сохраняет навыки и промпты между сессиями, прямая коммуникация агент-агент и агент-человек без остановки выполнения.
Результат: ARC-AGI-3 вырос с 30% до 95%, непрерывный прогон nanoGPT на 85.5 часов, обходит Claude Code и Codex на ряде бенчмарков.
https://arxiv.org/abs/2608.23552
Что если агентный фреймворк сам по себе мог бы учиться и улучшаться в ходе работы? Именно это делает Prime Agent — открытый harness для долгосрочных задач.
Ключевая идея: иерархия состояний L0–L3. L0 — веса модели, L1 — активный контекст, L2 — персистентный REPL и рекурсивные субагенты, L3 — история, память и переиспользуемые навыки на диске. Агент сам управляет потоком информации между уровнями.
Фишки: рекурсивные вызовы rlm() создают параллельные субагенты, "Continual Harness" сохраняет навыки и промпты между сессиями, прямая коммуникация агент-агент и агент-человек без остановки выполнения.
Результат: ARC-AGI-3 вырос с 30% до 95%, непрерывный прогон nanoGPT на 85.5 часов, обходит Claude Code и Codex на ряде бенчмарков.
https://arxiv.org/abs/2608.23552
OpenAI представила собственный чип для инференса — Jalapeño.
Первые тесты показывают лидирующие показатели скорости и энергоэффективности среди аналогов. Чип обеспечивает более высокую пропускную способность и меньшую задержку при работе с современными моделями.
Что это значит на практике: ответы от ChatGPT и других продуктов OpenAI станут быстрее, а стоимость вычислений снизится. Компания перестаёт полностью зависеть от Nvidia и берёт контроль над железом в свои руки — как это уже сделали Google с TPU и Amazon с Trainium.
Для пользователей — это прежде всего скорость. Для OpenAI — экономия на инфраструктуре и независимость. Следим за тем, когда Jalapeño появится в реальных продуктах.
https://openai.com/index/jalapeno-first-results
Первые тесты показывают лидирующие показатели скорости и энергоэффективности среди аналогов. Чип обеспечивает более высокую пропускную способность и меньшую задержку при работе с современными моделями.
Что это значит на практике: ответы от ChatGPT и других продуктов OpenAI станут быстрее, а стоимость вычислений снизится. Компания перестаёт полностью зависеть от Nvidia и берёт контроль над железом в свои руки — как это уже сделали Google с TPU и Amazon с Trainium.
Для пользователей — это прежде всего скорость. Для OpenAI — экономия на инфраструктуре и независимость. Следим за тем, когда Jalapeño появится в реальных продуктах.
https://openai.com/index/jalapeno-first-results
OpenAI
Jalapeño’s first results show industry-leading speed and efficiency in AI inference
Jalapeño is a custom inference chip from OpenAI that delivers faster, more power-efficient AI inference, with higher throughput and lower latency for modern models.
Nvidia выпустила Shadow Engine Recovery в NVIDIA Dynamo
Nvidia представила технологию мгновенного восстановления LLM-инференса после сбоев — Shadow Engine Recovery в фреймворке Dynamo.
Раньше при падении движка приходилось делать холодный перезапуск: перезагружать веса в память GPU, компилировать ядра, пересоздавать CUDA-графы. Для больших моделей это занимало до 5 минут, пока оставшиеся серверы захлёбывались от нагрузки.
Новое решение держит на тех же GPU полностью инициализированный «теневой» движок в режиме ожидания. Ключевая хитрость — GPU Memory Service (GMS), который хранит веса модели независимо от процесса движка. При сбое теневой движок подхватывает трафик за 7,3 секунды вместо 283 — в 39 раз быстрее.
Тест проводился на модели GLM-5.2 с серверами на базе NVIDIA B200. Функция доступна в preview-режиме.
https://developer.nvidia.com/blog/restore-llm-inference-capacity-in-seconds-with-shadow-engine-recovery-in-nvidia-dynamo/
Nvidia представила технологию мгновенного восстановления LLM-инференса после сбоев — Shadow Engine Recovery в фреймворке Dynamo.
Раньше при падении движка приходилось делать холодный перезапуск: перезагружать веса в память GPU, компилировать ядра, пересоздавать CUDA-графы. Для больших моделей это занимало до 5 минут, пока оставшиеся серверы захлёбывались от нагрузки.
Новое решение держит на тех же GPU полностью инициализированный «теневой» движок в режиме ожидания. Ключевая хитрость — GPU Memory Service (GMS), который хранит веса модели независимо от процесса движка. При сбое теневой движок подхватывает трафик за 7,3 секунды вместо 283 — в 39 раз быстрее.
Тест проводился на модели GLM-5.2 с серверами на базе NVIDIA B200. Функция доступна в preview-режиме.
https://developer.nvidia.com/blog/restore-llm-inference-capacity-in-seconds-with-shadow-engine-recovery-in-nvidia-dynamo/
NVIDIA Technical Blog
Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo
When an LLM engine process fails, the standard recovery path involves a cold restart. This requires loading weights into HBM from storage, compiling kernels, and capturing NVIDIA CUDA graphs.
Nvidia Tech выпустила CUDA Python 1.0 — теперь Python стал полноценным способом работы с платформой CUDA наравне с C++.
Раньше Python-разработчику для работы с GPU приходилось либо писать расширения на CUDA C++, либо полностью зависеть от сторонних библиотек вроде PyTorch или CuPy. Когда нужно было что-то за пределами их возможностей — начинались проблемы.
Что изменилось: появился единый официальный слой от NVIDIA для доступа к CUDA из Python. Ключевые компоненты — cuda.core (устройства, потоки, буферы), cuda.compute (параллельные алгоритмы), nvmath-python (математические библиотеки). Теперь разные GPU-библиотеки могут работать с одними и теми же объектами без лишних протоколов обмена данными.
Главное для разработчиков: CUDA Python 1.0 вводит семантическое версионирование — API больше не будут ломаться без предупреждения. Это снимает главный барьер для тех, кто боялся строить проекты на нестабильной основе.
https://developer.nvidia.com/blog/cuda-python-1-0-stable-apis-one-foundation-full-platform-access/
Раньше Python-разработчику для работы с GPU приходилось либо писать расширения на CUDA C++, либо полностью зависеть от сторонних библиотек вроде PyTorch или CuPy. Когда нужно было что-то за пределами их возможностей — начинались проблемы.
Что изменилось: появился единый официальный слой от NVIDIA для доступа к CUDA из Python. Ключевые компоненты — cuda.core (устройства, потоки, буферы), cuda.compute (параллельные алгоритмы), nvmath-python (математические библиотеки). Теперь разные GPU-библиотеки могут работать с одними и теми же объектами без лишних протоколов обмена данными.
Главное для разработчиков: CUDA Python 1.0 вводит семантическое версионирование — API больше не будут ломаться без предупреждения. Это снимает главный барьер для тех, кто боялся строить проекты на нестабильной основе.
https://developer.nvidia.com/blog/cuda-python-1-0-stable-apis-one-foundation-full-platform-access/
NVIDIA Technical Blog
CUDA Python 1.0: Stable APIs, One Foundation, Full Platform Access
For years, a Python developer who needed a GPU had two realistic choices: Learn NVIDIA CUDA C++ well enough to write an extension, set up a build toolchain, and maintain bindings back to Python…
👍1
GigaBrain-0.7: робот с тремя «мозгами» вместо одного
Большинство VLA-моделей (Vision-Language-Action) — это просто "смотришь → делаешь". GigaBrain-0.7 от GigaAI предлагает трёхсистемную архитектуру: System 1 генерирует действия через flow matching, System 2 планирует и декомпозирует задачи, System 3 предсказывает будущие состояния и оценивает прогресс через world model. Все три системы общаются через семантические, визуальные и value-интерфейсы.
Ключевые детали: предобучение на 37 000+ часов траекторий, 16 типов роботов, ~270M vision-language сэмплов. Вместо полной блокировки градиентов действий в VLM-бэкбоне используют Soft Knowledge Insulation — градиенты не блокируются, а ослабляются. Обучение одностадийное, без фрагментации на этапы.
Веса и код будут публично доступны.
https://arxiv.org/abs/2608.15875
Большинство VLA-моделей (Vision-Language-Action) — это просто "смотришь → делаешь". GigaBrain-0.7 от GigaAI предлагает трёхсистемную архитектуру: System 1 генерирует действия через flow matching, System 2 планирует и декомпозирует задачи, System 3 предсказывает будущие состояния и оценивает прогресс через world model. Все три системы общаются через семантические, визуальные и value-интерфейсы.
Ключевые детали: предобучение на 37 000+ часов траекторий, 16 типов роботов, ~270M vision-language сэмплов. Вместо полной блокировки градиентов действий в VLM-бэкбоне используют Soft Knowledge Insulation — градиенты не блокируются, а ослабляются. Обучение одностадийное, без фрагментации на этапы.
Веса и код будут публично доступны.
https://arxiv.org/abs/2608.15875
Зачем учить агента решать задачи, если можно научить его строить правильный "скелет" под каждую задачу?
Авторы из NUS предлагают JIT-Agent — мета-агент, который генерирует agent harness (память, планирование, инструменты, control loop) прямо во время инференса, под конкретную задачу. Это в противовес классическому подходу AOT (Ahead-of-Time), где один универсальный harness оптимизируется заранее и применяется ко всем задачам подряд.
Обучение в три этапа: сначала учат генерировать harness по примерам от учителя, затем учат чинить сломанный код (compiler errors, runtime failures), наконец дообучают через Evo-GDPO — RL-метод, который поощряет harness-ы, превосходящие текущий архив.
Результат: DeepSeek-V4-Flash + JIT-Agent обходит GPT-5.6 на нескольких бенчмарках (+9.1 на DeepSearchQA). Ключевая идея: интеллект агента — это свойство пары модель+harness, а не весов модели в одиночку.
https://arxiv.org/abs/2608.25593
Авторы из NUS предлагают JIT-Agent — мета-агент, который генерирует agent harness (память, планирование, инструменты, control loop) прямо во время инференса, под конкретную задачу. Это в противовес классическому подходу AOT (Ahead-of-Time), где один универсальный harness оптимизируется заранее и применяется ко всем задачам подряд.
Обучение в три этапа: сначала учат генерировать harness по примерам от учителя, затем учат чинить сломанный код (compiler errors, runtime failures), наконец дообучают через Evo-GDPO — RL-метод, который поощряет harness-ы, превосходящие текущий архив.
Результат: DeepSeek-V4-Flash + JIT-Agent обходит GPT-5.6 на нескольких бенчмарках (+9.1 на DeepSearchQA). Ключевая идея: интеллект агента — это свойство пары модель+harness, а не весов модели в одиночку.
https://arxiv.org/abs/2608.25593
👍1
Агент, который учится на своих ошибках — но точечно, а не переписывая всё с нуля (by Princeton University)
Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.
Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.
Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.
Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.
https://arxiv.org/abs/2608.24876
Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.
Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.
Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.
Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.
https://arxiv.org/abs/2608.24876
Nvidia Tech — NVLink Fusion и новая память NVHBM для ИИ-инфраструктуры
Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.
Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.
Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.
Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.
Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
NVIDIA Technical Blog
NVIDIA NVLink Fusion Brings NVHBM to Next-Generation AI Infrastructure
AI factories must support increasingly large models and more complex reasoning workloads. To keep up with the insatiable compute demands of AI workloads, hyperscalers and AI-native companies are…