Nvidia представила Spectrum-X Ethernet — сетевую архитектуру нового поколения для гигамасштабных ИИ-кластеров.
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
NVIDIA представила результаты нового бенчмарка AgentX
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA Technical Blog
NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt
AI agents have expanded inference from single-turn interactions into multi-step workflows that reason, invoke tools, coordinate subagents, and carry growing context from one turn to the next.
NVIDIA представила Scale-In — пятый столп сетевой инфраструктуры для ИИ-фабрик
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
NVIDIA Technical Blog
NVIDIA BlueField-4 Powers New Scale-In Network Infrastructure for Agentic AI Factories
Traditional cloud infrastructure was designed for predictable, general-purpose workloads and standard interfaces. Agentic AI factories connect diverse users, agents, applications, data sources…
Зайди в сгенерированный мир — с видео, звуком и речью (by JD.com)
Большинство world models генерируют только видео, без звука и без нормального управления. EchoWM решает сразу три проблемы: генерирует 720p видео + звуки окружения + речь персонажей, поддерживает и вид от первого, и от третьего лица, и позволяет непрерывно "ходить" по сцене через 6-DoF траектории камеры.
Ключевая идея — единый интерфейс camera intent: и дискретные команды (WASD), и непрерывные позы камеры приводятся к одному относительному 6-DoF представлению. Модель сама учится, как одна траектория управляет и наблюдателем от первого лица, и персонажем + камерой от третьего.
Обучение — 4 стадии: сначала аудио-визуальный pretraining, потом заморозка backbone и обучение только trajectory pathway, потом joint fine-tuning, потом авторегрессионный post-training на собственных роллаутах для долгосрочной генерации.
https://arxiv.org/abs/2608.23189
Большинство world models генерируют только видео, без звука и без нормального управления. EchoWM решает сразу три проблемы: генерирует 720p видео + звуки окружения + речь персонажей, поддерживает и вид от первого, и от третьего лица, и позволяет непрерывно "ходить" по сцене через 6-DoF траектории камеры.
Ключевая идея — единый интерфейс camera intent: и дискретные команды (WASD), и непрерывные позы камеры приводятся к одному относительному 6-DoF представлению. Модель сама учится, как одна траектория управляет и наблюдателем от первого лица, и персонажем + камерой от третьего.
Обучение — 4 стадии: сначала аудио-визуальный pretraining, потом заморозка backbone и обучение только trajectory pathway, потом joint fine-tuning, потом авторегрессионный post-training на собственных роллаутах для долгосрочной генерации.
https://arxiv.org/abs/2608.23189
Аннотации как роллауты: новый способ учить видео-модели
Обучение видеомоделей через RL страдает от одной проблемы: когда модель сэмплирует несколько ответов и сравнивает их по наградам, хорошие ответы встречаются редко. Авторы предлагают простую идею: добавлять саму аннотацию (ground truth) в группу роллаутов как "оракульный" ответ с гарантированно высокой наградой.
Проблема: если просто добавить GT в группу, он сдвигает среднее вверх, и нормально хорошие on-policy роллауты получают отрицательный advantage (авторы называют это advantage inversion). Итог — модель учится имитировать GT и подавляет исследование.
Решение — OraRL: GT исключается из вычисления baseline, но остаётся целью оптимизации. Advantages считаются только по on-policy роллаутам, а gap до оракула кодируется отдельно. Плюс sign-balanced pruning даёт 1.48× ускорение.
Результат: Video-ORA-9B без chain-of-thought бьёт специализированные модели по 7 задачам (temporal grounding, tracking, segmentation и др.) и быстрее в инференсе.
Обучение видеомоделей через RL страдает от одной проблемы: когда модель сэмплирует несколько ответов и сравнивает их по наградам, хорошие ответы встречаются редко. Авторы предлагают простую идею: добавлять саму аннотацию (ground truth) в группу роллаутов как "оракульный" ответ с гарантированно высокой наградой.
Проблема: если просто добавить GT в группу, он сдвигает среднее вверх, и нормально хорошие on-policy роллауты получают отрицательный advantage (авторы называют это advantage inversion). Итог — модель учится имитировать GT и подавляет исследование.
Решение — OraRL: GT исключается из вычисления baseline, но остаётся целью оптимизации. Advantages считаются только по on-policy роллаутам, а gap до оракула кодируется отдельно. Плюс sign-balanced pruning даёт 1.48× ускорение.
Результат: Video-ORA-9B без chain-of-thought бьёт специализированные модели по 7 задачам (temporal grounding, tracking, segmentation и др.) и быстрее в инференсе.
Prime Agent: агент, который сам себя улучшает (by Prime Intellect)
Что если агентный фреймворк сам по себе мог бы учиться и улучшаться в ходе работы? Именно это делает Prime Agent — открытый harness для долгосрочных задач.
Ключевая идея: иерархия состояний L0–L3. L0 — веса модели, L1 — активный контекст, L2 — персистентный REPL и рекурсивные субагенты, L3 — история, память и переиспользуемые навыки на диске. Агент сам управляет потоком информации между уровнями.
Фишки: рекурсивные вызовы rlm() создают параллельные субагенты, "Continual Harness" сохраняет навыки и промпты между сессиями, прямая коммуникация агент-агент и агент-человек без остановки выполнения.
Результат: ARC-AGI-3 вырос с 30% до 95%, непрерывный прогон nanoGPT на 85.5 часов, обходит Claude Code и Codex на ряде бенчмарков.
https://arxiv.org/abs/2608.23552
Что если агентный фреймворк сам по себе мог бы учиться и улучшаться в ходе работы? Именно это делает Prime Agent — открытый harness для долгосрочных задач.
Ключевая идея: иерархия состояний L0–L3. L0 — веса модели, L1 — активный контекст, L2 — персистентный REPL и рекурсивные субагенты, L3 — история, память и переиспользуемые навыки на диске. Агент сам управляет потоком информации между уровнями.
Фишки: рекурсивные вызовы rlm() создают параллельные субагенты, "Continual Harness" сохраняет навыки и промпты между сессиями, прямая коммуникация агент-агент и агент-человек без остановки выполнения.
Результат: ARC-AGI-3 вырос с 30% до 95%, непрерывный прогон nanoGPT на 85.5 часов, обходит Claude Code и Codex на ряде бенчмарков.
https://arxiv.org/abs/2608.23552
OpenAI представила собственный чип для инференса — Jalapeño.
Первые тесты показывают лидирующие показатели скорости и энергоэффективности среди аналогов. Чип обеспечивает более высокую пропускную способность и меньшую задержку при работе с современными моделями.
Что это значит на практике: ответы от ChatGPT и других продуктов OpenAI станут быстрее, а стоимость вычислений снизится. Компания перестаёт полностью зависеть от Nvidia и берёт контроль над железом в свои руки — как это уже сделали Google с TPU и Amazon с Trainium.
Для пользователей — это прежде всего скорость. Для OpenAI — экономия на инфраструктуре и независимость. Следим за тем, когда Jalapeño появится в реальных продуктах.
https://openai.com/index/jalapeno-first-results
Первые тесты показывают лидирующие показатели скорости и энергоэффективности среди аналогов. Чип обеспечивает более высокую пропускную способность и меньшую задержку при работе с современными моделями.
Что это значит на практике: ответы от ChatGPT и других продуктов OpenAI станут быстрее, а стоимость вычислений снизится. Компания перестаёт полностью зависеть от Nvidia и берёт контроль над железом в свои руки — как это уже сделали Google с TPU и Amazon с Trainium.
Для пользователей — это прежде всего скорость. Для OpenAI — экономия на инфраструктуре и независимость. Следим за тем, когда Jalapeño появится в реальных продуктах.
https://openai.com/index/jalapeno-first-results
OpenAI
Jalapeño’s first results show industry-leading speed and efficiency in AI inference
Jalapeño is a custom inference chip from OpenAI that delivers faster, more power-efficient AI inference, with higher throughput and lower latency for modern models.
Nvidia выпустила Shadow Engine Recovery в NVIDIA Dynamo
Nvidia представила технологию мгновенного восстановления LLM-инференса после сбоев — Shadow Engine Recovery в фреймворке Dynamo.
Раньше при падении движка приходилось делать холодный перезапуск: перезагружать веса в память GPU, компилировать ядра, пересоздавать CUDA-графы. Для больших моделей это занимало до 5 минут, пока оставшиеся серверы захлёбывались от нагрузки.
Новое решение держит на тех же GPU полностью инициализированный «теневой» движок в режиме ожидания. Ключевая хитрость — GPU Memory Service (GMS), который хранит веса модели независимо от процесса движка. При сбое теневой движок подхватывает трафик за 7,3 секунды вместо 283 — в 39 раз быстрее.
Тест проводился на модели GLM-5.2 с серверами на базе NVIDIA B200. Функция доступна в preview-режиме.
https://developer.nvidia.com/blog/restore-llm-inference-capacity-in-seconds-with-shadow-engine-recovery-in-nvidia-dynamo/
Nvidia представила технологию мгновенного восстановления LLM-инференса после сбоев — Shadow Engine Recovery в фреймворке Dynamo.
Раньше при падении движка приходилось делать холодный перезапуск: перезагружать веса в память GPU, компилировать ядра, пересоздавать CUDA-графы. Для больших моделей это занимало до 5 минут, пока оставшиеся серверы захлёбывались от нагрузки.
Новое решение держит на тех же GPU полностью инициализированный «теневой» движок в режиме ожидания. Ключевая хитрость — GPU Memory Service (GMS), который хранит веса модели независимо от процесса движка. При сбое теневой движок подхватывает трафик за 7,3 секунды вместо 283 — в 39 раз быстрее.
Тест проводился на модели GLM-5.2 с серверами на базе NVIDIA B200. Функция доступна в preview-режиме.
https://developer.nvidia.com/blog/restore-llm-inference-capacity-in-seconds-with-shadow-engine-recovery-in-nvidia-dynamo/
NVIDIA Technical Blog
Restore LLM Inference Capacity in Seconds with Shadow Engine Recovery in NVIDIA Dynamo
When an LLM engine process fails, the standard recovery path involves a cold restart. This requires loading weights into HBM from storage, compiling kernels, and capturing NVIDIA CUDA graphs.
Nvidia Tech выпустила CUDA Python 1.0 — теперь Python стал полноценным способом работы с платформой CUDA наравне с C++.
Раньше Python-разработчику для работы с GPU приходилось либо писать расширения на CUDA C++, либо полностью зависеть от сторонних библиотек вроде PyTorch или CuPy. Когда нужно было что-то за пределами их возможностей — начинались проблемы.
Что изменилось: появился единый официальный слой от NVIDIA для доступа к CUDA из Python. Ключевые компоненты — cuda.core (устройства, потоки, буферы), cuda.compute (параллельные алгоритмы), nvmath-python (математические библиотеки). Теперь разные GPU-библиотеки могут работать с одними и теми же объектами без лишних протоколов обмена данными.
Главное для разработчиков: CUDA Python 1.0 вводит семантическое версионирование — API больше не будут ломаться без предупреждения. Это снимает главный барьер для тех, кто боялся строить проекты на нестабильной основе.
https://developer.nvidia.com/blog/cuda-python-1-0-stable-apis-one-foundation-full-platform-access/
Раньше Python-разработчику для работы с GPU приходилось либо писать расширения на CUDA C++, либо полностью зависеть от сторонних библиотек вроде PyTorch или CuPy. Когда нужно было что-то за пределами их возможностей — начинались проблемы.
Что изменилось: появился единый официальный слой от NVIDIA для доступа к CUDA из Python. Ключевые компоненты — cuda.core (устройства, потоки, буферы), cuda.compute (параллельные алгоритмы), nvmath-python (математические библиотеки). Теперь разные GPU-библиотеки могут работать с одними и теми же объектами без лишних протоколов обмена данными.
Главное для разработчиков: CUDA Python 1.0 вводит семантическое версионирование — API больше не будут ломаться без предупреждения. Это снимает главный барьер для тех, кто боялся строить проекты на нестабильной основе.
https://developer.nvidia.com/blog/cuda-python-1-0-stable-apis-one-foundation-full-platform-access/
NVIDIA Technical Blog
CUDA Python 1.0: Stable APIs, One Foundation, Full Platform Access
For years, a Python developer who needed a GPU had two realistic choices: Learn NVIDIA CUDA C++ well enough to write an extension, set up a build toolchain, and maintain bindings back to Python…
👍1
GigaBrain-0.7: робот с тремя «мозгами» вместо одного
Большинство VLA-моделей (Vision-Language-Action) — это просто "смотришь → делаешь". GigaBrain-0.7 от GigaAI предлагает трёхсистемную архитектуру: System 1 генерирует действия через flow matching, System 2 планирует и декомпозирует задачи, System 3 предсказывает будущие состояния и оценивает прогресс через world model. Все три системы общаются через семантические, визуальные и value-интерфейсы.
Ключевые детали: предобучение на 37 000+ часов траекторий, 16 типов роботов, ~270M vision-language сэмплов. Вместо полной блокировки градиентов действий в VLM-бэкбоне используют Soft Knowledge Insulation — градиенты не блокируются, а ослабляются. Обучение одностадийное, без фрагментации на этапы.
Веса и код будут публично доступны.
https://arxiv.org/abs/2608.15875
Большинство VLA-моделей (Vision-Language-Action) — это просто "смотришь → делаешь". GigaBrain-0.7 от GigaAI предлагает трёхсистемную архитектуру: System 1 генерирует действия через flow matching, System 2 планирует и декомпозирует задачи, System 3 предсказывает будущие состояния и оценивает прогресс через world model. Все три системы общаются через семантические, визуальные и value-интерфейсы.
Ключевые детали: предобучение на 37 000+ часов траекторий, 16 типов роботов, ~270M vision-language сэмплов. Вместо полной блокировки градиентов действий в VLM-бэкбоне используют Soft Knowledge Insulation — градиенты не блокируются, а ослабляются. Обучение одностадийное, без фрагментации на этапы.
Веса и код будут публично доступны.
https://arxiv.org/abs/2608.15875
Зачем учить агента решать задачи, если можно научить его строить правильный "скелет" под каждую задачу?
Авторы из NUS предлагают JIT-Agent — мета-агент, который генерирует agent harness (память, планирование, инструменты, control loop) прямо во время инференса, под конкретную задачу. Это в противовес классическому подходу AOT (Ahead-of-Time), где один универсальный harness оптимизируется заранее и применяется ко всем задачам подряд.
Обучение в три этапа: сначала учат генерировать harness по примерам от учителя, затем учат чинить сломанный код (compiler errors, runtime failures), наконец дообучают через Evo-GDPO — RL-метод, который поощряет harness-ы, превосходящие текущий архив.
Результат: DeepSeek-V4-Flash + JIT-Agent обходит GPT-5.6 на нескольких бенчмарках (+9.1 на DeepSearchQA). Ключевая идея: интеллект агента — это свойство пары модель+harness, а не весов модели в одиночку.
https://arxiv.org/abs/2608.25593
Авторы из NUS предлагают JIT-Agent — мета-агент, который генерирует agent harness (память, планирование, инструменты, control loop) прямо во время инференса, под конкретную задачу. Это в противовес классическому подходу AOT (Ahead-of-Time), где один универсальный harness оптимизируется заранее и применяется ко всем задачам подряд.
Обучение в три этапа: сначала учат генерировать harness по примерам от учителя, затем учат чинить сломанный код (compiler errors, runtime failures), наконец дообучают через Evo-GDPO — RL-метод, который поощряет harness-ы, превосходящие текущий архив.
Результат: DeepSeek-V4-Flash + JIT-Agent обходит GPT-5.6 на нескольких бенчмарках (+9.1 на DeepSearchQA). Ключевая идея: интеллект агента — это свойство пары модель+harness, а не весов модели в одиночку.
https://arxiv.org/abs/2608.25593
👍1
Агент, который учится на своих ошибках — но точечно, а не переписывая всё с нуля (by Princeton University)
Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.
Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.
Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.
Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.
https://arxiv.org/abs/2608.24876
Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.
Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.
Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.
Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.
https://arxiv.org/abs/2608.24876
Nvidia Tech — NVLink Fusion и новая память NVHBM для ИИ-инфраструктуры
Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.
Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.
Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.
Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.
Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
NVIDIA Technical Blog
NVIDIA NVLink Fusion Brings NVHBM to Next-Generation AI Infrastructure
AI factories must support increasingly large models and more complex reasoning workloads. To keep up with the insatiable compute demands of AI workloads, hyperscalers and AI-native companies are…
Nvidia представила COMPASS — фреймворк для обучения роботов навигации сразу под разные типы корпусов.
Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.
В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.
Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.
Код и инструкции доступны в репозитории COMPASS на GitHub.
https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.
В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.
Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.
Код и инструкции доступны в репозитории COMPASS на GitHub.
https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
NVIDIA Technical Blog
How to Train a Cross-Embodiment Robot Navigation Policy with AI Agents
Navigation enables a robot to turn perception and motion into purposeful autonomy. Unlike locomotion, which produces stable movement, navigation must be used to continuously localize the robot…
Nvidia + Alibaba: Qwen3.8-Flash-Next на GB300 NVL72 для агентного кодинга
Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.
Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.
На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.
Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.
Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.
На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.
Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.
https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
NVIDIA Technical Blog
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
Alibaba released the model weights for Qwen3.8-Flash-Next as a preview of the upcoming Qwen4 architecture for developers to experiment with and evaluate. It’s a multimodal mixture-of-experts (MoE)…
Управляй инструментами LLM без переобучения — одним вектором в пространстве активаций
Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».
Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.
Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.
https://arxiv.org/abs/2608.25198
Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».
Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.
Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.
https://arxiv.org/abs/2608.25198
👍1
Как правильно подключать и отключать плагины без перезапуска всей системы? (by DeepSeek)
Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.
DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:
Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.
Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.
Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.
DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:
Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.
Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.
Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Агентный ИИ: единица измерения — выполненная работа, а не ответ на вопрос
Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.
Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов
Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.
https://arxiv.org/abs/2608.23283
Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.
Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов
Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.
https://arxiv.org/abs/2608.23283
Google DeepMind запустила первые в мире двойные слепые оценки AI-моделей.
Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.
Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.
Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.
Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.
Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.
Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.
https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Google DeepMind
Piloting the world's first double-blind AI evaluations
Building trust in proprietary model benchmarks using cryptographically secure environments
Amazon Science предупреждает: не доверяйте слепо консенсусу AI-судей
Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.
Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.
Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.
https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.
Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.
Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.
https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
Amazon Science
When LLM judges agree, should we believe them?
Discounting the opinions of LLM judges with highly correlated outputs ensures that panels of judges reflect a true diversity of perspectives.
👍1
Apple ML опубликовала исследование о новом подходе к обучению AI-ответам на вопросы.
Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.
Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.
Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.
Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.
https://machinelearning.apple.com/research/rubric-based-alignment
Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.
Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.
Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.
Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.
https://machinelearning.apple.com/research/rubric-based-alignment
Apple Machine Learning Research
From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
Designing effective reward signals for open-domain question answering is challenging because high-quality responses must simultaneously…