Nvidia Tech: GPU-ускорение кластеризации финансовых инструментов для квантов
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
Nvidia представила AdaptGrow — алгоритм матричной факторизации, который позволяет группировать до 1 миллиона финансовых инструментов одновременно с помощью GPU-инфраструктуры.
Что нового: память сокращена с 20n² до 4n² байт, что позволяет обрабатывать 100 000 инструментов на одном GPU NVIDIA GB200 за 13 секунд. Миллион инструментов обрабатывается на 16 узлах за 2–4 минуты.
Почему важно: квантовые стратегии — портфельное строительство, риск-агрегация, статарбитраж — требуют точной кластеризации. Неверные группировки маскируют реальные риски и разрушают арбитражные пары в стрессовых условиях рынка.
Для пользователей: инструмент работает как на одном GPU, так и в мультиузловой конфигурации без смены интерфейса. Доступен companion notebook для воспроизведения результатов.
https://developer.nvidia.com/blog/gpu-accelerated-clustering-for-financial-instruments-at-scale/
NVIDIA Technical Blog
GPU-Accelerated Clustering for Financial Instruments at Scale
Use AdaptGrow, a GPU-accelerated matrix factorization algorithm, to turn rolling correlation and tail-dependence matrices into hard clusters, soft factor loadings, and structural-break signals at…
Nvidia выпустила DSX MaxLPS — набор технологий для максимальной эффективности ИИ-фабрик в рамках фиксированного энергобюджета.
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
Главная проблема: традиционное резервирование мощности под пиковую нагрузку «замораживает» энергию впустую. В типичном дата-центре на 100 МВт лишь 60% реально доходит до GPU.
MaxLPS решает это тремя способами: динамическое перераспределение мощности между стойками в реальном времени, программная оптимизация производительности на ватт для конкретных задач, а также жидкостное охлаждение при 45°C для снижения накладных расходов на климатику.
Результат на системах Vera Rubin NVL72 и GB200 NVL72: до 40% больше GPU-мощностей в том же здании и рост производительности на ватт в 1,3–1,5 раза.
Для операторов это означает больше токенов с каждого мегаватта без строительства новых объектов.
https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/
NVIDIA Technical Blog
Maximizing AI Factory Performance per Watt with NVIDIA DSX MaxLPS
AI factories are power-constrained industrial systems. The question is no longer how many GPUs fit in a data center, but how much AI output each available megawatt can deliver.
Агент улучшает себя сам — но без изменения весов (by HKUST)
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
Что если заморозить LLM и дать ей самой переписывать свой "обвес" — промпты, инструменты, память, логику? Именно это делает Hierarchical Self-Improvement (HSI).
Идея: три уровня эволюции. Первый — task harness (как агент выполняет задачи). Второй — evolver (как переписывается harness). Третий — meta-evolver (как улучшается сам evolver). При этом внешний якорь заморожен — иначе получится бесконечная рекурсия.
Фишка: reasoning отключается во время выполнения задач, но включается при переписывании. Это изолирует эффект эволюции harness от test-time scaling.
Результат на бенчмарке BALROG (текстовые игры): на средних уровнях сложности HSI стабильно улучшает базовый harness. На лёгких — evolved harness обобщается на новые задачи. На сложных — никакой магии: если базовая модель слабая, harness не спасёт.
Два фундаментальных ограничения: нужен информативный reward-сигнал и достаточно сильная базовая модель.
https://arxiv.org/abs/2608.08466
🤔1
Трансформеры забывают контекст — и вот как это починить без переобучения (by Google DeepMind)
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981
Представьте: модель правильно понимает, что "bank" — это берег реки, а потом на следующем шаге уверенно советует поискать там банкомат. Это не баг конкретной модели — это фундаментальное ограничение архитектуры трансформера: глубокие слои вычисляют правильный контекст, но мелкие слои при обработке следующего токена его "не видят".
Авторы предлагают recirculation — простую идею: на каждом шаге генерации немного "подтекать" активациям из глубокого слоя обратно в мелкий. Не замена вектора, а лёгкая утечка. Это работает без дообучения, потому что residual stream трансформера — общая "доска", где фичи на разных глубинах совместимы.
Результат на Gemma3: -23% perplexity, +21% на GSM8k. Почти без доп. латентности при генерации.
https://arxiv.org/abs/2608.17981
Бенчмарки для world models теперь умеют думать сами
Оценивать видео-генераторы типа world models — боль. Существующие бенчмарки выдают скалярные оценки, которые нельзя ни объяснить, ни проверить. Почему модель провалилась? Непонятно.
Авторы HarnessEval-W предлагают радикальный сдвиг: вместо статичного набора метрик — агентный пайплайн оценки. Идея взята из LLM-экосистемы: evaluation harness, то есть «упряжь» для оценщика.
Как работает: главный агент анализирует контекст каждого тест-кейса, выбирает нужные навыки из библиотеки (физика, геометрия, постоянство объектов) и запускает специализированных суб-агентов с инструментами. Например, при оценке столкновения: трекинг bounding boxes, проверка временного пересечения, оценка скорости. Результат — не просто число, а дерево доказательств с полной цепочкой рассуждений.
Бенчмарк покрывает 3 оси: качество рендера, корректность переходов при действиях и сохранность состояния мира во времени. Протестировано 18 моделей.
https://arxiv.org/abs/2608.16859
Оценивать видео-генераторы типа world models — боль. Существующие бенчмарки выдают скалярные оценки, которые нельзя ни объяснить, ни проверить. Почему модель провалилась? Непонятно.
Авторы HarnessEval-W предлагают радикальный сдвиг: вместо статичного набора метрик — агентный пайплайн оценки. Идея взята из LLM-экосистемы: evaluation harness, то есть «упряжь» для оценщика.
Как работает: главный агент анализирует контекст каждого тест-кейса, выбирает нужные навыки из библиотеки (физика, геометрия, постоянство объектов) и запускает специализированных суб-агентов с инструментами. Например, при оценке столкновения: трекинг bounding boxes, проверка временного пересечения, оценка скорости. Результат — не просто число, а дерево доказательств с полной цепочкой рассуждений.
Бенчмарк покрывает 3 оси: качество рендера, корректность переходов при действиях и сохранность состояния мира во времени. Протестировано 18 моделей.
https://arxiv.org/abs/2608.16859
NVIDIA достигла 100% на ARC-AGI-3
NVIDIA представила архитектуру агентов AVO (Agentic Variation Operators), которая набрала 100 баллов на бенчмарке ARC-AGI-3, пройдя все 183 уровня в 25 средах.
Ключевой момент: базовая модель Claude Opus 5 самостоятельно справляется лишь с 30% заданий. AVO поднимает этот показатель до 100% — не за счёт более мощной модели, а за счёт архитектуры системы вокруг неё.
AVO работает через постоянную память, супервизор для отслеживания прогресса и автономный цикл гипотез-действий-проверки. Та же система ранее оптимизировала GPU-ядра без участия человека 7 дней подряд и превзошла FlashAttention-4 на 10,5%.
Вывод прост: будущее агентного ИИ — не в гонке за мощностью моделей, а в грамотном системном дизайне вокруг них.
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
NVIDIA представила архитектуру агентов AVO (Agentic Variation Operators), которая набрала 100 баллов на бенчмарке ARC-AGI-3, пройдя все 183 уровня в 25 средах.
Ключевой момент: базовая модель Claude Opus 5 самостоятельно справляется лишь с 30% заданий. AVO поднимает этот показатель до 100% — не за счёт более мощной модели, а за счёт архитектуры системы вокруг неё.
AVO работает через постоянную память, супервизор для отслеживания прогресса и автономный цикл гипотез-действий-проверки. Та же система ранее оптимизировала GPU-ядра без участия человека 7 дней подряд и превзошла FlashAttention-4 на 10,5%.
Вывод прост: будущее агентного ИИ — не в гонке за мощностью моделей, а в грамотном системном дизайне вокруг них.
https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/
NVIDIA Technical Blog
NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents
A frontier language model is only one component of an AI agent. The surrounding agent system—often called a harness—determines how the model receives context, uses tools, maintains state…
PyTorch + IBM: ИИ-агенты ускоряют запуск моделей на новом железе
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
PyTorch и IBM показали, как AI-агенты помогают запускать тысячи HuggingFace-моделей на новом ускорителе Spyre в день выхода — без месяцев ручной работы инженеров.
Раньше каждая новая архитектура модели или новый чип требовали недель специализированной работы: нужно было вручную писать адаптеры, чтобы модель корректно опускалась на железо. Теперь coding-агенты генерируют эти адаптеры автоматически — тонкие прослойки кода, которые на лету подменяют неподдерживаемые операции на совместимые, не меняя математику вычислений.
Результат: полная совместимость с тысячами моделей Transformers на Spyre при минимальных ручных правках.
Это меняет экономику AI-инфраструктуры: новое железо больше не обязано ждать зрелого софтстека, а разработчики моделей не блокируются на отсутствии поддержки платформы.
https://pytorch.org/blog/harnessing-ai-for-day-one-model-enablement/
Hydra-0: один интерфейс для управления любым роботом
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Главная проблема мультироботных world model — разные роботы имеют разные системы команд. Команда в пространстве суставов одного робота вообще не совместима с другим. Авторы предлагают Action Flow — универсальный интерфейс в виде траекторий точек прямо в плоскости камеры.
Идея проста: вместо передачи команды роботу напрямую, берём 3D-геометрию робота, симулируем движение в Isaac Lab, проецируем видимые точки поверхности через матрицу камеры в 2D. Получаем визуальные траектории — одинаковые по формату для манипулятора, двуруких роботов и даже человеческих рук.
World model обучается предсказывать будущее видео, обусловленное этими траекториями. Если геометрия недоступна — треки извлекаются напрямую из видео трекером.
Тот же интерфейс работает в обратную сторону: задаёшь желаемый поток объекта, модель выводит совместимые действия робота.
Зачем делать backprop через 15-шаговый агент, если можно просто пошуметь по весам?
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Дообучение LLM-агентов на длинных траекториях — боль: нужно хранить активации, делать backprop через сотни шагов, а разреженные награды делают credit assignment почти невозможным. Авторы предлагают использовать Evolution Strategies (ES) вместо RL.
Идея проста: берём текущие веса LLM, сэмплируем случайные возмущения, запускаем агентов в среде, смотрим на награды, делаем взвешенное обновление весов. Никакого backprop — только инференс-уровень памяти GPU!
Agentic ESOpt выигрывает у GRPO на длинных горизонтах: на Sudoku в 15 ходов — +12.5%, на ReAct Math/DocVQA — +8.3% над GRPO. Бонус: позволяет дообучать 27B модель там, где RL просто не влезает в память.
Главный инсайт: ES не просто дешевле RL — на длинных траекториях он принципиально лучше справляется с attribution, не раскладывая награду по шагам.
https://arxiv.org/abs/2608.17310
Синтез задач для терминальных агентов: как не потерять смысл по дороге
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580
Обучать агентов, работающих в терминале — это не просто "нагенерировать задач". Задача — это связка из инструкции, среды, решения и верификатора. Если хоть один компонент не согласован с остальными, вся задача бесполезна.
Авторы из USTC предлагают FACET — пайплайн синтеза терминальных задач, который решает две проблемы: потерю информации из источников и рассинхрон артефактов задачи.
Ключевая идея: сначала агентски реконструировать сценарий из набора навыков (восстановить зависимости, промежуточные состояния, workflow), потом поднять реальный Docker-контейнер — и уже против этого живого состояния среды генерировать инструкцию, решение и верификатор. Все артефакты заземлены на одно и то же исполняемое состояние.
В итоге: 71K+ навыков → валидные задачи с автоматической починкой упавших тестов. Эксперименты показывают, что данные FACET улучшают post-training агентов на нескольких масштабах моделей.
https://arxiv.org/abs/2608.18580
Amazon Science выпустила SOP-Bench — открытый бенчмарк для оценки AI-агентов на реальных бизнес-процедурах.
Большинство существующих тестов проверяют агентов на изолированных задачах с чистыми данными. SOP-Bench идёт дальше: 2000+ задач из 12 отраслей (медицина, логистика, финансы, модерация контента), реальные рабочие инструкции с намеренной неоднозначностью, работающие API-инструменты и эталонные ответы для объективной оценки.
Ключевой вывод из тестирования 11 топовых моделей: новые модели не всегда лучше, больше инструментов иногда снижает успешность, и ни одна модель не побеждает во всех сценариях.
Бенчмарк открытый — команды могут тестировать собственных агентов и добавлять свои процедуры. Это важно для компаний, которые хотят реально оценить AI-агентов перед внедрением в продакшн, а не полагаться на красивые демо.
https://www.amazon.science/blog/sop-bench-a-new-benchmark-for-evaluating-ai-agents-on-real-business-procedures
Большинство существующих тестов проверяют агентов на изолированных задачах с чистыми данными. SOP-Bench идёт дальше: 2000+ задач из 12 отраслей (медицина, логистика, финансы, модерация контента), реальные рабочие инструкции с намеренной неоднозначностью, работающие API-инструменты и эталонные ответы для объективной оценки.
Ключевой вывод из тестирования 11 топовых моделей: новые модели не всегда лучше, больше инструментов иногда снижает успешность, и ни одна модель не побеждает во всех сценариях.
Бенчмарк открытый — команды могут тестировать собственных агентов и добавлять свои процедуры. Это важно для компаний, которые хотят реально оценить AI-агентов перед внедрением в продакшн, а не полагаться на красивые демо.
https://www.amazon.science/blog/sop-bench-a-new-benchmark-for-evaluating-ai-agents-on-real-business-procedures
Amazon Science
SOP-Bench: A new benchmark for evaluating AI agents on real business procedures
Extendable framework enables testing agents on the full set of capabilities required to successfully complete a procedure, not isolated proxy tasks.
Один агент — хорошо, а граф агентов — лучше
Свежий большой survey о том, как строить мультиагентные системы на базе LLM. Авторы вводят понятие Graph Engineering — способ организации агентов не просто в цепочки, а в графы с явной структурой задач, координацией и управлением состоянием.
Иерархия такая: Model Intelligence (один LLM) → Individual Intelligence (агент с инструментами и памятью) → System Intelligence (граф агентов). Каждый уровень решает то, что предыдущий не может.
Ключевые компоненты Graph Engineering: декомпозиция задач в граф подзадач, оптимизация воркфлоу, моделирование возможностей агентов, их командная организация, коммуникация между ними, и — что важно — управление состоянием в рантайме с локализацией и восстановлением после сбоев.
Авторы также смотрят вперёд: следующий уровень после графов — Ontology Engineering, где агенты разделяют общую семантику и выравнивают цели.
https://arxiv.org/abs/2608.21156
Свежий большой survey о том, как строить мультиагентные системы на базе LLM. Авторы вводят понятие Graph Engineering — способ организации агентов не просто в цепочки, а в графы с явной структурой задач, координацией и управлением состоянием.
Иерархия такая: Model Intelligence (один LLM) → Individual Intelligence (агент с инструментами и памятью) → System Intelligence (граф агентов). Каждый уровень решает то, что предыдущий не может.
Ключевые компоненты Graph Engineering: декомпозиция задач в граф подзадач, оптимизация воркфлоу, моделирование возможностей агентов, их командная организация, коммуникация между ними, и — что важно — управление состоянием в рантайме с локализацией и восстановлением после сбоев.
Авторы также смотрят вперёд: следующий уровень после графов — Ontology Engineering, где агенты разделяют общую семантику и выравнивают цели.
https://arxiv.org/abs/2608.21156
Агент, который учится на своих же победах — без дообучения
Обычно LLM-агенты каждый раз заново "изобретают велосипед": решили задачу через workflow — и забыли. FlowEvo от Southeast University ломает этот паттерн.
Идея: когда агент успешно решает задачу, полезная часть workflow компилируется в исполняемый "скилл" и кладётся в персистентный банк. При следующих задачах скиллы либо запускаются напрямую, либо используются как структурный контекст для генерации нового workflow.
Получается петля: workflow → скилл → новый workflow. Причём всё это без обновления весов модели — чисто inference-time эволюция.
Ещё интересная деталь: есть lifecycle-механизм, который отслеживает "пользу" каждого скилла и автоматически подавляет те, что стабильно вредят.
Проверили на 5 бенчмарках (ALFWorld, HumanEval, MBPP, GSM8K, MATH-500) — лучше 8 базелайнов на всех, работает с 10 разными базовыми моделями.
https://arxiv.org/abs/2607.21596
Обычно LLM-агенты каждый раз заново "изобретают велосипед": решили задачу через workflow — и забыли. FlowEvo от Southeast University ломает этот паттерн.
Идея: когда агент успешно решает задачу, полезная часть workflow компилируется в исполняемый "скилл" и кладётся в персистентный банк. При следующих задачах скиллы либо запускаются напрямую, либо используются как структурный контекст для генерации нового workflow.
Получается петля: workflow → скилл → новый workflow. Причём всё это без обновления весов модели — чисто inference-time эволюция.
Ещё интересная деталь: есть lifecycle-механизм, который отслеживает "пользу" каждого скилла и автоматически подавляет те, что стабильно вредят.
Проверили на 5 бенчмарках (ALFWorld, HumanEval, MBPP, GSM8K, MATH-500) — лучше 8 базелайнов на всех, работает с 10 разными базовыми моделями.
https://arxiv.org/abs/2607.21596
ReWorld: мировая модель с долгосрочной памятью (by Alibaba/TongyiLab)
Представьте: вы гуляете по виртуальному миру, уходите далеко, возвращаетесь — и место выглядит точно так же, как вы его оставили. Это и есть задача ReWorld.
Проблема: управление (следить за командами камеры) и память (помнить посещённые места) конфликтуют при совместном обучении. Авторы разделили их через mixed attention windows: одни головы трансформера обучаются на коротких окнах (контроль), другие — на длинных (память). Чтобы это работало на инференсе с ограниченным KV-кешем, используется random head routing — каждый шаг случайно меняется, какие головы "глобальные".
Для долгосрочной памяти: старые чанки сохраняются как "landmarks" по пространственному расстоянию, а при возврате в локацию извлекаются по близости позы камеры. Chunk-drop training учит модель работать с неполной историей.
Результат: стриминговая генерация видео в реальном времени с пространственной консистентностью на длинных роллаутах.
https://arxiv.org/abs/2608.23565
Представьте: вы гуляете по виртуальному миру, уходите далеко, возвращаетесь — и место выглядит точно так же, как вы его оставили. Это и есть задача ReWorld.
Проблема: управление (следить за командами камеры) и память (помнить посещённые места) конфликтуют при совместном обучении. Авторы разделили их через mixed attention windows: одни головы трансформера обучаются на коротких окнах (контроль), другие — на длинных (память). Чтобы это работало на инференсе с ограниченным KV-кешем, используется random head routing — каждый шаг случайно меняется, какие головы "глобальные".
Для долгосрочной памяти: старые чанки сохраняются как "landmarks" по пространственному расстоянию, а при возврате в локацию извлекаются по близости позы камеры. Chunk-drop training учит модель работать с неполной историей.
Результат: стриминговая генерация видео в реальном времени с пространственной консистентностью на длинных роллаутах.
https://arxiv.org/abs/2608.23565
Nvidia представила Spectrum-X Ethernet — сетевую архитектуру нового поколения для гигамасштабных ИИ-кластеров.
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
Проблема: обычный Ethernet создавался для хаотичного веб-трафика, а не для синхронных коллективных операций сотен тысяч GPU. Результат — коллизии маршрутов, потери пакетов и деградация производительности при соседних задачах.
Решение Nvidia — три аппаратных контура управления: адаптивная маршрутизация на уровне пакета (реакция за сотни наносекунд), точный контроль перегрузок через ECN и аппаратный балансировщик нагрузки прямо в SuperNIC.
Ключевые цифры: при сбое линии восстановление занимает 2,68 мс против 1,08 секунды у обычного Ethernet. При многозадачной нагрузке стандартная сеть замедляется в 1,6 раза, Spectrum-X — практически без деградации.
Итог: это уже не просто сеть — это инфраструктурный фундамент для ИИ-фабрик, где каждая миллисекунда простоя GPU стоит реальных денег.
https://developer.nvidia.com/blog/giga-scale-ai-ethernet-evolution-spectrum-x-ethernet-rewrites-rules/
NVIDIA представила результаты нового бенчмарка AgentX
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA протестировала свои новейшие GPU-системы на специализированном бенчмарке для агентного ИИ — AgentX от SemiAnalysis. Результаты впечатляют.
Vera Rubin NVL72 показала до 30x больше токенов на мегаватт по сравнению с GB300 NVL72 на агентных задачах. Сам GB300 NVL72 при этом превосходит старый H200 NVL8 в 15x по той же метрике — и в 80x для больших MoE-моделей вроде Kimi K3 2.8T.
Почему это важно: агентный ИИ кардинально изменил нагрузку на железо. Один агентный запрос потребляет в 15 раз больше токенов, чем обычный чат. Эффективность на ватт теперь напрямую определяет экономику AI-фабрик.
Для операторов дата-центров это означает до 10x снижение стоимости за миллион токенов по сравнению с H200. Меньше энергии — больше пользователей на одну стойку.
https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
NVIDIA Technical Blog
NVIDIA Vera Rubin and Blackwell Set a New Standard for Agentic AI Performance per Watt
AI agents have expanded inference from single-turn interactions into multi-step workflows that reason, invoke tools, coordinate subagents, and carry growing context from one turn to the next.
NVIDIA представила Scale-In — пятый столп сетевой инфраструктуры для ИИ-фабрик
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
В основе — новый чип BlueField-4 DPU, который берёт на себя всю инфраструктурную работу: безопасность, управление трафиком, доступ к хранилищам и мониторинг. Главное — он делает это независимо от хост-CPU, не отнимая ресурсы у вычислений.
Что это значит на практике: при росте нагрузки от агентных ИИ-систем узкие места в безопасности и доступе к данным больше не будут тормозить работу GPU-кластеров. BlueField-4 поддерживает пропускную способность до 800 Гбит/с и работает в связке с Spectrum-X Ethernet и DOCA-микросервисами.
Теперь у NVIDIA есть полный стек: Scale-Up (NVLink), Scale-Out (InfiniBand/Ethernet), Scale-Across, Context Memory (CMX) — и теперь Scale-In для периметра фабрики.
Для операторов дата-центров это единая точка контроля над изоляцией арендаторов, обнаружением угроз и наблюдаемостью всей инфраструктуры.
https://developer.nvidia.com/blog/nvidia-bluefield-4-powers-new-scale-in-network-infrastructure-for-agentic-ai-factories/
NVIDIA Technical Blog
NVIDIA BlueField-4 Powers New Scale-In Network Infrastructure for Agentic AI Factories
Traditional cloud infrastructure was designed for predictable, general-purpose workloads and standard interfaces. Agentic AI factories connect diverse users, agents, applications, data sources…
Зайди в сгенерированный мир — с видео, звуком и речью (by JD.com)
Большинство world models генерируют только видео, без звука и без нормального управления. EchoWM решает сразу три проблемы: генерирует 720p видео + звуки окружения + речь персонажей, поддерживает и вид от первого, и от третьего лица, и позволяет непрерывно "ходить" по сцене через 6-DoF траектории камеры.
Ключевая идея — единый интерфейс camera intent: и дискретные команды (WASD), и непрерывные позы камеры приводятся к одному относительному 6-DoF представлению. Модель сама учится, как одна траектория управляет и наблюдателем от первого лица, и персонажем + камерой от третьего.
Обучение — 4 стадии: сначала аудио-визуальный pretraining, потом заморозка backbone и обучение только trajectory pathway, потом joint fine-tuning, потом авторегрессионный post-training на собственных роллаутах для долгосрочной генерации.
https://arxiv.org/abs/2608.23189
Большинство world models генерируют только видео, без звука и без нормального управления. EchoWM решает сразу три проблемы: генерирует 720p видео + звуки окружения + речь персонажей, поддерживает и вид от первого, и от третьего лица, и позволяет непрерывно "ходить" по сцене через 6-DoF траектории камеры.
Ключевая идея — единый интерфейс camera intent: и дискретные команды (WASD), и непрерывные позы камеры приводятся к одному относительному 6-DoF представлению. Модель сама учится, как одна траектория управляет и наблюдателем от первого лица, и персонажем + камерой от третьего.
Обучение — 4 стадии: сначала аудио-визуальный pretraining, потом заморозка backbone и обучение только trajectory pathway, потом joint fine-tuning, потом авторегрессионный post-training на собственных роллаутах для долгосрочной генерации.
https://arxiv.org/abs/2608.23189
Аннотации как роллауты: новый способ учить видео-модели
Обучение видеомоделей через RL страдает от одной проблемы: когда модель сэмплирует несколько ответов и сравнивает их по наградам, хорошие ответы встречаются редко. Авторы предлагают простую идею: добавлять саму аннотацию (ground truth) в группу роллаутов как "оракульный" ответ с гарантированно высокой наградой.
Проблема: если просто добавить GT в группу, он сдвигает среднее вверх, и нормально хорошие on-policy роллауты получают отрицательный advantage (авторы называют это advantage inversion). Итог — модель учится имитировать GT и подавляет исследование.
Решение — OraRL: GT исключается из вычисления baseline, но остаётся целью оптимизации. Advantages считаются только по on-policy роллаутам, а gap до оракула кодируется отдельно. Плюс sign-balanced pruning даёт 1.48× ускорение.
Результат: Video-ORA-9B без chain-of-thought бьёт специализированные модели по 7 задачам (temporal grounding, tracking, segmentation и др.) и быстрее в инференсе.
Обучение видеомоделей через RL страдает от одной проблемы: когда модель сэмплирует несколько ответов и сравнивает их по наградам, хорошие ответы встречаются редко. Авторы предлагают простую идею: добавлять саму аннотацию (ground truth) в группу роллаутов как "оракульный" ответ с гарантированно высокой наградой.
Проблема: если просто добавить GT в группу, он сдвигает среднее вверх, и нормально хорошие on-policy роллауты получают отрицательный advantage (авторы называют это advantage inversion). Итог — модель учится имитировать GT и подавляет исследование.
Решение — OraRL: GT исключается из вычисления baseline, но остаётся целью оптимизации. Advantages считаются только по on-policy роллаутам, а gap до оракула кодируется отдельно. Плюс sign-balanced pruning даёт 1.48× ускорение.
Результат: Video-ORA-9B без chain-of-thought бьёт специализированные модели по 7 задачам (temporal grounding, tracking, segmentation и др.) и быстрее в инференсе.
Prime Agent: агент, который сам себя улучшает (by Prime Intellect)
Что если агентный фреймворк сам по себе мог бы учиться и улучшаться в ходе работы? Именно это делает Prime Agent — открытый harness для долгосрочных задач.
Ключевая идея: иерархия состояний L0–L3. L0 — веса модели, L1 — активный контекст, L2 — персистентный REPL и рекурсивные субагенты, L3 — история, память и переиспользуемые навыки на диске. Агент сам управляет потоком информации между уровнями.
Фишки: рекурсивные вызовы rlm() создают параллельные субагенты, "Continual Harness" сохраняет навыки и промпты между сессиями, прямая коммуникация агент-агент и агент-человек без остановки выполнения.
Результат: ARC-AGI-3 вырос с 30% до 95%, непрерывный прогон nanoGPT на 85.5 часов, обходит Claude Code и Codex на ряде бенчмарков.
https://arxiv.org/abs/2608.23552
Что если агентный фреймворк сам по себе мог бы учиться и улучшаться в ходе работы? Именно это делает Prime Agent — открытый harness для долгосрочных задач.
Ключевая идея: иерархия состояний L0–L3. L0 — веса модели, L1 — активный контекст, L2 — персистентный REPL и рекурсивные субагенты, L3 — история, память и переиспользуемые навыки на диске. Агент сам управляет потоком информации между уровнями.
Фишки: рекурсивные вызовы rlm() создают параллельные субагенты, "Continual Harness" сохраняет навыки и промпты между сессиями, прямая коммуникация агент-агент и агент-человек без остановки выполнения.
Результат: ARC-AGI-3 вырос с 30% до 95%, непрерывный прогон nanoGPT на 85.5 часов, обходит Claude Code и Codex на ряде бенчмарков.
https://arxiv.org/abs/2608.23552
OpenAI представила собственный чип для инференса — Jalapeño.
Первые тесты показывают лидирующие показатели скорости и энергоэффективности среди аналогов. Чип обеспечивает более высокую пропускную способность и меньшую задержку при работе с современными моделями.
Что это значит на практике: ответы от ChatGPT и других продуктов OpenAI станут быстрее, а стоимость вычислений снизится. Компания перестаёт полностью зависеть от Nvidia и берёт контроль над железом в свои руки — как это уже сделали Google с TPU и Amazon с Trainium.
Для пользователей — это прежде всего скорость. Для OpenAI — экономия на инфраструктуре и независимость. Следим за тем, когда Jalapeño появится в реальных продуктах.
https://openai.com/index/jalapeno-first-results
Первые тесты показывают лидирующие показатели скорости и энергоэффективности среди аналогов. Чип обеспечивает более высокую пропускную способность и меньшую задержку при работе с современными моделями.
Что это значит на практике: ответы от ChatGPT и других продуктов OpenAI станут быстрее, а стоимость вычислений снизится. Компания перестаёт полностью зависеть от Nvidia и берёт контроль над железом в свои руки — как это уже сделали Google с TPU и Amazon с Trainium.
Для пользователей — это прежде всего скорость. Для OpenAI — экономия на инфраструктуре и независимость. Следим за тем, когда Jalapeño появится в реальных продуктах.
https://openai.com/index/jalapeno-first-results
OpenAI
Jalapeño’s first results show industry-leading speed and efficiency in AI inference
Jalapeño is a custom inference chip from OpenAI that delivers faster, more power-efficient AI inference, with higher throughput and lower latency for modern models.