Nvidia установила мировой рекорд по обучению MoE-моделей на GB300 NVL72
Новый серверный стек GB300 NVL72 показал 1 648 TFLOPs на один GPU при предобучении DeepSeek-V3 671B — это мировой рекорд. Для сравнения: предыдущее поколение GB200 выдавало 606 TFLOPs. Рост в 3 раза за одно поколение.
Ключевой момент: MoE-архитектуры активируют лишь часть параметров на каждый токен (37B из 671B у DeepSeek-V3), но требуют постоянной передачи данных между GPU. Именно коммуникация, а не вычисления, становится узким местом. GB300 решает это через NVLink 5-го поколения с пропускной способностью 1,8 ТБ/с на GPU и 130 ТБ/с внутри стойки.
Ещё важнее: только за счёт обновлений софта (Megatron Core, TorchTitan, JAX) производительность выросла в 1,5–10 раз без смены железа. При масштабировании с 256 до 1 024 GPU эффективность остаётся выше 97%.
Для индустрии это означает: крупные модели можно обучать быстрее и дешевле на том же оборудовании.
https://developer.nvidia.com/blog/setting-a-world-record-for-moe-pre-training-on-nvidia-gb300-nvl72/
Новый серверный стек GB300 NVL72 показал 1 648 TFLOPs на один GPU при предобучении DeepSeek-V3 671B — это мировой рекорд. Для сравнения: предыдущее поколение GB200 выдавало 606 TFLOPs. Рост в 3 раза за одно поколение.
Ключевой момент: MoE-архитектуры активируют лишь часть параметров на каждый токен (37B из 671B у DeepSeek-V3), но требуют постоянной передачи данных между GPU. Именно коммуникация, а не вычисления, становится узким местом. GB300 решает это через NVLink 5-го поколения с пропускной способностью 1,8 ТБ/с на GPU и 130 ТБ/с внутри стойки.
Ещё важнее: только за счёт обновлений софта (Megatron Core, TorchTitan, JAX) производительность выросла в 1,5–10 раз без смены железа. При масштабировании с 256 до 1 024 GPU эффективность остаётся выше 97%.
Для индустрии это означает: крупные модели можно обучать быстрее и дешевле на том же оборудовании.
https://developer.nvidia.com/blog/setting-a-world-record-for-moe-pre-training-on-nvidia-gb300-nvl72/
NVIDIA Technical Blog
Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72
Frontier model pre-training has converged on mixture of experts (MoE), which is fundamentally changing what limits large-scale AI training. As compute per token falls…
🔥2
Зачем стэкать слои, если можно их зациклить?
Looped Transformers — идея применять одни и те же веса повторно вместо наращивания глубины — давно известна, но всегда упиралась в честное сравнение: если ты гоняешь модель N раз, то и compute умножается на N. Авторы Loopie честно решают эту задачу.
Главные фишки:
1. Layer-loop вместо model-loop. Вместо того чтобы прогонять всю модель целиком дважды (1→2→3→1→2→3), каждый слой зацикливается на месте (1→1→2→2→3→3). Это дает лучший скейлинг на больших объёмах токенов и дружелюбнее к железу.
2. Loopie Recipe — рецепт подбора параметров при фиксированном compute-бюджете, чтобы looped-модель реально конкурировала с обычным трансформером того же размера.
3. Результат: Loopie-20B-A2B (MoE, 2 loop-шага) достигает frontier-уровня на reasoning-бенчмарках.
Два шага петли — не много, но авторы показывают, что именно здесь баланс compute/качество оптимален.
https://arxiv.org/abs/2607.16051
Looped Transformers — идея применять одни и те же веса повторно вместо наращивания глубины — давно известна, но всегда упиралась в честное сравнение: если ты гоняешь модель N раз, то и compute умножается на N. Авторы Loopie честно решают эту задачу.
Главные фишки:
1. Layer-loop вместо model-loop. Вместо того чтобы прогонять всю модель целиком дважды (1→2→3→1→2→3), каждый слой зацикливается на месте (1→1→2→2→3→3). Это дает лучший скейлинг на больших объёмах токенов и дружелюбнее к железу.
2. Loopie Recipe — рецепт подбора параметров при фиксированном compute-бюджете, чтобы looped-модель реально конкурировала с обычным трансформером того же размера.
3. Результат: Loopie-20B-A2B (MoE, 2 loop-шага) достигает frontier-уровня на reasoning-бенчмарках.
Два шага петли — не много, но авторы показывают, что именно здесь баланс compute/качество оптимален.
https://arxiv.org/abs/2607.16051
(by Alibaba)
Бесконечный интерактивный мир на одной домашней видеокарте — теперь реально.
ABot-World-0 от Alibaba AMAP — это world model, которая генерирует игровые миры в реальном времени прямо с клавиатуры. 720P, до 16 FPS, задержка 1.2 секунды, всё на одной RTX 5090 с 19 ГБ VRAM.
Ключевые идеи:
1. Обучают сначала bidirectional-модель (видит весь контекст), потом дистиллируют в causal (потоковую). Это даёт качество + скорость.
2. LongForcing — новый трюк против дрейфа: долгие self-rollouts студента supervise-ятся расширенным bidirectional учителем, чтобы накопленные ошибки не убивали когерентность.
3. Единый action space для роуминга камеры и управления персонажем — просто клавиатура, никаких latent action.
Данные собирают агентом WorldExplorer прямо из игр и симуляторов с фидбеком от обучения.
https://arxiv.org/abs/2607.19191
Бесконечный интерактивный мир на одной домашней видеокарте — теперь реально.
ABot-World-0 от Alibaba AMAP — это world model, которая генерирует игровые миры в реальном времени прямо с клавиатуры. 720P, до 16 FPS, задержка 1.2 секунды, всё на одной RTX 5090 с 19 ГБ VRAM.
Ключевые идеи:
1. Обучают сначала bidirectional-модель (видит весь контекст), потом дистиллируют в causal (потоковую). Это даёт качество + скорость.
2. LongForcing — новый трюк против дрейфа: долгие self-rollouts студента supervise-ятся расширенным bidirectional учителем, чтобы накопленные ошибки не убивали когерентность.
3. Единый action space для роуминга камеры и управления персонажем — просто клавиатура, никаких latent action.
Данные собирают агентом WorldExplorer прямо из игр и симуляторов с фидбеком от обучения.
https://arxiv.org/abs/2607.19191
Как дообучить триллионную модель на железе Huawei — и зачем это нужно для логистики?
Почти все крупные посттренинги LLM делаются на CUDA или TPU. Авторы из Huawei и партнёров показали, что можно полноценно дообучить DeepSeek-V4-Pro (триллион параметров, MoE) на Ascend 910C NPU — SIMD-архитектуре, принципиально отличной от NVIDIA.
Главный инженерный результат: они подняли MFU с ~12% до 34%, то есть в 2.93× — через оптимизацию ядер AscendC, переработку коммуникаций и параллелизма. Для этого создали AuraKernel — агент, который автоматически оптимизирует узкие места в ядрах под конкретную архитектуру.
Второй результат — специализация модели под Operations Research (задачи оптимизации: логистика, расписания, supply chain). CPT + SFT на OR-данных подняли точность с 60.5% до 71.2% на ключевых бенчмарках, обогнав GPT-4o-Mini на ~4 пункта.
Первая публичная документация полного дообучения триллионной MoE-модели на Ascend SuperPOD.
https://arxiv.org/abs/2607.20145
Почти все крупные посттренинги LLM делаются на CUDA или TPU. Авторы из Huawei и партнёров показали, что можно полноценно дообучить DeepSeek-V4-Pro (триллион параметров, MoE) на Ascend 910C NPU — SIMD-архитектуре, принципиально отличной от NVIDIA.
Главный инженерный результат: они подняли MFU с ~12% до 34%, то есть в 2.93× — через оптимизацию ядер AscendC, переработку коммуникаций и параллелизма. Для этого создали AuraKernel — агент, который автоматически оптимизирует узкие места в ядрах под конкретную архитектуру.
Второй результат — специализация модели под Operations Research (задачи оптимизации: логистика, расписания, supply chain). CPT + SFT на OR-данных подняли точность с 60.5% до 71.2% на ключевых бенчмарках, обогнав GPT-4o-Mini на ~4 пункта.
Первая публичная документация полного дообучения триллионной MoE-модели на Ascend SuperPOD.
https://arxiv.org/abs/2607.20145
Google DeepMind выпустила сразу три новых модели семейства Gemini Flash.
Gemini 3.6 Flash — улучшенная рабочая лошадка: на 17% меньше токенов на выходе по сравнению с 3.5 Flash, лучше в кодинге (DeepSWE: 49% против 37%) и работе с документами. Цена — $1.50 за 1М входных и $7.50 за 1М выходных токенов, что дешевле предшественника.
Gemini 3.5 Flash-Lite — самая быстрая модель серии: 350 токенов в секунду, всего $0.30/$2.50 за 1М токенов. Обходит даже 3 Flash по агентным задачам и кодингу.
Gemini 3.5 Flash Cyber — специализированная модель для поиска и исправления уязвимостей в коде. Пока доступна только правительствам и доверенным партнёрам через платформу CodeMender.
Отдельно: Google уже начала самый амбициозный pre-training run для Gemini 4, а Gemini 3.5 Pro тестируется с партнёрами.
https://deepmind.google/blog/introducing-gemini-36-flash-35-flash-lite-and-35-flash-cyber/
Gemini 3.6 Flash — улучшенная рабочая лошадка: на 17% меньше токенов на выходе по сравнению с 3.5 Flash, лучше в кодинге (DeepSWE: 49% против 37%) и работе с документами. Цена — $1.50 за 1М входных и $7.50 за 1М выходных токенов, что дешевле предшественника.
Gemini 3.5 Flash-Lite — самая быстрая модель серии: 350 токенов в секунду, всего $0.30/$2.50 за 1М токенов. Обходит даже 3 Flash по агентным задачам и кодингу.
Gemini 3.5 Flash Cyber — специализированная модель для поиска и исправления уязвимостей в коде. Пока доступна только правительствам и доверенным партнёрам через платформу CodeMender.
Отдельно: Google уже начала самый амбициозный pre-training run для Gemini 4, а Gemini 3.5 Pro тестируется с партнёрами.
https://deepmind.google/blog/introducing-gemini-36-flash-35-flash-lite-and-35-flash-cyber/
Google
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
We’re introducing new Gemini models, including Gemini 3.6 Flash, 3.5 Flash-Lite and 3.5 Flash Cyber.
Apple ML опубликовала исследование о новом способе обучения AI-агентов, которые умеют вызывать API.
Главная проблема: чтобы обучить такого агента, раньше нужны были полноценные рабочие среды с реальными API и базами данных — дорого и сложно масштабировать.
Решение от Apple ML: генерировать обучающие данные без всякой реальной среды. Вместо этого LLM сама играет роль "цифрового мира" — симулирует ответы API на лету, исходя только из их спецификаций. Специальный агент-учитель решает задачи, LLM-симулятор генерирует правдоподобные ответы, а LLM-судья фильтрует некачественные примеры.
Результат: модели, дообученные на таких синтетических данных, показали заметный прирост на бенчмарках AppWorld и OfficeBench.
Почему важно: это делает создание AI-агентов для работы с API дешевле и быстрее — без необходимости поднимать сложную инфраструктуру. Потенциально ускорит разработку умных ассистентов в продуктах Apple.
https://machinelearning.apple.com/research/environment-free
Главная проблема: чтобы обучить такого агента, раньше нужны были полноценные рабочие среды с реальными API и базами данных — дорого и сложно масштабировать.
Решение от Apple ML: генерировать обучающие данные без всякой реальной среды. Вместо этого LLM сама играет роль "цифрового мира" — симулирует ответы API на лету, исходя только из их спецификаций. Специальный агент-учитель решает задачи, LLM-симулятор генерирует правдоподобные ответы, а LLM-судья фильтрует некачественные примеры.
Результат: модели, дообученные на таких синтетических данных, показали заметный прирост на бенчмарках AppWorld и OfficeBench.
Почему важно: это делает создание AI-агентов для работы с API дешевле и быстрее — без необходимости поднимать сложную инфраструктуру. Потенциально ускорит разработку умных ассистентов в продуктах Apple.
https://machinelearning.apple.com/research/environment-free
Apple Machine Learning Research
Environment-free Synthetic Data Generation for API-Calling Agents
Training API-calling large language model (LLM) agents demands massive amounts of high-quality trajectories. However, collecting such data…
Apple ML представила CalibAtt — метод ускорения генерации видео по тексту без дообучения моделей.
Проблема: современные диффузионные модели генерируют качественное видео, но работают медленно из-за тяжёлых трансформерных блоков с пространственно-временным вниманием.
Решение: исследователи заметили, что значительная часть связей между токенами стабильно даёт близкие к нулю оценки — и эти паттерны повторяются. CalibAtt делает офлайн-калибровку, находит такие блоки и просто пропускает их при инференсе — аппаратно-эффективным способом.
Результат: до 1.58× ускорения на моделях Wan 2.1 14B и Mochi 1 при сохранении качества видео и соответствия тексту. Метод обходит конкурирующие training-free подходы.
Почему важно: ускорение генерации видео без потери качества и без переобучения — это прямой путь к снижению затрат на инференс в продуктовых системах. Работа принята на ECCV 2026.
https://machinelearning.apple.com/research/calibrated-sparse-attention
Проблема: современные диффузионные модели генерируют качественное видео, но работают медленно из-за тяжёлых трансформерных блоков с пространственно-временным вниманием.
Решение: исследователи заметили, что значительная часть связей между токенами стабильно даёт близкие к нулю оценки — и эти паттерны повторяются. CalibAtt делает офлайн-калибровку, находит такие блоки и просто пропускает их при инференсе — аппаратно-эффективным способом.
Результат: до 1.58× ускорения на моделях Wan 2.1 14B и Mochi 1 при сохранении качества видео и соответствия тексту. Метод обходит конкурирующие training-free подходы.
Почему важно: ускорение генерации видео без потери качества и без переобучения — это прямой путь к снижению затрат на инференс в продуктовых системах. Работа принята на ECCV 2026.
https://machinelearning.apple.com/research/calibrated-sparse-attention
Apple Machine Learning Research
Accelerating Text-to-Video Generation with Calibrated Sparse Attention
Recent diffusion models enable high-quality video generation, but suffer from slow runtimes. The large transformer-based backbones used in…
Токены шаблона чата — это скрытые регистры смысла в диффузионных трансформерах
Когда генерируешь картинку через модель с LLM-энкодером, промпт оборачивается в chat template: system/user/assistant токены. Все думали, что эти структурные токены — просто форматирование, мусор. Оказалось — нет.
Авторы из RTP-LLM вскрыли механику DiT-моделей (на примере Qwen-Image) и обнаружили: именно chat-template токены становятся главными "attention sinks" — они притягивают на себя основное внимание image-токенов. Но это ещё не всё: они не просто поглощают внимание впустую, а реально участвуют в передаче семантики объектов. Причём делают это хитро — не читая промпт напрямую, а забирая смысл из уже обработанных image latents.
Практический выход: раз "промпт-читающие" головы внимания каузально бесполезны, их можно отрезать. Обрезка 20% attention FLOPs даёт потерю всего 1.4 пункта на GenEval — бесплатное ускорение без дообучения.
https://arxiv.org/abs/2607.19139
Когда генерируешь картинку через модель с LLM-энкодером, промпт оборачивается в chat template: system/user/assistant токены. Все думали, что эти структурные токены — просто форматирование, мусор. Оказалось — нет.
Авторы из RTP-LLM вскрыли механику DiT-моделей (на примере Qwen-Image) и обнаружили: именно chat-template токены становятся главными "attention sinks" — они притягивают на себя основное внимание image-токенов. Но это ещё не всё: они не просто поглощают внимание впустую, а реально участвуют в передаче семантики объектов. Причём делают это хитро — не читая промпт напрямую, а забирая смысл из уже обработанных image latents.
Практический выход: раз "промпт-читающие" головы внимания каузально бесполезны, их можно отрезать. Обрезка 20% attention FLOPs даёт потерю всего 1.4 пункта на GenEval — бесплатное ускорение без дообучения.
https://arxiv.org/abs/2607.19139
Агент, который сам себя улучшает в процессе исследования (by Beijing Academy of AI)
Большинство research-агентов просто ищут дольше, если не нашли ответ. AREX делает иначе: после каждого раунда поиска агент проверяет, какие именно ограничения задачи ещё не выполнены, и формулирует новый, более точный исследовательский вопрос.
Ключевая идея — асимметрия поиска и верификации. Найти ответ, удовлетворяющий всем условиям сразу, сложно. Но проверить каждое условие по отдельности — значительно проще. AREX использует верификацию не как финальный фильтр, а как сигнал для следующего раунда.
Дополнительно агент учится сжимать собственный контекст: вместо полной истории — компактное состояние с подтверждёнными фактами и нерешёнными пробелами.
Модели: 4B (dense) и 122B-A10B (MoE). На бенчмарках BrowseComp, GAIA, HLE конкурируют с моделями с гораздо большим числом активных параметров.
https://arxiv.org/abs/2607.21461
Большинство research-агентов просто ищут дольше, если не нашли ответ. AREX делает иначе: после каждого раунда поиска агент проверяет, какие именно ограничения задачи ещё не выполнены, и формулирует новый, более точный исследовательский вопрос.
Ключевая идея — асимметрия поиска и верификации. Найти ответ, удовлетворяющий всем условиям сразу, сложно. Но проверить каждое условие по отдельности — значительно проще. AREX использует верификацию не как финальный фильтр, а как сигнал для следующего раунда.
Дополнительно агент учится сжимать собственный контекст: вместо полной истории — компактное состояние с подтверждёнными фактами и нерешёнными пробелами.
Модели: 4B (dense) и 122B-A10B (MoE). На бенчмарках BrowseComp, GAIA, HLE конкурируют с моделями с гораздо большим числом активных параметров.
https://arxiv.org/abs/2607.21461
PPO убивает исследование редких токенов — и вот почему
Когда LLM обучают с RL, стандартный PPO-Clip постепенно "схлопывает" политику: модель всё сильнее эксплуатирует уже популярные токены и почти игнорирует редкие. Почему? Авторы нашли геометрическую причину: PPO меряет изменение политики евклидовой метрикой на importance ratio, тогда как реальное пространство политик — риманово многообразие с метрикой KL-дивергенции. Из-за этого редкий токен (p=0.01) при clip=0.2 может вырасти лишь до 0.012, а частый (p=0.8) — до 0.96. Асимметрия огромная.
Решение — RIPO (Riemannian Isometric Policy Optimization): граница клиппинга адаптируется к локальной геометрии многообразия. Редкие действия получают больший "бюджет" обновления, частые — меньший. Результат: +60% относительного улучшения над GRPO на AIME24.
https://arxiv.org/abs/2607.10169
Когда LLM обучают с RL, стандартный PPO-Clip постепенно "схлопывает" политику: модель всё сильнее эксплуатирует уже популярные токены и почти игнорирует редкие. Почему? Авторы нашли геометрическую причину: PPO меряет изменение политики евклидовой метрикой на importance ratio, тогда как реальное пространство политик — риманово многообразие с метрикой KL-дивергенции. Из-за этого редкий токен (p=0.01) при clip=0.2 может вырасти лишь до 0.012, а частый (p=0.8) — до 0.96. Асимметрия огромная.
Решение — RIPO (Riemannian Isometric Policy Optimization): граница клиппинга адаптируется к локальной геометрии многообразия. Редкие действия получают больший "бюджет" обновления, частые — меньший. Результат: +60% относительного улучшения над GRPO на AIME24.
https://arxiv.org/abs/2607.10169
Nvidia выпустила туториал по кастомизации Nemotron 3 Nano
Теперь дообучить открытую языковую модель Nemotron 3 Nano можно буквально за 5 минут — с помощью платформы Prime Intellect Lab. Никакого собственного GPU-кластера не нужно: всё обучение происходит в облаке.
Процесс простой: устанавливаешь CLI, запускаешь базовую оценку модели, обучаешь LoRA-адаптер через reinforcement learning с верифицируемыми наградами — и скачиваешь готовый адаптер. В тесте на математических задачах точность заметно выросла по сравнению с базовой моделью.
Важно: Nemotron 3 выходит с открытыми весами, данными и рецептами обучения — это упрощает воспроизводимость и адаптацию под конкретные задачи. Тот же воркфлоу работает и для более крупных Nemotron 3 Super и Ultra.
Для разработчиков, которым нужна специализированная модель без боли с инфраструктурой — это реально удобно.
https://developer.nvidia.com/blog/start-customizing-nvidia-nemotron-3-nano-with-prime-intellect-lab-in-minutes/
Теперь дообучить открытую языковую модель Nemotron 3 Nano можно буквально за 5 минут — с помощью платформы Prime Intellect Lab. Никакого собственного GPU-кластера не нужно: всё обучение происходит в облаке.
Процесс простой: устанавливаешь CLI, запускаешь базовую оценку модели, обучаешь LoRA-адаптер через reinforcement learning с верифицируемыми наградами — и скачиваешь готовый адаптер. В тесте на математических задачах точность заметно выросла по сравнению с базовой моделью.
Важно: Nemotron 3 выходит с открытыми весами, данными и рецептами обучения — это упрощает воспроизводимость и адаптацию под конкретные задачи. Тот же воркфлоу работает и для более крупных Nemotron 3 Super и Ultra.
Для разработчиков, которым нужна специализированная модель без боли с инфраструктурой — это реально удобно.
https://developer.nvidia.com/blog/start-customizing-nvidia-nemotron-3-nano-with-prime-intellect-lab-in-minutes/
NVIDIA Technical Blog
Start Customizing NVIDIA Nemotron 3 Nano with Prime Intellect Lab in Minutes
Customization is what enables developers to take a general model and tailor it to use cases, domains, languages, and more. However, customization comes with a few challenges.
PyTorch + Google: пишем TPU-ядра без боли
PyTorch представил TPU-бэкенд для своего DSL Helion — совместная разработка с Google. Теперь можно писать ML-ядра в привычном PyTorch-стиле, а компилятор сам переведёт их в оптимизированный Pallas-код для TPU.
Зачем это нужно? Раньше для TPU приходилось вручную писать на Pallas — низкоуровневом DSL с крутой кривой обучения. Helion убирает этот барьер: один и тот же код работает и на GPU, и на TPU.
Результаты впечатляют: на задаче Flash Attention ядро, сгенерированное Helion, выдаёт 838 TFLOPs (~79% MFU) на TPU v7. Автотюнер сам подбирает оптимальную стратегию пайплайнинга под разные размеры входных данных.
Три целевых сценария: задачи, где нужен автотюнинг; разработчики без экспертизы в Pallas; команды, поддерживающие единую кодовую базу для GPU и TPU.
https://pytorch.org/blog/helion-on-tpu-towards-hardware-heterogeneous-kernel-authoring/
PyTorch представил TPU-бэкенд для своего DSL Helion — совместная разработка с Google. Теперь можно писать ML-ядра в привычном PyTorch-стиле, а компилятор сам переведёт их в оптимизированный Pallas-код для TPU.
Зачем это нужно? Раньше для TPU приходилось вручную писать на Pallas — низкоуровневом DSL с крутой кривой обучения. Helion убирает этот барьер: один и тот же код работает и на GPU, и на TPU.
Результаты впечатляют: на задаче Flash Attention ядро, сгенерированное Helion, выдаёт 838 TFLOPs (~79% MFU) на TPU v7. Автотюнер сам подбирает оптимальную стратегию пайплайнинга под разные размеры входных данных.
Три целевых сценария: задачи, где нужен автотюнинг; разработчики без экспертизы в Pallas; команды, поддерживающие единую кодовую базу для GPU и TPU.
https://pytorch.org/blog/helion-on-tpu-towards-hardware-heterogeneous-kernel-authoring/
PyTorch Foundation обновила сразу шесть проектов
В апреле 2025 PyTorch Foundation расширилась до мультипроектной организации. Теперь под её крылом — PyTorch, vLLM, DeepSpeed, Ray, Helion и Safetensors. Вот главное за квартал.
PyTorch 2.13: FlexAttention на Apple Silicon работает до 12x быстрее, новый бэкенд CuTeDSL, экономия памяти GPU до 4x при обучении, поддержка Python 3.15.
vLLM полностью переписал Model Runner V2, добавил поддержку Kimi K3, Qwen 3 в день релиза. Первая конференция vLLM — 24–26 августа в Сан-Франциско.
DeepSpeed интегрировал алгоритм Ulysses прямо в Hugging Face Trainer и получил награду на ASPLOS 2026.
Ray поддержал GPU-серверы GB200/GB300, использовался при обучении MAI-Thinking-1 и Nemotron 3 Ultra.
Helion обогнал FlashAttention-4 на NVIDIA Blackwell и показал ускорение автотюнинга в 10x с помощью LLM.
Safetensors добавил GIL-Free сериализацию и быструю загрузку моделей через Metal на Apple.
https://pytorch.org/blog/driving-the-future-of-open-source-ai-an-update-from-pytorch-foundation-projects/
В апреле 2025 PyTorch Foundation расширилась до мультипроектной организации. Теперь под её крылом — PyTorch, vLLM, DeepSpeed, Ray, Helion и Safetensors. Вот главное за квартал.
PyTorch 2.13: FlexAttention на Apple Silicon работает до 12x быстрее, новый бэкенд CuTeDSL, экономия памяти GPU до 4x при обучении, поддержка Python 3.15.
vLLM полностью переписал Model Runner V2, добавил поддержку Kimi K3, Qwen 3 в день релиза. Первая конференция vLLM — 24–26 августа в Сан-Франциско.
DeepSpeed интегрировал алгоритм Ulysses прямо в Hugging Face Trainer и получил награду на ASPLOS 2026.
Ray поддержал GPU-серверы GB200/GB300, использовался при обучении MAI-Thinking-1 и Nemotron 3 Ultra.
Helion обогнал FlashAttention-4 на NVIDIA Blackwell и показал ускорение автотюнинга в 10x с помощью LLM.
Safetensors добавил GIL-Free сериализацию и быструю загрузку моделей через Metal на Apple.
https://pytorch.org/blog/driving-the-future-of-open-source-ai-an-update-from-pytorch-foundation-projects/
SANA-Video 2.0: быстрая генерация видео без квадратичного внимания (by NVIDIA)
Главная боль видеогенерации — softmax attention с O(N²) сложностью. При 1080p видео латентных токенов десятки тысяч, и квадратичный attention просто убивает скорость.
SANA-Video 2.0 решает это гибридным подходом: 75% слоёв используют линейное внимание O(N), а 25% — обычный softmax в качестве "якорей". Соотношение 3:1 взято не из LLM-литературы вслепую, а подобрано экспериментально именно для видео.
Второй ключевой трюк — Block Attention Residuals (AttnRes): вместо того чтобы каждый слой заново выводил информацию из предыдущего, готовые блочные представления передаются напрямую вглубь сети. Это повышает эффективный ранг состояний в глубоких слоях на ~12%.
Результат: 5B модель генерирует 480p видео за 13.2 сек на одном H100, DiT-forward в 3.2× быстрее полного softmax-аналога при 720p/60s, а преимущество растёт с длиной видео. VBench Total — 84.30, конкурентно с моделями 13-14B.
https://arxiv.org/abs/2607.21553
Главная боль видеогенерации — softmax attention с O(N²) сложностью. При 1080p видео латентных токенов десятки тысяч, и квадратичный attention просто убивает скорость.
SANA-Video 2.0 решает это гибридным подходом: 75% слоёв используют линейное внимание O(N), а 25% — обычный softmax в качестве "якорей". Соотношение 3:1 взято не из LLM-литературы вслепую, а подобрано экспериментально именно для видео.
Второй ключевой трюк — Block Attention Residuals (AttnRes): вместо того чтобы каждый слой заново выводил информацию из предыдущего, готовые блочные представления передаются напрямую вглубь сети. Это повышает эффективный ранг состояний в глубоких слоях на ~12%.
Результат: 5B модель генерирует 480p видео за 13.2 сек на одном H100, DiT-forward в 3.2× быстрее полного softmax-аналога при 720p/60s, а преимущество растёт с длиной видео. VBench Total — 84.30, конкурентно с моделями 13-14B.
https://arxiv.org/abs/2607.21553
Робот забывает, что значат слова, пока учится двигаться
Когда дообучаешь VLA-модель (Vision-Language-Action) на робототехнических демонстрациях, она теряет базовое понимание языка. Натренировали робота брать зелёную кружку — он берёт зелёную, даже если ему говорят "возьми розовую". Цветовое понимание просто стёрлось в процессе BC-файнтюнинга.
Авторы предлагают Anchor-Align — два дополнительных лосса поверх стандартного BC:
1. Vision-Language Anchoring: держим замороженную копию исходной VLM и дистиллируем её hidden states на каждом слое декодера в обучаемый backbone. Никаких новых данных — просто дистилляция от себя же.
2. Language-Action Alignment: автоматически конвертируем траектории действий в текстовые метки ("двигай вправо") и учим модель предсказывать их на тех же наблюдениях, где она предсказывает действия. Оказалось, что у co-trained VLA языковая и action головы могут буквально противоречить друг другу!
Результат: на реальном роботе xArm7 — с 10% до нормальной генерализации на OOD инструкции.
Когда дообучаешь VLA-модель (Vision-Language-Action) на робототехнических демонстрациях, она теряет базовое понимание языка. Натренировали робота брать зелёную кружку — он берёт зелёную, даже если ему говорят "возьми розовую". Цветовое понимание просто стёрлось в процессе BC-файнтюнинга.
Авторы предлагают Anchor-Align — два дополнительных лосса поверх стандартного BC:
1. Vision-Language Anchoring: держим замороженную копию исходной VLM и дистиллируем её hidden states на каждом слое декодера в обучаемый backbone. Никаких новых данных — просто дистилляция от себя же.
2. Language-Action Alignment: автоматически конвертируем траектории действий в текстовые метки ("двигай вправо") и учим модель предсказывать их на тех же наблюдениях, где она предсказывает действия. Оказалось, что у co-trained VLA языковая и action головы могут буквально противоречить друг другу!
Результат: на реальном роботе xArm7 — с 10% до нормальной генерализации на OOD инструкции.
LLM-as-a-Coach: когда скалярная оценка — это слишком мало
Стандартный RL для LLM работает так: модель-судья смотрит на ответ и выдаёт число от 1 до 10. Всё остальное — анализ, советы, нюансы — выбрасывается. Это узкий канал: максимум 3.3 бита на пример.
Авторы предлагают Experiential Learning: вместо судьи — коуч. Коуч анализирует ответ по рубрикам и формулирует передаваемые советы (experiential knowledge). Эти советы подаются как контекст учителю, а политика обучается минимизировать KL-дивергенцию с этим контекст-обусловленным учителем. Никакого скаляра — плотный токен-уровневый сигнал.
Bandwidth контекста из 1024 токенов — теоретически 17 600 бит, то есть в 5000+ раз больше, чем скалярная оценка.
На практике: EL стабильно обгоняет RL на open-ended задачах, меньше подвержен reward hacking и лучше обобщается за пределы тренировочного распределения.
https://arxiv.org/abs/2607.18110
Стандартный RL для LLM работает так: модель-судья смотрит на ответ и выдаёт число от 1 до 10. Всё остальное — анализ, советы, нюансы — выбрасывается. Это узкий канал: максимум 3.3 бита на пример.
Авторы предлагают Experiential Learning: вместо судьи — коуч. Коуч анализирует ответ по рубрикам и формулирует передаваемые советы (experiential knowledge). Эти советы подаются как контекст учителю, а политика обучается минимизировать KL-дивергенцию с этим контекст-обусловленным учителем. Никакого скаляра — плотный токен-уровневый сигнал.
Bandwidth контекста из 1024 токенов — теоретически 17 600 бит, то есть в 5000+ раз больше, чем скалярная оценка.
На практике: EL стабильно обгоняет RL на open-ended задачах, меньше подвержен reward hacking и лучше обобщается за пределы тренировочного распределения.
https://arxiv.org/abs/2607.18110
Nvidia Tech запустила ModelExpress (MX) — систему для ускоренной доставки весов AI-моделей на GPU в кластерах.
Проблема была простой: модели весят сотни гигабайт, и каждый новый воркер тратил минуты на загрузку с нуля. MX решает это умно — сначала проверяет, есть ли уже загруженная копия у соседнего GPU, и если да, передаёт веса напрямую через P2P RDMA, минуя диск и оперативную память.
Результат впечатляет: веса DeepSeek-V4 Pro (806 ГБ) передаются между репликами менее чем за 10 секунд. Общее время запуска сократилось с 8 минут до 1 минуты 44 секунд.
MX также умеет: скачивать чекпоинты из облака без записи на диск, использовать GPUDirect Storage, координировать загрузку так, чтобы кластер из 10 реплик скачивал данные один раз, а не десять. Система интегрирована с vLLM, SGLang и Dynamo.
Для production-деплоев больших моделей это серьёзное ускорение масштабирования.
https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
Проблема была простой: модели весят сотни гигабайт, и каждый новый воркер тратил минуты на загрузку с нуля. MX решает это умно — сначала проверяет, есть ли уже загруженная копия у соседнего GPU, и если да, передаёт веса напрямую через P2P RDMA, минуя диск и оперативную память.
Результат впечатляет: веса DeepSeek-V4 Pro (806 ГБ) передаются между репликами менее чем за 10 секунд. Общее время запуска сократилось с 8 минут до 1 минуты 44 секунд.
MX также умеет: скачивать чекпоинты из облака без записи на диск, использовать GPUDirect Storage, координировать загрузку так, чтобы кластер из 10 реплик скачивал данные один раз, а не десять. Система интегрирована с vLLM, SGLang и Dynamo.
Для production-деплоев больших моделей это серьёзное ускорение масштабирования.
https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
NVIDIA Technical Blog
ModelExpress: Distributing Model Artifacts at the Speed of Light
Every byte moved has a cost. As model checkpoints grow to hundreds of gigabytes or even a terabyte, that cost adds up quickly. To make things even worse, moving these model weights around the cluster…
Apple ML выпустила исследование LEAD — новый метод для улучшения длинных цепочек рассуждений в языковых моделях.
Проблема: когда задачу разбивают на слишком мелкие шаги, модель теряет контекст и не может исправить ошибки на «сложных» этапах — они накапливаются и становятся необратимыми.
Решение — метод LEAD (Lookahead-Enhanced Atomic Decomposition): модель заглядывает чуть вперёд и проверяет несколько вариантов развития событий одновременно. Это даёт достаточно изоляции для стабильности и достаточно контекста для исправления ошибок.
Результат на практике: модель o4-mini с LEAD решает головоломку Checkers Jumping до сложности n=13, тогда как без метода ломается уже на n=11.
Пока это академическое исследование, но подход может напрямую улучшить агентные системы и сложные многошаговые задачи в будущих продуктах Apple.
https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
Проблема: когда задачу разбивают на слишком мелкие шаги, модель теряет контекст и не может исправить ошибки на «сложных» этапах — они накапливаются и становятся необратимыми.
Решение — метод LEAD (Lookahead-Enhanced Atomic Decomposition): модель заглядывает чуть вперёд и проверяет несколько вариантов развития событий одновременно. Это даёт достаточно изоляции для стабильности и достаточно контекста для исправления ошибок.
Результат на практике: модель o4-mini с LEAD решает головоломку Checkers Jumping до сложности n=13, тогда как без метода ломается уже на n=11.
Пока это академическое исследование, но подход может напрямую улучшить агентные системы и сложные многошаговые задачи в будущих продуктах Apple.
https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
Apple Machine Learning Research
LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning
Long-horizon execution in Large Language Models (LLMs) remains unstable even when high-level strategies are provided. Evaluating on…
Одна видеомодель — и прямая, и обратная динамика робота
Обычно для предсказания последствий действий робота и для восстановления действий по желаемому результату нужны разные модели. Авторы предлагают Masked Visual Actions: вместо того чтобы подавать в видеомодель низкоразмерные векторы команд, они просто маскируют нужные пиксели в видео.
Идея проста: если показать модели траекторию робота (активная сущность) — она предскажет, что произойдёт с объектами. Если показать желаемое движение объекта (пассивная сущность) — та же модель восстановит, как должен двигаться робот. Один чекпоинт, обученный на 15 часах роботизированных данных, решает обе задачи.
Модель применяется для оценки политик, планирования и обратного моделирования в реальных манипуляционных задачах. Бонус: подход не зависит от типа робота, так как действия закодированы прямо в пикселях.
https://arxiv.org/abs/2607.19343
Обычно для предсказания последствий действий робота и для восстановления действий по желаемому результату нужны разные модели. Авторы предлагают Masked Visual Actions: вместо того чтобы подавать в видеомодель низкоразмерные векторы команд, они просто маскируют нужные пиксели в видео.
Идея проста: если показать модели траекторию робота (активная сущность) — она предскажет, что произойдёт с объектами. Если показать желаемое движение объекта (пассивная сущность) — та же модель восстановит, как должен двигаться робот. Один чекпоинт, обученный на 15 часах роботизированных данных, решает обе задачи.
Модель применяется для оценки политик, планирования и обратного моделирования в реальных манипуляционных задачах. Бонус: подход не зависит от типа робота, так как действия закодированы прямо в пикселях.
https://arxiv.org/abs/2607.19343
Единый принцип интеллекта: ищи то, чему можно научиться
Новизна без структуры — это шум телевизора. Минимизация удивления — это тёмная комната. Оба подхода провалились по одной причине: они не различают "обучаемую" и "необучаемую" новизну.
Авторы предлагают единый принцип: максимизируй learnable novelty — ту часть удивления, которую ограниченный наблюдатель реально может усвоить. Формально это "эпиплексность" (epiplexity): длина описания лучшей модели, которую конечный вычислитель способен подобрать под данные.
Ключевой трюк: вместо дорогого поиска по всем программам используют reservoir computer с ridge regression — закрытая формула, дифференцируемая и быстрая.
Результаты впечатляют: без единой метки нейронный клеточный автомат сам развивает солитоны, MNIST-энкодер разделяет классы цифр, RL-агент исследует среду эффективнее в задачах с редкими наградами. А rule 110 (единственный Тьюринг-полный элементарный КА) занимает первое место в рейтинге сложности.
https://arxiv.org/abs/2607.18433
Новизна без структуры — это шум телевизора. Минимизация удивления — это тёмная комната. Оба подхода провалились по одной причине: они не различают "обучаемую" и "необучаемую" новизну.
Авторы предлагают единый принцип: максимизируй learnable novelty — ту часть удивления, которую ограниченный наблюдатель реально может усвоить. Формально это "эпиплексность" (epiplexity): длина описания лучшей модели, которую конечный вычислитель способен подобрать под данные.
Ключевой трюк: вместо дорогого поиска по всем программам используют reservoir computer с ridge regression — закрытая формула, дифференцируемая и быстрая.
Результаты впечатляют: без единой метки нейронный клеточный автомат сам развивает солитоны, MNIST-энкодер разделяет классы цифр, RL-агент исследует среду эффективнее в задачах с редкими наградами. А rule 110 (единственный Тьюринг-полный элементарный КА) занимает первое место в рейтинге сложности.
https://arxiv.org/abs/2607.18433
3DGS всегда мылит дальние горы и скрытые объекты — и вот почему
3D Gaussian Splatting отлично работает, но упорно размывает далёкие объекты и окклюдированные области. Авторы доказали, что это не баг данных, а структурный изъян оптимизации — и назвали его Blur Trap.
Суть проблемы: градиент позиции каждого гауссиана строго ортогонален лучу зрения. То есть оптимизатор может двигать примитивы только поперёк луча, но никогда вдоль глубины. Плюс alpha-blending гасит сигнал для скрытых гауссианов, не давая им делиться.
Решение намеренно минималистичное — два оператора исследования:
1. Random Seeding — случайно засеиваем новые гауссианы по всей сцене, обходя ортогональность
2. Random Splitting — случайно делим гауссианы без оглядки на градиент, обходя подавление alpha-blending
Оба оператора просты, но именно это и нужно: проверить, что exploration сам по себе — недостающий ингредиент 3DGS. Эксперименты на 5 датасетах подтверждают улучшение при минимальных накладных расходах.
https://arxiv.org/abs/2607.17965
3D Gaussian Splatting отлично работает, но упорно размывает далёкие объекты и окклюдированные области. Авторы доказали, что это не баг данных, а структурный изъян оптимизации — и назвали его Blur Trap.
Суть проблемы: градиент позиции каждого гауссиана строго ортогонален лучу зрения. То есть оптимизатор может двигать примитивы только поперёк луча, но никогда вдоль глубины. Плюс alpha-blending гасит сигнал для скрытых гауссианов, не давая им делиться.
Решение намеренно минималистичное — два оператора исследования:
1. Random Seeding — случайно засеиваем новые гауссианы по всей сцене, обходя ортогональность
2. Random Splitting — случайно делим гауссианы без оглядки на градиент, обходя подавление alpha-blending
Оба оператора просты, но именно это и нужно: проверить, что exploration сам по себе — недостающий ингредиент 3DGS. Эксперименты на 5 датасетах подтверждают улучшение при минимальных накладных расходах.
https://arxiv.org/abs/2607.17965