LLM-как-верификатор: новая ось масштабирования
Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.
Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.
Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)
Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.
Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.
https://arxiv.org/abs/2607.05391
Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.
Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.
Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)
Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.
Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.
https://arxiv.org/abs/2607.05391
Как честно сравнить 30 роботов-манипуляторов сразу в симуляции и реальном мире?
Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.
Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.
Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.
Сайт: robodojo-benchmark.com
https://arxiv.org/abs/2607.04434
Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.
Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.
Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.
Сайт: robodojo-benchmark.com
https://arxiv.org/abs/2607.04434
Microsoft Research выпустила Aurora 1.5 — крупное обновление своей AI-модели для прогнозирования погоды и анализа состояния Земли.
Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.
Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.
Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.
https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.
Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.
Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.
https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
Microsoft Research
Aurora 1.5: Extending open foundation models for weather and Earth-system applications - Microsoft Research
Aurora 1.5 adds 22 more variables, hourly temporal resolution, and probabilistic ensemble forecasting to the Aurora foundation model, making it more useful for real-world weather, climate, and energy applications.
👍1
Nvidia Tech: хост-оффлоадинг активаций ускоряет обучение LLM на 57%
Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.
Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.
Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок
Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.
https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.
Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.
Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок
Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.
https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
NVIDIA Technical Blog
Reducing High-Bandwidth Memory Bottlenecks in JAX-Based LLM Training with Host Offloading
Large language model (LLM) training workloads increasingly run into GPU memory limits before compute is fully used. Model weights, gradients, optimizer states, communication buffers…
Nvidia Tech обновила документацию и инструменты CUDA: вышел подробный гайд по kernel fusion — технике объединения нескольких GPU-операций в одно ядро.
Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.
На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.
Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.
Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.
https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.
На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.
Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.
Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.
https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
NVIDIA Technical Blog
Kernel Fusion in NVIDIA CUDA: Optimizing Memory Traffic and Launch Overhead
There are many ways to optimize code for GPUs. In this post, you’ll learn how kernel fusion can improve memory bandwidth and reduce kernel launch overhead, along with multiple ways to apply it in…
Jet-Long: расширяем контекст LLM до 128K без дообучения (by NVIDIA)
Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.
Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.
Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.
Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.
https://arxiv.org/abs/2607.07740
Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.
Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.
Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.
Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.
https://arxiv.org/abs/2607.07740
👍1
Линейное внимание: как не потерять качество в погоне за скоростью? (by ETH Zurich)
Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.
Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.
Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.
https://arxiv.org/abs/2607.07953
Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.
Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.
Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.
https://arxiv.org/abs/2607.07953
👍1
Sparse Delta Memory: RNN с памятью в миллион слотов (by Meta AI)
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.
SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.
Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.
Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.
https://arxiv.org/abs/2607.07386
Nvidia Research представила RoboLab — платформу для оценки роботизированных AI-систем.
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.
RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.
Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.
https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
NVIDIA Technical Blog
How to Evaluate General-Purpose Robot Policies for Real-World Deployment
Robotics foundation models have made remarkable progress. Today’s best systems can follow natural language instructions to pick, place, sort, and manipulate a wide variety of objects.
Nvidia Tech рассказала, как правильно проектировать LLM-модели под железо, чтобы выжать максимум из GPU.
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:
1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.
2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.
3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.
Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.
Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.
https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
NVIDIA Technical Blog
AI Model Co-Design: Hardware-Friendly LLM Design
AI performance comes down to three dimensions: Deployments must balance all three: High accuracy is wasted if responses are slow, and raw throughput means little if each user’s experience is laggy.
Nvidia Tech обновила BioNeMo Agent Toolkit — набор инструментов для ускорения предсказания биомолекулярных структур.
Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.
Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.
Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.
https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.
Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.
Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.
https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
NVIDIA Technical Blog
Accelerating End-to-End Co-Folding Performance with NVIDIA BioNeMo Agent Toolkit
Biomolecular structure prediction and co-folding with models like OpenFold3 are now mainstream, large-scale workloads powering drug discovery and protein design. Increasingly, they’re driven end-to…
Video генерация — это новый ImageNet (by Google DeepMind)
В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.
Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.
Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.
https://arxiv.org/abs/2607.09024
В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.
Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.
Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.
https://arxiv.org/abs/2607.09024
Remember When It Matters: Proactive Memory Agent (by Meta Research)
LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.
Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?
Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.
https://arxiv.org/abs/2607.08716
LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.
Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?
Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.
https://arxiv.org/abs/2607.08716
Границы объектов как основа предобучения vision-моделей
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.
Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.
Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.
Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.
https://arxiv.org/abs/2607.05247
Amazon Science совместно с Университетом Мичигана научили роботов чувствовать прикосновения.
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.
HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.
Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.
Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.
https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
Amazon Science
Amazon and University of Michigan give robots a sense of touch
HydroShear, a new physics-based simulator, teaches robots how to use their sense of touch to perform complex manipulation tasks, in a way that transfers seamlessly to the real world.
PyTorch (Meta): скрытая стоимость нормализации в нейросетях
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.
Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.
Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention
Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.
Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.
https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
ABot-N1: один мозг для всех задач навигации (by Alibaba)
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383
Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.
Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".
Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.
https://arxiv.org/abs/2607.10383
Зачем генерировать, если можно просто считать?
Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.
Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.
Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.
Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.
Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.
https://arxiv.org/abs/2607.06553
Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.
Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.
Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.
Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.
Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.
https://arxiv.org/abs/2607.06553
RL для LLM-агентов без ожидания "отстающих" траекторий
Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.
Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.
Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.
Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.
https://arxiv.org/abs/2607.07508
Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.
Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.
Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.
Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.
https://arxiv.org/abs/2607.07508
Microsoft Research выпустила верифицированную криптографию для SymCrypt — библиотеки, которая работает в Windows и Azure.
Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.
Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.
Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.
https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.
Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.
Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.
https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
Microsoft Research
Scaling cryptographic verification to boost computer security
Cryptographic code supports vital protections in modern computing systems. Learn how a new method helps verify code as developers write it while preserving speed and adaptability as it gets implemented and evolves:
NVIDIA улучшила квантовые вычисления
NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.
Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.
Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.
Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.
https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.
Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.
Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.
Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.
https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
NVIDIA Technical Blog
NVIDIA Ising Decoding Cuts Color Code Logical Error Rates by Over 300x
Useful quantum computers will require fault tolerant logical operations. Researchers are actively exploring many different quantum error correction (QEC) codes to enable this…