InhumanScience
102 subscribers
566 photos
879 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Sparse Delta Memory: RNN с памятью в миллион слотов (by Meta AI)

Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.

SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.

Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.

Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.

https://arxiv.org/abs/2607.07386
Nvidia Research представила RoboLab — платформу для оценки роботизированных AI-систем.

Проблема в том, что существующие бенчмарки устаревают быстро: модели набирают 90%+ и сравнивать их становится бессмысленно. Плюс большинство тестов используют те же данные, что и при обучении — это не проверка обобщения, а проверка памяти.

RoboLab решает это тремя способами: быстрая генерация новых задач через агентный AI (минуты вместо часов), поддержка любого робота без привязки к конкретной платформе, и детальная диагностика — не просто «успех/провал», а анализ плавности движений, реакции на разные формулировки команд и статистическая достоверность результатов.

Интеграция в NVIDIA Isaac Lab-Arena запланирована на август 2026 года.

https://developer.nvidia.com/blog/how-to-evaluate-general-purpose-robot-policies-for-real-world-deployment/
Nvidia Tech рассказала, как правильно проектировать LLM-модели под железо, чтобы выжать максимум из GPU.

Суть простая: форма модели напрямую влияет на скорость и стоимость инференса. Три главных правила от инженеров Nvidia:

1. Делай линейные слои близкими к квадратным — это повышает арифметическую интенсивность и переводит вычисления из memory-bound в compute-bound режим.

2. Выравнивай размерности под тайловые размеры GPU — кратность 128, а лучше 256 или 512. Иначе часть вычислительных ядер просто простаивает.

3. Используй ширину, а не глубину — больше ширина модели при меньшем числе слоёв лучше масштабируется на несколько GPU.

Дополнительно: квантизация NVFP4 и инструменты TensorRT дают высокий throughput с минимальной потерей точности на Blackwell-чипах.

Для разработчиков моделей это практический гайд: правильная архитектура ещё до обучения экономит деньги на деплое и ускоряет отклик для пользователей.

https://developer.nvidia.com/blog/ai-model-co-design-hardware-friendly-llm-design/
Nvidia Tech обновила BioNeMo Agent Toolkit — набор инструментов для ускорения предсказания биомолекулярных структур.

Что нового: три ключевых ускорения в одном пайплайне. MMseqs2-GPU ускоряет генерацию MSA до 177 раз по сравнению с CPU. Библиотека cuEquivariance сокращает время работы OpenFold3 до 3 раз и расширяет лимит длины последовательностей с ~2500 до ~5900 токенов. Новый Fold-CP распределяет вычисления на несколько GPU, позволяя обрабатывать сборки до 32 000 токенов на 64 GPU B300.

Почему важно: предсказание структур белков — основа разработки лекарств. Раньше скрининг миллиардов соединений с помощью таких моделей был слишком дорогим. Теперь это становится реальным.

Всё это доступно через агентный интерфейс BioNeMo и интегрировано в популярные open-source модели вроде OpenFold3 и Boltz.

https://developer.nvidia.com/blog/accelerating-end-to-end-co-folding-performance-with-nvidia-bionemo-agent-toolkit/
Video генерация — это новый ImageNet (by Google DeepMind)

В NLP один GPT решает тысячи задач. В computer vision до сих пор отдельная модель на каждую задачу: глубина, сегментация, поза. Авторы предлагают радикальную идею: предобучение на генерацию видео — это и есть универсальный аналог next-token prediction для зрения.

Модель GenCeption берёт backbone от video diffusion модели (DiT), дообучает его на синтетических данных через мультизадачный fine-tuning — и получает единую архитектуру с одной головой и одной функцией потерь для всех задач. Задача задаётся текстовым промптом, а не архитектурными изменениями.

Результат: GenCeption бьёт или догоняет DepthAnything, SAM, VGGT на их же задачах, используя в 7-500 раз меньше данных. Плюс emergent поведение: zero-shot перенос из симуляции в реальность и обобщение на невиданные объекты.

https://arxiv.org/abs/2607.09024
Remember When It Matters: Proactive Memory Agent (by Meta Research)

LLM-агенты на длинных задачах страдают от "behavioral state decay": нашли требование в начале — забыли к середине, получили ошибку — повторили её снова. Просто длинный контекст не спасает.

Авторы добавили отдельного "memory agent", который работает параллельно с основным агентом. Каждые N шагов он обновляет структурированный банк памяти (требования, факты среды, неудачные попытки, диагнозы) и решает — вмешаться или промолчать. Не просто хранит, а активно решает: нужно ли сейчас напомнить агенту что-то важное?

Результат: Claude Sonnet 4.5 на Terminal-Bench вырос с 37.6% до 45.9%, на τ²-Bench с 55.0% до 61.8%. Даже более сильный Opus 4.6 получил +2.4 pp. Пассивное выкладывание памяти в контекст работает хуже — важно именно избирательное вмешательство.

https://arxiv.org/abs/2607.08716
Границы объектов как основа предобучения vision-моделей

Большинство vision-моделей учатся распознавать семантику, но плохо понимают геометрию. LingBot-Vision переворачивает подход: границы объектов становятся не выходом модели, а сигналом обучения.

Ключевая идея: учитель (EMA-сеть) предсказывает поля границ прямо в процессе обучения, затем токены с границами принудительно маскируются — и студент должен восстановить именно их из окружающего контекста. Граница — самое информативное место в изображении, поэтому это самая сложная и полезная задача.

Чтобы избежать коллапса при регрессии непрерывных полей, авторы переходят к категориальной параметризации: предсказание ориентации границы как классификация по дискретным бинам. Это стабилизирует обучение и даёт бесплатную валидацию через a-contrario теорию.

Результат: 1B ViT обходит модели до 7× больше на задачах глубины и сегментации. Студент на 0.3B параметров догоняет DINOv3 на 7B по NYU-Depth v2.

https://arxiv.org/abs/2607.05247
Amazon Science совместно с Университетом Мичигана научили роботов чувствовать прикосновения.

Исследователи создали симулятор HydroShear, который точно моделирует тактильные силы — в том числе сдвиг и трение — когда робот берёт и перемещает предметы. Раньше обучать роботов осязанию в симуляции было почти невозможно: физика была либо точной, но медленной, либо быстрой, но слишком упрощённой.

HydroShear запоминает историю движения объекта по сенсору и рассчитывает, как деформируется мягкий материал датчика в каждой точке контакта. Это позволяет обучать роботов целиком в симуляции, а потом переносить навыки в реальный мир без дополнительной настройки.

Результат: 93% успешных выполнений четырёх сложных задач — вставка штыря, укладка в ящик, расстановка книг, открывание ящика. Для сравнения, лучший конкурент показал лишь 61%.

Для складской автоматизации это прорыв: роботы смогут аккуратно работать с хрупкими предметами без дорогостоящих экспериментов в реальном мире.

https://www.amazon.science/blog/amazon-and-university-of-michigan-give-robots-a-sense-of-touch
PyTorch (Meta): скрытая стоимость нормализации в нейросетях

Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.

Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.

Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention

Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.

Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.

https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
ABot-N1: один мозг для всех задач навигации (by Alibaba)

Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.

Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".

Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.

https://arxiv.org/abs/2607.10383
Зачем генерировать, если можно просто считать?

Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.

Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.

Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.

Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.

Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.

https://arxiv.org/abs/2607.06553
RL для LLM-агентов без ожидания "отстающих" траекторий

Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.

Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.

Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.

Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.

https://arxiv.org/abs/2607.07508
Microsoft Research выпустила верифицированную криптографию для SymCrypt — библиотеки, которая работает в Windows и Azure.

Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.

Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.

Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.

https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
NVIDIA улучшила квантовые вычисления

NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.

Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.

Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.

Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.

https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
Nvidia Tech представила метод оценки вероятности экстремальных погодных событий с помощью диффузионных моделей.

Проблема: редкие события вроде тропических циклонов требуют миллионов симуляций для статистически значимой оценки риска — это дорого и долго.

Решение: модель cBottle направленно генерирует именно редкие сценарии (например, ураган у берегов Флориды), а специальный коэффициент «отношения шансов» пересчитывает, насколько вероятен такой сценарий в реальном климате. Это importance sampling — меньше расчётов, точнее результат.

Ключевой момент: метод требует производных второго порядка через нейросеть, но даёт резкое снижение погрешности по сравнению с классическим Монте-Карло.

Реализация уже доступна в открытой библиотеке NVIDIA Earth2Studio. Применения: страхование, инфраструктурное планирование, климатические исследования.

https://developer.nvidia.com/blog/extreme-event-likelihoods-with-guided-generative-models/
Зачем гонять дорогой RL на большой модели, если можно на маленькой?

(by Bytedance + Tsinghua)

Идея Direct-OPD проста и элегантна: запускаем RL на дешёвой слабой модели (1.5B), а потом переносим не саму модель, а разницу в поведении до и после RL на сильную модель (7B+).

Ключевой инсайт: если скопировать финальную политику слабой модели, сильная модель деградирует — она уже умеет больше. Нужно передать только то, чему научил RL, то есть сдвиг log πT − log πTref. Это и есть неявная награда слабой модели!

Результат: Qwen3-1.7B вырастает с 48.3 до 58.3 на AIME 2024 за 4 часа на 8 A100. Прямой RL на той же модели требует 32 A100 и неделю. Работает даже если студент изначально сильнее учителя.

По духу похоже на DPO, только наоборот: не учим политику из предпочтений, а извлекаем награду из политики.

https://arxiv.org/abs/2607.05394
Роботы теперь учатся управлять собой из YouTube, а не только из дорогих демонстраций

LingBot-VA 2.0 — это попытка переосмыслить, как видео-модели используются в робототехнике. Раньше брали готовый видеогенератор (обученный на реконструкцию пикселей), прикручивали к нему модуль действий и дообучали на дорогих роботизированных данных. Проблемы: медленный инференс, слабое понимание динамики, плохая генерализация.

Авторы предлагают нативный подход: обучить весь стек с нуля под задачи управления. Ключевые идеи:

1. Семантический токенайзер — выравнивает латентное пространство видео и действий в одно общее, используя self-supervision на нелейбленном видео из интернета.

2. Causal DiT с MoE — причинный трансформер с разреженными экспертами для быстрого инференса.

3. Foresight Reasoning — асинхронное предсказание: робот действует, пока модель параллельно предсказывает будущее, корректируясь на реальных наблюдениях.
Игровой мир без конца — буквально

LingBot-World-Infinity — это интерактивная world model, которая генерирует игровой мир в реальном времени бесконечно долго без деградации качества. Авторы провели непрерывную сессию длиной больше часа — и визуального распада не заметили.

Две главные проблемы прошлых подходов: накопление ошибок (через минуты мир "плывёт") и дороговизна высококачественного рендера. Решение: сначала обучают стабильную causal video модель, затем дистиллируют её в быстрый студент-вариант, который выдаёт 720p/60fps.

Поверх генератора — агентский слой: pilot agent управляет персонажем, director agent подсевает новый контент по мере исследования. Поддерживаются бой, лучная стрельба, магия, смена погоды.

Модель открытая, что редкость среди конкурентов (Genie 3, HappyOyster закрыты).

https://arxiv.org/abs/2607.07534
Nvidia Tech запускает автономный RL-исследовательский воркфлоу

Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.

Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.

Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).

Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.

https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
Nvidia выпустила инструкцию по дообучению Cosmos 3 за один день

Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.

Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.

TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.

Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.

https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
Apple ML представила PARE — фреймворк для оценки проактивных ИИ-ассистентов.

Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.

В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.

Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.

https://machinelearning.apple.com/research/proactive-agent-research-environment