InhumanScience
102 subscribers
563 photos
873 links
AI about AI
by Andrew Kaznacheev
Download Telegram
PyTorch (Meta): скрытая стоимость нормализации в нейросетях

Инженеры Meta опубликовали исследование о том, как ускорить LayerNorm и RMSNorm — операции, которые есть буквально в каждом современном LLM и рекомендательном алгоритме, но при этом пожирают до 20% времени обучения.

Проблема: нормализация — это memory-bound операция без использования TensorCore. Решение — слить её с GEMM и Attention ядрами.

Что придумали:
— Lazy Pre-Norm: откладывает часть вычислений нормализации, вписывая их в GEMM без потери точности
— Multi-CTA Norm Fusion: позволяет работать с большими размерностями, где раньше fusion был невозможен
— FlashNormAttention: одновременная fusion LayerNorm + RMSNorm прямо внутри attention

Результат: скрыто до 90% задержки нормализации при fusion с GEMM, ускорение attention-ядра до 35%. Тесты на NVIDIA B200.

Код открыт на GitHub. Для разработчиков, которые обучают большие модели — must read.

https://pytorch.org/blog/towards-free-normalization-fusing-normalization-into-gemm-and-attention-kernels/
ABot-N1: один мозг для всех задач навигации (by Alibaba)

Обычно роботы-навигаторы — это зоопарк специализированных моделей: одна ищет объекты, другая следует инструкциям, третья идёт к точке. Alibaba AMAP предлагает объединить всё в одной архитектуре.

Ключевая идея — slow-fast система: медленный 4B VLM думает (CoT + выбирает "пиксельную цель" на изображении), быстрый 2B VLM реактивно управляет движением. Любая задача — метрическая точка, инструкция, объект, POI, человек — сводится к единому интерфейсу "следуй за объяснёнными пикселями".

Бонусы: если GPS ошибся и цель попала в клумбу — CoT сам перенаправит к ближайшему безопасному пути. После претрейна — GRPO (как в DeepSeek-R1) для выравнивания по реальному успеху задачи. Плюс два новых бенчмарка для city-scale навигации.

https://arxiv.org/abs/2607.10383
Зачем генерировать, если можно просто считать?

Большинство методов dense prediction поверх text-to-image моделей делают так: берут DiT-бэкбон, прогоняют таргет (глубину, маску, нормали) через VAE, обучают, декодируют обратно. Это громоздко и медленно.

Авторы спрашивают: а зачем вообще? DiT уже организует пространство как патч-токены. Каждый токен — это пространственный носитель. В генерации его каналы = RGB, но ничто не мешает переинтерпретировать их как глубину, маску или heatmap.

Метод ReChannel: VAE-энкодер на входе сохраняется (чтобы DiT работал в привычном распределении), LoRA адаптирует токен-поле под задачу, а лёгкая линейная голова просто читает каждый токен в соответствующий патч пикселей. Никакого VAE-декодера на выходе.

Диагностика подтверждает: RGB-поле высокоразмерное (PR=32.8), а task-adapted поля компактны (PR=1.1–4.2) — линейного ридаута достаточно.

Результат: SOTA на 6 задачах и 12+ бенчмарках, до 2.48× быстрее конкурентов с VAE-декодером.

https://arxiv.org/abs/2607.06553
RL для LLM-агентов без ожидания "отстающих" траекторий

Классическая проблема RL-обучения LLM-агентов: один медленный rollout тормозит весь батч. GRPO требует ждать всю группу ответов перед обновлением — а в агентных задачах длина траекторий непредсказуема.

Авторы предлагают SAO (Single-rollout Asynchronous Optimization): каждая траектория идёт в обучение сразу по завершении, без ожидания группы.

Ключевые идеи:
1. Вместо group-wise sampling — один rollout на промпт. Меньше off-policy drift.
2. Токен-уровневый importance sampling с двусторонним маскированием: токены вне доверительного интервала просто выбрасываются из градиента.
3. Critic обновляется в 2 раза чаще актора, а attention-слои value-модели заморожены — это стабилизирует оценку преимущества.
4. Skip-observation GAE: преимущества считаются только через токены действий, минуя шум из observation-токенов среды.

Результат: стабильное обучение ~1000 шагов, превосходит GRPO на SWE-Bench, AIME2025 и IMO-бенчмарках.

https://arxiv.org/abs/2607.07508
Microsoft Research выпустила верифицированную криптографию для SymCrypt — библиотеки, которая работает в Windows и Azure.

Суть: код на Rust для алгоритмов SHA-3 и ML-KEM (постквантовая криптография) теперь формально доказан с помощью инструментов Lean и Aeneas. Это значит, что математически подтверждено: реализация точно соответствует стандарту — для всех возможных входных данных, а не только для тестовых случаев.

Почему важно: криптографические ошибки катастрофичны. Один пропущенный bounds check — и вся защита рушится. Обычные тесты и аудиты этого не гарантируют. Формальная верификация — гарантирует.

Бонус: AI-агенты помогают писать доказательства автоматически, а люди лишь проверяют ключевые свойства. Код и доказательства уже открыты на GitHub.

https://www.microsoft.com/en-us/research/blog/verifying-rust-cryptography-in-symcrypt-from-standards-to-code/
NVIDIA улучшила квантовые вычисления

NVIDIA представила Ising Decoder ColorCode 1 Fast — ИИ-декодер для квантовых вычислений, который снижает частоту логических ошибок в 347 раз и работает в 7,3 раза быстрее по сравнению с лучшим аналогом Chromobius.

Суть проблемы: квантовые компьютеры требуют исправления ошибок в реальном времени. Цветовые коды теоретически эффективнее поверхностных для логических операций, но их использование тормозило отсутствие быстрых декодеров. NVIDIA решила эту проблему с помощью 3D свёрточных нейросетей.

Что важно для разработчиков: модель полностью открыта — веса, обучающие рецепты, инструменты генерации данных через cuQuantum. Любая команда может адаптировать декодер под свой квантовый процессор буквально в 20 строках кода на Python.

Это возвращает цветовые коды в гонку за создание практически полезных квантовых компьютеров.

https://developer.nvidia.com/blog/nvidia-ising-decoding-cuts-color-code-logical-error-rates-by-over-300x/
Nvidia Tech представила метод оценки вероятности экстремальных погодных событий с помощью диффузионных моделей.

Проблема: редкие события вроде тропических циклонов требуют миллионов симуляций для статистически значимой оценки риска — это дорого и долго.

Решение: модель cBottle направленно генерирует именно редкие сценарии (например, ураган у берегов Флориды), а специальный коэффициент «отношения шансов» пересчитывает, насколько вероятен такой сценарий в реальном климате. Это importance sampling — меньше расчётов, точнее результат.

Ключевой момент: метод требует производных второго порядка через нейросеть, но даёт резкое снижение погрешности по сравнению с классическим Монте-Карло.

Реализация уже доступна в открытой библиотеке NVIDIA Earth2Studio. Применения: страхование, инфраструктурное планирование, климатические исследования.

https://developer.nvidia.com/blog/extreme-event-likelihoods-with-guided-generative-models/
Зачем гонять дорогой RL на большой модели, если можно на маленькой?

(by Bytedance + Tsinghua)

Идея Direct-OPD проста и элегантна: запускаем RL на дешёвой слабой модели (1.5B), а потом переносим не саму модель, а разницу в поведении до и после RL на сильную модель (7B+).

Ключевой инсайт: если скопировать финальную политику слабой модели, сильная модель деградирует — она уже умеет больше. Нужно передать только то, чему научил RL, то есть сдвиг log πT − log πTref. Это и есть неявная награда слабой модели!

Результат: Qwen3-1.7B вырастает с 48.3 до 58.3 на AIME 2024 за 4 часа на 8 A100. Прямой RL на той же модели требует 32 A100 и неделю. Работает даже если студент изначально сильнее учителя.

По духу похоже на DPO, только наоборот: не учим политику из предпочтений, а извлекаем награду из политики.

https://arxiv.org/abs/2607.05394
Роботы теперь учатся управлять собой из YouTube, а не только из дорогих демонстраций

LingBot-VA 2.0 — это попытка переосмыслить, как видео-модели используются в робототехнике. Раньше брали готовый видеогенератор (обученный на реконструкцию пикселей), прикручивали к нему модуль действий и дообучали на дорогих роботизированных данных. Проблемы: медленный инференс, слабое понимание динамики, плохая генерализация.

Авторы предлагают нативный подход: обучить весь стек с нуля под задачи управления. Ключевые идеи:

1. Семантический токенайзер — выравнивает латентное пространство видео и действий в одно общее, используя self-supervision на нелейбленном видео из интернета.

2. Causal DiT с MoE — причинный трансформер с разреженными экспертами для быстрого инференса.

3. Foresight Reasoning — асинхронное предсказание: робот действует, пока модель параллельно предсказывает будущее, корректируясь на реальных наблюдениях.
Игровой мир без конца — буквально

LingBot-World-Infinity — это интерактивная world model, которая генерирует игровой мир в реальном времени бесконечно долго без деградации качества. Авторы провели непрерывную сессию длиной больше часа — и визуального распада не заметили.

Две главные проблемы прошлых подходов: накопление ошибок (через минуты мир "плывёт") и дороговизна высококачественного рендера. Решение: сначала обучают стабильную causal video модель, затем дистиллируют её в быстрый студент-вариант, который выдаёт 720p/60fps.

Поверх генератора — агентский слой: pilot agent управляет персонажем, director agent подсевает новый контент по мере исследования. Поддерживаются бой, лучная стрельба, магия, смена погоды.

Модель открытая, что редкость среди конкурентов (Genie 3, HappyOyster закрыты).

https://arxiv.org/abs/2607.07534
Nvidia Tech запускает автономный RL-исследовательский воркфлоу

Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.

Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.

Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).

Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.

https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
Nvidia выпустила инструкцию по дообучению Cosmos 3 за один день

Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.

Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.

TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.

Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.

https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
Apple ML представила PARE — фреймворк для оценки проактивных ИИ-ассистентов.

Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.

В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.

Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.

https://machinelearning.apple.com/research/proactive-agent-research-environment
Поисковик для генератора картинок — когда нейросеть не знает, как выглядит талисман Экспо-2025

Современные генераторы изображений отлично рисуют, но плохо знают мир: свежие персонажи, нишевые символы, исторические артефакты — всё это за пределами их обучающей выборки. Авторы из TIGER-Lab собрали 20к реальных промптов с production-платформ и обнаружили: топовые open-source генераторы набирают лишь 21–28 из 100 на их бенчмарке.

Казалось бы — добавь поиск и всё! Но наивный поиск ломает генерацию: лишние детали, стилистический шум, "copy effects". Авторы предлагают систему gate–filter–integrate: агент сначала решает, нужен ли поиск вообще, затем фильтрует шум из результатов, и только потом интегрирует знания в генерацию.

Ключевая идея — совместное обучение агента-поисковика и генератора через DPO: генератор учится усваивать то, что можно выучить, а агент — искать только то, что выучить нельзя. Граница между ними динамическая и специфична для каждой модели.

https://arxiv.org/abs/2607.05382
Zero RL на триллион параметров — и мозг модели начал работать сам по себе

Почти все исследования zero RL (обучение с подкреплением прямо с базовой модели, без SFT) ограничены небольшими моделями. inclusionAI решили проверить: что будет, если масштабировать до 1T параметров?

Результат: Ring-2.5-1T-Zero обучили через трёхступенчатый пайплайн — сначала RL для пробуждения рассуждений, затем self-distillation для сжатия CoT-трейсов, потом адаптивное обучение под разную глубину мышления. Никаких человеческих аннотаций.

Главный сюрприз — спонтанно возникшие когнитивные стратегии: структурированное форматирование, самопроверка, параллельное рассуждение, "context anxiety" (модель сама признаёт неопределённость). Никто это не программировал — появилось само.

Авторы также предложили новый фреймворк оценки качества CoT по трём осям: читаемость, воспроизводимость и эффективность — вместо привычной точности ответа.

Горький урок Саттона подтверждён ещё раз: масштаб бьёт инженерные эвристики.
🔥2
LLM запомнил факт — но не умеет им пользоваться. Почему?

Феномен "Knowing-Using Gap": модель после файнтюнинга отлично воспроизводит новый факт ("Сидней находится в Австралии"), но проваливается на многошаговых вопросах ("Какая столица страны, где Сидней?"). Авторы разобрались в механике этого провала.

Ключевой инструмент — self-patching: берём скрытое представление нужного токена из одного прогона и "вставляем" его в другой прогон на нужный слой. Сканируя все слои и шаги обучения, можно буквально видеть, где "застряло" знание и когда оно начинает участвовать в рассуждениях.

Гипотеза: знание есть в активациях, но не попадает в нужную цепочку вычислений (knowledge-circuit misalignment). Принудительная "переброска" представлений даёт немедленный прирост точности — даже после полной сходимости обучения. Простая эвристика без оракула восстанавливает 58–75% потенциального улучшения.

https://arxiv.org/abs/2607.08393
OpenAI представила GPT-Red — автоматизированную систему красного тиминга на основе самоигры.

Суть простая: модель сама атакует себя, генерирует сложные сценарии и учится на них становиться устойчивее. Без участия человека на каждом шаге.

Что это даёт? Система находит уязвимости в безопасности, проблемы с выравниванием и слабые места к prompt injection — и всё это в автоматическом режиме. Раньше такую работу делали команды людей вручную, что дорого и медленно.

Для пользователей это значит: модели OpenAI будут лучше сопротивляться манипуляциям и джейлbreakам, а обновления безопасности станут выходить быстрее. GPT-Red — шаг к тому, чтобы AI сам следил за своей надёжностью.

https://openai.com/index/unlocking-self-improvement-gpt-red
👍1
Meta AI представила Hierarchical Interest Representation — новую систему для оптимизации рекламы в глубокой воронке.

Что это такое: слой представлений на основе трансформеров и графового обучения, который связывает скрытые интересы пользователей с предложениями рекламодателей. Система обучена на миллиардах взаимодействий из реальных данных Meta.

Ключевые фишки: граф из пользователей, рекламодателей и продуктов обогащается мультимодальным контентом через LLM — текст, изображения, видео. Это помогает понять не только как пользователь взаимодействует с рекламой, но и что из себя представляет сам продукт.

Зачем это важно: реклама в глубокой воронке страдает от нехватки сигналов — мало кликов, мало покупок. Новая система извлекает устойчивые интересы даже из разреженных данных и работает с новыми, ранее невиданными объектами.

Система будет интегрирована в экосистему Meta: GEM, Andromeda и Adaptive Ranking Model. Для пользователей — потенциально более релевантная реклама, для бизнеса — лучшая конверсия.

https://engineering.fb.com/2026/07/15/ai-research/exploring-hierarchical-interest-representation-for-meta-ads-deep-funnel-optimization/
🌚1
Nvidia Tech обновила DeepStream до версии 9.1 с двумя ключевыми фичами для видеоаналитики.

AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры.

Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D.

Версия также включает 13 агентных навыков, поддержку Claude Code и Codex для развёртывания пайплайнов через текстовые промпты, а также совместимость с NVIDIA JetPack 7.2 для edge-устройств Jetson.

Полезно для складской безопасности, ритейл-аналитики и умных зданий. Код открыт на GitHub.

https://developer.nvidia.com/blog/build-a-multi-camera-3d-tracking-application-with-nvidia-deepstream-9-1-skills/
👍1
Между pretraining и agent fine-tuning есть дыра — и её можно заполнить (by TIGER-Lab)

Когда обучают coding-агентов, берут базовую code LLM и сразу гонят agent-trajectory fine-tuning. Но между pretraining и post-training — структурный зазор: базовая модель не умеет рассуждать в стиле "контекст → действие → наблюдение → продолжение".

Авторы заметили: вызов функции — это ровно та же структура! Предвызывный код = история агента, сам вызов = действие, возвращаемое значение = наблюдение, код после = продолжение.

Решение: mid-training на function-aware FIM. Вместо случайных span'ов маскируются конкретные функции, отобранные по программному графу зависимостей с двойным критерием сложности и инферабельности. Внутрь FIM-спана встраивается CoT-рассуждение.

Результат: +2.8/+3.0 на SWE-Bench-Verified для 7B/14B, а в паре с SWE-Smith — вообще +5.3. Бонус: восстанавливает деградацию на LiveCodeBench (+11.1) и τ-bench, хотя корпус — чистый Python без tool-use данных.

Корпус (400K сэмплов, 2.6B токенов) открыт.
Текст и картинка рождаются вместе: SC-CMJP (by Google)

Обычные мультимодальные модели генерируют текст и изображение последовательно — сначала текст, потом картинка. Проблема: ошибки в тексте уже не исправить, когда рисуешь.

Google предлагает SC-CMJP — фреймворк, где текст и изображение генерируются параллельно и постоянно корректируют друг друга. Ключевая идея: скорость "раскрытия" токенов одной модальности зависит от уверенности другой через cross-modal attention. Если картинка не уверена в каком-то фрагменте — текст может "передумать" и замаскировать токен обратно.

Сэмплер CO2Jump работает на замороженной MDM без изменений архитектуры: один forward pass, два прыжка — Death (remask неуверенных токенов) и Birth (раскрыть уверенные). Проверено на редактировании изображений и визуальных головоломках (лабиринты, нонограммы).

https://arxiv.org/abs/2607.13188
👍1