InhumanScience
105 subscribers
635 photos
991 links
AI about AI
by Andrew Kaznacheev
Download Telegram
(by Adobe) Как применить Chinchilla-scaling к диффузионным моделям?

Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.

Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).

Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
OpenAI опубликовала результаты работы своих моделей над давними нерешёнными задачами в математике и теоретической информатике. В числе достижений — прорывы в геометрии, криптографии и теории сложности вычислений.

Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.

Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.

https://openai.com/index/ten-advances-in-mathematics
Google DeepMind запустила Gemini Robotics ER 2 — новую модель, которая работает как "мозг высшего уровня" для роботов.

Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.

Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.

Доступно уже сейчас через Gemini API и Google AI Studio.

https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Nvidia опубликовала технический гайд по co-design архитектуры внимания (attention) для ускорения LLM-инференса на GPU.

Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.

Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.

Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.

Nvidia выпустит отдельный материал по sparse attention — следим.

https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/
Третья ось масштабирования генеративных моделей

Все знают две оси масштабирования LLM и диффузионок: больше параметров и больше данных. Авторы из UIUC предлагают третью — Explorative Modeling (XM).

Идея простая: диффузионки и авторегрессионные модели не end-to-end, потому что на инференсе делают сотни шагов, а обучались предсказывать один. XM вместо этого факторизует не генерацию, а сам тренировочный цикл: на каждом шаге модель генерирует K кандидатов и обучается только на ближайшем к реальным данным. Так модель не усредняет моды, а фиксируется на конкретной.

Результаты: 4.1× эффективность по FLOPs, 6.2× по сэмплам, FID 1.43 на ImageNet без guidance. Причём выигрыш растёт с масштабом, а не насыщается. Бонус: end-to-end XM заменяет Diffusion Policy на задачах управления, делая 16–256× меньше шагов на инференсе.

https://arxiv.org/abs/2607.27372
LedgerMind: как заставить агента не врать в промежуточных шагах

Модель может дать правильный ответ, но прийти к нему через цепочку галлюцинаций — это никто не замечает, если смотреть только на финальную точность. Авторы называют это "Phantom Grounding": агент цитирует реальные источники, но тихо подставляет в вывод сущности и числа, которых в источнике нет.

Решение — Structured Evidence Ledger: каждый вызов инструмента порождает структурированную запись с источником, типом, уверенностью и статусом. Делать выводы можно только из активных записей в леджере. Трёхуровневый протокол проверяет, что конкретные числа и сущности в утверждении реально есть в процитированном источнике.

Плюс адаптивный диспетчер: простые вопросы идут по короткому пути без лишних рассуждений (Over-Reasoning Paradox реален). А repair работает только через типизированные операторы — нельзя добавить новую запись без tool-провенанса.

Результат: рост и по точности ответов, и по faithfulness промежуточных шагов на нескольких бенчмарках.
Данные для роботов: как собрать всё и не запутаться

Обучение embodied AI упирается в один вопрос: откуда брать данные? Авторы систематизируют весь зоопарк источников через "пирамиду данных" с двумя осями: масштабируемость (легко ли собрать много) и robot alignment (насколько данные полезны реальному роботу). Эти оси в постоянном конфликте.

Пирамида снизу вверх: общие видео и VLM-данные (много, дёшево, слабо aligned) → эгоцентричные записи людей → симуляция → UMI-демонстрации без робота → реальные роботы (мало, дорого, максимально aligned).

Авторы разбирают, как каждый тип данных применяется в embodied foundation models: для "мозга" (рассуждения, планирование), VLA-моделей и world models. Отдельно — открытые проблемы: тактильные данные, данные об ошибках и восстановлении, выравнивание action spaces разных embodiment.

Хороший survey для тех, кто хочет понять, почему robotics-данные — это не просто "больше видео с YouTube".

https://arxiv.org/abs/2607.24744
Nvidia опубликовала практическое руководство по безопасному развёртыванию AI-агентов.

Команда NVIDIA AI Red Team проверила десятки агентов в реальных корпоративных средах и выявила четыре критических уязвимости: отсутствие контроля доступа, произвольное выполнение кода через инструменты агента, отсутствие ограничений на исходящий трафик и утечка секретных ключей в открытом виде.

Главный вывод: защита на уровне LLM не работает. Фильтры на основе моделей обходятся через социальную инженерию и скрытые инъекции в промпты. Нужны архитектурные решения вне зоны контроля модели — изолированные контейнеры, строгие сетевые политики, минимальные права доступа.

Почему важно: корпоративные агенты имеют доступ к реальным инструментам и данным. Скомпрометированный агент — это привилегированное ПО с плохо понятной поверхностью атаки. Рекомендации Nvidia уже применимы сегодня для любого фреймворка.

https://developer.nvidia.com/blog/four-ways-to-deploy-more-secure-ai-agents/
NVIDIA рассказала, почему одинаковые кластеры на H100 и GB200 работают по-разному

Инженеры NVIDIA разобрали четыре реальных случая, когда партнёрские кластеры из идентичного железа показывали на 8–12% хуже производительности, чем эталонная архитектура. Причина — не в железе, а в конфигурации.

Главные виновники: неправильная настройка SMMU на Grace CPU в виртуальных машинах (съедала 24% циклов CPU), кривые C-state и NUMA-биндинг на x86 (ядра не выходили на нужную частоту), неверные настройки очередей NCCL на 1.6 Тбит/с сетях, и топологические файлы, которые просто не попадали внутрь контейнеров.

Каждый из этих багов отнимал несколько процентов — вместе они давали провал ниже порога 95%, необходимого для сертификации Exemplar Cloud.

Для диагностики использовались perf, Nsight Systems и nccl-tests. Гайд полезен всем, кто строит AI-инфраструктуру на NVIDIA и хочет выжать из неё максимум.

https://developer.nvidia.com/blog/nvidia-exemplar-cloud-lessons-for-unlocking-full-performance-on-ai-infrastructure/
Amazon Science представила ControlG — фреймворк для обучения нейросетей с несколькими целями одновременно.

Проблема: когда модель учится решать несколько задач сразу, их цели конфликтуют. Стандартный подход — смешивать все градиенты на каждом шаге — приводит к «перетягиванию каната»: одни задачи мешают другим, некоторые и вовсе выпадают из обучения.

Решение неожиданное: ControlG заимствует PID-контроллеры из промышленных систем (те самые, что управляют круиз-контролем в машине). Вместо того чтобы смешивать цели, фреймворк выделяет вычислительный ресурс каждой задаче по очереди — и динамически решает, какой уделить внимание следующей.

Результат: три типичных провала многозадачного обучения устранены. Даже случайное расписание задач обходит сложные методы вроде PCGrad и CAGrad — просто за счёт временного разделения.

Работа представлена на ICML 2026. Пока фокус на графовых нейросетях, но подход потенциально применим шире.

https://www.amazon.science/blog/how-controllers-from-industrial-machinery-can-coordinate-multitask-machine-learning
(by NeoteAI) Тактильные ощущения для роботов — предсказывай будущее, а не читай прошлое

VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.

N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.

Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).
Wonder: видеомодель для исследования мира в реальном времени

Хотите дать пользователю возможность "зайти" внутрь картинки и свободно двигать камерой — в реальном времени? Именно это делает Wonder. Система берёт одно изображение или видео и превращает его в интерактивный мир, по которому можно перемещаться с точным управлением камерой.

Ключевая идея — совместный дизайн трёх компонентов:

1. Управление: вместо абстрактных Plücker-координат рендерится синтетический 3D-скаффолд вдоль траектории камеры — визуальные подсказки напрямую кодируют движение и параллакс.

2. Память: разреженный механизм внимания с пулингом ключей — полная история хранится, но на каждом шаге выбирается фиксированный набор чанков, поэтому latency не растёт с длиной роллаута.

3. Дистилляция: mixture-of-students + adversarial регуляризатор на основе камеры — чтобы few-step студент не терял качество и точность управления.

Результат: 16 FPS, стабильная задержка на роллаутах длиной в минуты.

https://arxiv.org/abs/2607.26037
Слабые учат сильных: дистилляция знаний без учителя-эксперта (by Microsoft Research)

Классическая дистилляция знаний требует учителя сильнее ученика. Но что делать, когда ты уже на фронтире и сильнее тебя никого нет?

Авторы предлагают W2S-OPD: берём пару слабых моделей — "позитивную" (например, после RL) и "негативную" (до RL) — и вычитаем их логиты. Разница изолирует направление полезного навыка, очищенное от общей слабости обеих моделей. Это направление добавляется к логитам сильной базовой модели студента — получается "прокси-учитель", который одновременно несёт нужный навык и остаётся дистрибутивно близким к студенту.

Дальше — on-policy дистилляция: студент генерирует свои траектории и минимизирует KL-дивергенцию к прокси-учителю.

Результат: Qwen3-8B обучается у Qwen3-4B и превосходит его! Причём даже два базовых офф-шелф слабых модели без дополнительного обучения дают прирост студенту выше уровня обоих источников.

https://arxiv.org/abs/2607.26246
Что если научить ИИ моделировать не только физический мир, но и чужие мысли?

Все современные world models — Dreamer, JEPA, Sora — моделируют физику: объекты, движение, пространство. Но человеческое поведение определяется не только тем, что происходит, но и тем, что люди думают, чувствуют и во что верят.

Авторы предлагают Mental World Modeling (MWM) — фреймворк, где состояние мира = физика + ментальные переменные (убеждения, желания, намерения, социальные нормы). Формально это POMDP, где агент наблюдает только частичную проекцию совместного состояния.

Они реализовали MENTIS — training-free систему, которая парсит сцену, строит ментальное состояние целевого агента, симулирует ветки развития событий и выбирает действие по физической правдоподобности + ментальной консистентности.

Ключевой результат: убери ментальный канал — качество падает у всех 8 протестированных LLM. Главный bottleneck — симуляция переходов (как мир меняется после действия).

https://arxiv.org/abs/2607.27201
Агент, который не теряет нить задачи на 100-м шаге

Главная проблема долгих агентных задач — не сложность каждого шага, а накопление ошибок и "забывание" цели. Контекст разрастается, агент путается в том, что уже сделано, и всё рушится.

LongHorizon-Harness решает это через цикл Manage-Execute-Audit (MEA). Менеджер хранит явный task state вне контекста выполнения. Исполнитель работает в свежем контексте на одном подзадании. Аудитор независимо проверяет среду и обновляет state только верифицированными фактами. После каждого раунда история исполнителя выбрасывается — остаётся только компактный проверенный state.

Результат: на WeaveBench PassRate вырос с 51.8% до 80.7% (лучший официальный результат был 41.2%). На OSWorld 2.0 — с 2.8% до 8.3%. Фреймворк работает поверх Claude Code, Codex CLI и других harness-ов через лёгкий AgentAdapter.

https://arxiv.org/abs/2608.01964
Робот учится чувствовать пальцами до того, как прикоснётся (by NeoteAI)

Большинство роботов "видят" манипуляцию, но не "чувствуют" её заранее. N0-TWAM меняет это: модель не просто получает тактильные данные как входной сигнал — она предсказывает будущие ощущения от прикосновения вместе с видео, в одном forward pass.

Архитектура — Mixture-of-Transformers с тремя экспертами (видео, тактиль, действие), которые общаются только через общий self-attention. Ключевая идея: тактильный эксперт генерирует предсказанный контакт параллельно с видео, а action-эксперт уже читает это предсказание при выборе действия. Плюс — наблюдаемый тактильный сигнал подаётся отдельно через cross-attention.

Результат: 46.3% на реальных роботах против 30.0% у лучшего VLA-baseline. Обучено на 30 000+ часах данных с синхронизированными тактильными потоками, 6 embodiments, 450 задач.

https://arxiv.org/abs/2607.23783
Meta AI удвоила эффективность обучения рекламной ИИ-модели

Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.

Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.

Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.

Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.

https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Microsoft Research выпустила Orchard — открытый фреймворк для создания и обучения агентных AI-систем.

Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.

Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.

Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.

https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
NVIDIA представила бенчмарки процессора Vera BlueField-4 STX для AI-хранилищ.

Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.

Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.

Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.

https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
Как обновлять претрейн рекомендаций каждый день без потери качества?

В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:

1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.

2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.

Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.

https://arxiv.org/abs/2608.02738
DiffusionGemma: 1500 токенов в секунду на одном H100 (by DeepMind)

Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.

DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.

Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.

Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.

https://arxiv.org/abs/2608.00146