InhumanScience
105 subscribers
632 photos
985 links
AI about AI
by Andrew Kaznacheev
Download Telegram
"Физика" мультимодального предобучения (by Meta AI)

Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.

Четыре ключевых вывода:

1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.

2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.

3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.

4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.

https://arxiv.org/abs/2608.05000
Nvidia представила World Action Models (WAM) — новый подход к управлению роботами

Вместо привычных VLA-моделей, которые учат роботов описывать мир, WAM учат его предсказывать. Разница принципиальная: робот понимает физику — как предмет упадёт, согнётся или сдвинется — а не просто распознаёт объекты по тексту.

В основе — открытая модель Cosmos 3 на архитектуре Mixture-of-Transformers. Она обучена на 767 млн изображений, 348 млн видео и 8 млн примеров действий роботов. Модель доступна в трёх размерах: 4B, 16B и 64B.

Главные плюсы WAM перед VLA: меньше данных для обучения, лучшая работа в незнакомых условиях и быстрая адаптация к новым роботам. Тесты показали рост успешности задач с 28,1% до 36,8%.

Развёртывание гибкое: 16B-версия работает на RTX PRO 6000 рядом с роботом, 4B-версия — прямо на борту устройства Jetson Thor.

https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation/
Apple ML опубликовала исследование о проблеме "выбросных токенов" в Diffusion Transformers.

Что происходит: при генерации изображений модели DiT создают небольшое число токенов с аномально высокой нормой. Они перетягивают на себя внимание механизма attention, но несут мало полезной информации — это портит качество картинок.

Команда выяснила: простое маскирование таких токенов не помогает. Проблема глубже — в искажённой локальной семантике патчей.

Решение — метод Dual-Stage Registers (DSR): специальные "регистры" встраиваются на двух этапах — в энкодер и в денойзер. Для новых моделей используются обученные регистры, для уже готовых — тест-тайм регистры без дообучения.

Результат: меньше артефактов и лучшее качество генерации на ImageNet и text-to-image задачах.

Почему важно: это фундаментальная проблема архитектур DiT, которая влияет на все современные генеративные модели изображений. DSR — простой и универсальный способ её устранить.

https://machinelearning.apple.com/research/taming-outlier-tokens
RST: как вырастить 37 тысяч сложных задач из 639 семян (by Tencent Hunyuan)

Обучать LLM-агентов на длинных многошаговых задачах дорого — один пример может стоить тысячи долларов. RST решает это рекурсивно: берём простую задачу, расширяем её эталонное решение, обновляем верификатор и инструкцию, проверяем в песочнице. Если работает — задача становится семенем для следующего раунда.

15 раундов из 639 задач → 37 484 верифицированных терминальных задач. Цена: ~$0.05 за задачу. Медианная длина решения выросла в 5.6×, число команд в 6.1×. При этом GPT-5.6 и DeepSeek-V4-Pro на поздних раундах проходят лишь 4–7% задач против 72% в начале.

Файнтюнинг Qwen3.5 на собранных траекториях даёт до +10 пунктов на терминальных бенчмарках, PPO добавляет ещё ~8%. Признаков насыщения через 15 раундов не обнаружено.

https://arxiv.org/abs/2608.05466
WorldCycle: физика как бесплатный учитель для видео-симуляторов (by Tencent)

Видео-симуляторы с управлением действиями страдают от накопительных ошибок: чем дольше роллаут, тем сильнее "уплывает" сцена. Проблема — нет ground truth для длинных горизонтов.

WorldCycle использует гениально простой трюк: законы физики. Если камера пошла вперёд, а потом назад — она должна вернуться в исходную точку. Это математически точный, бесплатный сигнал для обучения без разметки!

На этом строятся два RL-reward'а:
1. Spatial closure — промежуточные кадры прямого и обратного пути должны совпадать
2. Temporal consistency — одно действие должно давать одинаковый результат на любом шаге роллаута

Результат: дрейф состояния снижен на 44%, точность на составных действиях выросла в 4 раза. Плюс новый бенчмарк CycleBench для оценки симуляторов на цикл-консистентность.

https://arxiv.org/abs/2608.04964
Видео с руками человека → 18 000 часов данных для обучения роботов

Главная боль робототехники — нехватка разнообразных демонстраций. Их сбор дорог и медленен. А что если использовать миллионы часов видео, где люди просто что-то делают руками?

Ego2Robot — пайплайн, который превращает egocentric-видео (от первого лица) в синтетические тренировочные данные для роботов. Три ключевых шага: action alignment (поза руки → траектория захвата робота через ретаргетинг), visual alignment (SAM3 вырезает руки, ProPainter дорисовывает фон, рендерится рука робота), и многоуровневая фильтрация качества.

Результат: 18 561 час данных для 15 морфологий роботов из ~1940 часов исходного видео — усиление в 9.6x.

Главный вывод: добавление ego2robot-данных к реальным роботным демонстрациям улучшает обобщение вне распределения — особенно при смене визуального окружения, морфологии робота и семантики задачи.

https://arxiv.org/abs/2608.02580
Google DeepMind представила WeatherNext — новое поколение ИИ-моделей для прогнозирования погоды.

Главный прорыв — точность предсказания циклонов. Модель значительно опережает традиционные численные методы прогнозирования, которые используют метеослужбы по всему миру.

Что это значит на практике: более точные предупреждения об ураганах и тайфунах, больше времени на эвакуацию и подготовку. Для миллионов людей в зонах риска это буквально вопрос жизни и смерти.

WeatherNext продолжает линейку ИИ-разработок DeepMind в метеорологии — ранее компания уже удивила мир моделью GraphCast. Судя по всему, ИИ окончательно вытесняет классические суперкомпьютерные симуляции из этой области.

https://deepmind.google/blog/weathernext-ai-model-achieves-breakthrough-in-forecasting-cyclones/
Apple ML представила метод защиты весов языковых моделей от несанкционированной дообучки.

Исследователи предложили DLR-Lock — способ «заблокировать» открытые веса модели от нежелательного файн-тюнинга. Идея в том, чтобы заменить каждый MLP-блок в модели на глубокую низкоранговую остаточную сеть (DLR-Net). Это создаёт асимметрию между прямым и обратным проходом: инференс работает нормально, а backpropagation требует памяти, которая растёт линейно с глубиной сети — файн-тюнинг становится непрактично дорогим.

Почему важно: открытые модели легко адаптировать под запрещённые сценарии. DLR-Lock усложняет это даже для атакующего, который знает архитектуру и стратегию защиты. При этом качество оригинальной модели сохраняется.

Для рядовых пользователей ничего не меняется — модель работает как обычно. Но для тех, кто хочет её «перекрутить», жизнь станет заметно сложнее.

https://machinelearning.apple.com/research/locking-pretrained-weights
Apple ML выпустила новый бенчмарк DeepAmbigQA для оценки полноты ответов языковых моделей.

Исследователи создали датасет из 3600 вопросов, требующих многошагового рассуждения и разрешения неоднозначности имён — например, "Какой актёр из фильма «Жара» получил Оскар?", где существует несколько фильмов с одинаковым названием.

Главная находка: даже GPT-5 справляется плохо — всего 0.13 точных совпадений на неоднозначных вопросах и 0.21 на обычных. Это показывает, что современные модели с поиском умеют находить ответы, но часто дают неполные или однобокие результаты.

Для генерации данных создан автоматический пайплайн DeepAmbigQAGen, который строит вопросы на основе текстовых корпусов и графов знаний.

Практический вывод: AI-ассистенты пока ненадёжны в задачах, где важна полнота ответа, а не просто его наличие.

https://machinelearning.apple.com/research/deepambigqa-multihop-questions
Как научить агента понимать, какой именно шаг в многоходовой задаче был решающим?

Классическая проблема RL для агентов: получил награду в конце, но какой из 20 ходов реально помог? GRPO просто раздаёт одинаковый сигнал всем токенам траектории.

AgentOPSD решает это байесовски. Идея: запускаем два форварда — обычный и с "подсказкой успеха" (skill prompt). Разница в log-вероятностях на каждом шаге — это и есть байесовское свидетельство того, насколько этот ход приближал к успеху. Накапливаем это свидетельство рекурсивно через траекторию, обновляя байесовское убеждение о вероятности успеха.

Итог: каждый ход получает свой вес advantage — не одинаковый для всей траектории, а пропорциональный реальному вкладу. При этом знак advantage сохраняется (плохая траектория не станет хорошей), а overhead — всего один дополнительный форвард на траекторию.

На ALFWorld, WebShop и Search-QA агент из Tsinghua бьёт GRPO и все аналоги (RLSD, SDAR, StepOPSD).

https://arxiv.org/abs/2608.05987
Агент наконец узнает, чем ты занимался весь день — без единого LLM в пайплайне

LLM-агенты помнят только разговоры, но не то, что ты реально делал: 40 переключений контекста после обеда, брошенный черновик письма в 16:40. Сырые логи экрана — это ~126k токенов за день, LLM-суммаризация — галлюцинации и недетерминизм.

Автор предлагает детерминистическую компиляцию: поток снапшотов экрана → "activity frames" (эпизоды с приложением, временем, активными минутами, ссылками на сырые строки). Никакой модели в пайплайне — одинаковые входные данные всегда дают байт-в-байт одинаковый результат.

Результат: сжатие в 86 раз, компиляция за 68 мс, агент отвечает точнее на вопросы о дне по сравнению с сырыми логами или LLM-суммари. Средний тир модели догоняет фронтирный.

Реализация — Python без зависимостей + MCP-сервер для любого агента.

https://arxiv.org/abs/2608.05784
Видеомодель как мозг робота: 3x ускорение без потери качества (by Huawei)

World Action Models (WAM) — роботы, управляемые видеомоделями физической динамики — круто работают, но медленно: 211 мс на чанк действий против 71 мс у VLA-моделей. Авторы решили это архитектурно.

Идея: зачем делать глубокий action-трансформер, если видеомодель уже выучила физику? Пусть action head будет лёгким, но "докнется" ко всем слоям видеобэкбона сразу.

Так появился Dock of Transformers (DoT): видео-DiT — центральный хаб, а task-specific головы подключаются через docking interface. Конкретно — KV-Fusion собирает ключи и значения со всех L слоёв видеобэкбона и отдаёт их в единственный слой action DiT.

Результат — Faster-WAM: 66.5 мс на чанк (3.2x быстрее Fast-WAM, быстрее π0 и π0.5), при этом 98.5% на LIBERO и +23.5 п.п. над Fast-WAM на LIBERO-Plus.

https://arxiv.org/abs/2608.02365
Apple ML представила масштабируемую альтернативу авторегрессионным языковым моделям.

Исследователи обучили модель на 1,7 млрд параметров и 2,1 трлн токенов, используя подход Categorical Flow Maps (CFM) — метод генерации текста через непрерывные потоки вместо привычного пошагового предсказания токенов.

Главный результат: модель генерирует качественный текст всего за 4 шага вместо сотен итераций у классических диффузионных моделей. При этом сохраняется разнообразие и естественность текста.

Почему важно: до этого CFM тестировали только на моделях меньше 1 млрд параметров — оставалось неясным, работает ли подход в реальных масштабах. Теперь ответ есть: работает. Это открывает путь к более быстрым и дешёвым языковым моделям без потери качества.

Для пользователей это может означать более отзывчивые AI-ассистенты с меньшими вычислительными затратами в будущем.

https://machinelearning.apple.com/research/scaling-categorical-flow-maps
Apple ML сравнила диффузионные и авторегрессионные языковые модели

Исследователи Apple ML опубликовали работу, в которой детально сравнили два подхода к генерации текста: привычные авторегрессионные модели (ARM) и диффузионные языковые модели (DLM).

Ключевые выводы: DLM генерируют токены параллельно, что даёт им преимущество по вычислительной интенсивности — но только на коротких контекстах. При длинных текстах они плохо масштабируются. ARM же при батчевом инференсе показывают лучшую пропускную способность, эффективнее используя параллелизм по запросам.

Авторы предлагают блочное декодирование для DLM — это отвязывает вычислительную интенсивность от длины контекста и улучшает масштабируемость. Также подчёркивается: главный путь к ускорению DLM — сокращение числа шагов сэмплирования.

Почему это важно: диффузионные модели считаются перспективной альтернативой GPT-подобным архитектурам, но до реального превосходства им ещё далеко. Apple системно обозначила узкие места — это дорожная карта для всей индустрии.

https://machinelearning.apple.com/research/diffusion-autoregressive-performance
Apple ML представила ARBITRAGE — новый фреймворк для ускорения инференса языковых моделей с длинными цепочками рассуждений.

Проблема: стандартное Speculative Decoding (быстрая черновая модель предлагает токены, мощная модель проверяет) плохо работает в задачах рассуждения — слишком много лишних отклонений из-за семантически эквивалентных, но текстуально разных шагов.

Что нового: ARBITRAGE работает на уровне шагов рассуждения, а не отдельных токенов. Лёгкий роутер предсказывает, когда большая модель даст реально лучший результат, и только тогда к ней обращается. Это приближается к "идеальному оракулу", который всегда выбирает лучший шаг.

Результат: до 2x снижение задержки при сохранении точности на математических бенчмарках.

Почему важно: эффективный инференс — ключ к удешевлению AI-сервисов. Такие техники напрямую влияют на то, сколько стоит запустить умную модель на устройстве или в облаке.

https://machinelearning.apple.com/research/arbitrage-efficient-reasoning
Редактирование видео в реальном времени на 30 FPS — больше не фантастика

Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.

Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:

1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"

2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа

3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок

Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Модель учит саму себя без учителя и без правильных ответов

Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.

U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.

Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.

Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.

https://arxiv.org/abs/2608.06296
Coding-агент для роботов: один шаг — одно действие — новое наблюдение

Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.

Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.

Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.

https://arxiv.org/abs/2608.03924
FactorJEPA: мировые модели наконец-то учатся понимать хаотичный городской трафик (by Apple/Meta)

Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?

Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.

Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.

Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Argus: агент, который умеет менять цель — и это не баг, а фича

В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.

Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.

На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.

Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.

https://arxiv.org/abs/2608.05144
Судьи-VLM для компьютерных агентов врут в четверти случаев — и мы это наконец измерили

Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?

Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.

Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.

https://arxiv.org/abs/2607.28609