InhumanScience
106 subscribers
719 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Видео на всю длину истории, а не только один клип

Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.

Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.

Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.

Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.

https://arxiv.org/abs/2608.23383
Дистилляция из нескольких учителей сломана — и вот почему (by ByteDance & Tsinghua)

Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.

Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.

Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness

Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Nvidia представила TensorRT Model Connect — инструмент для развёртывания открытых моделей в нативных C++ приложениях всего двумя командами.

Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.

Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.

Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.

Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect

https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
Apple ML опубликовала исследование о том, насколько последовательно языковые модели обновляют свои убеждения при получении новых данных.

Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.

Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".

Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.

https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Apple ML представила Agent Seer — систему для автоматической генерации тестовых сценариев для AI-агентов.

Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.

Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.

Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.

Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.

https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
LLM пишет 3D-модели как программу — и получает чёткие грани, именованные детали и редактируемость

Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).

Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.

Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.

https://arxiv.org/abs/2608.26238
LLM как мозг игрового мира: Code World Model

Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.

Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.

Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.

Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.

https://arxiv.org/abs/2608.25927
Бесплатное ускорение reasoning-моделей в 3 раза без переобучения

Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.

Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.

Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).

Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.

https://arxiv.org/abs/2608.26070
PyTorch: vLLM займёт центральное место на конференции 2026 года

PyTorch Conference North America 2026 пройдёт в Сан-Хосе 20–21 октября. Фреймворк vLLM для деплоя LLM станет одной из главных тем — ему посвящены десятки сессий.

Что обсудят: управление KV-кешем, disaggregated serving, перенос моделей между разными ускорителями (TPU, Trainium, Gaudi, Arm), оптимизация ядер и интеграция с PyTorch. Отдельные треки — по Mixture-of-Experts, механизмам внимания и продакшн-деплою.

Почему важно: vLLM де-факто стал стандартом для высоконагруженного инференса. Конференция покажет, как экосистема вокруг него продолжает расти — от облачных провайдеров до академических проектов.

Регистрация уже открыта.

https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
Что если представить физический мир как исполняемый код?

VLM умеют описывать физику словами, но описание — это не понимание механизма. Почему мяч летит именно так? Какова его масса? Какое ускорение?

Авторы предлагают Code-as-World: физический мир кодируется не пикселями и не текстом, а исполняемым кодом — с объектами, параметрами, динамикой и визуализацией. Это как написать симулятор сцены.

Главная фишка — агентный цикл открытий: предложи гипотезу → запусти симулятор → отрендери → сравни с реальным видео → исправь. Повторяй, пока код не совпадёт с наблюдениями. Что-то вроде того, как Ньютон выводил законы из данных, только автоматически.

На выходе — верифицированные «исполняемые миры», которые используют как физическую разметку для обучения VLM. Модель Code-as-World-VL-9B обходит Gemini на бенчмарке QuantiPhy по количественному физическому рассуждению.

https://arxiv.org/abs/2608.27549
Больше данных — не всегда ответ для роботов

Хочешь научить робота новым задачам? Обычно говорят: собери больше траекторий. Но авторы VLAct утверждают: дело не в количестве данных, а в том, как они формируют представления в backbone.

Проблема: при наивном дообучении VLM на роботных данных происходит три беды. Узкие траектории разрушают полезные vision-language признаки. Один action head "переспециализирует" backbone под свою геометрию. Разные embodiment-ы не делятся общими знаниями.

Решение VLAct: защита мелких слоёв LLM от перезаписи + микс caption-данных + обучение сразу с несколькими action heads + унифицированное пространство действий для разных роботов.

Результат: +7.6–21.4 пункта на бенчмарках только за счёт лучшего backbone — при том же action head, тех же данных и том же бюджете дообучения. 82.6% на LIBERO-Plus, 92.5% на RoboTwin 2.0. Всё на 16 GPU и открытых данных.

https://arxiv.org/abs/2608.27550
Робот учится по видео с людьми — без единой совместной записи

Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.

Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.

Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.

Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.

https://arxiv.org/abs/2608.26103
DART-SD: как научить агента чинить только сломанное (by ByteDance)

Когда LLM-агент использует инструменты в несколько шагов, стандартные подходы страдают от одной проблемы: SFT штрафует модель за нормальные шаги, а RL размазывает награду равномерно по всей траектории. Оба метода не понимают, что пространство решений — это не линейная цепочка, а граф с «ромбовидной» топологией, где разные пути пересекаются в одних и тех же состояниях.

DART-SD строит граф переходов (ISTG) из траекторий учителя, находит точку Critical Topological Breakpoint — первый момент, где студент сходит с успешного пути — и обучает модель только на шагах восстановления после этой точки. Всё, что было до CTB, не трогается градиентами.

Результат: меньше лишних вызовов инструментов, лучше качество на 5 бенчмарках, и модель постепенно сдвигает границу своей компетентности с каждым раундом само-дистилляции.

https://arxiv.org/abs/2608.18524
Находить объекты в видео параллельно, а не по очереди

Задача spatio-temporal video grounding — найти объект в видео по текстовому запросу: определить временной интервал и нарисовать bounding box в каждом кадре. Проблема: стандартные MLLM генерируют боксы один за другим, и чем длиннее видео — тем медленнее и хуже (ошибки накапливаются).

Авторы из MBZUAI предлагают Parallel Tube Decoding (PTD): вместо того чтобы генерировать боксы последовательно, модель сначала за один шаг предсказывает временной интервал, а затем параллельно генерирует все боксы сразу. Итого всегда ровно два декодирующих раунда, независимо от длины трубки.

Чтобы это работало, вводят Decoupled Block Attention — каждый бокс видит общий видео-контекст, но не видит другие боксы. Плюс RL-оптимизация с пространственными и временными наградами.

Результат: ускорение латентности в 79 раз, пропускная способность выросла в 92 раза по сравнению с базовым текстовым декодингом, при этом качество локализации улучшилось.

https://arxiv.org/abs/2608.28192
Модель учится без правильных ответов — и обгоняет ту, у которой они были

Представьте: у вас есть сложные олимпиадные задачи, и вы не знаете правильных ответов. Можно ли всё равно улучшить модель? TTPO говорит — да.

Ключевое наблюдение: на задачах уровня AIME псевдо-метки (majority vote по K роллаутам) ошибаются в ~85% случаев. Казалось бы, учиться на таком шуме бессмысленно. Но вот хитрость: даже когда псевдо-метка неверна, ~79% "несогласных" роллаутов тоже неверны. Значит, штрафовать несогласных — правильно почти всегда, независимо от качества метки.

Отсюда асимметричный дизайн:
- Роллауты, согласные с псевдо-меткой → дистилляция (OPSD) с токен-уровневыми весами
- Несогласные роллауты → GRPO-штраф с маскировкой аномальных токенов

Результат: Qwen3-1.7B без единого правильного ответа вырастает с 38.0% до 45.2% на олимпиадных бенчмарках — обгоняя TTRL и даже label-supervised OPSD.

https://arxiv.org/abs/2608.27448
Microsoft Research выпустила GigaPath-Flash и GigaTIME-Flash — ускоренные версии своих ИИ-моделей для анализа патологических снимков.

Суть: оригинальные модели GigaPath и GigaTIME умели анализировать гигапиксельные срезы тканей и строить карты опухолевого микроокружения, но требовали огромных вычислительных ресурсов. Flash-версии решают эту проблему — через дистилляцию знаний из миллиардной модели в компактную архитектуру.

Цифры говорят сами за себя: GigaPath-Flash работает в 50 раз дешевле при сохранении 97% точности. GigaTIME-Flash — в 6 раз быстрее и потребляет в 8 раз меньше памяти, при этом показывая лучшее качество на новых данных.

Практически это означает: анализ миллиона слайдов теперь занимает 70 GPU-дней вместо 300. Исследователи смогут изучать десятки тысяч пациентов, тестировать гипотезы и искать биомаркеры рака в реальном масштабе.

Модели открыты под лицензией Apache 2.0 и доступны на HuggingFace. Для клинического применения не предназначены.

https://www.microsoft.com/en-us/research/blog/gigapath-flash-and-gigatime-flash-toward-population-scale-discovery-with-efficient-pathology-foundation-models/
Nvidia Tech — BioNeMo Agent Toolkit теперь работает с Claude Science

NVIDIA интегрировала BioNeMo Agent Toolkit в Claude Science — научную платформу Anthropic. Результат: ИИ-агент может самостоятельно запускать NIM-микросервисы для предсказания структуры белков прямо внутри исследовательской среды.

Что это даёт? Агент берёт белковые последовательности, строит множественные выравнивания (MSA), запускает сразу две модели — OpenFold3 и Boltz-2 — и сравнивает результаты. Без MSA точность предсказания комплексов рушится (iPTM падает с 0.85 до 0.14), с ним — обе модели независимо воспроизводят одну и ту же структуру.

На внутренних тестах BioNeMo-навыки подняли корректность задач с 60% до 100% и вдвое снизили расход токенов.

Для кого важно: исследователям в биологии, химии, геномике и разработке лекарств — теперь не нужно вручную настраивать окружения и API для каждой модели. Агент делает это сам.

https://developer.nvidia.com/blog/run-nvidia-bionemo-nim-microservices-for-protein-structure-prediction-in-claude-science/
Nvidia — новый инструмент для обучения автопилота без реального автомобиля

NVIDIA выпустила Omniverse NuRec — систему, которая позволяет адаптировать восприятие автономного вождения к новым моделям автомобилей без сбора реальных данных с нуля.

Как это работает: NuRec берёт записи реальных поездок, реконструирует сцены с помощью 3D Gaussian splatting и рендерит их с точки зрения камер другого автомобиля. Например, данные с SUV можно «пересчитать» под конфигурацию седана.

В открытом доступе на Hugging Face уже лежит датасет из 1500+ нейронно-реконструированных сцен по ~20 секунд каждая.

Почему это важно: разработка нового автомобиля занимает годы, а обучать восприятие нужно заранее. NuRec позволяет готовить модели до того, как реальный флот вообще существует — экономя время и деньги на разметку данных.

https://developer.nvidia.com/blog/scale-av-perception-across-vehicle-platforms-with-nvidia-omniverse-nurec/
Qwen3.8-Flash-Next: мощь 397B-модели за 1/9 вычислительных затрат (by Qwen)

Команда Qwen выкатила техотчёт о новой архитектуре: 125B параметров, но активируется лишь 6B на токен. При этом модель обходит предшественника на 8 из 14 бенчмарков, тратя в 9 раз меньше FLOPs на обучение.

Ключевые архитектурные решения:

1. Гибрид GDN + Sparse Attention: вместо полного attention везде — 3 слоя рекуррентного Gated DeltaNet на 1 слой разреженного attention. Линейная стоимость для длинных контекстов, при 1M токенов QSA в 7.6× быстрее dense attention.

2. Gated Residual (GR): расширение residual stream на 4 ветки с elementwise gate. Побочный эффект — стабильность обучения без единого loss spike на полном масштабе.

3. N-gram embedding таблицы (51B параметров) хранятся в CPU памяти и подгружаются по мере нужды — почти бесплатные дополнительные параметры.

4. Оптимизатор Muon вместо AdamW для 2D-весов.

Интересный вывод: loss и accuracy на бенчмарках расходятся — минимум loss ≠ максимум качества.
Хочешь научить робота новым трюкам без миллионов размеченных демонстраций? Смотри видео!

ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.

Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!

Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.

https://arxiv.org/abs/2609.00188
Evolution Strategies против GRPO: кто лучше для дообучения LLM на рассуждениях?

GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?

ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.

Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.

Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.

https://arxiv.org/abs/2608.27351