InhumanScience
105 subscribers
641 photos
999 links
AI about AI
by Andrew Kaznacheev
Download Telegram
SANA-Video 2.0: быстрая генерация видео без квадратичного внимания (by NVIDIA)

Главная боль видеогенерации — softmax attention с O(N²) сложностью. При 1080p видео латентных токенов десятки тысяч, и квадратичный attention просто убивает скорость.

SANA-Video 2.0 решает это гибридным подходом: 75% слоёв используют линейное внимание O(N), а 25% — обычный softmax в качестве "якорей". Соотношение 3:1 взято не из LLM-литературы вслепую, а подобрано экспериментально именно для видео.

Второй ключевой трюк — Block Attention Residuals (AttnRes): вместо того чтобы каждый слой заново выводил информацию из предыдущего, готовые блочные представления передаются напрямую вглубь сети. Это повышает эффективный ранг состояний в глубоких слоях на ~12%.

Результат: 5B модель генерирует 480p видео за 13.2 сек на одном H100, DiT-forward в 3.2× быстрее полного softmax-аналога при 720p/60s, а преимущество растёт с длиной видео. VBench Total — 84.30, конкурентно с моделями 13-14B.

https://arxiv.org/abs/2607.21553
Робот забывает, что значат слова, пока учится двигаться

Когда дообучаешь VLA-модель (Vision-Language-Action) на робототехнических демонстрациях, она теряет базовое понимание языка. Натренировали робота брать зелёную кружку — он берёт зелёную, даже если ему говорят "возьми розовую". Цветовое понимание просто стёрлось в процессе BC-файнтюнинга.

Авторы предлагают Anchor-Align — два дополнительных лосса поверх стандартного BC:

1. Vision-Language Anchoring: держим замороженную копию исходной VLM и дистиллируем её hidden states на каждом слое декодера в обучаемый backbone. Никаких новых данных — просто дистилляция от себя же.

2. Language-Action Alignment: автоматически конвертируем траектории действий в текстовые метки ("двигай вправо") и учим модель предсказывать их на тех же наблюдениях, где она предсказывает действия. Оказалось, что у co-trained VLA языковая и action головы могут буквально противоречить друг другу!

Результат: на реальном роботе xArm7 — с 10% до нормальной генерализации на OOD инструкции.
LLM-as-a-Coach: когда скалярная оценка — это слишком мало

Стандартный RL для LLM работает так: модель-судья смотрит на ответ и выдаёт число от 1 до 10. Всё остальное — анализ, советы, нюансы — выбрасывается. Это узкий канал: максимум 3.3 бита на пример.

Авторы предлагают Experiential Learning: вместо судьи — коуч. Коуч анализирует ответ по рубрикам и формулирует передаваемые советы (experiential knowledge). Эти советы подаются как контекст учителю, а политика обучается минимизировать KL-дивергенцию с этим контекст-обусловленным учителем. Никакого скаляра — плотный токен-уровневый сигнал.

Bandwidth контекста из 1024 токенов — теоретически 17 600 бит, то есть в 5000+ раз больше, чем скалярная оценка.

На практике: EL стабильно обгоняет RL на open-ended задачах, меньше подвержен reward hacking и лучше обобщается за пределы тренировочного распределения.

https://arxiv.org/abs/2607.18110
Nvidia Tech запустила ModelExpress (MX) — систему для ускоренной доставки весов AI-моделей на GPU в кластерах.

Проблема была простой: модели весят сотни гигабайт, и каждый новый воркер тратил минуты на загрузку с нуля. MX решает это умно — сначала проверяет, есть ли уже загруженная копия у соседнего GPU, и если да, передаёт веса напрямую через P2P RDMA, минуя диск и оперативную память.

Результат впечатляет: веса DeepSeek-V4 Pro (806 ГБ) передаются между репликами менее чем за 10 секунд. Общее время запуска сократилось с 8 минут до 1 минуты 44 секунд.

MX также умеет: скачивать чекпоинты из облака без записи на диск, использовать GPUDirect Storage, координировать загрузку так, чтобы кластер из 10 реплик скачивал данные один раз, а не десять. Система интегрирована с vLLM, SGLang и Dynamo.

Для production-деплоев больших моделей это серьёзное ускорение масштабирования.

https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
Apple ML выпустила исследование LEAD — новый метод для улучшения длинных цепочек рассуждений в языковых моделях.

Проблема: когда задачу разбивают на слишком мелкие шаги, модель теряет контекст и не может исправить ошибки на «сложных» этапах — они накапливаются и становятся необратимыми.

Решение — метод LEAD (Lookahead-Enhanced Atomic Decomposition): модель заглядывает чуть вперёд и проверяет несколько вариантов развития событий одновременно. Это даёт достаточно изоляции для стабильности и достаточно контекста для исправления ошибок.

Результат на практике: модель o4-mini с LEAD решает головоломку Checkers Jumping до сложности n=13, тогда как без метода ломается уже на n=11.

Пока это академическое исследование, но подход может напрямую улучшить агентные системы и сложные многошаговые задачи в будущих продуктах Apple.

https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
Одна видеомодель — и прямая, и обратная динамика робота

Обычно для предсказания последствий действий робота и для восстановления действий по желаемому результату нужны разные модели. Авторы предлагают Masked Visual Actions: вместо того чтобы подавать в видеомодель низкоразмерные векторы команд, они просто маскируют нужные пиксели в видео.

Идея проста: если показать модели траекторию робота (активная сущность) — она предскажет, что произойдёт с объектами. Если показать желаемое движение объекта (пассивная сущность) — та же модель восстановит, как должен двигаться робот. Один чекпоинт, обученный на 15 часах роботизированных данных, решает обе задачи.

Модель применяется для оценки политик, планирования и обратного моделирования в реальных манипуляционных задачах. Бонус: подход не зависит от типа робота, так как действия закодированы прямо в пикселях.

https://arxiv.org/abs/2607.19343
Единый принцип интеллекта: ищи то, чему можно научиться

Новизна без структуры — это шум телевизора. Минимизация удивления — это тёмная комната. Оба подхода провалились по одной причине: они не различают "обучаемую" и "необучаемую" новизну.

Авторы предлагают единый принцип: максимизируй learnable novelty — ту часть удивления, которую ограниченный наблюдатель реально может усвоить. Формально это "эпиплексность" (epiplexity): длина описания лучшей модели, которую конечный вычислитель способен подобрать под данные.

Ключевой трюк: вместо дорогого поиска по всем программам используют reservoir computer с ridge regression — закрытая формула, дифференцируемая и быстрая.

Результаты впечатляют: без единой метки нейронный клеточный автомат сам развивает солитоны, MNIST-энкодер разделяет классы цифр, RL-агент исследует среду эффективнее в задачах с редкими наградами. А rule 110 (единственный Тьюринг-полный элементарный КА) занимает первое место в рейтинге сложности.

https://arxiv.org/abs/2607.18433
3DGS всегда мылит дальние горы и скрытые объекты — и вот почему

3D Gaussian Splatting отлично работает, но упорно размывает далёкие объекты и окклюдированные области. Авторы доказали, что это не баг данных, а структурный изъян оптимизации — и назвали его Blur Trap.

Суть проблемы: градиент позиции каждого гауссиана строго ортогонален лучу зрения. То есть оптимизатор может двигать примитивы только поперёк луча, но никогда вдоль глубины. Плюс alpha-blending гасит сигнал для скрытых гауссианов, не давая им делиться.

Решение намеренно минималистичное — два оператора исследования:
1. Random Seeding — случайно засеиваем новые гауссианы по всей сцене, обходя ортогональность
2. Random Splitting — случайно делим гауссианы без оглядки на градиент, обходя подавление alpha-blending

Оба оператора просты, но именно это и нужно: проверить, что exploration сам по себе — недостающий ингредиент 3DGS. Эксперименты на 5 датасетах подтверждают улучшение при минимальных накладных расходах.

https://arxiv.org/abs/2607.17965
Molt: фреймворк для agentic RL, который влезает в голову за один вечер (by NVIDIA)

Проблема с существующими RL-фреймворками для LLM: они строились под гиперскейл, и каждое изменение алгоритма требует копаться в слоях трейнера, движка роллаутов и конфигурационной обвязки. Molt говорит: сложность — это не цена производительности, это архитектурный выбор.

Ключевая идея: 4 концепта (agent, generator, trainer, estimators) + один асинхронный цикл. Изменение алгоритма трогает ровно один компонент. Никаких форков vLLM или Ray — апстрим-улучшения прилетают автоматически.

Отдельная фича: token-first граница агента. Агент, написанный под стандартный OpenAI/Anthropic SDK, тренируется без изменений — SDK-трафик перехватывается как token ids через loopback-сервер.

Результат: кодовая база в несколько раз меньше Megatron-стеков, при этом throughput статистически сопоставим. Проверено на 700B MoE с expert parallelism 256 — тот же цикл, что и для 4B dense-модели.

https://arxiv.org/abs/2607.21653
HOPE: сжать нейросеть без единого примера данных (by Google)

Стандартные методы прунинга смотрят на "величину весов" и выкидывают маленькие. Проблема: большие веса — это часто просто артефакты оптимизации, а не реально важные нейроны.

Google предлагает другой подход: перенести анализ из пространства параметров в функциональное пространство. Каждый нейрон рассматривается как оператор Гильберта-Шмидта, и вместо "насколько большой вес?" задаётся вопрос "насколько сильно меняется поведение сети, если убрать этот нейрон?".

Ключевой трюк: для вычисления норм в гильбертовом пространстве нужна статистика входных данных — но авторы берут её прямо из Batch Normalization слоёв. Никаких реальных данных не нужно!

Единый фреймворк объединяет прунинг, слияние нейронов и удаление целых блоков под одним критерием дистortion-cost J. Всё гиперпараметр-фри.

https://arxiv.org/abs/2607.21366
👍2
Знают ли LLM, что учить ПЕРЕД чем? (by Peking University)

Современные LLM легко решают задачи ЕГЭ и ГАО-КАО. Но понимают ли они структуру учебной программы — что "линейные уравнения" требуют знания арифметики, а не наоборот?

Авторы построили K12-KGraph — граф знаний на основе официальных китайских школьных учебников (математика, физика, химия, биология). Граф содержит 7 типов узлов (концепт, навык, эксперимент, упражнение, раздел...) и рёбра типа "является предпосылкой", "проверяет", "иллюстрирует" и т.д.

Из графа сгенерированы бенчмарк K12-Bench (23 640 вопросов на понимание структуры учебника) и датасет K12-Train (7 335 SFT-примеров). Результат: даже Gemini-2.5-Flash набирает лишь 57% точного совпадения. А файнтюнинг на K12-Train даёт +24 балла на GaokaoBench против лучшего конкурента — при вдвое меньшем объёме данных.

https://arxiv.org/abs/2605.09635
NVIDIA запустила Nemotron 3 Ultra для проектирования чипов

NVIDIA представила модель Nemotron 3 Ultra в связке с агентом ACE-RTL для автоматизации RTL-кодинга — написания кода на уровне регистровых передач при разработке микросхем.

Результаты впечатляют: на бенчмарке CVDP система достигает 97,1% успешных решений в 9 категориях задач. При этом модель использует на 71% меньше токенов за итерацию, чем конкурент Kimi K2.6, и на 28% меньше, чем GLM 5.2.

Агент работает по схеме «генерация → тест → рефлексия»: пишет RTL-код, запускает симуляцию, анализирует ошибки и итеративно исправляет их. Именно так работают реальные инженеры.

Архитектура — гибридная Mamba-Attention MoE на 550B параметров (55B активных), контекст до 1M токенов. Это критично: в одной итерации отладки контекст быстро раздувается до спецификаций, кода, логов симулятора и предыдущих попыток.

Модель совместима с EDA-инструментами Cadence, Siemens и Synopsys.

https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-leads-open-models-on-accuracy-and-efficiency-in-agentic-rtl-coding/
👍2
Amazon инвестирует в Lean FRO — организацию, которая делает математические доказательства корректности ПО доступными для разработчиков.

Суть: обычное тестирование проверяет лишь те случаи, о которых вы подумали. Lean позволяет математически доказать, что система не может вести себя неправильно — при любых входных данных.

Amazon уже использует Lean в продуктах: Bedrock AgentCore проверяет границы поведения AI-агентов, SampCert гарантирует защиту приватности в AWS Clean Rooms, AWS Neuron — корректность компиляции для AI-чипов. Один инженер с помощью LLM+Lean доказал корректность протокола Amazon Aurora за рекордно короткое время.

Почему Lean развивают вне Amazon? Чтобы клиенты, аудиторы и регуляторы могли независимо проверять инструменты — это принципиально для безопасности AI-агентов.

Это крупнейшее пожертвование в истории Lean FRO.

https://www.amazon.science/news/amazon-is-investing-in-the-lean-focused-research-organization
Skill Self-Play: LLM учит сам себя через эволюцию навыков (by Qwen/Alibaba)

Проблема self-play для LLM: либо ты заперт в узкой среде с жёстким верификатором, либо генерируешь хаотичные задачи без контроля качества — и данные деградируют.

Skill-SP решает это через библиотеку "скиллов" — модульных блоков знаний, которые одновременно направляют генерацию задач И верифицируют ответы. Три агента: Proposer (генерирует задачи, опираясь на скиллы), Solver (решает), Controller (анализирует результаты и эволюционирует библиотеку — уточняет скиллы, удаляет устаревшие, индуцирует новые).

Скилл — это не просто подсказка, а живой интерфейс: он проактивно управляет сложностью задач и отслеживает прогресс модели.

Результат на Qwen3-4B: +42.9 пунктов на tool calling, +12.0 на логических задачах против обычного self-play. Unguided SP вообще не смог сгенерировать валидные логические пазлы.

https://arxiv.org/abs/2607.22529
Тренируй агента в том же harness, в котором он деплоится

Большая проблема современных агентов: их тренируют в упрощённых условиях, а деплоят через сложные harness-обёртки (Claude Code, Codex, OpenClaw). Это создаёт train-deploy mismatch — модель учится одному, а работает в другом.

OpenForgeRL закрывает этот разрыв двумя компонентами: прокси-сервер перехватывает LLM-вызовы внутри harness и собирает пары prompt-response как обычные RL-сэмплы, а Kubernetes-оркестратор запускает каждый rollout в отдельном контейнере в облаке (Azure).

Результат: агент тренируется прямо в своём реальном harness, а траектории автоматически реконструируются в формат для любого RL-фреймворка (veRL, GRPO и т.д.).

На практике: OpenForge-GUI (8B) бьёт более крупные модели на OSWorld, Mind2Web и WebVoyager. Плюс выяснилось — более простые harness'ы учатся лучше, а error recovery остаётся слабым местом даже после RL.

https://arxiv.org/abs/2607.21557
Творческий AI-агент с «холстом» вместо чата

Большинство AI-инструментов для творчества работают по схеме «промпт → результат». Но реальный творческий процесс — это черновики, версии, правки, референсы, обратная связь. Где всё это хранить?

JarvisHub предлагает заменить линейный чат на «холст» (canvas) — граф-структуру, где каждый артефакт (изображение, видео, аудио, промпт, UI-элемент) — это узел с историей создания, зависимостями и версиями. Агент не читает историю переписки, а смотрит на текущее состояние проекта на холсте.

Архитектура: canvas state (граф артефактов) + protocol bridge (валидация действий агента) + agent runtime (планирование, вызов инструментов, запись траектории).

Агент может читать холст, создавать/редактировать узлы, вызывать генеративные инструменты и записывать результаты обратно — всё трассируемо и восстанавливаемо.

Демо: генерация sci-fi трейлера с музыкой и озвучкой, интерактивная веб-разработка, создание презентаций.

https://arxiv.org/abs/2607.23588
NVIDIA выпустила Ising Calibration 1.5 — ИИ-модель для автоматической калибровки квантовых компьютеров.

Это 31-миллиардная vision-language модель, которая анализирует диагностические данные квантовых процессоров и определяет, как их нужно настраивать. Новая версия стала на 11,4% компактнее и на 86,5% лучше справляется с задачами в режиме in-context learning по сравнению с предшественником.

Главное для пользователей: впервые доступна NVFP4-квантизированная версия, которая запускается на одной потребительской видеокарте или NVIDIA DGX Spark — без дата-центра. По качеству модель обходит все открытые аналоги и конкурирует с закрытыми гигантами вроде GPT 5.6 Sol.

Веса, датасеты, бенчмарк QCalEval и готовые рецепты развёртывания доступны на Hugging Face под лицензией OpenMDW. Квантовые лаборатории теперь могут автоматизировать калибровку прямо на месте.

https://developer.nvidia.com/blog/nvidia-ising-enables-fully-automated-quantum-computer-calibration-with-enhanced-in-context-learning/
Apple ML представила GH-ESD — инструмент для поиска системных ошибок в моделях компьютерного зрения.

Проблема: vision-модели часто стабильно ошибаются на определённых типах изображений — например, плохо распознают объекты в специфическом контексте или расположении. Найти такие «зоны провала» вручную крайне сложно.

GH-ESD автоматизирует этот процесс: сначала LLM генерирует гипотезы о возможных паттернах ошибок, затем Vision Language Models ищут реальные примеры, а статистический анализ подтверждает или отвергает гипотезы.

Важно, что метод работает не только для классификации изображений, но и для детекции объектов и сегментации — задач, где ошибки зависят от пространственного контекста.

На новом бенчмарке GESD точность Precision@10 выросла с 0.63 до 0.73 по сравнению с предыдущими подходами.

Для разработчиков это означает более быстрое выявление слабых мест модели и конкретные подсказки для её улучшения. Статья принята на ECCV 2026.

https://machinelearning.apple.com/research/gh-esd
Kimi K3 — 2.8 триллиона параметров в открытом доступе (by Moonshot AI)

Пока open-source модели топчутся в районе 1T параметров, Kimi K3 делает резкий прыжок — 2.8T параметров, 104B активируемых, контекст до 1M токенов. И всё это выложено в открытый доступ.

Ключевые архитектурные трюки: Kimi Delta Attention (линейное внимание с channel-wise forget gate) чередуется с обычным MLA в пропорции 3:1. Attention Residuals позволяют каждому слою тянуть информацию из всех предыдущих слоёв, а не только из соседнего. MoE расширен до 896 экспертов, активируется 16 на токен.

В итоге — примерно 2.5× прирост эффективности масштабирования по сравнению с Kimi K2.

По бенчмаркам модель обходит все открытые аналоги и большинство проприетарных систем, уступая только Claude 4.5 и GPT-5.

https://arxiv.org/abs/2607.24653
Как дистиллировать знания из GPT-5 в открытую модель, если у тебя нет доступа к его логитам?

Стандартный подход — KL-дивергенция по токенам — не работает между разными моделями: у них разные токенизаторы, и логиты проприетарных моделей закрыты. Копировать «сырые» траектории рассуждений тоже плохо: студент начинает имитировать стиль учителя и галлюцинировать.

Авторы предлагают MAPD: между учителем и студентом вставляется структурированный JSON-протокол — нормализованное промежуточное представление с планом рассуждений, найденными фактами и верификацией ответа. Проприетарная мультиагентная система генерирует эти протоколы офлайн. Затем студент обучается через self-distillation: одна ветвь видит протокол как привилегированную информацию, другая — нет. KL между ними считается внутри одной модели, что обходит проблему разных токенизаторов. Сверху — стандартный GRPO.

Эксперименты с Claude Opus, GPT и Gemini как учителями показывают стабильный прирост без перенастройки пайплайна под каждого учителя.
Робот учится без робота: HiFi-UMI собирает данные руками человека и сразу деплоит политику

Главная проблема масштабирования робо-манипуляций — дорогая телеоперация: нужен сам робот, риг и оператор. HiFi-UMI предлагает радикальный ответ: вообще убрать робота из сбора данных.

Система — это перчатка-захват с головным стерео-SLAM, GPIO-триггером (синхронизация до 40 мкс) и шестью широкоугольными камерами. Точность траектории — 3 мм. Автоматический пайплайн реконструирует, воспроизводит и валидирует каждую демонстрацию: 98% реконструкций и 98% реплеев проходят проверку (~96% суммарно).

Главный результат: zero-robot post-training — дообучение только на HiFi-UMI данных без единой телеоперированной траектории — на трёх бэкбонах (VLA и WAM) совпадает с in-domain телеоперацией с разницей в −2.5, +3.1 и −0.6 п.п. Лучшая политика достигает 85% на задаче точной вставки.

Открытый датасет HiFi-UMI-2K: 2000 часов, 480+ сцен.

https://arxiv.org/abs/2607.25895