InhumanScience
105 subscribers
635 photos
991 links
AI about AI
by Andrew Kaznacheev
Download Telegram
(by NeoteAI) Тактильные ощущения для роботов — предсказывай будущее, а не читай прошлое

VLA-модели научились следовать инструкциям и переносить навыки между задачами, но тактильные ощущения в них почти не используются. Главная проблема: тактильный сигнал разреженный, почти пустой вне момента контакта, и если просто добавить его как ещё одну камеру — толку мало.

N0-VTLA предлагает другой путь: вместо текущего тактильного кадра модель предсказывает будущее изменение контакта. Маленький предиктор читает визуально-языковой контекст + текущие тактильные токены и выдаёт латентные токены z — оценку того, какой контакт произойдёт за следующие 50 шагов. Именно z подаётся в action expert, а не сырой тактильный сигнал.

Дополнительно: метод ALTER превращает опыт деплоя в обучающий сигнал через попарную модель прогресса с тактильно-детектируемыми событиями (например, падение объекта).
Wonder: видеомодель для исследования мира в реальном времени

Хотите дать пользователю возможность "зайти" внутрь картинки и свободно двигать камерой — в реальном времени? Именно это делает Wonder. Система берёт одно изображение или видео и превращает его в интерактивный мир, по которому можно перемещаться с точным управлением камерой.

Ключевая идея — совместный дизайн трёх компонентов:

1. Управление: вместо абстрактных Plücker-координат рендерится синтетический 3D-скаффолд вдоль траектории камеры — визуальные подсказки напрямую кодируют движение и параллакс.

2. Память: разреженный механизм внимания с пулингом ключей — полная история хранится, но на каждом шаге выбирается фиксированный набор чанков, поэтому latency не растёт с длиной роллаута.

3. Дистилляция: mixture-of-students + adversarial регуляризатор на основе камеры — чтобы few-step студент не терял качество и точность управления.

Результат: 16 FPS, стабильная задержка на роллаутах длиной в минуты.

https://arxiv.org/abs/2607.26037
Слабые учат сильных: дистилляция знаний без учителя-эксперта (by Microsoft Research)

Классическая дистилляция знаний требует учителя сильнее ученика. Но что делать, когда ты уже на фронтире и сильнее тебя никого нет?

Авторы предлагают W2S-OPD: берём пару слабых моделей — "позитивную" (например, после RL) и "негативную" (до RL) — и вычитаем их логиты. Разница изолирует направление полезного навыка, очищенное от общей слабости обеих моделей. Это направление добавляется к логитам сильной базовой модели студента — получается "прокси-учитель", который одновременно несёт нужный навык и остаётся дистрибутивно близким к студенту.

Дальше — on-policy дистилляция: студент генерирует свои траектории и минимизирует KL-дивергенцию к прокси-учителю.

Результат: Qwen3-8B обучается у Qwen3-4B и превосходит его! Причём даже два базовых офф-шелф слабых модели без дополнительного обучения дают прирост студенту выше уровня обоих источников.

https://arxiv.org/abs/2607.26246
Что если научить ИИ моделировать не только физический мир, но и чужие мысли?

Все современные world models — Dreamer, JEPA, Sora — моделируют физику: объекты, движение, пространство. Но человеческое поведение определяется не только тем, что происходит, но и тем, что люди думают, чувствуют и во что верят.

Авторы предлагают Mental World Modeling (MWM) — фреймворк, где состояние мира = физика + ментальные переменные (убеждения, желания, намерения, социальные нормы). Формально это POMDP, где агент наблюдает только частичную проекцию совместного состояния.

Они реализовали MENTIS — training-free систему, которая парсит сцену, строит ментальное состояние целевого агента, симулирует ветки развития событий и выбирает действие по физической правдоподобности + ментальной консистентности.

Ключевой результат: убери ментальный канал — качество падает у всех 8 протестированных LLM. Главный bottleneck — симуляция переходов (как мир меняется после действия).

https://arxiv.org/abs/2607.27201
Агент, который не теряет нить задачи на 100-м шаге

Главная проблема долгих агентных задач — не сложность каждого шага, а накопление ошибок и "забывание" цели. Контекст разрастается, агент путается в том, что уже сделано, и всё рушится.

LongHorizon-Harness решает это через цикл Manage-Execute-Audit (MEA). Менеджер хранит явный task state вне контекста выполнения. Исполнитель работает в свежем контексте на одном подзадании. Аудитор независимо проверяет среду и обновляет state только верифицированными фактами. После каждого раунда история исполнителя выбрасывается — остаётся только компактный проверенный state.

Результат: на WeaveBench PassRate вырос с 51.8% до 80.7% (лучший официальный результат был 41.2%). На OSWorld 2.0 — с 2.8% до 8.3%. Фреймворк работает поверх Claude Code, Codex CLI и других harness-ов через лёгкий AgentAdapter.

https://arxiv.org/abs/2608.01964
Робот учится чувствовать пальцами до того, как прикоснётся (by NeoteAI)

Большинство роботов "видят" манипуляцию, но не "чувствуют" её заранее. N0-TWAM меняет это: модель не просто получает тактильные данные как входной сигнал — она предсказывает будущие ощущения от прикосновения вместе с видео, в одном forward pass.

Архитектура — Mixture-of-Transformers с тремя экспертами (видео, тактиль, действие), которые общаются только через общий self-attention. Ключевая идея: тактильный эксперт генерирует предсказанный контакт параллельно с видео, а action-эксперт уже читает это предсказание при выборе действия. Плюс — наблюдаемый тактильный сигнал подаётся отдельно через cross-attention.

Результат: 46.3% на реальных роботах против 30.0% у лучшего VLA-baseline. Обучено на 30 000+ часах данных с синхронизированными тактильными потоками, 6 embodiments, 450 задач.

https://arxiv.org/abs/2607.23783
Meta AI удвоила эффективность обучения рекламной ИИ-модели

Meta рассказала, как оптимизировала GEM — фундаментальную модель рекомендаций рекламы в Instagram и Facebook. За 12 месяцев команда удвоила эффективность обучения до 20–25% MFU и одновременно увеличила вычислительные затраты в 4 раза.

Главные проблемы были нетривиальными: пользовательские данные имеют переменную длину последовательностей, стандартные LLM-оптимизации не работают для рекомендательных систем, а масштабирование на тысячи GPU без потери эффективности — отдельная инженерная задача.

Решили через два направления: собственные ядра вычислений (Jagged Flash Attention устранил до 50% потерь на паддинг) и умное 5D-распараллеливание с учётом сетевой топологии дата-центра.

Для пользователей это означает более точную и быструю рекламную выдачу в продуктах Meta. Для индустрии — новый ориентир: оказывается, рекомендательные системы LLM-масштаба требуют принципиально иного инженерного подхода, чем языковые модели.

https://engineering.fb.com/2026/08/03/ml-applications/training-gem-at-llm-scale-meta-ads-recommendation-foundation-model/
Microsoft Research выпустила Orchard — открытый фреймворк для создания и обучения агентных AI-систем.

Главная идея: единая инфраструктура на основе Kubernetes, которая работает для разных типов агентов — от написания кода до веб-навигации и личных ассистентов. Не нужно каждый раз строить всё с нуля.

Что впечатляет на практике: модель Orchard-SWE с ~3 млрд активных параметров набирает 69,7% на бенчмарке SWE-bench Verified (73% с дополнительным ранжированием). Это вплотную к закрытым системам, которые в 10 раз больше. Orchard-GUI как браузерный агент показывает 68,4% на трёх веб-бенчмарках — на уровне решений OpenAI и Google.

Почему важно: раньше топовые агенты строились на закрытых пайплайнах, недоступных большинству исследователей. Microsoft открывает код, обучающие данные и методы оценки — это реально снижает порог входа в агентный AI.

https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai/
NVIDIA представила бенчмарки процессора Vera BlueField-4 STX для AI-хранилищ.

Новый чип на базе 88 ядер Olympus (Armv9.2) показал серьёзное превосходство над x86 в задачах хранения данных: шифрование быстрее до 1,43x, сжатие — до 3,29x, проверка целостности CRC32C — до 3,67x, восстановление данных по Reed-Solomon — до 3,26x.

Почему это важно: агентные AI-системы генерируют тысячи параллельных запросов к хранилищу. Каждый шаг агента требует шифрования, сжатия, проверки — и всё это ложится на CPU. Обычные x86-процессоры становятся узким местом, тормозя генерацию токенов.

Vera решает эту проблему: больше операций с меньшими затратами энергии и охлаждения. Для дата-центров это означает выше плотность серверов и меньше инфраструктурных расходов при росте нагрузки от AI-агентов.

https://developer.nvidia.com/blog/nvidia-vera-storage-benchmarks-faster-encryption-compression-integrity-checking-and-recovery-for-ai-native-storage/
Как обновлять претрейн рекомендаций каждый день без потери качества?

В промышленных рекомендательных системах (Shopee, например) поведение пользователей постоянно меняется — новые товары, новые юзеры. Значит, претрейн модели нужно обновлять регулярно. Но тут две беды:

1. Пользователь смотрел велосипедные шестерёнки, потом вдруг — штаны. Учить модель "предсказывать штаны после шестерёнок" — это шум, а не сигнал.

2. При файнтюнинге под задачу (CTR, ранжирование) градиенты задачи и претрейна конфликтуют и буквально обнуляют друг друга.

Авторы предлагают KGD: разделить "знания о поведении" и "геометрию под задачу" на независимые параметры. Претрейн фильтрует шумные переходы через коллаборативную и семантическую близость (BMTP). Задача читает энкодер через read-only cross-attention и пишет свою геометрию ортогональным low-rank остатком (ACR). Итог: энкодер можно обновлять ежедневно, не ломая то, что выучила задача. На Shopee: +1.75% GMV и +1.53% рекламной выручки в A/B тесте.

https://arxiv.org/abs/2608.02738
DiffusionGemma: 1500 токенов в секунду на одном H100 (by DeepMind)

Авторегрессивные LLM упираются в memory-bandwidth: GPU простаивает, пока тащит веса из памяти. Диффузионные модели решают это, генерируя сразу блок токенов параллельно.

DeepMind взяли готовую Gemma 4 26B MoE и дообучили её как text diffusion модель — потратив меньше 10% от исходного числа токенов предобучения. Схема двухэтапная: сначала SFT для адаптации к диффузионному процессу, затем дистилляция сэмплера + RL для качества и скорости.

Результат: модель генерирует блок из 256 токенов примерно за 12 шагов денойзинга, выдавая ~20 токенов за один forward pass против 3-6 у speculative decoding. Итог — ~1500 TPS на H100, до 2000 TPS на RTX 6000.

Модель открыта под Apache 2.0, поддерживает мультимодальность, длинный контекст и режим "thinking". Можно переключаться между AR и диффузионным режимом динамически.

https://arxiv.org/abs/2608.00146
Что если оптимизировать рассуждения LLM прямо в скрытом пространстве трансформера, а не через токены?

Большинство методов латентного рассуждения (например, LatentSeek) работают так: берём латентные переменные, декодируем их в токены, потом обратным проходом обновляем латенты. Проблема: дискретное декодирование создаёт информационное узкое горлышко — непонятно, как именно латент влияет на ответ.

GRADCUIT решает это иначе: латентные переменные вставляются прямо в промежуточный hidden state трансформера. Тогда self-attention сам становится "цепочкой" для передачи градиентов — каждый сгенерированный токен может напрямую "видеть" латенты через attention, и градиент течёт обратно без потерь.

Результат: +6.6 п.п. к точности над CoT, +2.4 п.п. над LatentSeek на 5 моделях и 3 бенчмарках (GPQA, GSM8K, MATH-500). Бонус — интерпретируемость: через якобиан можно посмотреть, какие латенты реально влияют на ответ.

https://arxiv.org/abs/2608.02585
OpenAI представила GPT-Live — систему для голосового общения с ИИ в реальном времени, которую команда построила всего за шесть месяцев.

Главное отличие от обычных голосовых ассистентов — отсутствие пошагового режима "ты говоришь — я отвечаю". Вместо этого используется бесшовная речевая модель, которая слушает и реагирует непрерывно, как живой собеседник.

Низкая задержка архитектуры делает разговор заметно естественнее: паузы минимальны, а ИИ может перебить или уточнить в нужный момент.

Для пользователей это значит — меньше ощущения "общения с роботом" и больше живого диалога. Особенно это важно для сценариев, где скорость реакции критична: обучение, поддержка, переговорные тренажёры.

https://openai.com/index/continuous-voice-interaction-with-gpt-live
Nvidia Tech выпустила Alpamayo 2 Super — открытую модель на 34 млрд параметров для разработки автономных автомобилей.

Что нового: модель объединяет 32B-рассуждатель Cosmos 3 Super и 2B Action Expert, обученный с помощью reinforcement learning. Один инструмент заменяет целый зоопарк отдельных моделей: генерирует траектории, объясняет решения через цепочки причинно-следственных связей, предсказывает манёвры (перестроение, остановка), отвечает на вопросы о сцене и автоматически размечает данные.

Почему важно: раньше для каждой задачи нужна была отдельная модель. Теперь одна основа покрывает весь цикл разработки — от обучения политики до оценки и сбора данных. На бенчмарке LingoQA модель набрала 79.2, обогнав GPT-4o на 23 балла.

Веса доступны на Hugging Face, ноутбуки — на GitHub. Лицензия OpenMDW-1.1 разрешает коммерческое использование и дообучение без дополнительных согласований с Nvidia.

https://developer.nvidia.com/blog/generate-trajectories-reasoning-traces-and-auto-labels-with-nvidia-alpamayo-2-super/
Apple ML опубликовала масштабное исследование о выравнивании мультимодальных языковых моделей.

Главная проблема, которую изучали учёные — галлюцинации в мультимодальных LLM. Модели не только выдают неверные факты, но и генерируют ответы, противоречащие содержимому изображений. Команда систематически разобрала, какие именно компоненты alignment-обучения реально влияют на качество.

Ключевые находки: комбинирование офлайн-методов (DPO) и онлайн-методов (online-DPO) улучшает результаты. А главное — исследователи предложили новый способ создания обучающих данных под названием BDHS (Bias-Driven Hallucination Sampling), который не требует ни ручной разметки, ни сторонних моделей. При этом метод показывает конкурентные результаты на стандартных бенчмарках.

Для пользователей это означает прогресс в сторону более точных и надёжных мультимодальных ассистентов — таких, которые меньше "придумывают" то, чего нет на картинке.

https://machinelearning.apple.com/research/alignment-multimodal-llms
Мировые модели устарели — нужны World Proxies (by Shanghai AI Lab)

Классические world models предсказывают следующее физическое состояние среды. Полезно, но узко. Авторы предлагают сменить парадигму: вместо "что будет дальше в мире" — "какую информацию агент получит от действия".

Идея: Agent-Centric World Proxy — это посредник между агентом и реальной средой. Агент спрашивает прокси вместо реального мира, получая дешёвый, безопасный и параллелизуемый фидбек.

Шесть типов прокси: динамики, пространственный, исполнения (что вернёт код/инструмент), памяти/опыта, навыков и верификации/наград.

Три уровня использования: L1 — подсказки при инференсе, L2 — обучение политики на синтетических роллаутах, L3 — совместная эволюция агента и прокси.

По сути это survey + roadmap, переосмысляющий world modeling как инфраструктуру для непрерывного самоулучшения агентов.

https://arxiv.org/abs/2608.02713
Как сжать видео+аудио токены в 13 раз и почти ничего не потерять?

Omni-LLM (модели, которые понимают видео, аудио и текст одновременно) страдают от огромного числа токенов — видео и аудио генерируют их в разы больше, чем текст. OmniPack предлагает двухэтапное сжатие без дообучения.

Этап 1 (до LLM): каждая модальность сжимается независимо. Для видео считается важность токенов через внимание энкодера + межкадровые изменения + пространственная уникальность. Для аудио — акустические границы. Затем выбираются не только "важные", но и "покрывающие" токены, чтобы не потерять редкие события. Похожие токены мёрджатся.

Этап 2 (внутри LLM): после того как аудио и видео "познакомились" семантически, применяется совместное аудио-визуальное прунинг с учётом текстового запроса.

Результат: 7.5% токенов от исходного числа, ускорение prefill в 4.5×, FLOPs меньше в 10×, при этом 95.6% качества сохраняется на 5 бенчмарках.

https://arxiv.org/abs/2608.03812
"Физика" мультимодального предобучения (by Meta AI)

Как правильно объединять текст и картинки в одной модели с нуля? Meta провела масштабное исследование, заменив интуицию контролируемыми экспериментами.

Четыре ключевых вывода:

1. Знания текут асимметрично: язык сильно помогает visual understanding, а вот visual generation почти не улучшает язык.

2. Модальности могут синергировать или конкурировать — зависит от сложности задач и архитектуры. Shared attention = синергия, раздельные FFN = изоляция конкуренции.

3. Визуальные данные нужно вводить с самого начала обучения. Поздний alignment вызывает "vision laziness" — модель ленится обновлять визуальные компоненты и опирается на языковые паттерны.

4. Всё это проверили на 13.5B MoE-модели, обученной на 2T токенах — рецепты работают и при масштабировании.

https://arxiv.org/abs/2608.05000
Nvidia представила World Action Models (WAM) — новый подход к управлению роботами

Вместо привычных VLA-моделей, которые учат роботов описывать мир, WAM учат его предсказывать. Разница принципиальная: робот понимает физику — как предмет упадёт, согнётся или сдвинется — а не просто распознаёт объекты по тексту.

В основе — открытая модель Cosmos 3 на архитектуре Mixture-of-Transformers. Она обучена на 767 млн изображений, 348 млн видео и 8 млн примеров действий роботов. Модель доступна в трёх размерах: 4B, 16B и 64B.

Главные плюсы WAM перед VLA: меньше данных для обучения, лучшая работа в незнакомых условиях и быстрая адаптация к новым роботам. Тесты показали рост успешности задач с 28,1% до 36,8%.

Развёртывание гибкое: 16B-версия работает на RTX PRO 6000 рядом с роботом, 4B-версия — прямо на борту устройства Jetson Thor.

https://developer.nvidia.com/blog/beyond-vlas-how-world-action-models-reshape-robot-manipulation/
Apple ML опубликовала исследование о проблеме "выбросных токенов" в Diffusion Transformers.

Что происходит: при генерации изображений модели DiT создают небольшое число токенов с аномально высокой нормой. Они перетягивают на себя внимание механизма attention, но несут мало полезной информации — это портит качество картинок.

Команда выяснила: простое маскирование таких токенов не помогает. Проблема глубже — в искажённой локальной семантике патчей.

Решение — метод Dual-Stage Registers (DSR): специальные "регистры" встраиваются на двух этапах — в энкодер и в денойзер. Для новых моделей используются обученные регистры, для уже готовых — тест-тайм регистры без дообучения.

Результат: меньше артефактов и лучшее качество генерации на ImageNet и text-to-image задачах.

Почему важно: это фундаментальная проблема архитектур DiT, которая влияет на все современные генеративные модели изображений. DSR — простой и универсальный способ её устранить.

https://machinelearning.apple.com/research/taming-outlier-tokens
RST: как вырастить 37 тысяч сложных задач из 639 семян (by Tencent Hunyuan)

Обучать LLM-агентов на длинных многошаговых задачах дорого — один пример может стоить тысячи долларов. RST решает это рекурсивно: берём простую задачу, расширяем её эталонное решение, обновляем верификатор и инструкцию, проверяем в песочнице. Если работает — задача становится семенем для следующего раунда.

15 раундов из 639 задач → 37 484 верифицированных терминальных задач. Цена: ~$0.05 за задачу. Медианная длина решения выросла в 5.6×, число команд в 6.1×. При этом GPT-5.6 и DeepSeek-V4-Pro на поздних раундах проходят лишь 4–7% задач против 72% в начале.

Файнтюнинг Qwen3.5 на собранных траекториях даёт до +10 пунктов на терминальных бенчмарках, PPO добавляет ещё ~8%. Признаков насыщения через 15 раундов не обнаружено.

https://arxiv.org/abs/2608.05466