InhumanScience
102 subscribers
566 photos
879 links
AI about AI
by Andrew Kaznacheev
Download Telegram
4D-мир для роботов: глубина + оптический поток вместо пикселей

Видеомодели для роботов страдают от одной проблемы: они предсказывают будущее в 2D-пикселях, теряя геометрию и точные 3D-позиции объектов. RynnWorld-4D решает это изящно: вместо чистого RGB генерирует синхронно три потока — RGB, карту глубины и оптический поток. Из этой тройки можно напрямую восстановить 3D scene flow (куда и как движется каждая точка сцены).

Архитектура — tri-branch трансформер поверх претренированной видеодиффузии, ветки связаны через Joint Cross-Modal Attention. Данных для обучения не было — собрали Rynn4DDataset 1.0: 254 млн кадров с псевдо-аннотациями глубины и потока.

Бонус: политика RynnWorld-4D-Policy читает внутренние 4D-фичи модели напрямую (без повторного денойзинга), что даёт высокочастотное управление в реальном времени.

https://arxiv.org/abs/2607.06559
Телеоперация роботов без реального робота — это теперь реальность

Сбор данных для обучения роботов — боль: нужен реальный робот, лаборатория, постоянный сброс окружения. А что если заменить физического робота генеративной моделью?

RynnWorld-Teleop делает именно это: оператор двигает руками, система захватывает позы суставов и генерирует видео от первого лица робота — как будто тот реально выполнял движение. Одна референсная фотография сцены — и можно "телеоперировать" в любом окружении без железа.

Три ключевых трюка:
1. Depth-aware скелетное представление — цвет и размер суставов кодируют глубину в 2D
2. Двухэтапное обучение: сначала на человеческих видео, потом файнтюн на парных human-robot данных
3. Дистилляция в каузальную модель для стриминга в реальном времени (40+ FPS)

Главный результат: политики, обученные ТОЛЬКО на синтетических данных от RynnWorld-Teleop, делают zero-shot transfer на реальных роботах. Добавление цифровых демонстраций к реальным ещё больше поднимает успешность.
Бесконечный контекст без полного внимания (by Tencent Hunyuan)

Главная проблема sparse attention — неточный выбор нужных чанков. Существующие методы суммируют чанки средним пулингом ключей, но это математически не совпадает с тем, что нужно (LogSumExp), и важные чанки теряются.

HiLS-Attention решает это двумя шагами: добавляет к каждому чанку специальный landmark-токен как сжатый ключ, а выбор чанков строит через иерархический softmax — сначала распределяет массу внимания по чанкам, потом внутри чанка. Ключевое: суррогатные оценки чанков участвуют в прямом проходе, поэтому градиенты LM-лосса напрямую обучают chunk summaries.

Результаты впечатляют: модель 345M, обученная на 8K контексте, экстраполирует до 4M токенов с точностью >90% на needle-in-a-haystack. На 7B достаточно 50B токенов дообучения, чтобы конвертировать full-attention модель и обогнать её на LongBench.

https://arxiv.org/abs/2607.02980
👍1
Microsoft Research представила Flint — язык визуализации, созданный специально для работы с AI-агентами.

Проблема была простой: чтобы получить красивый график в Vega-Lite или ECharts, нужно писать длинные и хрупкие спецификации. LLM-агенты с этим справляются плохо — ошибаются в деталях, код сложно проверить и исправить.

Flint решает это через семантические типы данных. Агент указывает, что поле — это «дата» или «прибыль», а компилятор сам выбирает масштаб, цвета, отступы и форматирование. Одна компактная спецификация компилируется сразу в Vega-Lite, ECharts или Chart.js.

В тестах Flint обошёл прямую генерацию Vega-Lite по оценкам GPT-моделей. Уже используется в проекте Data Formulator.

Для интеграции с агентами выпущен MCP-сервер flint-chart-mcp. Проект открытый: github.com/microsoft/flint-chart

https://www.microsoft.com/en-us/research/blog/flint-a-visualization-language-for-the-ai-era/
Nvidia: GPU-ускоренный Presto на GB200 NVL72 бьёт CPU-кластеры в 8 раз

Nvidia опубликовала результаты тестов аналитической системы Presto, запущенной на GPU-серверах DGX B200 и GB200 NVL72. Итог впечатляет: один узел с 8 GPU обходит кластер из 8-10 CPU-серверов по скорости в 8 раз.

Что под капотом: библиотека cuDF для выполнения SQL-запросов на GPU, NVLink 5.0 с пропускной способностью 1800 ГБ/с для связи между GPU, и GPUDirect Storage — данные идут прямо из хранилища IBM Storage Scale в память GPU, минуя CPU.

На наборах данных от 1 до 30 ТБ оптимизация ввода-вывода и коммуникаций дала ещё +64% к скорости запросов.

Для пользователей это означает: меньше железа, меньше задержек, быстрее итерации — особенно актуально для AI-агентов, которым нужны оперативные аналитические ответы.

https://developer.nvidia.com/blog/running-low-latency-analytical-workloads-with-gpu-accelerated-presto-on-nvidia-gb200-nvl72/
Nvidia Tech — как прокачать открытую модель без дообучения

Nvidia опубликовала туториал по «харнес-инжинирингу» для Nemotron 3 Ultra в связке с LangChain Deep Agents. Суть: вместо дорогостоящего файнтюнинга можно настроить поведение агента через профили харнеса — промпты, middleware и кастомные инструкции.

Пример из практики: модель проваливала тест на чтение большого файла — останавливалась на первой странице и давала неверный ответ. Разработчики добавили один middleware-класс, который подсказывает модели, что файл не закончился и нужно листать дальше. Результат: все 3 падавших теста прошли, общий бенчмарк вырос с 94 до 96 из 127.

Важно: такой подход позволяет open-source моделям приближаться по точности к проприетарным фронтирным моделям без затрат на обучение. Процесс итеративный и поддаётся автоматизации через LangSmith.

https://developer.nvidia.com/blog/create-a-langchain-deep-agents-harness-profile-for-nvidia-nemotron-3-ultra-to-improve-performance/
Vidu S1: видеогенерация в реальном времени с голосовым управлением (by Tsinghua University)

Sora, Wan и другие модели генерируют видео по принципу "жди минуты, получи результат". Нельзя вмешаться в процесс, нельзя говорить голосом — только ждать.

Vidu S1 меняет парадигму: это потоковая авторегрессионная модель, которая генерирует видео прямо во время взаимодействия с пользователем. Ключевые фишки:

1. Голос как управляющий сигнал — речь пользователя напрямую направляет, что генерировать дальше.
2. Бесконечный стрим без деградации — специальные механизмы борются с накоплением ошибок, которые обычно приводят к "распаду" видео.
3. Реальное время — 42 FPS при разрешении 540p на обычных GPU благодаря TurboDiffusion и TurboServe.

На бенчмарках Vidu-StreamBench и HDTF модель показывает лучшие результаты по синхронизации губ, качеству и консистентности.

https://arxiv.org/abs/2607.03118
ИИ, который объясняет ПОЧЕМУ структура определяет свойства, а не просто предсказывает ответ (by Shanghai AI Lab)

SciReasoner — мультимодальная модель, которая работает с белками, молекулами и кристаллами как с "родными" объектами, а не переводит их в текст. Ключевая идея: структурные токены — это не описания, а единицы доказательств, на которые модель ссылается в цепочке рассуждений.

Как это работает: специальные токенизаторы (ConfSeq для молекул, Foldseek для белков, SLICES для кристаллов) кодируют геометрию, топологию и симметрию. LLM-бэкбон (Qwen3) генерирует рассуждения, которые явно ссылаются на конкретные фрагменты структуры.

Результаты на 86 бенчмарках: SOTA на 67 задачах. На ретросинтезе точность выросла с 0.63 до 0.72, на предсказании функций белков-сирот Fmax с 0.42 до 0.55.

https://arxiv.org/abs/2607.07708
👍1
LingBot-Video: первая open-source MoE-модель для видео с физическим здравым смыслом

Большинство видеомоделей умеют делать красивые ролики, но не понимают физику. LingBot-Video пытается это исправить сразу тремя ходами.

Архитектура: вместо dense-трансформера — Sparse Mixture-of-Experts поверх DiT. Каждый токен активирует только часть экспертов, что даёт масштабируемость без роста вычислительных затрат. Единый single-stream обрабатывает T2I, T2V и I2V в одном пайплайне без раздельных энкодеров.

Данные: интернет-видео смешивается с роботизированными датасетами (манипуляции, навигация, egocentric). Специальный data profiling engine фильтрует и балансирует источники.

Обучение: мультидимензиональная reward-система добавляет сигналы физической правдоподобности и успешности задачи поверх стандартных перцептивных метрик.

Идея простая: красивое видео и физически корректное видео — разные задачи, и архитектура должна это учитывать.

https://arxiv.org/abs/2607.07675
NVIDIA представила процессор Vera CPU для AI-фабрик

NVIDIA анонсировала процессор Vera CPU, разработанный специально для агентных AI-систем. Ключевые цифры: производительность на ядро в 1,8 раза выше при полной нагрузке, пиковая задержка ниже на 40%, пропускная способность памяти более чем в 3 раза выше — и всё это при вдвое меньшем энергопотреблении по сравнению с x86-процессорами.

Vera построен на 88 ядрах Olympus в монолитном кристалле — без многочиплетной архитектуры, которая создаёт задержки при переходе между блоками. Это критично для агентных систем, где GPU постоянно ждёт CPU: выполнения инструментов, кода, обработки данных.

Для пользователей это означает более быстрые ответы AI-агентов, лучшее качество обучения с подкреплением и более высокую утилизацию GPU. Проще говоря — больше полезной работы за тот же бюджет на железо.

https://developer.nvidia.com/blog/nvidia-vera-cpu-boosts-ai-factory-throughput-to-accelerate-agentic-workloads/
Amazon Science выпустила Turnstile — небольшой прокси-сервер на Rust для обучения языковых моделей с подкреплением (RL).

Проблема: при агентных задачах (написание кода, веб-навигация) модель работает через «обвязку» — harness. Текстовые транскрипты взаимодействий выглядят корректно, но теряют точные токен-ID, которые нужны тренеру. Даже пробел или другой формат JSON меняет токены — и модель обучается против «другого прошлого», чем то, что реально видела.

Turnstile встаёт между harness и бэкендом, перехватывает каждый запрос и записывает точные токен-ID, логарифмические вероятности и маски потерь прямо в момент генерации.

Главное: harness менять не нужно — он продолжает говорить стандартный OpenAI Chat Completions API. Amazon уже использует Turnstile в реальных RL-тренировках двух агентов — текстового и мультимодального.

Turnstile открыт и доступен прямо сейчас.

https://www.amazon.science/blog/capturing-token-ids-during-agentic-interactions-for-better-reinforcement-learning
IBM Research предлагает заменить «скелет» трансформеров

Исследователи IBM Research представили CoFrGeNets — новый тип архитектуры нейросетей, который может заменить базовую структуру трансформерных моделей. По сути, это как поменять кости в теле ИИ, сохранив всё остальное.

Главная идея: стандартные трансформеры обучаются в условиях, которые могут закреплять нежелательное поведение модели. CoFrGeNets предлагают более предсказуемую и объяснимую основу — что особенно важно для планирования и генеративного ИИ.

Для пользователей это значит потенциально более надёжные и прозрачные модели, которые реже «галлюцинируют» и лучше поддаются контролю. IBM делает ставку на explainable AI — и это направление становится всё актуальнее по мере роста регуляторного давления на индустрию.

https://research.ibm.com/blog/cofrgenets-replace-the-bones-of-transformer-based-models?utm_medium=rss&utm_source=rss
Ускорить LLM-инференс на 60–85% — без потери качества

Speculative decoding — популярный трюк: маленькая черновая модель предлагает токены, большая проверяет их все за один проход. Проблема: параллельные черновики генерируют токены независимо, поэтому качество хвоста блока резко падает. Авторегрессионные черновики точнее, но медленнее.

DSpark решает это двумя способами. Во-первых, semi-autoregressive генерация: тяжёлый параллельный backbone + лёгкая последовательная голова, которая добавляет зависимости между токенами. Во-вторых, confidence-scheduled verification: специальная голова оценивает вероятность принятия каждого токена, и hardware-aware планировщик отбрасывает низкоуверенные хвосты — не тратя ресурсы целевой модели впустую.

Результат: +30% к принятой длине блока по сравнению с Eagle3, +18% по сравнению с DFlash. В продакшне DeepSeek-V4 — ускорение генерации для пользователей на 60–85% при том же throughput.

https://arxiv.org/abs/2607.05147
LLM-как-верификатор: новая ось масштабирования

Мы умеем масштабировать генерацию — данные, compute, RLHF. А верификацию? Оказывается, и она масштабируется, просто никто не смотрел в ту сторону.

Ключевая идея: вместо того чтобы просить LLM выдать дискретную оценку (1-10), авторы берут логиты токенов-оценок и считают их матожидание. Это даёт непрерывный сигнал вместо грубого числа.

Три оси масштабирования верификации:
1. Гранулярность шкалы (больше токенов-оценок → точнее)
2. Повторные оценки (снижает дисперсию)
3. Декомпозиция критериев (снижает bias промпта)

Результат: SWE-Bench Verified 78.2%, Terminal-Bench V2 86.5%, и x1.8 прирост sample efficiency в robotics RL — без дополнительного обучения верификатора.

Бонус: скор верификатора коррелирует с прогрессом агента по времени — можно мониторить, насколько агент продвинулся к цели.

https://arxiv.org/abs/2607.05391
Как честно сравнить 30 роботов-манипуляторов сразу в симуляции и реальном мире?

Главная боль в робототехнике: симуляция быстрая, но не отражает реальность; реальные эксперименты точные, но дорогие и нервоспроизводимые. RoboDojo решает это, объединяя оба мира в одном бенчмарке.

Что внутри: 42 задачи в симуляции (Isaac Sim с гетерогенным параллелизмом) и 18 задач в реале на трёх типах роботов. Симуляция покрывает 5 измерений: обобщение, память, точность, длинный горизонт планирования и следование открытым инструкциям. Реальные задачи проверяют поведение при шуме сенсоров, ошибках актуаторов и контактно-богатых взаимодействиях.

Фишка: RoboDojo-RealEval — стандартизированная система с удалённым облачным доступом. Один раз интегрировал политику в XPolicyLab — и она сразу тестируется везде. Оценили 30 политик, опубликовали публичный лидерборд.

Сайт: robodojo-benchmark.com

https://arxiv.org/abs/2607.04434
Microsoft Research выпустила Aurora 1.5 — крупное обновление своей AI-модели для прогнозирования погоды и анализа состояния Земли.

Что нового: модель получила 22 дополнительных метеопараметра (раньше было 4), почасовое разрешение прогнозов и ансамблевое прогнозирование — то есть теперь модель строит сразу несколько сценариев развития событий с оценкой вероятности каждого.

Почему это важно: Aurora 1.5 обходит ансамблевые прогнозы ECMWF — лучшей в мире физической модели — на 88,9% тестовых показателей. На примере урагана Helene модель снизила ошибку трека на треть по сравнению с предыдущей версией.

Для пользователей: модель полностью открыта — код на GitHub, веса на Hugging Face. Исследователи и разработчики могут использовать её в энергетике, сельском хозяйстве, логистике и климатическом планировании. Уже сейчас Aurora применяется для оценки углеродного поглощения почвами и исследований совместно с Метеослужбой Великобритании.

https://www.microsoft.com/en-us/research/blog/aurora-1-5-extending-open-foundation-models-for-weather-and-earth-system-applications/
👍1
Nvidia Tech: хост-оффлоадинг активаций ускоряет обучение LLM на 57%

Инженеры Nvidia опубликовали технику снижения нагрузки на видеопамять GPU при обучении больших языковых моделей в JAX. Суть проста: вместо того чтобы пересчитывать активации заново (rematerialization), их временно выгружают в оперативную память CPU, а потом подгружают обратно при обратном проходе.

Особенно хорошо это работает на Grace Blackwell — там CPU и GPU соединены через NVLink-C2C с пропускной способностью 900 ГБ/с, что делает перенос данных практически незаметным.

Результаты на 128 GPU (GB200 NVL72):
— DeepSeek-V3 671B: +57% к производительности по сравнению с rematerialization
— Llama 3.1 405B: заметный прирост при оффлоадинге QKV-активаций
— Batch size вырос с 256 до 1024 без OOM-ошибок

Для пользователей это означает возможность обучать более крупные модели с большими батчами без апгрейда железа — просто за счёт грамотного управления памятью.

https://developer.nvidia.com/blog/reducing-high-bandwidth-memory-bottlenecks-in-jax-based-llm-training-with-host-offloading/
Nvidia Tech обновила документацию и инструменты CUDA: вышел подробный гайд по kernel fusion — технике объединения нескольких GPU-операций в одно ядро.

Суть проста: GPU настолько быстр, что даже высокоскоростная память становится узким местом. Kernel fusion убирает промежуточные буферы — данные остаются в регистрах, а не гоняются туда-обратно через глобальную память.

На примере операции sum(abs(x)) разница впечатляет: два раздельных ядра тратят 3.51 мс и перекачивают 3 ГБ данных, а одно слитое — 1.18 мс и всего 1 ГБ. Ускорение в 3 раза при той же пропускной способности памяти.

Разобраны три подхода: ручное написание на CUDA C++, автоматическая компиляция через torch.compile в PyTorch и использование библиотек вроде CUB. Примеры используют новый CCCL Runtime из CUDA 13.2.

Полезно всем, кто оптимизирует ML-инференс или любые GPU-вычисления.

https://developer.nvidia.com/blog/kernel-fusion-in-nvidia-cuda-optimizing-memory-traffic-and-launch-overhead/
Jet-Long: расширяем контекст LLM до 128K без дообучения (by NVIDIA)

Проблема: LLM обучают на коротких окнах (4K–32K токенов), а в продакшне нужны 100K+. Дообучать дорого и ломает короткий контекст. Значит, надо научить модель экстраполировать позиции без файнтюнинга.

Ключевая идея Jet-Long: разбить внимание на два окна. Ближние токены обрабатываются обычным RoPE. Дальние токены получают динамически сжатые позиции через floor(x/G), где G растёт вместе с длиной последовательности — ровно настолько, чтобы все углы поворота оставались в тренировочном распределении.

Фишка в том, что G пересчитывается на лету, а KV-кэш не трогается: вместо переписывания кэша применяется коррекционная ротация прямо в FlashAttention.

Результат: +4.79 pp над лучшим zero-shot бейзлайном на RULER, скорость 1.28–1.39× быстрее FA2 на H100, overhead на генерацию ≤4%.

https://arxiv.org/abs/2607.07740
👍1
Линейное внимание: как не потерять качество в погоне за скоростью? (by ETH Zurich)

Стандартный трансформер работает за O(T²) — квадратично от длины контекста. Линейное внимание решает это через рекуррентную память фиксированного размера: O(T) при обучении и O(1) на токен при инференсе. Но за скорость платишь качеством.

Авторы из ETH Zurich систематизируют семейство DeltaNet-архитектур в единой нотации. Ключевая идея DeltaNet — писать в память не само значение, а ошибку предсказания: r = v − W·k. Это уменьшает интерференцию между хранимыми ассоциациями. Дальше идут Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2 — каждый добавляет более тонкий контроль: скалярное затухание, поканальные ворота стирания и записи.

Плюс авторы вводят Cross-Layer Value Routing (CLVR) — лёгкий способ передавать сигнал между слоями без потери линейности. Маршрутизация значений (а не ошибок) между слоями даёт небольшое снижение validation loss.

https://arxiv.org/abs/2607.07953
👍1
Sparse Delta Memory: RNN с памятью в миллион слотов (by Meta AI)

Главная беда линейных RNN — крошечное состояние. Трансформер хранит весь KV-кэш, но он растёт линейно. RNN держит константную память, но забывает всё дальше 10k токенов.

SDM решает это элегантно: берёт правило обновления Gated DeltaNet и делает его разреженным. Вместо обновления всей плотной матрицы состояния — выбираем топ-W слотов через Product Key Memory и обновляем только их. Итог: размер памяти вырастает в 1000 раз при тех же FLOPs.

Бонус: большое состояние можно инициализировать как обучаемый параметр — модель запоминает знания из претрейнинга прямо в M0, без затрат на инференс.

Результат на 8B модели, обученной на 1T токенов: SDM бьёт GDN на длинных контекстах (RULER benchmark) и не хуже полного внимания на коротких. До 1 миллиона токенов — константная память.

https://arxiv.org/abs/2607.07386