InhumanScience
106 subscribers
716 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Робот учится по видео с людьми — без единой совместной записи

Чтобы робот обобщался на новые задачи, нужны пары "человек делает → робот делает". Собирать их вручную дорого. Zero-WAM решает это автоматически: берёт видео роботов, генерирует из них семантически совпадающие видео с человеческими руками (через VLM + image editing), и обучает политику принимать такие видео как in-context инструкцию.

Ключевая идея: вместо текста — видео с человеком как "промпт". Модель аутореgressивно предсказывает и будущие кадры, и действия робота.

Чтобы модель не игнорировала видео-подсказку (shortcut через историю робота), вводят IFP-objective — предсказание нескольких будущих чанков сразу.

Результат: 46.95% на unseen задачах в RoboTwin 2.0, +29.5pp над baseline.

https://arxiv.org/abs/2608.26103
DART-SD: как научить агента чинить только сломанное (by ByteDance)

Когда LLM-агент использует инструменты в несколько шагов, стандартные подходы страдают от одной проблемы: SFT штрафует модель за нормальные шаги, а RL размазывает награду равномерно по всей траектории. Оба метода не понимают, что пространство решений — это не линейная цепочка, а граф с «ромбовидной» топологией, где разные пути пересекаются в одних и тех же состояниях.

DART-SD строит граф переходов (ISTG) из траекторий учителя, находит точку Critical Topological Breakpoint — первый момент, где студент сходит с успешного пути — и обучает модель только на шагах восстановления после этой точки. Всё, что было до CTB, не трогается градиентами.

Результат: меньше лишних вызовов инструментов, лучше качество на 5 бенчмарках, и модель постепенно сдвигает границу своей компетентности с каждым раундом само-дистилляции.

https://arxiv.org/abs/2608.18524
Находить объекты в видео параллельно, а не по очереди

Задача spatio-temporal video grounding — найти объект в видео по текстовому запросу: определить временной интервал и нарисовать bounding box в каждом кадре. Проблема: стандартные MLLM генерируют боксы один за другим, и чем длиннее видео — тем медленнее и хуже (ошибки накапливаются).

Авторы из MBZUAI предлагают Parallel Tube Decoding (PTD): вместо того чтобы генерировать боксы последовательно, модель сначала за один шаг предсказывает временной интервал, а затем параллельно генерирует все боксы сразу. Итого всегда ровно два декодирующих раунда, независимо от длины трубки.

Чтобы это работало, вводят Decoupled Block Attention — каждый бокс видит общий видео-контекст, но не видит другие боксы. Плюс RL-оптимизация с пространственными и временными наградами.

Результат: ускорение латентности в 79 раз, пропускная способность выросла в 92 раза по сравнению с базовым текстовым декодингом, при этом качество локализации улучшилось.

https://arxiv.org/abs/2608.28192
Модель учится без правильных ответов — и обгоняет ту, у которой они были

Представьте: у вас есть сложные олимпиадные задачи, и вы не знаете правильных ответов. Можно ли всё равно улучшить модель? TTPO говорит — да.

Ключевое наблюдение: на задачах уровня AIME псевдо-метки (majority vote по K роллаутам) ошибаются в ~85% случаев. Казалось бы, учиться на таком шуме бессмысленно. Но вот хитрость: даже когда псевдо-метка неверна, ~79% "несогласных" роллаутов тоже неверны. Значит, штрафовать несогласных — правильно почти всегда, независимо от качества метки.

Отсюда асимметричный дизайн:
- Роллауты, согласные с псевдо-меткой → дистилляция (OPSD) с токен-уровневыми весами
- Несогласные роллауты → GRPO-штраф с маскировкой аномальных токенов

Результат: Qwen3-1.7B без единого правильного ответа вырастает с 38.0% до 45.2% на олимпиадных бенчмарках — обгоняя TTRL и даже label-supervised OPSD.

https://arxiv.org/abs/2608.27448
Microsoft Research выпустила GigaPath-Flash и GigaTIME-Flash — ускоренные версии своих ИИ-моделей для анализа патологических снимков.

Суть: оригинальные модели GigaPath и GigaTIME умели анализировать гигапиксельные срезы тканей и строить карты опухолевого микроокружения, но требовали огромных вычислительных ресурсов. Flash-версии решают эту проблему — через дистилляцию знаний из миллиардной модели в компактную архитектуру.

Цифры говорят сами за себя: GigaPath-Flash работает в 50 раз дешевле при сохранении 97% точности. GigaTIME-Flash — в 6 раз быстрее и потребляет в 8 раз меньше памяти, при этом показывая лучшее качество на новых данных.

Практически это означает: анализ миллиона слайдов теперь занимает 70 GPU-дней вместо 300. Исследователи смогут изучать десятки тысяч пациентов, тестировать гипотезы и искать биомаркеры рака в реальном масштабе.

Модели открыты под лицензией Apache 2.0 и доступны на HuggingFace. Для клинического применения не предназначены.

https://www.microsoft.com/en-us/research/blog/gigapath-flash-and-gigatime-flash-toward-population-scale-discovery-with-efficient-pathology-foundation-models/
Nvidia Tech — BioNeMo Agent Toolkit теперь работает с Claude Science

NVIDIA интегрировала BioNeMo Agent Toolkit в Claude Science — научную платформу Anthropic. Результат: ИИ-агент может самостоятельно запускать NIM-микросервисы для предсказания структуры белков прямо внутри исследовательской среды.

Что это даёт? Агент берёт белковые последовательности, строит множественные выравнивания (MSA), запускает сразу две модели — OpenFold3 и Boltz-2 — и сравнивает результаты. Без MSA точность предсказания комплексов рушится (iPTM падает с 0.85 до 0.14), с ним — обе модели независимо воспроизводят одну и ту же структуру.

На внутренних тестах BioNeMo-навыки подняли корректность задач с 60% до 100% и вдвое снизили расход токенов.

Для кого важно: исследователям в биологии, химии, геномике и разработке лекарств — теперь не нужно вручную настраивать окружения и API для каждой модели. Агент делает это сам.

https://developer.nvidia.com/blog/run-nvidia-bionemo-nim-microservices-for-protein-structure-prediction-in-claude-science/
Nvidia — новый инструмент для обучения автопилота без реального автомобиля

NVIDIA выпустила Omniverse NuRec — систему, которая позволяет адаптировать восприятие автономного вождения к новым моделям автомобилей без сбора реальных данных с нуля.

Как это работает: NuRec берёт записи реальных поездок, реконструирует сцены с помощью 3D Gaussian splatting и рендерит их с точки зрения камер другого автомобиля. Например, данные с SUV можно «пересчитать» под конфигурацию седана.

В открытом доступе на Hugging Face уже лежит датасет из 1500+ нейронно-реконструированных сцен по ~20 секунд каждая.

Почему это важно: разработка нового автомобиля занимает годы, а обучать восприятие нужно заранее. NuRec позволяет готовить модели до того, как реальный флот вообще существует — экономя время и деньги на разметку данных.

https://developer.nvidia.com/blog/scale-av-perception-across-vehicle-platforms-with-nvidia-omniverse-nurec/
Qwen3.8-Flash-Next: мощь 397B-модели за 1/9 вычислительных затрат (by Qwen)

Команда Qwen выкатила техотчёт о новой архитектуре: 125B параметров, но активируется лишь 6B на токен. При этом модель обходит предшественника на 8 из 14 бенчмарков, тратя в 9 раз меньше FLOPs на обучение.

Ключевые архитектурные решения:

1. Гибрид GDN + Sparse Attention: вместо полного attention везде — 3 слоя рекуррентного Gated DeltaNet на 1 слой разреженного attention. Линейная стоимость для длинных контекстов, при 1M токенов QSA в 7.6× быстрее dense attention.

2. Gated Residual (GR): расширение residual stream на 4 ветки с elementwise gate. Побочный эффект — стабильность обучения без единого loss spike на полном масштабе.

3. N-gram embedding таблицы (51B параметров) хранятся в CPU памяти и подгружаются по мере нужды — почти бесплатные дополнительные параметры.

4. Оптимизатор Muon вместо AdamW для 2D-весов.

Интересный вывод: loss и accuracy на бенчмарках расходятся — минимум loss ≠ максимум качества.
Хочешь научить робота новым трюкам без миллионов размеченных демонстраций? Смотри видео!

ZimaBlue — это World Action Model (WAM), которая учится управлять роботом в три этапа: сначала смотрит 120,000 часов эгоцентрического видео без разметки действий, потом выравнивает знания на кросс-эмбодимент данных, и наконец дообучается на целевом роботе.

Ключевой результат: zero-shot success rate растёт с 36.1% (только данные целевого робота) → 46.1% (добавили кросс-эмбодимент) → 77.8% (добавили 120k часов видео). То есть обычное YouTube-видео даёт больший прирост, чем дорогие роботизированные демонстрации!

Для скорости авторы придумали Slow-Fast архитектуру: большая модель генерирует "мировые" представления, лёгкий Fast-модуль реагирует быстро. В итоге латентность 33 мс на RTX 4090 — ускорение в 13.6× против базового варианта.

https://arxiv.org/abs/2609.00188
Evolution Strategies против GRPO: кто лучше для дообучения LLM на рассуждениях?

GRPO — популярный RL-метод для улучшения reasoning у LLM — страдает от entropy collapse: модель концентрируется на узком наборе стратегий, и Pass@K при больших K может даже падать ниже базовой модели. А что если вместо backprop использовать Evolution Strategies (ES)?

ES не считает градиенты — вместо этого он сэмплирует популяцию возмущённых версий модели, оценивает их через forward pass и усредняет reward-взвешенные возмущения. Никакого backprop, меньше памяти, легко параллелить.

Авторы выяснили три вещи:
1. ES сохраняет разнообразие рассуждений — Pass@K выше, чем у GRPO, без entropy collapse.
2. Большой дрейф параметров у ES ≠ катастрофическое забывание: изменения функционально разреженны, старые знания сохраняются.
3. Z-score нормализация наград критична; с ростом модели нужен меньший размер популяции.

Бонус: комбинации ES→GRPO и GRPO→ES берут лучшее от обоих миров.

https://arxiv.org/abs/2608.27351
Google Gemini запустил агентное понимание видео — и это серьёзный апгрейд для разработчиков.

Новая функция доступна в моделях Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Вместо того чтобы тупо обрабатывать видео кадр за кадром с фиксированной скоростью, модель теперь сама решает — что смотреть, с какой скоростью и через какую модальность (кадры, аудио или транскрипт).

Результат: потребление токенов падает до 88%, стоимость анализа — до 66%, а точность растёт на 7%. Особенно ощутимо на длинных видео — лекциях, записях совещаний, многочасовых трансляциях.

Что умеет: точный поиск момента с точностью до секунды, поиск иголки в стоге сена в многочасовых видео, детекция аномалий и подсчёт объектов.

Включается одной строкой в API: processing: "agentic". Доступно в Google AI Studio уже сейчас, без доплаты.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
Nvidia Tech совместно с CrowdStrike создали замкнутую систему кибербезопасности на базе моделей Nemotron, где ИИ-агенты атакуют и защищают инфраструктуру в автоматическом режиме без участия человека.

Как это работает: красный агент запускает атаку, синий анализирует телеметрию и генерирует правила обнаружения, затем красный адаптирует тактику — и цикл повторяется на машинной скорости.

Результаты впечатляют: оптимизированная связка Nemotron 3 Ultra + дообученный Nemotron 3 Super показала 41,9% среднего обнаружения атак — это в 2,5 раза лучше базовой конфигурации. При тестировании на 8 новых атаках открытые модели обобщили 45% обнаружений против 29% у проприетарных систем.

Почему важно: традиционные red/blue team учения занимают недели из-за ручных итераций. Здесь весь цикл работает автономно, а стоимость — на 99% ниже топовых проприетарных моделей по данным CrowdStrike.

https://developer.nvidia.com/blog/building-an-adaptive-agentic-cybersecurity-system-with-nvidia-nemotron/
Хочешь обучить видео-модель мира на часы вперёд, потренировав её лишь на 5-секундных клипах?

SolarWM — полностью открытый фреймворк для обучения интерактивных video world models. Авторы собрали 1.43 млн клипов из 10 датасетов (реальный мир, синтетика, игры) и привели их к единому формату с согласованной геометрией камеры, семантикой и метаданными качества.

Главная идея: разделить тяжёлую предобработку данных и конструирование обучающей смеси. Хочешь поменять фильтрацию или веса источников — просто меняешь конфиг, не перезапуская всё с нуля.

Обучение — три стадии: bidirectional training → autoregressive адаптация → distribution matching distillation. Причём большую часть оптимизации нужно делать на первом этапе, остальные сходятся быстро.

Результат: семейство моделей от 5B до 33B параметров (WAN, LTX, MiniMax бэкбоны), которые после обучения на 5-секундных видео генерируют роллауты длиной от минут до часов без дополнительного файнтюнинга.

https://arxiv.org/abs/2609.02886
SMELT: как получить бесплатные вычисления в трансформере (by ByteDance)

Что если прогнать часть слоёв трансформера дважды, не платя за это дополнительными параметрами? Идея looped transformers известна давно, но всегда был подвох: extra FLOPs никто не контролировал.

SMELT закрывает этот вопрос честно — фиксируют сразу три бюджета: FLOPs, параметры и KV-кэш. Трюк возможен благодаря MoE: средние 50% слоёв прогоняются дважды, скрытое измерение сужается, а потерянную ёмкость восстанавливают добавлением экспертов.

Результат: на 1021 FLOPs SMELT достигает того же лосса на 14.7% дешевле. Выигрыш растёт со scale. Особенно хорошо работает на коде и задачах in-context learning — второй проход по слоям усиливает первый, а не перезаписывает его.

https://arxiv.org/abs/2609.01343
WikiSkill: агент, который учится как Википедия

Обычные AI-агенты накапливают опыт в параметрах модели или разрозненных логах. WikiSkill предлагает другой путь: между сырыми трейсами выполнения и процедурными инструкциями (skills) добавляется отдельный слой — постоянная база знаний в духе вики.

Архитектура трёхуровневая: Raw Layer (неизменяемые трейсы), Wiki Layer (структурированные паттерны и история эволюции), Skill Layer (процедурные инструкции). На каждой итерации Wiki Maintainer анализирует трейсы и обновляет вики, Skill Proposer предлагает улучшения навыков, а Gating механизм откатывает плохие обновления. Вики при этом никогда не сбрасывается.

Результаты впечатляют: Qwen-3.5-9B со скиллами WikiSkill бьёт Qwen-3.6-27B без скиллов (47.4% vs 39.4%). А скиллы, выученные большой моделью, переносятся на маленькую — и та работает лучше, чем со своими собственными скиллами.

https://arxiv.org/abs/2608.27454
Google DeepMind представила Gemini 3.8 Flash и 3.8 Flash Cyber — уже третий релиз Flash за шесть недель.

Gemini 3.8 Flash — новый флагман для агентных задач и сложного кода. На бенчмарке DeepSWE он обходит большинство более крупных и дорогих моделей, при этом сохраняет цену 3.7 Flash: $0,75 за млн входящих токенов. Модель работает усерднее — делает больше шагов рассуждения и итеративно вызывает инструменты.

Gemini 3.8 Flash Cyber заточен под кибербезопасность: находит уязвимости в коде на 20 языках программирования с точностью выше 70%, патчит баги на уровне лучших frontier-моделей, но дешевле. Chrome Security Team получила в 2,6 раза больше корректных патчей, чем от коммерческих аналогов. Доступ — только через программу Fairwind для доверенных организаций.

Оба варианта уже доступны через Google AI Studio, Gemini API и приложение Gemini.

https://deepmind.google/blog/introducing-gemini-3-8-flash-and-38-flash-cyber/
Meta AI разработала корпоративный "второй мозг" — AI-агент, который накапливает экспертные знания организации и делает их доступными для всех сотрудников.

Главная идея: большинство ценных знаний живёт в головах специалистов, а не в документах. Агент меняет это — он структурирует, как именно эксперты рассуждают, а не просто хранит факты.

Что внутри: система из 200+ файлов с позициями компании, глоссариями и логикой принятия решений. Плюс — петля самообучения: когда эксперт исправляет агента, правка автоматически проходит тесты и навсегда встраивается в базу знаний. Без переобучения модели.

Зачем это важно: эксперты в Meta теперь тратят меньше времени на рутинные вопросы и больше — на действительно сложные задачи. Паттерн универсален: compliance, финансы, безопасность, инженерия — любая область с накопленной экспертизой.

По сути, Meta создала способ превратить уходящих сотрудников и их опыт в постоянный актив компании.

https://engineering.fb.com/2026/09/02/ml-applications/organizational-second-brain-ai-learns-from-experts/
🔥1
Nvidia Tech обновила CUDA-инструментарий и опубликовала подробный гайд по оптимизации GPU-кода.

Разработчики показали, как за шесть шагов ускорить типичный пайплайн обработки изображений в 300 раз — с 6,8 секунд до 23 миллисекунд.

Что конкретно даёт прирост: замена ручных ядер на библиотеку CUB ускоряет вычисление медианы в 2717 раз. Pooled-буферы cuda::device_buffer сокращают накладные расходы на аллокацию памяти вдвое. Pinned-память для хоста ускоряет передачу данных CPU→GPU в 10 раз. Асинхронные потоки на каждый OpenMP-поток перекрывают вычисления и передачи данных.

Почему это важно: современные AI-модели и научные симуляции упираются именно в эффективность GPU-кода. Теперь у разработчиков есть пошаговый рецепт с конкретными цифрами и готовыми примерами на Google Colab.

https://developer.nvidia.com/blog/the-modern-cuda-toolbox-in-practice-a-step-by-step-optimization-walkthrough/
Как научить AI-агента делать ML-исследования, не тратя бюджет на пробы и ошибки? (by BAAI)

Авторы заметили: у автономных research-агентов есть модель и оркестратор, но нет третьего слоя — операционных знаний. Это разница между "знать про метод" и "уметь его запустить": какой API, какой конфиг, какие подводные камни.

Решение — система DisCo. Она берёт GitHub-репозитории и статьи, и автоматически дистиллирует их в "скиллы": компактные SKILL.md файлы с описанием что делать, когда применять и как использовать. Скилл верифицируется перед добавлением в библиотеку.

Результат — AREX-Skill Library: 5000+ скиллов из 1000 ML-репозиториев. Агент с этой библиотекой показал +134% на MLE-bench, +34% на PaperBench при том же backbone (GPT-5.5) и том же бюджете выполнения.

https://arxiv.org/abs/2609.02749
Random Attention: зачем вообще считать важность токенов? (by Salesforce AI)

KV cache у reasoning-моделей растёт на десятки тысяч токенов. Все методы сжатия соревнуются в том, какой токен "важнее" — накопленное внимание, норма значений, позиционная статистика...

Авторы спрашивают: а что если просто выкидывать случайно?

Random Attention: защищаем промпт целиком, остальное — равномерно случайная выборка, независимо в каждой голове. Никакого скоринга вообще.

Результат: на 4× сжатии точность не хуже лучших конкурентов, а throughput на 32–43% выше (нет прохода скоринга).

Почему это работает? Два механизма: 1) reasoning-трасса сама себя защищает — модель переформулирует то, что ещё нужно; 2) каждая голова хранит свою копию токена, случайная выборка сохраняет достаточно копий нужного факта.

Вывод: сигнал отбора почти ничего не даёт сверх случайного. Важно что защищать, а не как ранжировать остальное.

https://arxiv.org/abs/2609.03430
Гибридная LLM: зачем защищать то, что и так безопасно?

В гибридной Qwen3.8-27B 48 из 64 слоёв — это Gated DeltaNet (рекуррентные слои), а не обычный attention. Все публичные 4-битные квантизации держат гейты GDN в 8-16 бит, считая их "хрупкими": ошибка в рекуррентном состоянии накапливается через тысячи токенов. Авторы из Minima AI показали, что интуиция неверна.

Они заквантизировали все 496 линейных слоёв модели в NVFP4 W4A4, включая гейты — и точность не упала. Почему? Цепочка из четырёх причин: блочное масштабирование NVFP4 изолирует выбросы, нелинейности в гейтах (exp + softplus) сжимают ошибку, дельта-правило активно стирает ошибки состояния, а длинный контекст дополнительно "размывает" остаточный gap.

Бонус: модель на 2.9× меньше по VRAM, на 14-19% быстрее prefill — при том же качестве на бенчмарках.

https://arxiv.org/abs/2609.04098