InhumanScience
106 subscribers
719 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Iris: поисковый агент, который учится искать лучше с каждым циклом

Хорошая языковая модель — ещё не хороший поисковый агент. Нужно уметь решать многошаговые задачи в интернете, где ответ разбросан по десяткам страниц.

Iris от AllSpark Research — это end-to-end рецепт обучения таких агентов. Ключевые идеи:

1. Данные генерируются автоматически из структуры веб-графа: берём страницу, строим граф сущностей, генерируем многошаговый вопрос и заменяем все прямые "подсказки" на описательные отсылки — чтобы модель не могла схитрить простым поиском по строке.

2. Траектории от учителя фильтруются на двух уровнях: целиком (правильность, глубина, отсутствие петель) и пооборотно (LLM-судья маскирует плохие ходы, но не выбрасывает их из контекста).

3. SFT и RL чередуются итеративно: удачные траектории из RL-роллаутов идут обратно в SFT следующего цикла.

В итоге Iris-mini и Iris-pro бьют все open-source агенты на BrowseComp, DeepSearchQA и HLE.

https://arxiv.org/abs/2609.04304
RLVR делает модели умнее, но "забывает" альтернативные пути решения

(by University of Birmingham)

RLVR-обучение (PPO, GRPO) резко улучшает точность математических рассуждений — но ценой разнообразия решений. Авторы выяснили, ГДЕ именно теряются альтернативные пути.

Ключевое разделение: "доступ" (начало пути решения) vs "исполнение" (дальнейшие шаги). На задаче Countdown, где можно перебрать ВСЕ валидные решения, оказалось:

— При PPO точность выросла в 50 раз, но покрытие решений упало с 0.337 до 0.111
— Проблема концентрируется на ПЕРВОМ шаге: сдвиг вероятностей перед первой арифметической операцией в 16x больше, чем во всех последующих шагах
— Если принудительно дать модели "начало" забытого пути — она отлично его завершает!

Лечение: интерполяция весов поздних слоёв (20-28) с ранним чекпоинтом возвращает 37% покрытия без потери точности. SFT-модели сохраняют вдвое больше разнообразия.

https://arxiv.org/abs/2608.29188
Мультиагентные LLM наконец получили математику

Все знают, что системы типа AutoGen или MetaGPT работают, но никто не понимал — почему, когда они сходятся, и почему иногда застревают. Авторы дают первый строгий теоретический фундамент.

Ключевые идеи:
1. Оркестратор + воркеры — это билинейная игра координации. Качество декомпозиции задачи напрямую определяет, насколько близко воркеры сойдутся к Nash-равновесию.

2. Свободная рефлексия (Reflexion-style) может плато — и это доказуемо. Без внешнего верификатора даже идеальный текстовый судья не может гарантировать улучшение.

3. Авторы вводят SRMA: новая память коммитится только если внешний верификатор подтверждает снижение ошибки. Это даёт геометрическую сходимость.

Практический результат: Kimi-based система на SWE-bench — 72.2% (361/500), против 70.8% у публичного mini-SWE-agent v2.

https://arxiv.org/abs/2609.02750
👍1
MaxKernel: Агент для написания TPU-ядер (by Google)

LLM пишет быстрее человека низкоуровневый код для TPU? Звучит фантастически, но Google сделали именно это.

MaxKernel — мультиагентный фреймворк для автоматической генерации и оптимизации JAX/Pallas ядер под TPU. Внутри — специализированные субагенты: планировщик, кодогенератор, тестировщик, автотюнер и профилировщик (через XProf). Всё замкнуто в петлю: сгенерировал → скомпилировал → протестировал → профилировал → улучшил.

Три режима работы: с человеком в петле (HITL), полностью автономный и граф-поиск по пространству конфигураций (beam search и др.).

Результаты впечатляют: 1.58× ускорение на JAXBench, а на 8 продакшн-ядрах — 2.32× против референсного кода и 2.02× против написанного людьми вручную.

RAG с документацией по Pallas/Mosaic/XLA помогает агентам разбираться в железе без примеров человеческого кода.

https://arxiv.org/abs/2609.04523
OPD работает даже на одном примере — и вот почему

Оказывается, для on-policy дистилляции (OPD) не нужны тысячи обучающих примеров. Один единственный запрос восстанавливает большую часть разрыва между студентом и учителем — и это работает на четырёх доменах и трёх семействах моделей.

Почему? Авторы вводят понятие "покрытия состояний": каждый запрос порождает множество префиксов (состояний), на которых учитель даёт токен-уровневую обратную связь. Один запрос покрывает 71.5% состояний, которые посещает полный датасет. 16 семантически разнообразных запросов — уже 98.9%.

Главный вывод: OPD data-overfed но algorithm-starved. Данных достаточно с первых шагов, а вот скорость "поглощения" сигнала студентом падает одинаково — хоть на 1 запросе, хоть на 17k.

Бонус: даже бессмысленные шаблоны без задачи работают почти так же хорошо — главное, чтобы студент начал рассуждать.

https://arxiv.org/abs/2609.04172
NeoHorse-1: модель, которая сама себя улучшает через агентный роутинг

Идея рекурсивного самоулучшения AI звучит красиво, но как это реализовать конкретно? NeoHorse-1 предлагает механизм: агент выполняет задачи в харнессе (execution layer с инструментами), оставляет траектории взаимодействий, роутер оценивает сложность каждого запроса — и всё это превращается в обучающие данные для следующей итерации.

Ключевые компоненты: curriculum learning на основе routing-скоров (сначала простые примеры, потом сложные), on-policy distillation где учитель supervises ответы самого студента, а не фиксированные траектории, и feedback loop — обновлённая модель возвращается в харнесс, её новые слабые места определяют следующий датасет.

Результат: 4B модель поднялась с 58.94 до 64.87 macro-average по агентным бенчмаркам, а 9B — с 65.60 до 69.04. Самые большие gains на harness-based задачах. Это первый прототип, авторы планируют масштабировать итерации дальше.

https://arxiv.org/abs/2609.08183
DriveZero: автопилот, который превзошёл человека без единой человеческой траектории

Обычно end-to-end системы вождения учатся имитировать записи человека-водителя. Проблема: одна сцена — одна реализованная траектория, редкие аварийные ситуации почти не встречаются, и политика деградирует, выходя за пределы обучающих данных.

DriveZero разрывает эту зависимость через три шага:

1. DriveRL — привилегированный агент обучается с нуля через PPO в 196k параллельных симулированных мирах (без имитации!), превосходя log-replay эксперта на nuPlan.

2. DriveVFM — визуальный энкодер дистиллируется из замороженных фундаментальных моделей (DINOv3, SigLIP2, SAM, Depth Anything v2) без разметки.

3. DriveZero — камерная политика учится на роллаутах DriveRL, а не на человеческих траекториях. Goal-conditioned аугментация даёт разнообразные цели из одной сцены.

Результат: 95.3 PDMS на NAVSIMv1 — выше человека (94.8) и нового SOTA на NAVSIMv2 и HUGSIM.

https://arxiv.org/abs/2609.06055
World-Action модель для роботов: чем больше данных — тем лучше (by AgiBot World)

Классические VLA-политики учат маппинг наблюдение → действие, не моделируя физику. World-Action Models (WAM) сначала предсказывают, как изменится сцена, а потом извлекают действия. GE-Act 2.0 делает это с нуля, без готовых видео-генераторов.

Ключевые идеи:
1. Разделённое предобучение: visual planner учится на видео без меток действий, inverse dynamics model — на траекториях без языковых инструкций. Потом всё соединяется.
2. CoAE — компактный автоэнкодер, заточенный под управление, а не под качество картинки.
3. KASO решает "validity gap": когда предсказанное будущее не совпадает с записанным действием, модель выбирает только совместимые пары.

Результат: масштабирование с 300 до 30 000 часов данных поднимает zero-shot OOD успех с 17% до 44% на 100 реальных задачах — без файн-тюнинга под конкретные задачи.

https://arxiv.org/abs/2609.05588
OpenAI показала, как исследователь из MIT использует GPT-5.6 Sol вместе с Codex для автономного проведения квантовых вычислительных экспериментов. Система сама запускает опыты, анализирует результаты и калибрует кубиты — без постоянного участия человека.

Это важно: квантовые эксперименты требуют сложной итеративной настройки, которая раньше отнимала часы ручной работы. Теперь ИИ берёт на себя рутинный цикл "запустил — проверил — подстроил", ускоряя исследования.

Для учёных это означает возможность сосредоточиться на гипотезах, а не на операционной рутине. Связка мощной языковой модели с инструментом для работы с кодом превращает ИИ в полноценного лабораторного ассистента.

https://openai.com/index/codex-quantum-computing-experiments
Google DeepMind представила AlphaGenome Atlas — предсказательную карту всех возможных изменений ДНК в геноме человека.

Модель AlphaGenome анализирует, как каждая возможная мутация в ДНК влияет на работу генов. Это колоссальный объём данных: в геноме человека около 3 миллиардов пар оснований, и каждая может измениться тремя способами.

Почему это важно? Большинство генетических заболеваний вызваны именно точечными мутациями. Раньше учёным приходилось годами экспериментировать, чтобы понять последствия одного изменения. Теперь Atlas даёт готовые предсказания для всего генома сразу.

Это ускорит поиск причин редких болезней, разработку генных терапий и персонализированной медицины. По сути, DeepMind создала атлас последствий всех возможных генетических вариантов — инструмент, который раньше просто не существовал.

https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/
Nvidia — CUDA Rust: пишем GPU-ядра на Rust

Nvidia представила CUDA Rust — два инструмента для написания GPU-ядер прямо на Rust, без C++.

Первый — cuda-oxide — компилирует Rust-код в PTX через кастомный бэкенд rustc. Требует nightly-тулчейн и LLVM, пока в альфе.

Второй — cutile-rs — работает на стабильном Rust 1.89+ с CUDA 13.3, уже опубликован на crates.io и используется в движках HuggingFace Grout и mistral.rs.

Оба инструмента гарантируют память-безопасность на этапе компиляции — никаких гонок и алиасинга.

Почему это важно: всё больше AI-инфраструктуры (inference, serving, агентные рантаймы) пишется на Rust. Раньше GPU-ядра оставались исключением — теперь нет.

NVIDIA планирует поддержку interop между CUDA Rust, C++ и Python, так что выбор языка не закроет доступ к другим экосистемам.

https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/
AuK: один голосовой движок вместо десяти (by Tencent Hunyuan)

Зачем держать отдельные модели для TTS, редактирования эмоций, шумоподавления и клонирования голоса, если можно одну?

AuK — это единая open-source модель, которая по текстовой инструкции делает всё сразу: синтез речи, правку акустики (темп, громкость, питч), смену эмоций и акцента, редактирование слов прямо в аудио, разделение и улучшение звука.

Архитектура: MLLM-энкодер для семантики + аудио VAE + гибридный flow-трансформер с dual-stream MMDiT блоками. Обучение в два этапа: unified pre-training на 1.95 млн часов аудио, затем post-training с RLHF для редактирования и Flow-GRPO для генерации.

Бонус: дистиллированная версия AuK-Flash делает инференс за 4 шага без CFG — в 4.5× быстрее учителя. Код и веса открыты.

https://arxiv.org/abs/2609.08936
Что нужно роботу, чтобы не просто видеть мир, но и действовать в нём?

Команда OpenWAM предлагает систематический подход к обучению World-Action Models (WAM) — моделей, которые наследуют знания о динамике мира из видеогенерации, а затем учатся управлять действиями через робототехнический опыт.

Три ключевых вопроса, на которые отвечает статья:
1. Какие знания о мире должна наследовать WAM?
2. Как создать синергию между моделированием мира и генерацией действий?
3. Как масштабировать это на разные домены?

Главные находки: синергия мира и действий возникает не из размера модели, а из правильного потока информации и совместного расписания денойзинга. Pretrain на эгоцентрическом видео людей + роботных траекториях даёт лучшую OOD-генерализацию.

Результат — OpenWAM-α, обученная на 518M кадров (~6400 часов), оценённая на 8 симуляционных бенчмарках и реальных роботах. Всё открыто: веса, инфраструктура, данные.

https://arxiv.org/abs/2609.07398
Игровой движок из одного промпта — теперь реально?

Представьте: вы описываете мир словами, а система сама строит интерактивную сцену с правилами, физикой и состоянием объектов. Именно это предлагает Programmable World Model.

Ключевая идея — разделить два процесса: эволюцию состояния мира и генерацию видео. Coding agent переводит инструкции пользователя в исполняемый код, который управляет сущностями через 3D oriented bounding boxes (OBB). Затем state compiler проецирует эти боксы в пиксельные контролы, а видеомодель рендерит детали — анимацию, физику, внешний вид.

Зачем OBB, а не полные 3D-сцены? Компромисс: текст слишком абстрактен, полная геометрия слишком дорога в аннотации и порождает train/inference mismatch. OBB — золотая середина: задаёт позицию и ориентацию объекта в мировых координатах, не требуя меша или скелета.

Плюс авторы представили CombatStateBench — бенчмарк, проверяющий, совпадает ли то, что видно в видео, с состоянием движка (живые/мёртвые персонажи).

https://arxiv.org/abs/2609.10540
Nvidia Tech запустила EPD-disaggregation для мультимодального AI

Nvidia представила технику оптимизации инференса для мультимодальных моделей — encode-prefill-decode (EPD) disaggregation в фреймворке Dynamo. Суть: визуальное кодирование изображений теперь выполняется отдельно от LLM-обработки, а не в одной очереди.

Что это даёт на практике: до 5x быстрее время до первого токена и до 7x быстрее общее время ответа при работе с изображениями. Текстовые запросы в смешанном трафике тоже ускоряются на 42% — они больше не стоят в очереди за тяжёлыми мультимодальными запросами.

Особенно эффективно для запросов с несколькими изображениями или видео, коротких и средних ответов, а также квантизированных MoE-моделей. При квантизации весов до NVFP4 прирост производительности вырастает с 1.78x до 2.64x.

Важно: для длинных генераций и больших плотных моделей выигрыш минимален — там декодирование всё равно доминирует по времени.

https://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving/
Nvidia выпустила CUDA Toolkit 13.4

Крупное обновление для разработчиков GPU-приложений. Главное — CUDA теперь работает на Windows on Arm: раньше Arm-платформы поддерживались только через Linux, теперь барьер снят.

Что ещё важного:

Превью поддержки архитектуры Rubin (следующее поколение после Blackwell) — разработчики могут уже сейчас портировать приложения.

Multi-Process Service V3 — переработанное управление общими GPU: скриптуемый CLI, TOML-конфиги, интеграция с cgroup. Удобно для контейнерных сред и оркестрации.

CUDA Python расширился: текстуры и поверхности, NUMA-aware память, type stubs для IDE и AI-агентов.

CCCL 3.4 ускорил DeviceScan на Blackwell до 92% использования пропускной способности памяти.

Установщики SDK больше не включают драйвер Nvidia — теперь нужно ставить отдельно.

Toolkit доступен для скачивания на сайте Nvidia.

https://developer.nvidia.com/blog/cuda-toolkit-13-4-adds-windows-on-arm-support-and-greater-control-over-shared-gpus/
IBM Research: прорыв в квантовых вычислениях номинирован на премию Гордона Белла

Cleveland Clinic, RIKEN и IBM вошли в финал престижной премии ACM Gordon Bell Prize 2026 — одной из главных наград в области суперкомпьютинга.

Команда смоделировала белковую систему из 12 635 атомов — крупнейшую квантовую симуляцию биологически значимых молекул на сегодняшний день. Для этого объединили квантовые процессоры IBM Heron с японскими суперкомпьютерами Fugaku, RUQUO и Miyabi-G.

Новый результат: полностью автоматизированный сквозной воркфлоу, который убирает ручную координацию между квантовыми и классическими ресурсами. Это ускоряет расчёты и повышает точность вычислений энергии связывания белок-лиганд.

Проще говоря: квантовые компьютеры становятся реальным инструментом для медицинских исследований — быстрее, точнее, с меньшими усилиями.

https://research.ibm.com/blog/gordon-bell-finalists-2026?utm_medium=rss&utm_source=rss
RL для агентов-исследователей упёрся в потолок — и вот как его пробили

Представьте: вы обучаете RL-агента, который пишет ML-код и запускает эксперименты. Генерация текста батчится и масштабируется легко. А вот каждое выполнение кода требует отдельного Docker-контейнера с GPU — и стоит полную цену. Итог: execution становится жёстким bottleneck'ом при масштабировании.

Авторы из UIUC предлагают WMRL: заменить реальное окружение world model — языковой моделью, которая предсказывает результат выполнения кода без его реального запуска. Это даёт ускорение 3–4× при обучении.

Но бесплатного обеда нет: world model ошибается. Авторы формализуют ошибку как bias + noise и показывают, что они портят сходимость на O(B²) и O(σ²). Решение — два механизма коррекции: Online Debiasing (монотонное переотображение предсказанных наград по якорным реальным запускам) и Inverse-Variance Denoising (взвешенное слияние сигналов). С ними агент не просто не теряет в качестве — иногда превосходит baseline с реальным окружением.
LLM научился думать "концептами", а не токенами — и стал в 2 раза эффективнее

Стандартные LLM предсказывают следующий токен. Но что если обучать модель предсказывать не токены, а более высокоуровневые "концепты" — сжатые латентные представления сразу нескольких токенов?

Именно это делает NCP-ArchPreview. Архитектура состоит из трёх модулей: Token Encoder сжимает токены в концепты через mean pooling, Concept Module предсказывает следующий концепт в дискретном латентном пространстве (через vector quantization), а Token Decoder использует эти предсказания для генерации токенов. Обучение идёт совместно: и Next Token Prediction, и Next Concept Prediction.

Результат на 5.73T токенах: модель сходится в 1.95x быстрее OLMo-3-7B на тех же данных, обгоняет его на +2.45 пункта на бенчмарках и +5.99 на GSM8K. Бонус: концептное пространство ускоряет speculative decoding и даёт лёгкую доменную адаптацию через 17M-параметровый интерфейс.

Веса, код и рецепты обучения — в открытом доступе.

https://arxiv.org/abs/2609.10715
Один защитный слой для всех моделей — это провал. Нужен свой для каждой.

Исследователи из Johns Hopkins заметили очевидную, но важную вещь: фиксированный harness для защиты LLM-агентов работает плохо сразу по двум причинам. Для сильно выровненных моделей (Claude) он избыточен и убивает полезность до нуля. Для слабых моделей (GLM-5) он недостаточен и пропускает атаки.

Решение — EvoSafeHarness: система, которая автоматически эволюционирует отдельный harness под каждую пару модель×домен. Для финансового агента нужно отслеживать wash-trading через историю транзакций. Для файлового — фильтровать опасные команды и пути к секретам. Это принципиально разная логика.

Архитектура: Designer предлагает политику + код, Criticizer стресс-тестирует в чистом контексте, Cascade Test Environment оценивает отдельно utility и успешность атак (прямых и косвенных), Analyzer возвращает конкретные трейсы ошибок.
OpenAI — учёные используют ИИ в борьбе с супербактериями

Лаборатория Сесара де ла Фуэнте применяет Codex и ChatGPT для поиска новых антимикробных молекул прямо в геномах живых и вымерших организмов. ИИ помогает анализировать огромные массивы генетических данных и находить кандидатов, способных бороться с устойчивыми к антибиотикам инфекциями — одной из главных угроз современной медицины.

Раньше такой поиск занимал годы лабораторных экспериментов. Теперь ИИ ускоряет отбор перспективных молекул на порядки. Это не просто научный эксперимент — это реальный шанс создать новое поколение антибиотиков в эпоху, когда старые перестают работать.

Показательный пример того, как инструменты OpenAI выходят далеко за рамки написания текстов и кода.

https://openai.com/index/using-codex-chatgpt-to-search-for-new-antimicrobials