InhumanScience
106 subscribers
716 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Terminal-Universe: как превратить логи агентов в среды для обучения (by Qwen/Alibaba)

Есть парадокс: агентных траекторий накопилось море, а реалистичных исполняемых сред для обучения — дефицит. Авторы предлагают инвертировать процесс: не среда → траектория, а траектория → среда.

Идея: в логах агента уже спрятана вся информация о рабочем пространстве. Read-вызовы показывают содержимое файлов, Write/Edit — что менялось. Значит, можно откатить правки агента и восстановить исходное состояние задачи!

Пайплайн Terminal-Universe:
1. Детерминированный replay файловых операций — получаем частичный workspace
2. Агент-дополнитель восстанавливает недостающие файлы без утечки решения

Затем на каждой среде генерируют новые задачи: одиночные, кросс-репозиторные и многораундовые. Из публичных траекторий получили 37.3k сред. Файн-тюнинг Qwen3.5-27B дал +11.9 на Terminal-Bench и +13.8 на EvoCode-Bench.

https://arxiv.org/abs/2609.04148
LLaDA-Image: открытый рецепт для генерации изображений на базе диффузионных LLM

Что если взять диффузионную языковую модель (dLLM) вместо классического текстового энкодера и построить на ней генератор изображений? Именно это сделали в inclusionAI с LLaDA-Image — 6B DiT, обученный с нуля и полностью открытый.

Ключевая идея: сначала учим визуальный prior на изображениях БЕЗ подписей (>90% данных — image-only), а языковое выравнивание добавляем позже. Это экономит данные и улучшает реализм на длинном горизонте.

Архитектура: dLLM-based VLM понимает промпты и визуальный контекст, коннектор передаёт это в single-stream DiT, а для редактирования референсное изображение подаётся напрямую в DiT, минуя VLM.

Плюс TwinFlow-дистилляция даёт Turbo-версию на 2–4 шага.

Выпущены веса, код и полные рецепты обучения — включая FP8-варианты.

https://arxiv.org/abs/2609.03796
Одна модель — и физика, и геометрия, и внешний вид мира сразу

Большинство генеративных world models работают только с пикселями, игнорируя, где именно в пространстве стоит камера и как устроена геометрия сцены. Puffin-World от ACE Robotics предлагает другой подход: моделировать мир через три нативных состояния одновременно — физику (гравитация, ориентация), геометрию (глубина) и внешний вид (RGB).

Ключевая идея — Omni-Camera representation: плотное представление камеры, которое совмещает абсолютную физическую ориентацию (привязанную к гравитации) с относительными лучевыми полями. Это позволяет избежать дрейфа ориентации при длинных траекториях. Добавляется механизм physics propagation — знания о физике из воспринятых кадров распространяются на будущие.

Обучали на Puffin-16M: 15M триплетов изображение-текст-камера и 1M сложных траекторий. Результат — SOTA на camera-to-world понимании на 4 бенчмарках, плюс controllable 3D-генерация и реконструкция в одной модели. Код, веса и датасет открыты.
Nvidia представила NemoClaw — фреймворк для создания агентов с долгосрочной памятью.

На его основе разработан агент Chief of Staff, который ведёт структурированную «модель себя»: хранит данные о людях, проектах, приоритетах и рабочих паттернах. Знания записываются в Markdown-страницы, а решения и корректировки — в отдельную SQLite-базу. Это позволяет агенту не путать факты с суждениями.

Ключевая фишка — приоритет реальных целей пользователя над сиюминутной срочностью. Агент учится на поправках: каждое исправление попадает в аудит-журнал и обновляет политику предпочтений, которую можно читать и редактировать вручную.

Результаты впечатляют: общая точность выросла с 82,8% до 90,9%, а отслеживание изменившихся фактов — с 60% до 100% по сравнению с обычным RAG-агентом.

Безопасность обеспечивает NVIDIA OpenShell — изолированная среда с контролем доступа к файлам, процессам и сети.

https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw/
Nvidia Tech запускает мощный AI на устройствах без интернета.

Компания показала, как запускать современные reasoning-модели прямо на Jetson — компактных edge-устройствах. Раньше многошаговые рассуждения требовали дата-центра, теперь это работает локально.

Протестированы две модели: Nemotron 3.5 Lightning (MoE, 30B параметров, активирует только 3B) и Qwen3.8-27B (dense, все 27B). Первая быстрее генерирует токены, вторая лучше для сложных решений.

Ключевые оптимизации — NVFP4-квантизация и speculative decoding — вместе дают до 6.28x прироста скорости по сравнению с BF16.

Зачем это важно: роботы, бортовые ассистенты, промышленный мониторинг — всё это теперь работает без облака. Меньше задержек, ниже стоимость, данные остаются на устройстве.

https://developer.nvidia.com/blog/frontier-reasoning-reaches-the-edge-how-to-deploy-and-optimize-models-on-nvidia-jetson/
Nvidia представила PAIR — виртуальный роутер для локального AI-инференса

NVIDIA Personal AI Router (PAIR) решает проблему очередей при мультиагентных задачах: вместо того чтобы гонять все запросы через один GPU, он распределяет их по доступным устройствам в домашней сети.

Работает с Ollama и LM Studio без каких-либо изменений в агентах. Поддерживаются видеокарты GeForce RTX 20-й серии и новее, RTX PRO, DGX Spark и Apple M4+.

На практике: задача с пятью субагентами на одном RTX Spark заняла 18 минут. Кластер из трёх устройств справился за 8 минут 48 секунд.

Безопасность обеспечивается через mDNS-обнаружение и MTLS-шифрование. Устройства могут подключаться и отключаться динамически — PAIR учитывает загрузку GPU и наличие нужной модели на каждом узле.

PAIR доступен в бета-версии для Windows, macOS и Linux. Проект открытый.

https://developer.nvidia.com/blog/nvidia-pair-virtual-inference-router-expands-available-compute-on-your-local-network/
NeoMME: один трансформер для текста и картинок без отдельных башен (by H company)

Большинство мультимодальных моделей для поиска используют раздельные энкодеры для текста и изображений (как CLIP). NeoMME идёт другим путём: один двунаправленный трансформер обрабатывает и текстовые токены, и сырые патчи изображений 32×32 пикселя через общие слои.

Обучение с нуля на смеси текста, кода, математики, естественных и документных изображений. Вместо обычного MLM используется masked discrete diffusion, а для мультимодальных примеров — текстовый денойзинг, обусловленный патчами изображения.

На выходе модель даёт и dense-вектор, и late-interaction представление из одного прохода. 260M модель обрабатывает страницы 2048×2048 со скоростью 51 стр/сек на L40S. Хитрость со сжатием: hierarchical pooling + int8/binary квантизация сжимают эмбеддинг в 255 раз при сохранении 95% качества поиска.

https://arxiv.org/abs/2609.01657
LoRA стал лучше — просто нормализуй одну матрицу

LoRA — стандарт для дообучения LLM, но его оптимизационная динамика плохо изучена. Авторы заметили: матрица A в LoRA (down-projection) имеет произвольные нормы столбцов, что создаёт дисбаланс при проецировании входа в латентное пространство.

Идея NoRA проста: нормализуй каждый столбец матрицы A по rank-размерности. Вместо BAx получаем B·Norm(A)x. Нормализация зависит только от параметров, а не от входа — поэтому преобразование остаётся линейным и матрицы можно сливать обратно в веса после обучения (как в обычном LoRA).

Бонус: NoRA-init — вариант только для инициализации, без нормализации во время обучения. Работает почти так же хорошо.

Результат: лучшая сходимость, стабильность и меньше катастрофического забывания — на pretraining, SFT и RLVR. При этом никакого SVD, как в PiSSA/MiLoRA.

https://arxiv.org/abs/2608.31036
Учитель не нужен: OPD улучшает модель не потому, что учит у учителя

Метод On-Policy Distillation (OPD) — популярный способ улучшить рассуждения LLM через дистилляцию от более сильной модели. Авторы решили разобраться, а реально ли студент учится у учителя?

Оказалось: нет. Учительский сигнал крайне зашумлён — у модели Qwen3-235B около 50% токенов получают неверный знак преимущества. При этом обучение только на "шумных" примерах даёт ту же точность, что и стандартный OPD. Студент просто игнорирует смысл сигнала учителя.

Тогда что реально работает? Два наблюдения:
1. Улучшение идёт от токенов с низкой вероятностью (low-logp)
2. Достаточно фиксированного отрицательного преимущества — без учителя вообще

Авторы предложили OPSA: метод без учителя, который подавляет "хвостовые" токены, адаптируя силу сигнала через энтропию позиции. На Qwen3-1.7B — прирост Avg@32 на 263–307% относительно базовой модели.

https://arxiv.org/abs/2608.31046
Сжать историю чата в вектора и читать их напрямую — без восстановления текста

Когда LLM-агент работает долго, контекст разрастается до неприличных размеров. Обычный выход — резюмировать или обрезать текст. LatentPress предлагает другой путь: сжать историю в непрерывные «мягкие токены» и скормить их замороженной LLM напрямую, минуя любое восстановление текста.

Ключевая идея: разделить на WRITE (маленький адаптер ~0.1% параметров декодера кодирует контекст в векторы) и READ (замороженный декодер читает эти векторы как обычные эмбеддинги). Для диалогов — разные степени сжатия по ролям: реплики пользователя не сжимаются, ответы ассистента — в 8–32 раза.

Результат: 4.6–7.7× сжатие при сохранении ~0.5 accuracy на LongMemEval, инференс в 5–9× быстрее, запись истории — 43 мс. Похоже на xRAG и ICAE, но без файнтюнинга ридера и без декодирования обратно в текст.

https://arxiv.org/abs/2609.01507
Iris: поисковый агент, который учится искать лучше с каждым циклом

Хорошая языковая модель — ещё не хороший поисковый агент. Нужно уметь решать многошаговые задачи в интернете, где ответ разбросан по десяткам страниц.

Iris от AllSpark Research — это end-to-end рецепт обучения таких агентов. Ключевые идеи:

1. Данные генерируются автоматически из структуры веб-графа: берём страницу, строим граф сущностей, генерируем многошаговый вопрос и заменяем все прямые "подсказки" на описательные отсылки — чтобы модель не могла схитрить простым поиском по строке.

2. Траектории от учителя фильтруются на двух уровнях: целиком (правильность, глубина, отсутствие петель) и пооборотно (LLM-судья маскирует плохие ходы, но не выбрасывает их из контекста).

3. SFT и RL чередуются итеративно: удачные траектории из RL-роллаутов идут обратно в SFT следующего цикла.

В итоге Iris-mini и Iris-pro бьют все open-source агенты на BrowseComp, DeepSearchQA и HLE.

https://arxiv.org/abs/2609.04304
RLVR делает модели умнее, но "забывает" альтернативные пути решения

(by University of Birmingham)

RLVR-обучение (PPO, GRPO) резко улучшает точность математических рассуждений — но ценой разнообразия решений. Авторы выяснили, ГДЕ именно теряются альтернативные пути.

Ключевое разделение: "доступ" (начало пути решения) vs "исполнение" (дальнейшие шаги). На задаче Countdown, где можно перебрать ВСЕ валидные решения, оказалось:

— При PPO точность выросла в 50 раз, но покрытие решений упало с 0.337 до 0.111
— Проблема концентрируется на ПЕРВОМ шаге: сдвиг вероятностей перед первой арифметической операцией в 16x больше, чем во всех последующих шагах
— Если принудительно дать модели "начало" забытого пути — она отлично его завершает!

Лечение: интерполяция весов поздних слоёв (20-28) с ранним чекпоинтом возвращает 37% покрытия без потери точности. SFT-модели сохраняют вдвое больше разнообразия.

https://arxiv.org/abs/2608.29188
Мультиагентные LLM наконец получили математику

Все знают, что системы типа AutoGen или MetaGPT работают, но никто не понимал — почему, когда они сходятся, и почему иногда застревают. Авторы дают первый строгий теоретический фундамент.

Ключевые идеи:
1. Оркестратор + воркеры — это билинейная игра координации. Качество декомпозиции задачи напрямую определяет, насколько близко воркеры сойдутся к Nash-равновесию.

2. Свободная рефлексия (Reflexion-style) может плато — и это доказуемо. Без внешнего верификатора даже идеальный текстовый судья не может гарантировать улучшение.

3. Авторы вводят SRMA: новая память коммитится только если внешний верификатор подтверждает снижение ошибки. Это даёт геометрическую сходимость.

Практический результат: Kimi-based система на SWE-bench — 72.2% (361/500), против 70.8% у публичного mini-SWE-agent v2.

https://arxiv.org/abs/2609.02750
👍1
MaxKernel: Агент для написания TPU-ядер (by Google)

LLM пишет быстрее человека низкоуровневый код для TPU? Звучит фантастически, но Google сделали именно это.

MaxKernel — мультиагентный фреймворк для автоматической генерации и оптимизации JAX/Pallas ядер под TPU. Внутри — специализированные субагенты: планировщик, кодогенератор, тестировщик, автотюнер и профилировщик (через XProf). Всё замкнуто в петлю: сгенерировал → скомпилировал → протестировал → профилировал → улучшил.

Три режима работы: с человеком в петле (HITL), полностью автономный и граф-поиск по пространству конфигураций (beam search и др.).

Результаты впечатляют: 1.58× ускорение на JAXBench, а на 8 продакшн-ядрах — 2.32× против референсного кода и 2.02× против написанного людьми вручную.

RAG с документацией по Pallas/Mosaic/XLA помогает агентам разбираться в железе без примеров человеческого кода.

https://arxiv.org/abs/2609.04523
OPD работает даже на одном примере — и вот почему

Оказывается, для on-policy дистилляции (OPD) не нужны тысячи обучающих примеров. Один единственный запрос восстанавливает большую часть разрыва между студентом и учителем — и это работает на четырёх доменах и трёх семействах моделей.

Почему? Авторы вводят понятие "покрытия состояний": каждый запрос порождает множество префиксов (состояний), на которых учитель даёт токен-уровневую обратную связь. Один запрос покрывает 71.5% состояний, которые посещает полный датасет. 16 семантически разнообразных запросов — уже 98.9%.

Главный вывод: OPD data-overfed но algorithm-starved. Данных достаточно с первых шагов, а вот скорость "поглощения" сигнала студентом падает одинаково — хоть на 1 запросе, хоть на 17k.

Бонус: даже бессмысленные шаблоны без задачи работают почти так же хорошо — главное, чтобы студент начал рассуждать.

https://arxiv.org/abs/2609.04172
NeoHorse-1: модель, которая сама себя улучшает через агентный роутинг

Идея рекурсивного самоулучшения AI звучит красиво, но как это реализовать конкретно? NeoHorse-1 предлагает механизм: агент выполняет задачи в харнессе (execution layer с инструментами), оставляет траектории взаимодействий, роутер оценивает сложность каждого запроса — и всё это превращается в обучающие данные для следующей итерации.

Ключевые компоненты: curriculum learning на основе routing-скоров (сначала простые примеры, потом сложные), on-policy distillation где учитель supervises ответы самого студента, а не фиксированные траектории, и feedback loop — обновлённая модель возвращается в харнесс, её новые слабые места определяют следующий датасет.

Результат: 4B модель поднялась с 58.94 до 64.87 macro-average по агентным бенчмаркам, а 9B — с 65.60 до 69.04. Самые большие gains на harness-based задачах. Это первый прототип, авторы планируют масштабировать итерации дальше.

https://arxiv.org/abs/2609.08183
DriveZero: автопилот, который превзошёл человека без единой человеческой траектории

Обычно end-to-end системы вождения учатся имитировать записи человека-водителя. Проблема: одна сцена — одна реализованная траектория, редкие аварийные ситуации почти не встречаются, и политика деградирует, выходя за пределы обучающих данных.

DriveZero разрывает эту зависимость через три шага:

1. DriveRL — привилегированный агент обучается с нуля через PPO в 196k параллельных симулированных мирах (без имитации!), превосходя log-replay эксперта на nuPlan.

2. DriveVFM — визуальный энкодер дистиллируется из замороженных фундаментальных моделей (DINOv3, SigLIP2, SAM, Depth Anything v2) без разметки.

3. DriveZero — камерная политика учится на роллаутах DriveRL, а не на человеческих траекториях. Goal-conditioned аугментация даёт разнообразные цели из одной сцены.

Результат: 95.3 PDMS на NAVSIMv1 — выше человека (94.8) и нового SOTA на NAVSIMv2 и HUGSIM.

https://arxiv.org/abs/2609.06055
World-Action модель для роботов: чем больше данных — тем лучше (by AgiBot World)

Классические VLA-политики учат маппинг наблюдение → действие, не моделируя физику. World-Action Models (WAM) сначала предсказывают, как изменится сцена, а потом извлекают действия. GE-Act 2.0 делает это с нуля, без готовых видео-генераторов.

Ключевые идеи:
1. Разделённое предобучение: visual planner учится на видео без меток действий, inverse dynamics model — на траекториях без языковых инструкций. Потом всё соединяется.
2. CoAE — компактный автоэнкодер, заточенный под управление, а не под качество картинки.
3. KASO решает "validity gap": когда предсказанное будущее не совпадает с записанным действием, модель выбирает только совместимые пары.

Результат: масштабирование с 300 до 30 000 часов данных поднимает zero-shot OOD успех с 17% до 44% на 100 реальных задачах — без файн-тюнинга под конкретные задачи.

https://arxiv.org/abs/2609.05588
OpenAI показала, как исследователь из MIT использует GPT-5.6 Sol вместе с Codex для автономного проведения квантовых вычислительных экспериментов. Система сама запускает опыты, анализирует результаты и калибрует кубиты — без постоянного участия человека.

Это важно: квантовые эксперименты требуют сложной итеративной настройки, которая раньше отнимала часы ручной работы. Теперь ИИ берёт на себя рутинный цикл "запустил — проверил — подстроил", ускоряя исследования.

Для учёных это означает возможность сосредоточиться на гипотезах, а не на операционной рутине. Связка мощной языковой модели с инструментом для работы с кодом превращает ИИ в полноценного лабораторного ассистента.

https://openai.com/index/codex-quantum-computing-experiments
Google DeepMind представила AlphaGenome Atlas — предсказательную карту всех возможных изменений ДНК в геноме человека.

Модель AlphaGenome анализирует, как каждая возможная мутация в ДНК влияет на работу генов. Это колоссальный объём данных: в геноме человека около 3 миллиардов пар оснований, и каждая может измениться тремя способами.

Почему это важно? Большинство генетических заболеваний вызваны именно точечными мутациями. Раньше учёным приходилось годами экспериментировать, чтобы понять последствия одного изменения. Теперь Atlas даёт готовые предсказания для всего генома сразу.

Это ускорит поиск причин редких болезней, разработку генных терапий и персонализированной медицины. По сути, DeepMind создала атлас последствий всех возможных генетических вариантов — инструмент, который раньше просто не существовал.

https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/
Nvidia — CUDA Rust: пишем GPU-ядра на Rust

Nvidia представила CUDA Rust — два инструмента для написания GPU-ядер прямо на Rust, без C++.

Первый — cuda-oxide — компилирует Rust-код в PTX через кастомный бэкенд rustc. Требует nightly-тулчейн и LLVM, пока в альфе.

Второй — cutile-rs — работает на стабильном Rust 1.89+ с CUDA 13.3, уже опубликован на crates.io и используется в движках HuggingFace Grout и mistral.rs.

Оба инструмента гарантируют память-безопасность на этапе компиляции — никаких гонок и алиасинга.

Почему это важно: всё больше AI-инфраструктуры (inference, serving, агентные рантаймы) пишется на Rust. Раньше GPU-ядра оставались исключением — теперь нет.

NVIDIA планирует поддержку interop между CUDA Rust, C++ и Python, так что выбор языка не закроет доступ к другим экосистемам.

https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/