InhumanScience
106 subscribers
716 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Nvidia Tech запускает мощный AI на устройствах без интернета.

Компания показала, как запускать современные reasoning-модели прямо на Jetson — компактных edge-устройствах. Раньше многошаговые рассуждения требовали дата-центра, теперь это работает локально.

Протестированы две модели: Nemotron 3.5 Lightning (MoE, 30B параметров, активирует только 3B) и Qwen3.8-27B (dense, все 27B). Первая быстрее генерирует токены, вторая лучше для сложных решений.

Ключевые оптимизации — NVFP4-квантизация и speculative decoding — вместе дают до 6.28x прироста скорости по сравнению с BF16.

Зачем это важно: роботы, бортовые ассистенты, промышленный мониторинг — всё это теперь работает без облака. Меньше задержек, ниже стоимость, данные остаются на устройстве.

https://developer.nvidia.com/blog/frontier-reasoning-reaches-the-edge-how-to-deploy-and-optimize-models-on-nvidia-jetson/
Nvidia представила PAIR — виртуальный роутер для локального AI-инференса

NVIDIA Personal AI Router (PAIR) решает проблему очередей при мультиагентных задачах: вместо того чтобы гонять все запросы через один GPU, он распределяет их по доступным устройствам в домашней сети.

Работает с Ollama и LM Studio без каких-либо изменений в агентах. Поддерживаются видеокарты GeForce RTX 20-й серии и новее, RTX PRO, DGX Spark и Apple M4+.

На практике: задача с пятью субагентами на одном RTX Spark заняла 18 минут. Кластер из трёх устройств справился за 8 минут 48 секунд.

Безопасность обеспечивается через mDNS-обнаружение и MTLS-шифрование. Устройства могут подключаться и отключаться динамически — PAIR учитывает загрузку GPU и наличие нужной модели на каждом узле.

PAIR доступен в бета-версии для Windows, macOS и Linux. Проект открытый.

https://developer.nvidia.com/blog/nvidia-pair-virtual-inference-router-expands-available-compute-on-your-local-network/
NeoMME: один трансформер для текста и картинок без отдельных башен (by H company)

Большинство мультимодальных моделей для поиска используют раздельные энкодеры для текста и изображений (как CLIP). NeoMME идёт другим путём: один двунаправленный трансформер обрабатывает и текстовые токены, и сырые патчи изображений 32×32 пикселя через общие слои.

Обучение с нуля на смеси текста, кода, математики, естественных и документных изображений. Вместо обычного MLM используется masked discrete diffusion, а для мультимодальных примеров — текстовый денойзинг, обусловленный патчами изображения.

На выходе модель даёт и dense-вектор, и late-interaction представление из одного прохода. 260M модель обрабатывает страницы 2048×2048 со скоростью 51 стр/сек на L40S. Хитрость со сжатием: hierarchical pooling + int8/binary квантизация сжимают эмбеддинг в 255 раз при сохранении 95% качества поиска.

https://arxiv.org/abs/2609.01657
LoRA стал лучше — просто нормализуй одну матрицу

LoRA — стандарт для дообучения LLM, но его оптимизационная динамика плохо изучена. Авторы заметили: матрица A в LoRA (down-projection) имеет произвольные нормы столбцов, что создаёт дисбаланс при проецировании входа в латентное пространство.

Идея NoRA проста: нормализуй каждый столбец матрицы A по rank-размерности. Вместо BAx получаем B·Norm(A)x. Нормализация зависит только от параметров, а не от входа — поэтому преобразование остаётся линейным и матрицы можно сливать обратно в веса после обучения (как в обычном LoRA).

Бонус: NoRA-init — вариант только для инициализации, без нормализации во время обучения. Работает почти так же хорошо.

Результат: лучшая сходимость, стабильность и меньше катастрофического забывания — на pretraining, SFT и RLVR. При этом никакого SVD, как в PiSSA/MiLoRA.

https://arxiv.org/abs/2608.31036
Учитель не нужен: OPD улучшает модель не потому, что учит у учителя

Метод On-Policy Distillation (OPD) — популярный способ улучшить рассуждения LLM через дистилляцию от более сильной модели. Авторы решили разобраться, а реально ли студент учится у учителя?

Оказалось: нет. Учительский сигнал крайне зашумлён — у модели Qwen3-235B около 50% токенов получают неверный знак преимущества. При этом обучение только на "шумных" примерах даёт ту же точность, что и стандартный OPD. Студент просто игнорирует смысл сигнала учителя.

Тогда что реально работает? Два наблюдения:
1. Улучшение идёт от токенов с низкой вероятностью (low-logp)
2. Достаточно фиксированного отрицательного преимущества — без учителя вообще

Авторы предложили OPSA: метод без учителя, который подавляет "хвостовые" токены, адаптируя силу сигнала через энтропию позиции. На Qwen3-1.7B — прирост Avg@32 на 263–307% относительно базовой модели.

https://arxiv.org/abs/2608.31046
Сжать историю чата в вектора и читать их напрямую — без восстановления текста

Когда LLM-агент работает долго, контекст разрастается до неприличных размеров. Обычный выход — резюмировать или обрезать текст. LatentPress предлагает другой путь: сжать историю в непрерывные «мягкие токены» и скормить их замороженной LLM напрямую, минуя любое восстановление текста.

Ключевая идея: разделить на WRITE (маленький адаптер ~0.1% параметров декодера кодирует контекст в векторы) и READ (замороженный декодер читает эти векторы как обычные эмбеддинги). Для диалогов — разные степени сжатия по ролям: реплики пользователя не сжимаются, ответы ассистента — в 8–32 раза.

Результат: 4.6–7.7× сжатие при сохранении ~0.5 accuracy на LongMemEval, инференс в 5–9× быстрее, запись истории — 43 мс. Похоже на xRAG и ICAE, но без файнтюнинга ридера и без декодирования обратно в текст.

https://arxiv.org/abs/2609.01507
Iris: поисковый агент, который учится искать лучше с каждым циклом

Хорошая языковая модель — ещё не хороший поисковый агент. Нужно уметь решать многошаговые задачи в интернете, где ответ разбросан по десяткам страниц.

Iris от AllSpark Research — это end-to-end рецепт обучения таких агентов. Ключевые идеи:

1. Данные генерируются автоматически из структуры веб-графа: берём страницу, строим граф сущностей, генерируем многошаговый вопрос и заменяем все прямые "подсказки" на описательные отсылки — чтобы модель не могла схитрить простым поиском по строке.

2. Траектории от учителя фильтруются на двух уровнях: целиком (правильность, глубина, отсутствие петель) и пооборотно (LLM-судья маскирует плохие ходы, но не выбрасывает их из контекста).

3. SFT и RL чередуются итеративно: удачные траектории из RL-роллаутов идут обратно в SFT следующего цикла.

В итоге Iris-mini и Iris-pro бьют все open-source агенты на BrowseComp, DeepSearchQA и HLE.

https://arxiv.org/abs/2609.04304
RLVR делает модели умнее, но "забывает" альтернативные пути решения

(by University of Birmingham)

RLVR-обучение (PPO, GRPO) резко улучшает точность математических рассуждений — но ценой разнообразия решений. Авторы выяснили, ГДЕ именно теряются альтернативные пути.

Ключевое разделение: "доступ" (начало пути решения) vs "исполнение" (дальнейшие шаги). На задаче Countdown, где можно перебрать ВСЕ валидные решения, оказалось:

— При PPO точность выросла в 50 раз, но покрытие решений упало с 0.337 до 0.111
— Проблема концентрируется на ПЕРВОМ шаге: сдвиг вероятностей перед первой арифметической операцией в 16x больше, чем во всех последующих шагах
— Если принудительно дать модели "начало" забытого пути — она отлично его завершает!

Лечение: интерполяция весов поздних слоёв (20-28) с ранним чекпоинтом возвращает 37% покрытия без потери точности. SFT-модели сохраняют вдвое больше разнообразия.

https://arxiv.org/abs/2608.29188
Мультиагентные LLM наконец получили математику

Все знают, что системы типа AutoGen или MetaGPT работают, но никто не понимал — почему, когда они сходятся, и почему иногда застревают. Авторы дают первый строгий теоретический фундамент.

Ключевые идеи:
1. Оркестратор + воркеры — это билинейная игра координации. Качество декомпозиции задачи напрямую определяет, насколько близко воркеры сойдутся к Nash-равновесию.

2. Свободная рефлексия (Reflexion-style) может плато — и это доказуемо. Без внешнего верификатора даже идеальный текстовый судья не может гарантировать улучшение.

3. Авторы вводят SRMA: новая память коммитится только если внешний верификатор подтверждает снижение ошибки. Это даёт геометрическую сходимость.

Практический результат: Kimi-based система на SWE-bench — 72.2% (361/500), против 70.8% у публичного mini-SWE-agent v2.

https://arxiv.org/abs/2609.02750
👍1
MaxKernel: Агент для написания TPU-ядер (by Google)

LLM пишет быстрее человека низкоуровневый код для TPU? Звучит фантастически, но Google сделали именно это.

MaxKernel — мультиагентный фреймворк для автоматической генерации и оптимизации JAX/Pallas ядер под TPU. Внутри — специализированные субагенты: планировщик, кодогенератор, тестировщик, автотюнер и профилировщик (через XProf). Всё замкнуто в петлю: сгенерировал → скомпилировал → протестировал → профилировал → улучшил.

Три режима работы: с человеком в петле (HITL), полностью автономный и граф-поиск по пространству конфигураций (beam search и др.).

Результаты впечатляют: 1.58× ускорение на JAXBench, а на 8 продакшн-ядрах — 2.32× против референсного кода и 2.02× против написанного людьми вручную.

RAG с документацией по Pallas/Mosaic/XLA помогает агентам разбираться в железе без примеров человеческого кода.

https://arxiv.org/abs/2609.04523
OPD работает даже на одном примере — и вот почему

Оказывается, для on-policy дистилляции (OPD) не нужны тысячи обучающих примеров. Один единственный запрос восстанавливает большую часть разрыва между студентом и учителем — и это работает на четырёх доменах и трёх семействах моделей.

Почему? Авторы вводят понятие "покрытия состояний": каждый запрос порождает множество префиксов (состояний), на которых учитель даёт токен-уровневую обратную связь. Один запрос покрывает 71.5% состояний, которые посещает полный датасет. 16 семантически разнообразных запросов — уже 98.9%.

Главный вывод: OPD data-overfed но algorithm-starved. Данных достаточно с первых шагов, а вот скорость "поглощения" сигнала студентом падает одинаково — хоть на 1 запросе, хоть на 17k.

Бонус: даже бессмысленные шаблоны без задачи работают почти так же хорошо — главное, чтобы студент начал рассуждать.

https://arxiv.org/abs/2609.04172
NeoHorse-1: модель, которая сама себя улучшает через агентный роутинг

Идея рекурсивного самоулучшения AI звучит красиво, но как это реализовать конкретно? NeoHorse-1 предлагает механизм: агент выполняет задачи в харнессе (execution layer с инструментами), оставляет траектории взаимодействий, роутер оценивает сложность каждого запроса — и всё это превращается в обучающие данные для следующей итерации.

Ключевые компоненты: curriculum learning на основе routing-скоров (сначала простые примеры, потом сложные), on-policy distillation где учитель supervises ответы самого студента, а не фиксированные траектории, и feedback loop — обновлённая модель возвращается в харнесс, её новые слабые места определяют следующий датасет.

Результат: 4B модель поднялась с 58.94 до 64.87 macro-average по агентным бенчмаркам, а 9B — с 65.60 до 69.04. Самые большие gains на harness-based задачах. Это первый прототип, авторы планируют масштабировать итерации дальше.

https://arxiv.org/abs/2609.08183
DriveZero: автопилот, который превзошёл человека без единой человеческой траектории

Обычно end-to-end системы вождения учатся имитировать записи человека-водителя. Проблема: одна сцена — одна реализованная траектория, редкие аварийные ситуации почти не встречаются, и политика деградирует, выходя за пределы обучающих данных.

DriveZero разрывает эту зависимость через три шага:

1. DriveRL — привилегированный агент обучается с нуля через PPO в 196k параллельных симулированных мирах (без имитации!), превосходя log-replay эксперта на nuPlan.

2. DriveVFM — визуальный энкодер дистиллируется из замороженных фундаментальных моделей (DINOv3, SigLIP2, SAM, Depth Anything v2) без разметки.

3. DriveZero — камерная политика учится на роллаутах DriveRL, а не на человеческих траекториях. Goal-conditioned аугментация даёт разнообразные цели из одной сцены.

Результат: 95.3 PDMS на NAVSIMv1 — выше человека (94.8) и нового SOTA на NAVSIMv2 и HUGSIM.

https://arxiv.org/abs/2609.06055
World-Action модель для роботов: чем больше данных — тем лучше (by AgiBot World)

Классические VLA-политики учат маппинг наблюдение → действие, не моделируя физику. World-Action Models (WAM) сначала предсказывают, как изменится сцена, а потом извлекают действия. GE-Act 2.0 делает это с нуля, без готовых видео-генераторов.

Ключевые идеи:
1. Разделённое предобучение: visual planner учится на видео без меток действий, inverse dynamics model — на траекториях без языковых инструкций. Потом всё соединяется.
2. CoAE — компактный автоэнкодер, заточенный под управление, а не под качество картинки.
3. KASO решает "validity gap": когда предсказанное будущее не совпадает с записанным действием, модель выбирает только совместимые пары.

Результат: масштабирование с 300 до 30 000 часов данных поднимает zero-shot OOD успех с 17% до 44% на 100 реальных задачах — без файн-тюнинга под конкретные задачи.

https://arxiv.org/abs/2609.05588
OpenAI показала, как исследователь из MIT использует GPT-5.6 Sol вместе с Codex для автономного проведения квантовых вычислительных экспериментов. Система сама запускает опыты, анализирует результаты и калибрует кубиты — без постоянного участия человека.

Это важно: квантовые эксперименты требуют сложной итеративной настройки, которая раньше отнимала часы ручной работы. Теперь ИИ берёт на себя рутинный цикл "запустил — проверил — подстроил", ускоряя исследования.

Для учёных это означает возможность сосредоточиться на гипотезах, а не на операционной рутине. Связка мощной языковой модели с инструментом для работы с кодом превращает ИИ в полноценного лабораторного ассистента.

https://openai.com/index/codex-quantum-computing-experiments
Google DeepMind представила AlphaGenome Atlas — предсказательную карту всех возможных изменений ДНК в геноме человека.

Модель AlphaGenome анализирует, как каждая возможная мутация в ДНК влияет на работу генов. Это колоссальный объём данных: в геноме человека около 3 миллиардов пар оснований, и каждая может измениться тремя способами.

Почему это важно? Большинство генетических заболеваний вызваны именно точечными мутациями. Раньше учёным приходилось годами экспериментировать, чтобы понять последствия одного изменения. Теперь Atlas даёт готовые предсказания для всего генома сразу.

Это ускорит поиск причин редких болезней, разработку генных терапий и персонализированной медицины. По сути, DeepMind создала атлас последствий всех возможных генетических вариантов — инструмент, который раньше просто не существовал.

https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/
Nvidia — CUDA Rust: пишем GPU-ядра на Rust

Nvidia представила CUDA Rust — два инструмента для написания GPU-ядер прямо на Rust, без C++.

Первый — cuda-oxide — компилирует Rust-код в PTX через кастомный бэкенд rustc. Требует nightly-тулчейн и LLVM, пока в альфе.

Второй — cutile-rs — работает на стабильном Rust 1.89+ с CUDA 13.3, уже опубликован на crates.io и используется в движках HuggingFace Grout и mistral.rs.

Оба инструмента гарантируют память-безопасность на этапе компиляции — никаких гонок и алиасинга.

Почему это важно: всё больше AI-инфраструктуры (inference, serving, агентные рантаймы) пишется на Rust. Раньше GPU-ядра оставались исключением — теперь нет.

NVIDIA планирует поддержку interop между CUDA Rust, C++ и Python, так что выбор языка не закроет доступ к другим экосистемам.

https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/
AuK: один голосовой движок вместо десяти (by Tencent Hunyuan)

Зачем держать отдельные модели для TTS, редактирования эмоций, шумоподавления и клонирования голоса, если можно одну?

AuK — это единая open-source модель, которая по текстовой инструкции делает всё сразу: синтез речи, правку акустики (темп, громкость, питч), смену эмоций и акцента, редактирование слов прямо в аудио, разделение и улучшение звука.

Архитектура: MLLM-энкодер для семантики + аудио VAE + гибридный flow-трансформер с dual-stream MMDiT блоками. Обучение в два этапа: unified pre-training на 1.95 млн часов аудио, затем post-training с RLHF для редактирования и Flow-GRPO для генерации.

Бонус: дистиллированная версия AuK-Flash делает инференс за 4 шага без CFG — в 4.5× быстрее учителя. Код и веса открыты.

https://arxiv.org/abs/2609.08936
Что нужно роботу, чтобы не просто видеть мир, но и действовать в нём?

Команда OpenWAM предлагает систематический подход к обучению World-Action Models (WAM) — моделей, которые наследуют знания о динамике мира из видеогенерации, а затем учатся управлять действиями через робототехнический опыт.

Три ключевых вопроса, на которые отвечает статья:
1. Какие знания о мире должна наследовать WAM?
2. Как создать синергию между моделированием мира и генерацией действий?
3. Как масштабировать это на разные домены?

Главные находки: синергия мира и действий возникает не из размера модели, а из правильного потока информации и совместного расписания денойзинга. Pretrain на эгоцентрическом видео людей + роботных траекториях даёт лучшую OOD-генерализацию.

Результат — OpenWAM-α, обученная на 518M кадров (~6400 часов), оценённая на 8 симуляционных бенчмарках и реальных роботах. Всё открыто: веса, инфраструктура, данные.

https://arxiv.org/abs/2609.07398
Игровой движок из одного промпта — теперь реально?

Представьте: вы описываете мир словами, а система сама строит интерактивную сцену с правилами, физикой и состоянием объектов. Именно это предлагает Programmable World Model.

Ключевая идея — разделить два процесса: эволюцию состояния мира и генерацию видео. Coding agent переводит инструкции пользователя в исполняемый код, который управляет сущностями через 3D oriented bounding boxes (OBB). Затем state compiler проецирует эти боксы в пиксельные контролы, а видеомодель рендерит детали — анимацию, физику, внешний вид.

Зачем OBB, а не полные 3D-сцены? Компромисс: текст слишком абстрактен, полная геометрия слишком дорога в аннотации и порождает train/inference mismatch. OBB — золотая середина: задаёт позицию и ориентацию объекта в мировых координатах, не требуя меша или скелета.

Плюс авторы представили CombatStateBench — бенчмарк, проверяющий, совпадает ли то, что видно в видео, с состоянием движка (живые/мёртвые персонажи).

https://arxiv.org/abs/2609.10540
Nvidia Tech запустила EPD-disaggregation для мультимодального AI

Nvidia представила технику оптимизации инференса для мультимодальных моделей — encode-prefill-decode (EPD) disaggregation в фреймворке Dynamo. Суть: визуальное кодирование изображений теперь выполняется отдельно от LLM-обработки, а не в одной очереди.

Что это даёт на практике: до 5x быстрее время до первого токена и до 7x быстрее общее время ответа при работе с изображениями. Текстовые запросы в смешанном трафике тоже ускоряются на 42% — они больше не стоят в очереди за тяжёлыми мультимодальными запросами.

Особенно эффективно для запросов с несколькими изображениями или видео, коротких и средних ответов, а также квантизированных MoE-моделей. При квантизации весов до NVFP4 прирост производительности вырастает с 1.78x до 2.64x.

Важно: для длинных генераций и больших плотных моделей выигрыш минимален — там декодирование всё равно доминирует по времени.

https://developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving/