InhumanScience
106 subscribers
716 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Nvidia Tech обновила CUDA-инструментарий и опубликовала подробный гайд по оптимизации GPU-кода.

Разработчики показали, как за шесть шагов ускорить типичный пайплайн обработки изображений в 300 раз — с 6,8 секунд до 23 миллисекунд.

Что конкретно даёт прирост: замена ручных ядер на библиотеку CUB ускоряет вычисление медианы в 2717 раз. Pooled-буферы cuda::device_buffer сокращают накладные расходы на аллокацию памяти вдвое. Pinned-память для хоста ускоряет передачу данных CPU→GPU в 10 раз. Асинхронные потоки на каждый OpenMP-поток перекрывают вычисления и передачи данных.

Почему это важно: современные AI-модели и научные симуляции упираются именно в эффективность GPU-кода. Теперь у разработчиков есть пошаговый рецепт с конкретными цифрами и готовыми примерами на Google Colab.

https://developer.nvidia.com/blog/the-modern-cuda-toolbox-in-practice-a-step-by-step-optimization-walkthrough/
Как научить AI-агента делать ML-исследования, не тратя бюджет на пробы и ошибки? (by BAAI)

Авторы заметили: у автономных research-агентов есть модель и оркестратор, но нет третьего слоя — операционных знаний. Это разница между "знать про метод" и "уметь его запустить": какой API, какой конфиг, какие подводные камни.

Решение — система DisCo. Она берёт GitHub-репозитории и статьи, и автоматически дистиллирует их в "скиллы": компактные SKILL.md файлы с описанием что делать, когда применять и как использовать. Скилл верифицируется перед добавлением в библиотеку.

Результат — AREX-Skill Library: 5000+ скиллов из 1000 ML-репозиториев. Агент с этой библиотекой показал +134% на MLE-bench, +34% на PaperBench при том же backbone (GPT-5.5) и том же бюджете выполнения.

https://arxiv.org/abs/2609.02749
Random Attention: зачем вообще считать важность токенов? (by Salesforce AI)

KV cache у reasoning-моделей растёт на десятки тысяч токенов. Все методы сжатия соревнуются в том, какой токен "важнее" — накопленное внимание, норма значений, позиционная статистика...

Авторы спрашивают: а что если просто выкидывать случайно?

Random Attention: защищаем промпт целиком, остальное — равномерно случайная выборка, независимо в каждой голове. Никакого скоринга вообще.

Результат: на 4× сжатии точность не хуже лучших конкурентов, а throughput на 32–43% выше (нет прохода скоринга).

Почему это работает? Два механизма: 1) reasoning-трасса сама себя защищает — модель переформулирует то, что ещё нужно; 2) каждая голова хранит свою копию токена, случайная выборка сохраняет достаточно копий нужного факта.

Вывод: сигнал отбора почти ничего не даёт сверх случайного. Важно что защищать, а не как ранжировать остальное.

https://arxiv.org/abs/2609.03430
Гибридная LLM: зачем защищать то, что и так безопасно?

В гибридной Qwen3.8-27B 48 из 64 слоёв — это Gated DeltaNet (рекуррентные слои), а не обычный attention. Все публичные 4-битные квантизации держат гейты GDN в 8-16 бит, считая их "хрупкими": ошибка в рекуррентном состоянии накапливается через тысячи токенов. Авторы из Minima AI показали, что интуиция неверна.

Они заквантизировали все 496 линейных слоёв модели в NVFP4 W4A4, включая гейты — и точность не упала. Почему? Цепочка из четырёх причин: блочное масштабирование NVFP4 изолирует выбросы, нелинейности в гейтах (exp + softplus) сжимают ошибку, дельта-правило активно стирает ошибки состояния, а длинный контекст дополнительно "размывает" остаточный gap.

Бонус: модель на 2.9× меньше по VRAM, на 14-19% быстрее prefill — при том же качестве на бенчмарках.

https://arxiv.org/abs/2609.04098
Google DeepMind представил WeatherNext 3 — самую точную AI-модель прогноза погоды на сегодняшний день.

Что нового: модель обновляет прогнозы каждый час, используя данные со спутников в реальном времени. Разрешение выросло в 5 раз по сравнению с предыдущей версией — до 5 км. Добавили точные прогнозы осадков и специальные переменные для солнечной и ветровой энергетики (скорость ветра на высоте турбин, уровень солнечного излучения).

Почему важно: прежние модели работали с шестичасовой задержкой и размытыми предсказаниями. WeatherNext 3 учится напрямую на реальных данных, а не на физических симуляциях — это меняет точность прогнозов для быстро меняющейся погоды.

Для пользователей: улучшенные прогнозы уже доступны в Google Search, Maps и Gemini. Разработчики могут подключить данные через Google Cloud.

https://deepmind.google/blog/introducing-weathernext-3-our-most-advanced-and-accurate-global-weather-ai-model/
Nvidia Tech ускорила вывод LLM через speculative decoding

Nvidia опубликовала третью часть серии по co-design AI-моделей — на этот раз про speculative decoding. Суть техники: маленькая черновая модель предлагает несколько токенов, большая целевая модель проверяет их параллельно за один проход. Итог — меньше итераций, выше скорость, качество не страдает.

Команда сформулировала 5 практических правил выбора длины черновика. Например, оптимальная длина при доминировании attention-слоёв считается по формуле 128/G − 1, где G — число query-голов на один KV-голову.

Для бенчмаркинга выпущен SPEED-Bench с реалистичными задачами (код, саммаризация). Готовые примеры обучения для EAGLE-3, DFlash и DSpark доступны в репозитории NVIDIA/Model-Optimizer.

Для разработчиков это конкретный инструментарий: меньше гадать с гиперпараметрами, больше опираться на измеримые метрики при деплое быстрых LLM.

https://developer.nvidia.com/blog/co-designing-ai-models-using-speculative-decoding-for-faster-llm-inference/
Apple ML представила REFACTOR-VLA — систему, которая учит роботов переиспользовать навыки.

Проблема существующих VLA-моделей (OpenVLA, RT-2 и др.) — они «монолитны»: генерируют сырые команды без структуры, из-за чего плохо справляются с длинными многошаговыми задачами.

REFACTOR-VLA работает по принципу «сон/бодрствование»: в фазе сна система кластеризует фрагменты моторных программ через специальное ядро поведенческой эквивалентности (BEK), опираясь на латентную модель мира. В фазе бодрствования — генерирует структурированные программы-навыки и использует их для управления роботом.

Ключевые находки на бенчмарке LIBERO: просто увеличить модель мира (с 188М до 430М параметров) — не помогает, а добавление InfoNCE-лосса резко улучшает качество кластеризации навыков (NMI до 0.915 на Goal suite).

Работа опубликована в сентябре 2026 года.

https://machinelearning.apple.com/research/refactor-vla-motor-programs
Terminal-Universe: как превратить логи агентов в среды для обучения (by Qwen/Alibaba)

Есть парадокс: агентных траекторий накопилось море, а реалистичных исполняемых сред для обучения — дефицит. Авторы предлагают инвертировать процесс: не среда → траектория, а траектория → среда.

Идея: в логах агента уже спрятана вся информация о рабочем пространстве. Read-вызовы показывают содержимое файлов, Write/Edit — что менялось. Значит, можно откатить правки агента и восстановить исходное состояние задачи!

Пайплайн Terminal-Universe:
1. Детерминированный replay файловых операций — получаем частичный workspace
2. Агент-дополнитель восстанавливает недостающие файлы без утечки решения

Затем на каждой среде генерируют новые задачи: одиночные, кросс-репозиторные и многораундовые. Из публичных траекторий получили 37.3k сред. Файн-тюнинг Qwen3.5-27B дал +11.9 на Terminal-Bench и +13.8 на EvoCode-Bench.

https://arxiv.org/abs/2609.04148
LLaDA-Image: открытый рецепт для генерации изображений на базе диффузионных LLM

Что если взять диффузионную языковую модель (dLLM) вместо классического текстового энкодера и построить на ней генератор изображений? Именно это сделали в inclusionAI с LLaDA-Image — 6B DiT, обученный с нуля и полностью открытый.

Ключевая идея: сначала учим визуальный prior на изображениях БЕЗ подписей (>90% данных — image-only), а языковое выравнивание добавляем позже. Это экономит данные и улучшает реализм на длинном горизонте.

Архитектура: dLLM-based VLM понимает промпты и визуальный контекст, коннектор передаёт это в single-stream DiT, а для редактирования референсное изображение подаётся напрямую в DiT, минуя VLM.

Плюс TwinFlow-дистилляция даёт Turbo-версию на 2–4 шага.

Выпущены веса, код и полные рецепты обучения — включая FP8-варианты.

https://arxiv.org/abs/2609.03796
Одна модель — и физика, и геометрия, и внешний вид мира сразу

Большинство генеративных world models работают только с пикселями, игнорируя, где именно в пространстве стоит камера и как устроена геометрия сцены. Puffin-World от ACE Robotics предлагает другой подход: моделировать мир через три нативных состояния одновременно — физику (гравитация, ориентация), геометрию (глубина) и внешний вид (RGB).

Ключевая идея — Omni-Camera representation: плотное представление камеры, которое совмещает абсолютную физическую ориентацию (привязанную к гравитации) с относительными лучевыми полями. Это позволяет избежать дрейфа ориентации при длинных траекториях. Добавляется механизм physics propagation — знания о физике из воспринятых кадров распространяются на будущие.

Обучали на Puffin-16M: 15M триплетов изображение-текст-камера и 1M сложных траекторий. Результат — SOTA на camera-to-world понимании на 4 бенчмарках, плюс controllable 3D-генерация и реконструкция в одной модели. Код, веса и датасет открыты.
Nvidia представила NemoClaw — фреймворк для создания агентов с долгосрочной памятью.

На его основе разработан агент Chief of Staff, который ведёт структурированную «модель себя»: хранит данные о людях, проектах, приоритетах и рабочих паттернах. Знания записываются в Markdown-страницы, а решения и корректировки — в отдельную SQLite-базу. Это позволяет агенту не путать факты с суждениями.

Ключевая фишка — приоритет реальных целей пользователя над сиюминутной срочностью. Агент учится на поправках: каждое исправление попадает в аудит-журнал и обновляет политику предпочтений, которую можно читать и редактировать вручную.

Результаты впечатляют: общая точность выросла с 82,8% до 90,9%, а отслеживание изменившихся фактов — с 60% до 100% по сравнению с обычным RAG-агентом.

Безопасность обеспечивает NVIDIA OpenShell — изолированная среда с контролем доступа к файлам, процессам и сети.

https://developer.nvidia.com/blog/building-a-memory-driven-agent-with-nvidia-nemoclaw/
Nvidia Tech запускает мощный AI на устройствах без интернета.

Компания показала, как запускать современные reasoning-модели прямо на Jetson — компактных edge-устройствах. Раньше многошаговые рассуждения требовали дата-центра, теперь это работает локально.

Протестированы две модели: Nemotron 3.5 Lightning (MoE, 30B параметров, активирует только 3B) и Qwen3.8-27B (dense, все 27B). Первая быстрее генерирует токены, вторая лучше для сложных решений.

Ключевые оптимизации — NVFP4-квантизация и speculative decoding — вместе дают до 6.28x прироста скорости по сравнению с BF16.

Зачем это важно: роботы, бортовые ассистенты, промышленный мониторинг — всё это теперь работает без облака. Меньше задержек, ниже стоимость, данные остаются на устройстве.

https://developer.nvidia.com/blog/frontier-reasoning-reaches-the-edge-how-to-deploy-and-optimize-models-on-nvidia-jetson/
Nvidia представила PAIR — виртуальный роутер для локального AI-инференса

NVIDIA Personal AI Router (PAIR) решает проблему очередей при мультиагентных задачах: вместо того чтобы гонять все запросы через один GPU, он распределяет их по доступным устройствам в домашней сети.

Работает с Ollama и LM Studio без каких-либо изменений в агентах. Поддерживаются видеокарты GeForce RTX 20-й серии и новее, RTX PRO, DGX Spark и Apple M4+.

На практике: задача с пятью субагентами на одном RTX Spark заняла 18 минут. Кластер из трёх устройств справился за 8 минут 48 секунд.

Безопасность обеспечивается через mDNS-обнаружение и MTLS-шифрование. Устройства могут подключаться и отключаться динамически — PAIR учитывает загрузку GPU и наличие нужной модели на каждом узле.

PAIR доступен в бета-версии для Windows, macOS и Linux. Проект открытый.

https://developer.nvidia.com/blog/nvidia-pair-virtual-inference-router-expands-available-compute-on-your-local-network/
NeoMME: один трансформер для текста и картинок без отдельных башен (by H company)

Большинство мультимодальных моделей для поиска используют раздельные энкодеры для текста и изображений (как CLIP). NeoMME идёт другим путём: один двунаправленный трансформер обрабатывает и текстовые токены, и сырые патчи изображений 32×32 пикселя через общие слои.

Обучение с нуля на смеси текста, кода, математики, естественных и документных изображений. Вместо обычного MLM используется masked discrete diffusion, а для мультимодальных примеров — текстовый денойзинг, обусловленный патчами изображения.

На выходе модель даёт и dense-вектор, и late-interaction представление из одного прохода. 260M модель обрабатывает страницы 2048×2048 со скоростью 51 стр/сек на L40S. Хитрость со сжатием: hierarchical pooling + int8/binary квантизация сжимают эмбеддинг в 255 раз при сохранении 95% качества поиска.

https://arxiv.org/abs/2609.01657
LoRA стал лучше — просто нормализуй одну матрицу

LoRA — стандарт для дообучения LLM, но его оптимизационная динамика плохо изучена. Авторы заметили: матрица A в LoRA (down-projection) имеет произвольные нормы столбцов, что создаёт дисбаланс при проецировании входа в латентное пространство.

Идея NoRA проста: нормализуй каждый столбец матрицы A по rank-размерности. Вместо BAx получаем B·Norm(A)x. Нормализация зависит только от параметров, а не от входа — поэтому преобразование остаётся линейным и матрицы можно сливать обратно в веса после обучения (как в обычном LoRA).

Бонус: NoRA-init — вариант только для инициализации, без нормализации во время обучения. Работает почти так же хорошо.

Результат: лучшая сходимость, стабильность и меньше катастрофического забывания — на pretraining, SFT и RLVR. При этом никакого SVD, как в PiSSA/MiLoRA.

https://arxiv.org/abs/2608.31036
Учитель не нужен: OPD улучшает модель не потому, что учит у учителя

Метод On-Policy Distillation (OPD) — популярный способ улучшить рассуждения LLM через дистилляцию от более сильной модели. Авторы решили разобраться, а реально ли студент учится у учителя?

Оказалось: нет. Учительский сигнал крайне зашумлён — у модели Qwen3-235B около 50% токенов получают неверный знак преимущества. При этом обучение только на "шумных" примерах даёт ту же точность, что и стандартный OPD. Студент просто игнорирует смысл сигнала учителя.

Тогда что реально работает? Два наблюдения:
1. Улучшение идёт от токенов с низкой вероятностью (low-logp)
2. Достаточно фиксированного отрицательного преимущества — без учителя вообще

Авторы предложили OPSA: метод без учителя, который подавляет "хвостовые" токены, адаптируя силу сигнала через энтропию позиции. На Qwen3-1.7B — прирост Avg@32 на 263–307% относительно базовой модели.

https://arxiv.org/abs/2608.31046
Сжать историю чата в вектора и читать их напрямую — без восстановления текста

Когда LLM-агент работает долго, контекст разрастается до неприличных размеров. Обычный выход — резюмировать или обрезать текст. LatentPress предлагает другой путь: сжать историю в непрерывные «мягкие токены» и скормить их замороженной LLM напрямую, минуя любое восстановление текста.

Ключевая идея: разделить на WRITE (маленький адаптер ~0.1% параметров декодера кодирует контекст в векторы) и READ (замороженный декодер читает эти векторы как обычные эмбеддинги). Для диалогов — разные степени сжатия по ролям: реплики пользователя не сжимаются, ответы ассистента — в 8–32 раза.

Результат: 4.6–7.7× сжатие при сохранении ~0.5 accuracy на LongMemEval, инференс в 5–9× быстрее, запись истории — 43 мс. Похоже на xRAG и ICAE, но без файнтюнинга ридера и без декодирования обратно в текст.

https://arxiv.org/abs/2609.01507
Iris: поисковый агент, который учится искать лучше с каждым циклом

Хорошая языковая модель — ещё не хороший поисковый агент. Нужно уметь решать многошаговые задачи в интернете, где ответ разбросан по десяткам страниц.

Iris от AllSpark Research — это end-to-end рецепт обучения таких агентов. Ключевые идеи:

1. Данные генерируются автоматически из структуры веб-графа: берём страницу, строим граф сущностей, генерируем многошаговый вопрос и заменяем все прямые "подсказки" на описательные отсылки — чтобы модель не могла схитрить простым поиском по строке.

2. Траектории от учителя фильтруются на двух уровнях: целиком (правильность, глубина, отсутствие петель) и пооборотно (LLM-судья маскирует плохие ходы, но не выбрасывает их из контекста).

3. SFT и RL чередуются итеративно: удачные траектории из RL-роллаутов идут обратно в SFT следующего цикла.

В итоге Iris-mini и Iris-pro бьют все open-source агенты на BrowseComp, DeepSearchQA и HLE.

https://arxiv.org/abs/2609.04304
RLVR делает модели умнее, но "забывает" альтернативные пути решения

(by University of Birmingham)

RLVR-обучение (PPO, GRPO) резко улучшает точность математических рассуждений — но ценой разнообразия решений. Авторы выяснили, ГДЕ именно теряются альтернативные пути.

Ключевое разделение: "доступ" (начало пути решения) vs "исполнение" (дальнейшие шаги). На задаче Countdown, где можно перебрать ВСЕ валидные решения, оказалось:

— При PPO точность выросла в 50 раз, но покрытие решений упало с 0.337 до 0.111
— Проблема концентрируется на ПЕРВОМ шаге: сдвиг вероятностей перед первой арифметической операцией в 16x больше, чем во всех последующих шагах
— Если принудительно дать модели "начало" забытого пути — она отлично его завершает!

Лечение: интерполяция весов поздних слоёв (20-28) с ранним чекпоинтом возвращает 37% покрытия без потери точности. SFT-модели сохраняют вдвое больше разнообразия.

https://arxiv.org/abs/2608.29188
Мультиагентные LLM наконец получили математику

Все знают, что системы типа AutoGen или MetaGPT работают, но никто не понимал — почему, когда они сходятся, и почему иногда застревают. Авторы дают первый строгий теоретический фундамент.

Ключевые идеи:
1. Оркестратор + воркеры — это билинейная игра координации. Качество декомпозиции задачи напрямую определяет, насколько близко воркеры сойдутся к Nash-равновесию.

2. Свободная рефлексия (Reflexion-style) может плато — и это доказуемо. Без внешнего верификатора даже идеальный текстовый судья не может гарантировать улучшение.

3. Авторы вводят SRMA: новая память коммитится только если внешний верификатор подтверждает снижение ошибки. Это даёт геометрическую сходимость.

Практический результат: Kimi-based система на SWE-bench — 72.2% (361/500), против 70.8% у публичного mini-SWE-agent v2.

https://arxiv.org/abs/2609.02750
👍1
MaxKernel: Агент для написания TPU-ядер (by Google)

LLM пишет быстрее человека низкоуровневый код для TPU? Звучит фантастически, но Google сделали именно это.

MaxKernel — мультиагентный фреймворк для автоматической генерации и оптимизации JAX/Pallas ядер под TPU. Внутри — специализированные субагенты: планировщик, кодогенератор, тестировщик, автотюнер и профилировщик (через XProf). Всё замкнуто в петлю: сгенерировал → скомпилировал → протестировал → профилировал → улучшил.

Три режима работы: с человеком в петле (HITL), полностью автономный и граф-поиск по пространству конфигураций (beam search и др.).

Результаты впечатляют: 1.58× ускорение на JAXBench, а на 8 продакшн-ядрах — 2.32× против референсного кода и 2.02× против написанного людьми вручную.

RAG с документацией по Pallas/Mosaic/XLA помогает агентам разбираться в железе без примеров человеческого кода.

https://arxiv.org/abs/2609.04523