InhumanScience
105 subscribers
641 photos
999 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Агент, который сам себя улучшает в процессе исследования (by Beijing Academy of AI)

Большинство research-агентов просто ищут дольше, если не нашли ответ. AREX делает иначе: после каждого раунда поиска агент проверяет, какие именно ограничения задачи ещё не выполнены, и формулирует новый, более точный исследовательский вопрос.

Ключевая идея — асимметрия поиска и верификации. Найти ответ, удовлетворяющий всем условиям сразу, сложно. Но проверить каждое условие по отдельности — значительно проще. AREX использует верификацию не как финальный фильтр, а как сигнал для следующего раунда.

Дополнительно агент учится сжимать собственный контекст: вместо полной истории — компактное состояние с подтверждёнными фактами и нерешёнными пробелами.

Модели: 4B (dense) и 122B-A10B (MoE). На бенчмарках BrowseComp, GAIA, HLE конкурируют с моделями с гораздо большим числом активных параметров.

https://arxiv.org/abs/2607.21461
PPO убивает исследование редких токенов — и вот почему

Когда LLM обучают с RL, стандартный PPO-Clip постепенно "схлопывает" политику: модель всё сильнее эксплуатирует уже популярные токены и почти игнорирует редкие. Почему? Авторы нашли геометрическую причину: PPO меряет изменение политики евклидовой метрикой на importance ratio, тогда как реальное пространство политик — риманово многообразие с метрикой KL-дивергенции. Из-за этого редкий токен (p=0.01) при clip=0.2 может вырасти лишь до 0.012, а частый (p=0.8) — до 0.96. Асимметрия огромная.

Решение — RIPO (Riemannian Isometric Policy Optimization): граница клиппинга адаптируется к локальной геометрии многообразия. Редкие действия получают больший "бюджет" обновления, частые — меньший. Результат: +60% относительного улучшения над GRPO на AIME24.

https://arxiv.org/abs/2607.10169
Nvidia выпустила туториал по кастомизации Nemotron 3 Nano

Теперь дообучить открытую языковую модель Nemotron 3 Nano можно буквально за 5 минут — с помощью платформы Prime Intellect Lab. Никакого собственного GPU-кластера не нужно: всё обучение происходит в облаке.

Процесс простой: устанавливаешь CLI, запускаешь базовую оценку модели, обучаешь LoRA-адаптер через reinforcement learning с верифицируемыми наградами — и скачиваешь готовый адаптер. В тесте на математических задачах точность заметно выросла по сравнению с базовой моделью.

Важно: Nemotron 3 выходит с открытыми весами, данными и рецептами обучения — это упрощает воспроизводимость и адаптацию под конкретные задачи. Тот же воркфлоу работает и для более крупных Nemotron 3 Super и Ultra.

Для разработчиков, которым нужна специализированная модель без боли с инфраструктурой — это реально удобно.

https://developer.nvidia.com/blog/start-customizing-nvidia-nemotron-3-nano-with-prime-intellect-lab-in-minutes/
PyTorch + Google: пишем TPU-ядра без боли

PyTorch представил TPU-бэкенд для своего DSL Helion — совместная разработка с Google. Теперь можно писать ML-ядра в привычном PyTorch-стиле, а компилятор сам переведёт их в оптимизированный Pallas-код для TPU.

Зачем это нужно? Раньше для TPU приходилось вручную писать на Pallas — низкоуровневом DSL с крутой кривой обучения. Helion убирает этот барьер: один и тот же код работает и на GPU, и на TPU.

Результаты впечатляют: на задаче Flash Attention ядро, сгенерированное Helion, выдаёт 838 TFLOPs (~79% MFU) на TPU v7. Автотюнер сам подбирает оптимальную стратегию пайплайнинга под разные размеры входных данных.

Три целевых сценария: задачи, где нужен автотюнинг; разработчики без экспертизы в Pallas; команды, поддерживающие единую кодовую базу для GPU и TPU.

https://pytorch.org/blog/helion-on-tpu-towards-hardware-heterogeneous-kernel-authoring/
PyTorch Foundation обновила сразу шесть проектов

В апреле 2025 PyTorch Foundation расширилась до мультипроектной организации. Теперь под её крылом — PyTorch, vLLM, DeepSpeed, Ray, Helion и Safetensors. Вот главное за квартал.

PyTorch 2.13: FlexAttention на Apple Silicon работает до 12x быстрее, новый бэкенд CuTeDSL, экономия памяти GPU до 4x при обучении, поддержка Python 3.15.

vLLM полностью переписал Model Runner V2, добавил поддержку Kimi K3, Qwen 3 в день релиза. Первая конференция vLLM — 24–26 августа в Сан-Франциско.

DeepSpeed интегрировал алгоритм Ulysses прямо в Hugging Face Trainer и получил награду на ASPLOS 2026.

Ray поддержал GPU-серверы GB200/GB300, использовался при обучении MAI-Thinking-1 и Nemotron 3 Ultra.

Helion обогнал FlashAttention-4 на NVIDIA Blackwell и показал ускорение автотюнинга в 10x с помощью LLM.

Safetensors добавил GIL-Free сериализацию и быструю загрузку моделей через Metal на Apple.

https://pytorch.org/blog/driving-the-future-of-open-source-ai-an-update-from-pytorch-foundation-projects/
SANA-Video 2.0: быстрая генерация видео без квадратичного внимания (by NVIDIA)

Главная боль видеогенерации — softmax attention с O(N²) сложностью. При 1080p видео латентных токенов десятки тысяч, и квадратичный attention просто убивает скорость.

SANA-Video 2.0 решает это гибридным подходом: 75% слоёв используют линейное внимание O(N), а 25% — обычный softmax в качестве "якорей". Соотношение 3:1 взято не из LLM-литературы вслепую, а подобрано экспериментально именно для видео.

Второй ключевой трюк — Block Attention Residuals (AttnRes): вместо того чтобы каждый слой заново выводил информацию из предыдущего, готовые блочные представления передаются напрямую вглубь сети. Это повышает эффективный ранг состояний в глубоких слоях на ~12%.

Результат: 5B модель генерирует 480p видео за 13.2 сек на одном H100, DiT-forward в 3.2× быстрее полного softmax-аналога при 720p/60s, а преимущество растёт с длиной видео. VBench Total — 84.30, конкурентно с моделями 13-14B.

https://arxiv.org/abs/2607.21553
Робот забывает, что значат слова, пока учится двигаться

Когда дообучаешь VLA-модель (Vision-Language-Action) на робототехнических демонстрациях, она теряет базовое понимание языка. Натренировали робота брать зелёную кружку — он берёт зелёную, даже если ему говорят "возьми розовую". Цветовое понимание просто стёрлось в процессе BC-файнтюнинга.

Авторы предлагают Anchor-Align — два дополнительных лосса поверх стандартного BC:

1. Vision-Language Anchoring: держим замороженную копию исходной VLM и дистиллируем её hidden states на каждом слое декодера в обучаемый backbone. Никаких новых данных — просто дистилляция от себя же.

2. Language-Action Alignment: автоматически конвертируем траектории действий в текстовые метки ("двигай вправо") и учим модель предсказывать их на тех же наблюдениях, где она предсказывает действия. Оказалось, что у co-trained VLA языковая и action головы могут буквально противоречить друг другу!

Результат: на реальном роботе xArm7 — с 10% до нормальной генерализации на OOD инструкции.
LLM-as-a-Coach: когда скалярная оценка — это слишком мало

Стандартный RL для LLM работает так: модель-судья смотрит на ответ и выдаёт число от 1 до 10. Всё остальное — анализ, советы, нюансы — выбрасывается. Это узкий канал: максимум 3.3 бита на пример.

Авторы предлагают Experiential Learning: вместо судьи — коуч. Коуч анализирует ответ по рубрикам и формулирует передаваемые советы (experiential knowledge). Эти советы подаются как контекст учителю, а политика обучается минимизировать KL-дивергенцию с этим контекст-обусловленным учителем. Никакого скаляра — плотный токен-уровневый сигнал.

Bandwidth контекста из 1024 токенов — теоретически 17 600 бит, то есть в 5000+ раз больше, чем скалярная оценка.

На практике: EL стабильно обгоняет RL на open-ended задачах, меньше подвержен reward hacking и лучше обобщается за пределы тренировочного распределения.

https://arxiv.org/abs/2607.18110
Nvidia Tech запустила ModelExpress (MX) — систему для ускоренной доставки весов AI-моделей на GPU в кластерах.

Проблема была простой: модели весят сотни гигабайт, и каждый новый воркер тратил минуты на загрузку с нуля. MX решает это умно — сначала проверяет, есть ли уже загруженная копия у соседнего GPU, и если да, передаёт веса напрямую через P2P RDMA, минуя диск и оперативную память.

Результат впечатляет: веса DeepSeek-V4 Pro (806 ГБ) передаются между репликами менее чем за 10 секунд. Общее время запуска сократилось с 8 минут до 1 минуты 44 секунд.

MX также умеет: скачивать чекпоинты из облака без записи на диск, использовать GPUDirect Storage, координировать загрузку так, чтобы кластер из 10 реплик скачивал данные один раз, а не десять. Система интегрирована с vLLM, SGLang и Dynamo.

Для production-деплоев больших моделей это серьёзное ускорение масштабирования.

https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
Apple ML выпустила исследование LEAD — новый метод для улучшения длинных цепочек рассуждений в языковых моделях.

Проблема: когда задачу разбивают на слишком мелкие шаги, модель теряет контекст и не может исправить ошибки на «сложных» этапах — они накапливаются и становятся необратимыми.

Решение — метод LEAD (Lookahead-Enhanced Atomic Decomposition): модель заглядывает чуть вперёд и проверяет несколько вариантов развития событий одновременно. Это даёт достаточно изоляции для стабильности и достаточно контекста для исправления ошибок.

Результат на практике: модель o4-mini с LEAD решает головоломку Checkers Jumping до сложности n=13, тогда как без метода ломается уже на n=11.

Пока это академическое исследование, но подход может напрямую улучшить агентные системы и сложные многошаговые задачи в будущих продуктах Apple.

https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
Одна видеомодель — и прямая, и обратная динамика робота

Обычно для предсказания последствий действий робота и для восстановления действий по желаемому результату нужны разные модели. Авторы предлагают Masked Visual Actions: вместо того чтобы подавать в видеомодель низкоразмерные векторы команд, они просто маскируют нужные пиксели в видео.

Идея проста: если показать модели траекторию робота (активная сущность) — она предскажет, что произойдёт с объектами. Если показать желаемое движение объекта (пассивная сущность) — та же модель восстановит, как должен двигаться робот. Один чекпоинт, обученный на 15 часах роботизированных данных, решает обе задачи.

Модель применяется для оценки политик, планирования и обратного моделирования в реальных манипуляционных задачах. Бонус: подход не зависит от типа робота, так как действия закодированы прямо в пикселях.

https://arxiv.org/abs/2607.19343
Единый принцип интеллекта: ищи то, чему можно научиться

Новизна без структуры — это шум телевизора. Минимизация удивления — это тёмная комната. Оба подхода провалились по одной причине: они не различают "обучаемую" и "необучаемую" новизну.

Авторы предлагают единый принцип: максимизируй learnable novelty — ту часть удивления, которую ограниченный наблюдатель реально может усвоить. Формально это "эпиплексность" (epiplexity): длина описания лучшей модели, которую конечный вычислитель способен подобрать под данные.

Ключевой трюк: вместо дорогого поиска по всем программам используют reservoir computer с ridge regression — закрытая формула, дифференцируемая и быстрая.

Результаты впечатляют: без единой метки нейронный клеточный автомат сам развивает солитоны, MNIST-энкодер разделяет классы цифр, RL-агент исследует среду эффективнее в задачах с редкими наградами. А rule 110 (единственный Тьюринг-полный элементарный КА) занимает первое место в рейтинге сложности.

https://arxiv.org/abs/2607.18433
3DGS всегда мылит дальние горы и скрытые объекты — и вот почему

3D Gaussian Splatting отлично работает, но упорно размывает далёкие объекты и окклюдированные области. Авторы доказали, что это не баг данных, а структурный изъян оптимизации — и назвали его Blur Trap.

Суть проблемы: градиент позиции каждого гауссиана строго ортогонален лучу зрения. То есть оптимизатор может двигать примитивы только поперёк луча, но никогда вдоль глубины. Плюс alpha-blending гасит сигнал для скрытых гауссианов, не давая им делиться.

Решение намеренно минималистичное — два оператора исследования:
1. Random Seeding — случайно засеиваем новые гауссианы по всей сцене, обходя ортогональность
2. Random Splitting — случайно делим гауссианы без оглядки на градиент, обходя подавление alpha-blending

Оба оператора просты, но именно это и нужно: проверить, что exploration сам по себе — недостающий ингредиент 3DGS. Эксперименты на 5 датасетах подтверждают улучшение при минимальных накладных расходах.

https://arxiv.org/abs/2607.17965
Molt: фреймворк для agentic RL, который влезает в голову за один вечер (by NVIDIA)

Проблема с существующими RL-фреймворками для LLM: они строились под гиперскейл, и каждое изменение алгоритма требует копаться в слоях трейнера, движка роллаутов и конфигурационной обвязки. Molt говорит: сложность — это не цена производительности, это архитектурный выбор.

Ключевая идея: 4 концепта (agent, generator, trainer, estimators) + один асинхронный цикл. Изменение алгоритма трогает ровно один компонент. Никаких форков vLLM или Ray — апстрим-улучшения прилетают автоматически.

Отдельная фича: token-first граница агента. Агент, написанный под стандартный OpenAI/Anthropic SDK, тренируется без изменений — SDK-трафик перехватывается как token ids через loopback-сервер.

Результат: кодовая база в несколько раз меньше Megatron-стеков, при этом throughput статистически сопоставим. Проверено на 700B MoE с expert parallelism 256 — тот же цикл, что и для 4B dense-модели.

https://arxiv.org/abs/2607.21653
HOPE: сжать нейросеть без единого примера данных (by Google)

Стандартные методы прунинга смотрят на "величину весов" и выкидывают маленькие. Проблема: большие веса — это часто просто артефакты оптимизации, а не реально важные нейроны.

Google предлагает другой подход: перенести анализ из пространства параметров в функциональное пространство. Каждый нейрон рассматривается как оператор Гильберта-Шмидта, и вместо "насколько большой вес?" задаётся вопрос "насколько сильно меняется поведение сети, если убрать этот нейрон?".

Ключевой трюк: для вычисления норм в гильбертовом пространстве нужна статистика входных данных — но авторы берут её прямо из Batch Normalization слоёв. Никаких реальных данных не нужно!

Единый фреймворк объединяет прунинг, слияние нейронов и удаление целых блоков под одним критерием дистortion-cost J. Всё гиперпараметр-фри.

https://arxiv.org/abs/2607.21366
👍2
Знают ли LLM, что учить ПЕРЕД чем? (by Peking University)

Современные LLM легко решают задачи ЕГЭ и ГАО-КАО. Но понимают ли они структуру учебной программы — что "линейные уравнения" требуют знания арифметики, а не наоборот?

Авторы построили K12-KGraph — граф знаний на основе официальных китайских школьных учебников (математика, физика, химия, биология). Граф содержит 7 типов узлов (концепт, навык, эксперимент, упражнение, раздел...) и рёбра типа "является предпосылкой", "проверяет", "иллюстрирует" и т.д.

Из графа сгенерированы бенчмарк K12-Bench (23 640 вопросов на понимание структуры учебника) и датасет K12-Train (7 335 SFT-примеров). Результат: даже Gemini-2.5-Flash набирает лишь 57% точного совпадения. А файнтюнинг на K12-Train даёт +24 балла на GaokaoBench против лучшего конкурента — при вдвое меньшем объёме данных.

https://arxiv.org/abs/2605.09635
NVIDIA запустила Nemotron 3 Ultra для проектирования чипов

NVIDIA представила модель Nemotron 3 Ultra в связке с агентом ACE-RTL для автоматизации RTL-кодинга — написания кода на уровне регистровых передач при разработке микросхем.

Результаты впечатляют: на бенчмарке CVDP система достигает 97,1% успешных решений в 9 категориях задач. При этом модель использует на 71% меньше токенов за итерацию, чем конкурент Kimi K2.6, и на 28% меньше, чем GLM 5.2.

Агент работает по схеме «генерация → тест → рефлексия»: пишет RTL-код, запускает симуляцию, анализирует ошибки и итеративно исправляет их. Именно так работают реальные инженеры.

Архитектура — гибридная Mamba-Attention MoE на 550B параметров (55B активных), контекст до 1M токенов. Это критично: в одной итерации отладки контекст быстро раздувается до спецификаций, кода, логов симулятора и предыдущих попыток.

Модель совместима с EDA-инструментами Cadence, Siemens и Synopsys.

https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-leads-open-models-on-accuracy-and-efficiency-in-agentic-rtl-coding/
👍2
Amazon инвестирует в Lean FRO — организацию, которая делает математические доказательства корректности ПО доступными для разработчиков.

Суть: обычное тестирование проверяет лишь те случаи, о которых вы подумали. Lean позволяет математически доказать, что система не может вести себя неправильно — при любых входных данных.

Amazon уже использует Lean в продуктах: Bedrock AgentCore проверяет границы поведения AI-агентов, SampCert гарантирует защиту приватности в AWS Clean Rooms, AWS Neuron — корректность компиляции для AI-чипов. Один инженер с помощью LLM+Lean доказал корректность протокола Amazon Aurora за рекордно короткое время.

Почему Lean развивают вне Amazon? Чтобы клиенты, аудиторы и регуляторы могли независимо проверять инструменты — это принципиально для безопасности AI-агентов.

Это крупнейшее пожертвование в истории Lean FRO.

https://www.amazon.science/news/amazon-is-investing-in-the-lean-focused-research-organization
Skill Self-Play: LLM учит сам себя через эволюцию навыков (by Qwen/Alibaba)

Проблема self-play для LLM: либо ты заперт в узкой среде с жёстким верификатором, либо генерируешь хаотичные задачи без контроля качества — и данные деградируют.

Skill-SP решает это через библиотеку "скиллов" — модульных блоков знаний, которые одновременно направляют генерацию задач И верифицируют ответы. Три агента: Proposer (генерирует задачи, опираясь на скиллы), Solver (решает), Controller (анализирует результаты и эволюционирует библиотеку — уточняет скиллы, удаляет устаревшие, индуцирует новые).

Скилл — это не просто подсказка, а живой интерфейс: он проактивно управляет сложностью задач и отслеживает прогресс модели.

Результат на Qwen3-4B: +42.9 пунктов на tool calling, +12.0 на логических задачах против обычного self-play. Unguided SP вообще не смог сгенерировать валидные логические пазлы.

https://arxiv.org/abs/2607.22529
Тренируй агента в том же harness, в котором он деплоится

Большая проблема современных агентов: их тренируют в упрощённых условиях, а деплоят через сложные harness-обёртки (Claude Code, Codex, OpenClaw). Это создаёт train-deploy mismatch — модель учится одному, а работает в другом.

OpenForgeRL закрывает этот разрыв двумя компонентами: прокси-сервер перехватывает LLM-вызовы внутри harness и собирает пары prompt-response как обычные RL-сэмплы, а Kubernetes-оркестратор запускает каждый rollout в отдельном контейнере в облаке (Azure).

Результат: агент тренируется прямо в своём реальном harness, а траектории автоматически реконструируются в формат для любого RL-фреймворка (veRL, GRPO и т.д.).

На практике: OpenForge-GUI (8B) бьёт более крупные модели на OSWorld, Mind2Web и WebVoyager. Плюс выяснилось — более простые harness'ы учатся лучше, а error recovery остаётся слабым местом даже после RL.

https://arxiv.org/abs/2607.21557
Творческий AI-агент с «холстом» вместо чата

Большинство AI-инструментов для творчества работают по схеме «промпт → результат». Но реальный творческий процесс — это черновики, версии, правки, референсы, обратная связь. Где всё это хранить?

JarvisHub предлагает заменить линейный чат на «холст» (canvas) — граф-структуру, где каждый артефакт (изображение, видео, аудио, промпт, UI-элемент) — это узел с историей создания, зависимостями и версиями. Агент не читает историю переписки, а смотрит на текущее состояние проекта на холсте.

Архитектура: canvas state (граф артефактов) + protocol bridge (валидация действий агента) + agent runtime (планирование, вызов инструментов, запись траектории).

Агент может читать холст, создавать/редактировать узлы, вызывать генеративные инструменты и записывать результаты обратно — всё трассируемо и восстанавливаемо.

Демо: генерация sci-fi трейлера с музыкой и озвучкой, интерактивная веб-разработка, создание презентаций.

https://arxiv.org/abs/2607.23588