InhumanScience
106 subscribers
722 photos
1.13K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Nvidia запустила поддержку Qwen3.8-2.4T-A95B на GB300 NVL72

Alibaba выпустила открытые веса своей крупнейшей модели — Qwen3.8-2.4T-A95B с 2,4 триллиона параметров (95B активируется на каждый токен). Nvidia обеспечила её запуск на своей стойке GB300 NVL72 уже в день релиза.

Что важно: модель показывает свыше 4000 токенов в секунду на GPU и более 350 токенов в секунду на пользователя в режиме FP8 — без дополнительной оптимизации. Архитектура MoE делает инференс экономичным: платишь за 95B активных параметров, а не за все 2,4T.

Модель поддерживает контекст до 1 млн токенов и встроенные уровни глубины рассуждений (low/high/xhigh) — можно гибко балансировать между скоростью и качеством под конкретную задачу.

Доступна через SGLang, vLLM, NVIDIA Dynamo и NIM-контейнер. Веса — на Hugging Face и ModelScope.

https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
Spark-to-Paper: полный цикл написания научной статьи прямо в вашем coding assistant

Обычно системы автономного написания статей — это отдельные платформы со своей инфраструктурой. Авторы спросили: а нельзя ли всё это сделать просто как набор скиллов внутри обычного coding assistant?

Spark-to-Paper — 13 composable скиллов: планирование, поиск литературы, написание, ревью, генерация фигур, запуск экспериментов. Всё общается через файлы в общей директории. Работает внутри Claude Code, без дополнительной инфраструктуры.

Ключевые фишки: эксперименты планируются ДО того, как смотришь на результаты; если система раз за разом опровергает свою же гипотезу (Self-Refutation Loop) — она останавливается и берёт новую идею; фигуры сначала рисуются image-моделью, потом реконструируются в редактируемый векторный PDF через код.

Результат: 99.5% валидных цитат, обнаружение фабрикаций выросло с 14% до 92%, стоимость ~$8 за статью, ~3 часа работы.

https://arxiv.org/abs/2608.11924
AI сам изучает себя изнутри — и находит скрытые риски

Mechanist — это агентная система, которая автоматически исследует механизмы работы нейросетей. Вместо того чтобы люди вручную копались в активациях, AI сам генерирует гипотезы, ставит эксперименты, верифицирует результаты и итерируется.

Под капотом: граф знаний из 13 000 статей по интерпретируемости + 43 млн статей из 26 дисциплин + библиотека из 32 методов (SAE, causal tracing и др.).

Что нашёл Mechanist на практике:
— Скрытый риск: unsafe-поведение может передаваться через мультимодальные данные, которые выглядят абсолютно безопасными
— Теорию убеждений: отдельные "belief heads" управляют тем, как модель использует знания в сложных контекстах
— Способ управлять биологическими foundation-моделями через каузальное вмешательство в фичи

По сравнению с Claude Code и AI-Scientist — гипотезы новее, точнее и лучше проверяемы. Interpretability на автопилоте.

https://arxiv.org/abs/2608.12036
👍1
Библиотека навыков агента растёт — и начинает душить контекстное окно. SkillZip решает это умно.

Проблема: когда LLM-агенту нужны навыки из библиотеки, системы тащат целые пакеты целиком. Если два навыка (Clean CSV и Pivot Table) делят общую процедуру — она загружается дважды. При 100K навыков это катастрофа.

SkillZip меняет единицу хранения с "целого навыка" на "секцию с контрактом" (intent, операции, верификаторы). Поверх этого графа работает MotifZip — он находит повторяющиеся подграфы и сворачивает их в макросы, сохраняя контракт (интерфейс + верификаторы + возможность развернуть обратно). PathHydrate достаёт нужный подграф и разворачивает макросы ровно настолько, насколько нужно задаче.

Результат: сжатие 3.46×, -71% активного хранилища, сохранность зависимостей 99.2%. На ALFWorld обходит SkillDAG на 12.2 пункта.

https://arxiv.org/abs/2608.05604
Google DeepMind представила Gemini 3.7 Flash — новую версию своей рабочей модели для кода и агентов.

Релиз вышел всего через три недели после 3.6 Flash. Главное: модель стала заметно умнее в программировании — точность кода с первой попытки выросла, а на бенчмарке DeepSWE результат улетел с 49% до 65.3%. В веб-разработке модель генерирует более функциональные интерфейсы за меньше промптов.

Для работы с документами в юриспруденции, финансах и биологии — тоже прогресс: GDP.pdf benchmark вырос с 22% до 34%.

Цена снижена вдвое относительно 3.6 Flash: $0.75 за миллион входящих токенов и $3.75 за выходящие.

Пользователи Gemini AI Pro и Ultra уже получают 3.7 Flash через агента Spark. Разработчики могут попробовать через Google AI Studio прямо сейчас.

https://deepmind.google/blog/introducing-gemini-3-7-flash/
Nvidia Tech — новая модель для агентных задач

NVIDIA выпустила Nemotron 3.5 Lightning — открытую MoE-модель на 30B параметров (всего 3B активных). Она создана специально для «рабочей лошадки» в AI-агентах: валидация инструментов, делегирование подзадачам, рутинные вызовы — всё то, на что тратится большинство токенов.

Что важно: модель работает в 4 раза быстрее аналогов по размеру и выполняет 10 000 задач на 30% быстрее, чем Qwen3.6 35B при схожей точности. Деплоится как на DGX Spark, так и в датацентрах.

Для разработчиков: веса, данные и рецепты обучения открыты под лицензией OpenMDW-1.1. Поддержка LoRA, SFT и RL из коробки. Плюс новый инструмент NeMo Switchyard — он сам маршрутизирует задачи между моделями: сложное планирование идёт на Nemotron Ultra, а рутина — на Lightning.

Суть проста: зачем гонять frontier-модель на git pull, если есть быстрый и дешёвый специалист?

https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
Nvidia Tech запустила NeMo Switchyard — инструмент для умной маршрутизации задач между AI-моделями.

Суть простая: не каждую задачу нужно гнать в самую мощную (и дорогую) модель. Классификация, рассуждения, рутинные запросы — каждый шаг агента теперь может уходить к той модели, которая справится лучше и дешевле.

Switchyard анализирует три вещи: возможности модели, её стоимость и состояние инфраструктуры. На основе этого роутер в реальном времени решает, куда отправить запрос.

Важно: SDK не привязан к конкретному провайдеру. Поддерживаются OpenAI, Anthropic и другие API. Смена модели или эндпоинта не ломает логику роутинга.

Реальные тесты с LangChain и Cognition показали: затраты заметно снижаются при сохранении высокой точности.

Для разработчиков агентов это способ перестать переплачивать за каждый токен и строить более управляемые системы.

https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/
Зашифрованные мысли AI оказались не такими уж зашифрованными

Anthropic, OpenAI и Google скрывают внутренние рассуждения своих моделей в зашифрованных блоках — чтобы конкуренты не украли цепочки мыслей. Но исследователи нашли дыру: все блоки шифруются одним глобальным ключом и совместимы между разными моделями одного провайдера.

Атака элегантна: берёшь зашифрованный thinking-блок от умной модели (Claude Opus, GPT-5.6 Sol), передаёшь его слабой модели (Claude Haiku, GPT-5.6 Luna) и просишь "перепиши своё рассуждение". Слабая модель послушно расшифровывает чужие мысли — у неё нет защиты от дистилляции.

Авторы собрали 315 320 публично выложенных thinking-блоков из GitHub и нашли там 62 API-ключа, 33 пароля, 30 личных email. Люди постили логи агентов, не подозревая, что внутри зашифрованного мусора — их секреты.

Бонус-атака: можно подсунуть жертве отравленный thinking-блок с инструкциями — модель выполнит их незаметно для пользователя.

https://arxiv.org/abs/2608.09867
Интерактивный мировой движок, который генерирует без остановки 2 часа подряд

Alaya-EVOKE решает три проблемы сразу: persistent memory, быстрый отклик на команды и бесконечно долгая генерация. Ключевая идея — разделить ответственность. Вместо того чтобы пихать всю историю сессии в контекст диффузионной модели (что делает каждый шаг дороже), авторы выносят геометрию сцены во внешний world state bank, индексированный по позиции камеры. Деноизер всегда работает с фиксированным контекстом — независимо от длины сессии.

Второй трюк — переработанный teacher для дистилляции: chunk-wise sparse attention + отдельный текстовый промпт на каждый чанк. Это позволяет студенту (3 шага, без CFG) менять элементы сцены прямо на лету — добавить фейерверк, убрать воздушный шар — не ломая остальное.

Результат: 1.5-секундный чанк генерируется за 2.11 сек на одном H200, а сессия может длиться хоть 2 часа без деградации.

https://arxiv.org/abs/2608.13546
Единый фреймворк для роутинга между LLM-моделями

Зачем гонять каждый запрос через дорогой GPT-4, если с 80% задач справится дешёвая модель? Роутинг — выбор нужной LLM под каждый запрос — активно исследуется, но сравнивать подходы почти невозможно: у всех разные кодовые базы, метрики и наборы моделей.

Авторы из UIUC предложили LLMRouter — единую инфраструктуру, где любой роутер описывается пятью компонентами: энкодер контекста, энкодер модели, скоринговая функция, правило выбора и сигнал обучения. Это покрывает три семейства роутеров: single-turn, multi-turn/agentic и персонализированные.

В комплекте — бенчмарк xRouteBench с 18 кандидатами-моделями и 4 ключевых вывода: ни один роутер не побеждает везде; обученный роутинг лучше стратегии "всегда бери самую большую модель"; multi-turn не всегда выигрывает у single-turn; персонализация работает, но только при хорошем моделировании пользователя.

https://arxiv.org/abs/2608.06867
Apple ML представила исследование об ускорении машинного "забывания" данных.

Суть проблемы: когда нужно удалить данные пользователя из обученной модели (например, по запросу GDPR), стандартные методы unlearning обрабатывают все точки данных одинаково — это дорого и долго.

Что придумали в Apple: не все данные одинаково влияют на модель. Некоторые точки практически не оставляют следа в весах — их можно просто пропустить при unlearning без потери качества. Исследователи научились заранее выявлять такие "незначительные" точки через анализ функций влияния.

Результат: сокращение вычислительных затрат до 50% на реальных задачах в области зрения и языка.

Почему важно: право на удаление данных становится стандартом, и делать это эффективно — критично для масштабируемых AI-систем. Apple явно усиливает позиции в теме приватности ML.

https://machinelearning.apple.com/research/unlearning-low-influence-points
PyTorch: FP8-обучение на AMD GPU теперь в основной ветке TorchTitan

AMD совместно с командой PyTorch влила оптимизации из библиотеки Primus-Turbo напрямую в TorchTitan и TorchAO. Теперь AMD Instinct GPU поддерживаются нативно — без сторонних патчей.

Что конкретно улучшилось:

На плотных моделях вроде Llama3-8B прирост пропускной способности составил 13,4% по сравнению с BF16. На MoE-архитектурах (DeepSeek-V3 671B) через слияние Triton-ядер удалось вернуть 89% потерь от FP8-квантизации, а отдельные операции ускорились в 6,2 раза.

Исправлена критическая ошибка: AMD использует формат e4m3fnuz с другим диапазоном значений, чем NVIDIA. Раньше TorchAO молча выдавал неверные результаты — градиенты портились без каких-либо ошибок. Теперь формат определяется автоматически.

Итог: обучение больших моделей на AMD-кластерах стало быстрее, корректнее и доступно из коробки.

https://pytorch.org/blog/fp8-training-on-amd-gpus-with-torchtitan-and-torchao-upstreaming-performance-improvements/
DreamX-Phi 1.0: робот-манипулятор видит будущее (by Alibaba)

Хотите, чтобы робот не просто выполнял команды, а сначала "воображал" результат? Именно это делает DreamX-Phi — видео-модель мира, которая по одному кадру и заданной траектории рук предсказывает, как будет выглядеть сцена после манипуляции.

Главная проблема предыдущих подходов: красивое видео ≠ правильное движение. Модель могла генерировать реалистичный ролик, но рука двигалась не туда или хватала воздух.

Решение DreamX-Phi — три ключевых компонента:
1. SE(3)-траектории через PRoPE-attention — сохраняют реальную 3D-геометрию движения манипулятора
2. Оптический поток только от робота — явно показывает, где в кадре должно происходить движение
3. Depth + SAM3 маски + V-JEPA — следят за физической согласованностью объекта во времени

Обучение на 10к+ часов данных (Ego4D, AgiBot, симуляция). На WorldArena 2.0 — 1-е место в Track 1.

https://arxiv.org/abs/2608.13489
DarwinX: эволюция агентов без обучения весов (by Salesforce AI Research)

Что если улучшать агента не дообучением, а эволюцией его "оболочки" — промптов, инструментов и control flow?

DarwinX именно это и делает. Веса модели заморожены навсегда. Эволюционирует только harness вокруг неё. Каждый раз система предлагает небольшое изменение, запускает агента на реальных задачах и принимает правку только если она что-то улучшила, не сломав старое — "preserve-and-extend contract".

Ключевая идея: вместо одной линии улучшений — популяция веток-архив. Ветка, которая проиграла в общем зачёте, не выбрасывается — она может содержать единственный нужный фикс, который в комбинации с другой веткой откроет новые задачи.

Результаты впечатляют: Terminal-Bench 2.1 — 84.7%, WebArena-Infinity вырос с 43.5% до 93.0%, причём harness обученный на синтетике переносится на реальные задачи без дополнительной адаптации.

https://arxiv.org/abs/2608.07545
Intern-S2-Preview: научный агент на 397B параметров

Хотите модель, которая не просто отвечает на вопросы по науке, а реально работает как исследователь — запускает инструменты, итеративно планирует и адаптируется к новым доменам без переобучения?

Intern-S2-Preview-397B — это именно такая попытка. Ключевые фишки:

1. Memory Decoder: вместо дообучения огромного backbone к нему просто "прикручивается" маленькая параметрическая память (4B) с доменными знаниями. Лёгкий роутер на каждом токене решает, сколько брать от базовой модели, а сколько от памяти. Backbone при этом заморожен.

2. Time Series модуль: отдельная ветка для прогнозирования временных рядов поверх стандартного энкодера для длинных сигналов.

3. Agentic RL: специальный фреймворк для обучения с подкреплением на длинных агентских траекториях с верифицируемыми наградами.

По бенчмаркам — конкурентный уровень на научных, мультимодальных и агентских задачах.

https://arxiv.org/abs/2608.13505
LiveAnimate: анимация человека в реальном времени на 14B DiT (by Alibaba Qwen)

Все существующие системы pose-driven анимации работают офлайн — минуты или часы на клип. LiveAnimate — первая система, которая делает это в реальном времени (~20 FPS на 2×H100) с 14B-параметрной моделью.

Как это работает:

1. Stage 1 — превращают двунаправленный DiT в каузальный генератор через teacher-forcing: каждый блок обучается на чистой GT-истории, а референсное изображение всегда видно через глобальный Ref Sink.

2. Stage 2 — дистилляция до 3 шагов денойзинга через Block-wise Self-Forcing: сначала полный роллаут без градиентов, потом DMD-лосс блок за блоком. Это позволяет обучать 14B модель на одном узле 8×80GB GPU.

3. PR-Sink — умный KV-кэш: Static Sink (референс), Dynamic Sink (похожая поза из банка памяти по retrieval) + скользящее окно. Это держит внешний вид стабильным на длинных роллаутах.

Результат: трёхминутное видео без дрейфа идентичности, ~20 FPS.

https://arxiv.org/abs/2608.11745
Beam Search для мыслей: как перестать тратить GPU впустую на рассуждения

Параллельный сэмплинг reasoning-трасс — стандарт тест-тайм скейлинга. Но это дико неэффективно: сотни длинных трасс, большинство ведут в никуда, GPU то перегружен, то простаивает.

Авторы из Princeton предлагают Gambit — beam search на уровне "мыслей". Идея: не запускать трассы независимо, а периодически оценивать частичные рассуждения, обрезать плохие и ветвиться от лучших префиксов. Zero-sum политика: число активных трасс всегда константно, GPU не простаивает.

Ключевой трюк — warmup threshold: не оценивать трассы слишком рано, когда сигналы ещё шумные. Плюс decoupled memory management, чтобы не схлопнуться в одну "жадную" ветку.

Результат: +6.7% на HMMT-24, +3.3% на AIME-25 vs агрессивного прунинга, при этом на 68.5% меньше токенов vs параллельного сэмплинга. Throughput 2x выше.

https://arxiv.org/abs/2608.08020
Specification-first вместо code review: рефакторинг 189 файлов без единого ревьюера

Классическая проблема AI-агентов: код генерируется быстро, но ревью становится бутылочным горлышком. Особенно когда изменение затрагивает сотни взаимозависимых файлов — ни один человек не удержит весь граф зависимостей в голове.

Авторы предлагают перенести контроль РАНЬШЕ генерации. Вместо ревью кода — ревью спецификации. Протокол такой: сначала агент многократно сверяет спецификацию с реальным кодом, пока та не перестаёт давать расхождения. Потом код генерируется против замороженной спецификации. Потом свежая сессия того же агента сверяет результат с той же спецификацией — без памяти о процессе генерации.

Стресс-тест: удаление lifetime-инварианта в стриминговой подсистеме (717k строк TypeScript, 189 файлов, нет тестового оракула). Задача из разряда "проще переписать". Выполнено за 3 дня без единого человеческого ревью кода.
🤔1
ИИ для реальных открытий — не просто "ответить на вопрос", а пройти весь путь до результата

Большинство бенчмарков проверяют, может ли модель дать правильный ответ на заранее сформулированный вопрос. Но реальные научные задачи — разработка терапий, новых материалов — не приходят с готовой постановкой.

Apodex предлагают концепцию "heavy-duty solver" и фреймворк Discoverative AI. Идея: нужны четыре компонента инфраструктуры — формулировка задачи, среда с реальными данными и инструментами, верификация промежуточных и финальных результатов, и петли исправления ошибок.

Они выпускают бенчмарк TRACES с реальными задачами: дизайн капсидов AAV-вирусов, репозиционирование лекарств, анализ клинических данных. Важно: оценивается не только финальный ответ, но и весь trajectory — правильно ли агент декомпозировал задачу, исправлял ли ошибки по ходу.

На задаче дизайна AAV-капсидов их система превзошла опубликованный SOTA. Это ближе к тому, как работает реальная наука.

https://arxiv.org/abs/2608.11341
ACID для агентов — базы данных уже так умеют, почему агенты нет?

Когда LLM-агент выполняет длинную задачу (анализ данных, написание кода), он может упасть на середине и оставить всё в хаосе — файлы изменены, часть шагов выполнена, результат неверный. Авторы из Tsinghua предлагают перенести принципы ACID из баз данных в мир агентов.

Идея: каждый цикл "исследование → выполнение → валидация" — это транзакция. Если валидация провалилась — откат. Если прошла — коммит в append-only workspace.

Конкретно: агент оценивает уверенность в своих решениях и коде (divergence между P(решение|данные) и P(код|данные)), и если уверенность низкая — делает retry с обратной связью, а не тихо коммитит мусор. Изоляция параллельных агентов через версионированные воркспейсы. Durability — через граф памяти только из валидированных шагов.

На практике: Claude Code дал ответ 0.261 (неверно агрегировал данные), ACID-Agent поймал это и пересчитал — 0.206.

https://arxiv.org/abs/2608.13900
MegaParts: генерируем 3D-объекты из 300 деталей авторегрессионно (by Shanghai AI Laboratory)

Генерация 3D-объектов обычно игнорирует их составную природу — объект как единое целое, без деталей и компонентов. Это мешает редактированию и управлению структурой. Авторы предлагают MegaParts — авторегрессионный фреймворк, который генерирует объекты покомпонентно, масштабируясь до 300 частей.

Ключевая идея: адаптивный токенайзер для каждой части объекта. Простые детали кодируются несколькими токенами, сложные — длинными последовательностями. Это решает главный трейдофф между качеством геометрии и длиной контекста.

Генерация идёт как chain-of-thought: сначала bounding box объекта, потом bbox каждой части, потом геометрия внутри. Итого — до 256k токенов на объект.

Результат: качество выше диффузионных методов, а масштаб — в 6 раз больше по числу частей, чем у конкурентов.

https://arxiv.org/abs/2608.14783