Nvidia запустила поддержку Qwen3.8-2.4T-A95B на GB300 NVL72
Alibaba выпустила открытые веса своей крупнейшей модели — Qwen3.8-2.4T-A95B с 2,4 триллиона параметров (95B активируется на каждый токен). Nvidia обеспечила её запуск на своей стойке GB300 NVL72 уже в день релиза.
Что важно: модель показывает свыше 4000 токенов в секунду на GPU и более 350 токенов в секунду на пользователя в режиме FP8 — без дополнительной оптимизации. Архитектура MoE делает инференс экономичным: платишь за 95B активных параметров, а не за все 2,4T.
Модель поддерживает контекст до 1 млн токенов и встроенные уровни глубины рассуждений (low/high/xhigh) — можно гибко балансировать между скоростью и качеством под конкретную задачу.
Доступна через SGLang, vLLM, NVIDIA Dynamo и NIM-контейнер. Веса — на Hugging Face и ModelScope.
https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
Alibaba выпустила открытые веса своей крупнейшей модели — Qwen3.8-2.4T-A95B с 2,4 триллиона параметров (95B активируется на каждый токен). Nvidia обеспечила её запуск на своей стойке GB300 NVL72 уже в день релиза.
Что важно: модель показывает свыше 4000 токенов в секунду на GPU и более 350 токенов в секунду на пользователя в режиме FP8 — без дополнительной оптимизации. Архитектура MoE делает инференс экономичным: платишь за 95B активных параметров, а не за все 2,4T.
Модель поддерживает контекст до 1 млн токенов и встроенные уровни глубины рассуждений (low/high/xhigh) — можно гибко балансировать между скоростью и качеством под конкретную задачу.
Доступна через SGLang, vLLM, NVIDIA Dynamo и NIM-контейнер. Веса — на Hugging Face и ModelScope.
https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
NVIDIA Technical Blog
Serve Qwen3.8-2.4T-A95B, a 2.4T-Parameter Model, with Configurable Reasoning on NVIDIA GB300 NVL72
Alibaba released the open weights for Qwen3.8-2.4T-A95B (Qwen3.8-Max), its largest open-weight model, bringing near-frontier capabilities to the open ecosystem. It has 2.4T total parameters with 95B…
Spark-to-Paper: полный цикл написания научной статьи прямо в вашем coding assistant
Обычно системы автономного написания статей — это отдельные платформы со своей инфраструктурой. Авторы спросили: а нельзя ли всё это сделать просто как набор скиллов внутри обычного coding assistant?
Spark-to-Paper — 13 composable скиллов: планирование, поиск литературы, написание, ревью, генерация фигур, запуск экспериментов. Всё общается через файлы в общей директории. Работает внутри Claude Code, без дополнительной инфраструктуры.
Ключевые фишки: эксперименты планируются ДО того, как смотришь на результаты; если система раз за разом опровергает свою же гипотезу (Self-Refutation Loop) — она останавливается и берёт новую идею; фигуры сначала рисуются image-моделью, потом реконструируются в редактируемый векторный PDF через код.
Результат: 99.5% валидных цитат, обнаружение фабрикаций выросло с 14% до 92%, стоимость ~$8 за статью, ~3 часа работы.
https://arxiv.org/abs/2608.11924
Обычно системы автономного написания статей — это отдельные платформы со своей инфраструктурой. Авторы спросили: а нельзя ли всё это сделать просто как набор скиллов внутри обычного coding assistant?
Spark-to-Paper — 13 composable скиллов: планирование, поиск литературы, написание, ревью, генерация фигур, запуск экспериментов. Всё общается через файлы в общей директории. Работает внутри Claude Code, без дополнительной инфраструктуры.
Ключевые фишки: эксперименты планируются ДО того, как смотришь на результаты; если система раз за разом опровергает свою же гипотезу (Self-Refutation Loop) — она останавливается и берёт новую идею; фигуры сначала рисуются image-моделью, потом реконструируются в редактируемый векторный PDF через код.
Результат: 99.5% валидных цитат, обнаружение фабрикаций выросло с 14% до 92%, стоимость ~$8 за статью, ~3 часа работы.
https://arxiv.org/abs/2608.11924
AI сам изучает себя изнутри — и находит скрытые риски
Mechanist — это агентная система, которая автоматически исследует механизмы работы нейросетей. Вместо того чтобы люди вручную копались в активациях, AI сам генерирует гипотезы, ставит эксперименты, верифицирует результаты и итерируется.
Под капотом: граф знаний из 13 000 статей по интерпретируемости + 43 млн статей из 26 дисциплин + библиотека из 32 методов (SAE, causal tracing и др.).
Что нашёл Mechanist на практике:
— Скрытый риск: unsafe-поведение может передаваться через мультимодальные данные, которые выглядят абсолютно безопасными
— Теорию убеждений: отдельные "belief heads" управляют тем, как модель использует знания в сложных контекстах
— Способ управлять биологическими foundation-моделями через каузальное вмешательство в фичи
По сравнению с Claude Code и AI-Scientist — гипотезы новее, точнее и лучше проверяемы. Interpretability на автопилоте.
https://arxiv.org/abs/2608.12036
Mechanist — это агентная система, которая автоматически исследует механизмы работы нейросетей. Вместо того чтобы люди вручную копались в активациях, AI сам генерирует гипотезы, ставит эксперименты, верифицирует результаты и итерируется.
Под капотом: граф знаний из 13 000 статей по интерпретируемости + 43 млн статей из 26 дисциплин + библиотека из 32 методов (SAE, causal tracing и др.).
Что нашёл Mechanist на практике:
— Скрытый риск: unsafe-поведение может передаваться через мультимодальные данные, которые выглядят абсолютно безопасными
— Теорию убеждений: отдельные "belief heads" управляют тем, как модель использует знания в сложных контекстах
— Способ управлять биологическими foundation-моделями через каузальное вмешательство в фичи
По сравнению с Claude Code и AI-Scientist — гипотезы новее, точнее и лучше проверяемы. Interpretability на автопилоте.
https://arxiv.org/abs/2608.12036
👍1
Библиотека навыков агента растёт — и начинает душить контекстное окно. SkillZip решает это умно.
Проблема: когда LLM-агенту нужны навыки из библиотеки, системы тащат целые пакеты целиком. Если два навыка (Clean CSV и Pivot Table) делят общую процедуру — она загружается дважды. При 100K навыков это катастрофа.
SkillZip меняет единицу хранения с "целого навыка" на "секцию с контрактом" (intent, операции, верификаторы). Поверх этого графа работает MotifZip — он находит повторяющиеся подграфы и сворачивает их в макросы, сохраняя контракт (интерфейс + верификаторы + возможность развернуть обратно). PathHydrate достаёт нужный подграф и разворачивает макросы ровно настолько, насколько нужно задаче.
Результат: сжатие 3.46×, -71% активного хранилища, сохранность зависимостей 99.2%. На ALFWorld обходит SkillDAG на 12.2 пункта.
https://arxiv.org/abs/2608.05604
Проблема: когда LLM-агенту нужны навыки из библиотеки, системы тащат целые пакеты целиком. Если два навыка (Clean CSV и Pivot Table) делят общую процедуру — она загружается дважды. При 100K навыков это катастрофа.
SkillZip меняет единицу хранения с "целого навыка" на "секцию с контрактом" (intent, операции, верификаторы). Поверх этого графа работает MotifZip — он находит повторяющиеся подграфы и сворачивает их в макросы, сохраняя контракт (интерфейс + верификаторы + возможность развернуть обратно). PathHydrate достаёт нужный подграф и разворачивает макросы ровно настолько, насколько нужно задаче.
Результат: сжатие 3.46×, -71% активного хранилища, сохранность зависимостей 99.2%. На ALFWorld обходит SkillDAG на 12.2 пункта.
https://arxiv.org/abs/2608.05604
Google DeepMind представила Gemini 3.7 Flash — новую версию своей рабочей модели для кода и агентов.
Релиз вышел всего через три недели после 3.6 Flash. Главное: модель стала заметно умнее в программировании — точность кода с первой попытки выросла, а на бенчмарке DeepSWE результат улетел с 49% до 65.3%. В веб-разработке модель генерирует более функциональные интерфейсы за меньше промптов.
Для работы с документами в юриспруденции, финансах и биологии — тоже прогресс: GDP.pdf benchmark вырос с 22% до 34%.
Цена снижена вдвое относительно 3.6 Flash: $0.75 за миллион входящих токенов и $3.75 за выходящие.
Пользователи Gemini AI Pro и Ultra уже получают 3.7 Flash через агента Spark. Разработчики могут попробовать через Google AI Studio прямо сейчас.
https://deepmind.google/blog/introducing-gemini-3-7-flash/
Релиз вышел всего через три недели после 3.6 Flash. Главное: модель стала заметно умнее в программировании — точность кода с первой попытки выросла, а на бенчмарке DeepSWE результат улетел с 49% до 65.3%. В веб-разработке модель генерирует более функциональные интерфейсы за меньше промптов.
Для работы с документами в юриспруденции, финансах и биологии — тоже прогресс: GDP.pdf benchmark вырос с 22% до 34%.
Цена снижена вдвое относительно 3.6 Flash: $0.75 за миллион входящих токенов и $3.75 за выходящие.
Пользователи Gemini AI Pro и Ultra уже получают 3.7 Flash через агента Spark. Разработчики могут попробовать через Google AI Studio прямо сейчас.
https://deepmind.google/blog/introducing-gemini-3-7-flash/
Google
Introducing Gemini 3.7 Flash
Gemini 3.7 Flash is our most intelligent workhorse model yet for coding and agents.
Nvidia Tech — новая модель для агентных задач
NVIDIA выпустила Nemotron 3.5 Lightning — открытую MoE-модель на 30B параметров (всего 3B активных). Она создана специально для «рабочей лошадки» в AI-агентах: валидация инструментов, делегирование подзадачам, рутинные вызовы — всё то, на что тратится большинство токенов.
Что важно: модель работает в 4 раза быстрее аналогов по размеру и выполняет 10 000 задач на 30% быстрее, чем Qwen3.6 35B при схожей точности. Деплоится как на DGX Spark, так и в датацентрах.
Для разработчиков: веса, данные и рецепты обучения открыты под лицензией OpenMDW-1.1. Поддержка LoRA, SFT и RL из коробки. Плюс новый инструмент NeMo Switchyard — он сам маршрутизирует задачи между моделями: сложное планирование идёт на Nemotron Ultra, а рутина — на Lightning.
Суть проста: зачем гонять frontier-модель на git pull, если есть быстрый и дешёвый специалист?
https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
NVIDIA выпустила Nemotron 3.5 Lightning — открытую MoE-модель на 30B параметров (всего 3B активных). Она создана специально для «рабочей лошадки» в AI-агентах: валидация инструментов, делегирование подзадачам, рутинные вызовы — всё то, на что тратится большинство токенов.
Что важно: модель работает в 4 раза быстрее аналогов по размеру и выполняет 10 000 задач на 30% быстрее, чем Qwen3.6 35B при схожей точности. Деплоится как на DGX Spark, так и в датацентрах.
Для разработчиков: веса, данные и рецепты обучения открыты под лицензией OpenMDW-1.1. Поддержка LoRA, SFT и RL из коробки. Плюс новый инструмент NeMo Switchyard — он сам маршрутизирует задачи между моделями: сложное планирование идёт на Nemotron Ultra, а рутина — на Lightning.
Суть проста: зачем гонять frontier-модель на git pull, если есть быстрый и дешёвый специалист?
https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
NVIDIA Technical Blog
NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents
Long-running AI agents spend most of their time on high-volume execution: tool calls, result validation, and subagent delegation. Using a frontier reasoning model for every execution step adds cost…
Nvidia Tech запустила NeMo Switchyard — инструмент для умной маршрутизации задач между AI-моделями.
Суть простая: не каждую задачу нужно гнать в самую мощную (и дорогую) модель. Классификация, рассуждения, рутинные запросы — каждый шаг агента теперь может уходить к той модели, которая справится лучше и дешевле.
Switchyard анализирует три вещи: возможности модели, её стоимость и состояние инфраструктуры. На основе этого роутер в реальном времени решает, куда отправить запрос.
Важно: SDK не привязан к конкретному провайдеру. Поддерживаются OpenAI, Anthropic и другие API. Смена модели или эндпоинта не ломает логику роутинга.
Реальные тесты с LangChain и Cognition показали: затраты заметно снижаются при сохранении высокой точности.
Для разработчиков агентов это способ перестать переплачивать за каждый токен и строить более управляемые системы.
https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/
Суть простая: не каждую задачу нужно гнать в самую мощную (и дорогую) модель. Классификация, рассуждения, рутинные запросы — каждый шаг агента теперь может уходить к той модели, которая справится лучше и дешевле.
Switchyard анализирует три вещи: возможности модели, её стоимость и состояние инфраструктуры. На основе этого роутер в реальном времени решает, куда отправить запрос.
Важно: SDK не привязан к конкретному провайдеру. Поддерживаются OpenAI, Anthropic и другие API. Смена модели или эндпоинта не ломает логику роутинга.
Реальные тесты с LangChain и Cognition показали: затраты заметно снижаются при сохранении высокой точности.
Для разработчиков агентов это способ перестать переплачивать за каждый токен и строить более управляемые системы.
https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/
NVIDIA Technical Blog
Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard
Learn how NVIDIA NeMo Switchyard routes AI agent workloads across models using tuning-free and tunable routers that balance model capability, cost, and latency.
Зашифрованные мысли AI оказались не такими уж зашифрованными
Anthropic, OpenAI и Google скрывают внутренние рассуждения своих моделей в зашифрованных блоках — чтобы конкуренты не украли цепочки мыслей. Но исследователи нашли дыру: все блоки шифруются одним глобальным ключом и совместимы между разными моделями одного провайдера.
Атака элегантна: берёшь зашифрованный thinking-блок от умной модели (Claude Opus, GPT-5.6 Sol), передаёшь его слабой модели (Claude Haiku, GPT-5.6 Luna) и просишь "перепиши своё рассуждение". Слабая модель послушно расшифровывает чужие мысли — у неё нет защиты от дистилляции.
Авторы собрали 315 320 публично выложенных thinking-блоков из GitHub и нашли там 62 API-ключа, 33 пароля, 30 личных email. Люди постили логи агентов, не подозревая, что внутри зашифрованного мусора — их секреты.
Бонус-атака: можно подсунуть жертве отравленный thinking-блок с инструкциями — модель выполнит их незаметно для пользователя.
https://arxiv.org/abs/2608.09867
Anthropic, OpenAI и Google скрывают внутренние рассуждения своих моделей в зашифрованных блоках — чтобы конкуренты не украли цепочки мыслей. Но исследователи нашли дыру: все блоки шифруются одним глобальным ключом и совместимы между разными моделями одного провайдера.
Атака элегантна: берёшь зашифрованный thinking-блок от умной модели (Claude Opus, GPT-5.6 Sol), передаёшь его слабой модели (Claude Haiku, GPT-5.6 Luna) и просишь "перепиши своё рассуждение". Слабая модель послушно расшифровывает чужие мысли — у неё нет защиты от дистилляции.
Авторы собрали 315 320 публично выложенных thinking-блоков из GitHub и нашли там 62 API-ключа, 33 пароля, 30 личных email. Люди постили логи агентов, не подозревая, что внутри зашифрованного мусора — их секреты.
Бонус-атака: можно подсунуть жертве отравленный thinking-блок с инструкциями — модель выполнит их незаметно для пользователя.
https://arxiv.org/abs/2608.09867
Интерактивный мировой движок, который генерирует без остановки 2 часа подряд
Alaya-EVOKE решает три проблемы сразу: persistent memory, быстрый отклик на команды и бесконечно долгая генерация. Ключевая идея — разделить ответственность. Вместо того чтобы пихать всю историю сессии в контекст диффузионной модели (что делает каждый шаг дороже), авторы выносят геометрию сцены во внешний world state bank, индексированный по позиции камеры. Деноизер всегда работает с фиксированным контекстом — независимо от длины сессии.
Второй трюк — переработанный teacher для дистилляции: chunk-wise sparse attention + отдельный текстовый промпт на каждый чанк. Это позволяет студенту (3 шага, без CFG) менять элементы сцены прямо на лету — добавить фейерверк, убрать воздушный шар — не ломая остальное.
Результат: 1.5-секундный чанк генерируется за 2.11 сек на одном H200, а сессия может длиться хоть 2 часа без деградации.
https://arxiv.org/abs/2608.13546
Alaya-EVOKE решает три проблемы сразу: persistent memory, быстрый отклик на команды и бесконечно долгая генерация. Ключевая идея — разделить ответственность. Вместо того чтобы пихать всю историю сессии в контекст диффузионной модели (что делает каждый шаг дороже), авторы выносят геометрию сцены во внешний world state bank, индексированный по позиции камеры. Деноизер всегда работает с фиксированным контекстом — независимо от длины сессии.
Второй трюк — переработанный teacher для дистилляции: chunk-wise sparse attention + отдельный текстовый промпт на каждый чанк. Это позволяет студенту (3 шага, без CFG) менять элементы сцены прямо на лету — добавить фейерверк, убрать воздушный шар — не ломая остальное.
Результат: 1.5-секундный чанк генерируется за 2.11 сек на одном H200, а сессия может длиться хоть 2 часа без деградации.
https://arxiv.org/abs/2608.13546
Единый фреймворк для роутинга между LLM-моделями
Зачем гонять каждый запрос через дорогой GPT-4, если с 80% задач справится дешёвая модель? Роутинг — выбор нужной LLM под каждый запрос — активно исследуется, но сравнивать подходы почти невозможно: у всех разные кодовые базы, метрики и наборы моделей.
Авторы из UIUC предложили LLMRouter — единую инфраструктуру, где любой роутер описывается пятью компонентами: энкодер контекста, энкодер модели, скоринговая функция, правило выбора и сигнал обучения. Это покрывает три семейства роутеров: single-turn, multi-turn/agentic и персонализированные.
В комплекте — бенчмарк xRouteBench с 18 кандидатами-моделями и 4 ключевых вывода: ни один роутер не побеждает везде; обученный роутинг лучше стратегии "всегда бери самую большую модель"; multi-turn не всегда выигрывает у single-turn; персонализация работает, но только при хорошем моделировании пользователя.
https://arxiv.org/abs/2608.06867
Зачем гонять каждый запрос через дорогой GPT-4, если с 80% задач справится дешёвая модель? Роутинг — выбор нужной LLM под каждый запрос — активно исследуется, но сравнивать подходы почти невозможно: у всех разные кодовые базы, метрики и наборы моделей.
Авторы из UIUC предложили LLMRouter — единую инфраструктуру, где любой роутер описывается пятью компонентами: энкодер контекста, энкодер модели, скоринговая функция, правило выбора и сигнал обучения. Это покрывает три семейства роутеров: single-turn, multi-turn/agentic и персонализированные.
В комплекте — бенчмарк xRouteBench с 18 кандидатами-моделями и 4 ключевых вывода: ни один роутер не побеждает везде; обученный роутинг лучше стратегии "всегда бери самую большую модель"; multi-turn не всегда выигрывает у single-turn; персонализация работает, но только при хорошем моделировании пользователя.
https://arxiv.org/abs/2608.06867
Apple ML представила исследование об ускорении машинного "забывания" данных.
Суть проблемы: когда нужно удалить данные пользователя из обученной модели (например, по запросу GDPR), стандартные методы unlearning обрабатывают все точки данных одинаково — это дорого и долго.
Что придумали в Apple: не все данные одинаково влияют на модель. Некоторые точки практически не оставляют следа в весах — их можно просто пропустить при unlearning без потери качества. Исследователи научились заранее выявлять такие "незначительные" точки через анализ функций влияния.
Результат: сокращение вычислительных затрат до 50% на реальных задачах в области зрения и языка.
Почему важно: право на удаление данных становится стандартом, и делать это эффективно — критично для масштабируемых AI-систем. Apple явно усиливает позиции в теме приватности ML.
https://machinelearning.apple.com/research/unlearning-low-influence-points
Суть проблемы: когда нужно удалить данные пользователя из обученной модели (например, по запросу GDPR), стандартные методы unlearning обрабатывают все точки данных одинаково — это дорого и долго.
Что придумали в Apple: не все данные одинаково влияют на модель. Некоторые точки практически не оставляют следа в весах — их можно просто пропустить при unlearning без потери качества. Исследователи научились заранее выявлять такие "незначительные" точки через анализ функций влияния.
Результат: сокращение вычислительных затрат до 50% на реальных задачах в области зрения и языка.
Почему важно: право на удаление данных становится стандартом, и делать это эффективно — критично для масштабируемых AI-систем. Apple явно усиливает позиции в теме приватности ML.
https://machinelearning.apple.com/research/unlearning-low-influence-points
Apple Machine Learning Research
When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
As concerns around data privacy in machine learning grow, the ability to unlearn, or remove, specific data points from trained models…
PyTorch: FP8-обучение на AMD GPU теперь в основной ветке TorchTitan
AMD совместно с командой PyTorch влила оптимизации из библиотеки Primus-Turbo напрямую в TorchTitan и TorchAO. Теперь AMD Instinct GPU поддерживаются нативно — без сторонних патчей.
Что конкретно улучшилось:
На плотных моделях вроде Llama3-8B прирост пропускной способности составил 13,4% по сравнению с BF16. На MoE-архитектурах (DeepSeek-V3 671B) через слияние Triton-ядер удалось вернуть 89% потерь от FP8-квантизации, а отдельные операции ускорились в 6,2 раза.
Исправлена критическая ошибка: AMD использует формат e4m3fnuz с другим диапазоном значений, чем NVIDIA. Раньше TorchAO молча выдавал неверные результаты — градиенты портились без каких-либо ошибок. Теперь формат определяется автоматически.
Итог: обучение больших моделей на AMD-кластерах стало быстрее, корректнее и доступно из коробки.
https://pytorch.org/blog/fp8-training-on-amd-gpus-with-torchtitan-and-torchao-upstreaming-performance-improvements/
AMD совместно с командой PyTorch влила оптимизации из библиотеки Primus-Turbo напрямую в TorchTitan и TorchAO. Теперь AMD Instinct GPU поддерживаются нативно — без сторонних патчей.
Что конкретно улучшилось:
На плотных моделях вроде Llama3-8B прирост пропускной способности составил 13,4% по сравнению с BF16. На MoE-архитектурах (DeepSeek-V3 671B) через слияние Triton-ядер удалось вернуть 89% потерь от FP8-квантизации, а отдельные операции ускорились в 6,2 раза.
Исправлена критическая ошибка: AMD использует формат e4m3fnuz с другим диапазоном значений, чем NVIDIA. Раньше TorchAO молча выдавал неверные результаты — градиенты портились без каких-либо ошибок. Теперь формат определяется автоматически.
Итог: обучение больших моделей на AMD-кластерах стало быстрее, корректнее и доступно из коробки.
https://pytorch.org/blog/fp8-training-on-amd-gpus-with-torchtitan-and-torchao-upstreaming-performance-improvements/
DreamX-Phi 1.0: робот-манипулятор видит будущее (by Alibaba)
Хотите, чтобы робот не просто выполнял команды, а сначала "воображал" результат? Именно это делает DreamX-Phi — видео-модель мира, которая по одному кадру и заданной траектории рук предсказывает, как будет выглядеть сцена после манипуляции.
Главная проблема предыдущих подходов: красивое видео ≠ правильное движение. Модель могла генерировать реалистичный ролик, но рука двигалась не туда или хватала воздух.
Решение DreamX-Phi — три ключевых компонента:
1. SE(3)-траектории через PRoPE-attention — сохраняют реальную 3D-геометрию движения манипулятора
2. Оптический поток только от робота — явно показывает, где в кадре должно происходить движение
3. Depth + SAM3 маски + V-JEPA — следят за физической согласованностью объекта во времени
Обучение на 10к+ часов данных (Ego4D, AgiBot, симуляция). На WorldArena 2.0 — 1-е место в Track 1.
https://arxiv.org/abs/2608.13489
Хотите, чтобы робот не просто выполнял команды, а сначала "воображал" результат? Именно это делает DreamX-Phi — видео-модель мира, которая по одному кадру и заданной траектории рук предсказывает, как будет выглядеть сцена после манипуляции.
Главная проблема предыдущих подходов: красивое видео ≠ правильное движение. Модель могла генерировать реалистичный ролик, но рука двигалась не туда или хватала воздух.
Решение DreamX-Phi — три ключевых компонента:
1. SE(3)-траектории через PRoPE-attention — сохраняют реальную 3D-геометрию движения манипулятора
2. Оптический поток только от робота — явно показывает, где в кадре должно происходить движение
3. Depth + SAM3 маски + V-JEPA — следят за физической согласованностью объекта во времени
Обучение на 10к+ часов данных (Ego4D, AgiBot, симуляция). На WorldArena 2.0 — 1-е место в Track 1.
https://arxiv.org/abs/2608.13489
DarwinX: эволюция агентов без обучения весов (by Salesforce AI Research)
Что если улучшать агента не дообучением, а эволюцией его "оболочки" — промптов, инструментов и control flow?
DarwinX именно это и делает. Веса модели заморожены навсегда. Эволюционирует только harness вокруг неё. Каждый раз система предлагает небольшое изменение, запускает агента на реальных задачах и принимает правку только если она что-то улучшила, не сломав старое — "preserve-and-extend contract".
Ключевая идея: вместо одной линии улучшений — популяция веток-архив. Ветка, которая проиграла в общем зачёте, не выбрасывается — она может содержать единственный нужный фикс, который в комбинации с другой веткой откроет новые задачи.
Результаты впечатляют: Terminal-Bench 2.1 — 84.7%, WebArena-Infinity вырос с 43.5% до 93.0%, причём harness обученный на синтетике переносится на реальные задачи без дополнительной адаптации.
https://arxiv.org/abs/2608.07545
Что если улучшать агента не дообучением, а эволюцией его "оболочки" — промптов, инструментов и control flow?
DarwinX именно это и делает. Веса модели заморожены навсегда. Эволюционирует только harness вокруг неё. Каждый раз система предлагает небольшое изменение, запускает агента на реальных задачах и принимает правку только если она что-то улучшила, не сломав старое — "preserve-and-extend contract".
Ключевая идея: вместо одной линии улучшений — популяция веток-архив. Ветка, которая проиграла в общем зачёте, не выбрасывается — она может содержать единственный нужный фикс, который в комбинации с другой веткой откроет новые задачи.
Результаты впечатляют: Terminal-Bench 2.1 — 84.7%, WebArena-Infinity вырос с 43.5% до 93.0%, причём harness обученный на синтетике переносится на реальные задачи без дополнительной адаптации.
https://arxiv.org/abs/2608.07545
Intern-S2-Preview: научный агент на 397B параметров
Хотите модель, которая не просто отвечает на вопросы по науке, а реально работает как исследователь — запускает инструменты, итеративно планирует и адаптируется к новым доменам без переобучения?
Intern-S2-Preview-397B — это именно такая попытка. Ключевые фишки:
1. Memory Decoder: вместо дообучения огромного backbone к нему просто "прикручивается" маленькая параметрическая память (4B) с доменными знаниями. Лёгкий роутер на каждом токене решает, сколько брать от базовой модели, а сколько от памяти. Backbone при этом заморожен.
2. Time Series модуль: отдельная ветка для прогнозирования временных рядов поверх стандартного энкодера для длинных сигналов.
3. Agentic RL: специальный фреймворк для обучения с подкреплением на длинных агентских траекториях с верифицируемыми наградами.
По бенчмаркам — конкурентный уровень на научных, мультимодальных и агентских задачах.
https://arxiv.org/abs/2608.13505
Хотите модель, которая не просто отвечает на вопросы по науке, а реально работает как исследователь — запускает инструменты, итеративно планирует и адаптируется к новым доменам без переобучения?
Intern-S2-Preview-397B — это именно такая попытка. Ключевые фишки:
1. Memory Decoder: вместо дообучения огромного backbone к нему просто "прикручивается" маленькая параметрическая память (4B) с доменными знаниями. Лёгкий роутер на каждом токене решает, сколько брать от базовой модели, а сколько от памяти. Backbone при этом заморожен.
2. Time Series модуль: отдельная ветка для прогнозирования временных рядов поверх стандартного энкодера для длинных сигналов.
3. Agentic RL: специальный фреймворк для обучения с подкреплением на длинных агентских траекториях с верифицируемыми наградами.
По бенчмаркам — конкурентный уровень на научных, мультимодальных и агентских задачах.
https://arxiv.org/abs/2608.13505
LiveAnimate: анимация человека в реальном времени на 14B DiT (by Alibaba Qwen)
Все существующие системы pose-driven анимации работают офлайн — минуты или часы на клип. LiveAnimate — первая система, которая делает это в реальном времени (~20 FPS на 2×H100) с 14B-параметрной моделью.
Как это работает:
1. Stage 1 — превращают двунаправленный DiT в каузальный генератор через teacher-forcing: каждый блок обучается на чистой GT-истории, а референсное изображение всегда видно через глобальный Ref Sink.
2. Stage 2 — дистилляция до 3 шагов денойзинга через Block-wise Self-Forcing: сначала полный роллаут без градиентов, потом DMD-лосс блок за блоком. Это позволяет обучать 14B модель на одном узле 8×80GB GPU.
3. PR-Sink — умный KV-кэш: Static Sink (референс), Dynamic Sink (похожая поза из банка памяти по retrieval) + скользящее окно. Это держит внешний вид стабильным на длинных роллаутах.
Результат: трёхминутное видео без дрейфа идентичности, ~20 FPS.
https://arxiv.org/abs/2608.11745
Все существующие системы pose-driven анимации работают офлайн — минуты или часы на клип. LiveAnimate — первая система, которая делает это в реальном времени (~20 FPS на 2×H100) с 14B-параметрной моделью.
Как это работает:
1. Stage 1 — превращают двунаправленный DiT в каузальный генератор через teacher-forcing: каждый блок обучается на чистой GT-истории, а референсное изображение всегда видно через глобальный Ref Sink.
2. Stage 2 — дистилляция до 3 шагов денойзинга через Block-wise Self-Forcing: сначала полный роллаут без градиентов, потом DMD-лосс блок за блоком. Это позволяет обучать 14B модель на одном узле 8×80GB GPU.
3. PR-Sink — умный KV-кэш: Static Sink (референс), Dynamic Sink (похожая поза из банка памяти по retrieval) + скользящее окно. Это держит внешний вид стабильным на длинных роллаутах.
Результат: трёхминутное видео без дрейфа идентичности, ~20 FPS.
https://arxiv.org/abs/2608.11745
Beam Search для мыслей: как перестать тратить GPU впустую на рассуждения
Параллельный сэмплинг reasoning-трасс — стандарт тест-тайм скейлинга. Но это дико неэффективно: сотни длинных трасс, большинство ведут в никуда, GPU то перегружен, то простаивает.
Авторы из Princeton предлагают Gambit — beam search на уровне "мыслей". Идея: не запускать трассы независимо, а периодически оценивать частичные рассуждения, обрезать плохие и ветвиться от лучших префиксов. Zero-sum политика: число активных трасс всегда константно, GPU не простаивает.
Ключевой трюк — warmup threshold: не оценивать трассы слишком рано, когда сигналы ещё шумные. Плюс decoupled memory management, чтобы не схлопнуться в одну "жадную" ветку.
Результат: +6.7% на HMMT-24, +3.3% на AIME-25 vs агрессивного прунинга, при этом на 68.5% меньше токенов vs параллельного сэмплинга. Throughput 2x выше.
https://arxiv.org/abs/2608.08020
Параллельный сэмплинг reasoning-трасс — стандарт тест-тайм скейлинга. Но это дико неэффективно: сотни длинных трасс, большинство ведут в никуда, GPU то перегружен, то простаивает.
Авторы из Princeton предлагают Gambit — beam search на уровне "мыслей". Идея: не запускать трассы независимо, а периодически оценивать частичные рассуждения, обрезать плохие и ветвиться от лучших префиксов. Zero-sum политика: число активных трасс всегда константно, GPU не простаивает.
Ключевой трюк — warmup threshold: не оценивать трассы слишком рано, когда сигналы ещё шумные. Плюс decoupled memory management, чтобы не схлопнуться в одну "жадную" ветку.
Результат: +6.7% на HMMT-24, +3.3% на AIME-25 vs агрессивного прунинга, при этом на 68.5% меньше токенов vs параллельного сэмплинга. Throughput 2x выше.
https://arxiv.org/abs/2608.08020
Specification-first вместо code review: рефакторинг 189 файлов без единого ревьюера
Классическая проблема AI-агентов: код генерируется быстро, но ревью становится бутылочным горлышком. Особенно когда изменение затрагивает сотни взаимозависимых файлов — ни один человек не удержит весь граф зависимостей в голове.
Авторы предлагают перенести контроль РАНЬШЕ генерации. Вместо ревью кода — ревью спецификации. Протокол такой: сначала агент многократно сверяет спецификацию с реальным кодом, пока та не перестаёт давать расхождения. Потом код генерируется против замороженной спецификации. Потом свежая сессия того же агента сверяет результат с той же спецификацией — без памяти о процессе генерации.
Стресс-тест: удаление lifetime-инварианта в стриминговой подсистеме (717k строк TypeScript, 189 файлов, нет тестового оракула). Задача из разряда "проще переписать". Выполнено за 3 дня без единого человеческого ревью кода.
Классическая проблема AI-агентов: код генерируется быстро, но ревью становится бутылочным горлышком. Особенно когда изменение затрагивает сотни взаимозависимых файлов — ни один человек не удержит весь граф зависимостей в голове.
Авторы предлагают перенести контроль РАНЬШЕ генерации. Вместо ревью кода — ревью спецификации. Протокол такой: сначала агент многократно сверяет спецификацию с реальным кодом, пока та не перестаёт давать расхождения. Потом код генерируется против замороженной спецификации. Потом свежая сессия того же агента сверяет результат с той же спецификацией — без памяти о процессе генерации.
Стресс-тест: удаление lifetime-инварианта в стриминговой подсистеме (717k строк TypeScript, 189 файлов, нет тестового оракула). Задача из разряда "проще переписать". Выполнено за 3 дня без единого человеческого ревью кода.
🤔1
ИИ для реальных открытий — не просто "ответить на вопрос", а пройти весь путь до результата
Большинство бенчмарков проверяют, может ли модель дать правильный ответ на заранее сформулированный вопрос. Но реальные научные задачи — разработка терапий, новых материалов — не приходят с готовой постановкой.
Apodex предлагают концепцию "heavy-duty solver" и фреймворк Discoverative AI. Идея: нужны четыре компонента инфраструктуры — формулировка задачи, среда с реальными данными и инструментами, верификация промежуточных и финальных результатов, и петли исправления ошибок.
Они выпускают бенчмарк TRACES с реальными задачами: дизайн капсидов AAV-вирусов, репозиционирование лекарств, анализ клинических данных. Важно: оценивается не только финальный ответ, но и весь trajectory — правильно ли агент декомпозировал задачу, исправлял ли ошибки по ходу.
На задаче дизайна AAV-капсидов их система превзошла опубликованный SOTA. Это ближе к тому, как работает реальная наука.
https://arxiv.org/abs/2608.11341
Большинство бенчмарков проверяют, может ли модель дать правильный ответ на заранее сформулированный вопрос. Но реальные научные задачи — разработка терапий, новых материалов — не приходят с готовой постановкой.
Apodex предлагают концепцию "heavy-duty solver" и фреймворк Discoverative AI. Идея: нужны четыре компонента инфраструктуры — формулировка задачи, среда с реальными данными и инструментами, верификация промежуточных и финальных результатов, и петли исправления ошибок.
Они выпускают бенчмарк TRACES с реальными задачами: дизайн капсидов AAV-вирусов, репозиционирование лекарств, анализ клинических данных. Важно: оценивается не только финальный ответ, но и весь trajectory — правильно ли агент декомпозировал задачу, исправлял ли ошибки по ходу.
На задаче дизайна AAV-капсидов их система превзошла опубликованный SOTA. Это ближе к тому, как работает реальная наука.
https://arxiv.org/abs/2608.11341
ACID для агентов — базы данных уже так умеют, почему агенты нет?
Когда LLM-агент выполняет длинную задачу (анализ данных, написание кода), он может упасть на середине и оставить всё в хаосе — файлы изменены, часть шагов выполнена, результат неверный. Авторы из Tsinghua предлагают перенести принципы ACID из баз данных в мир агентов.
Идея: каждый цикл "исследование → выполнение → валидация" — это транзакция. Если валидация провалилась — откат. Если прошла — коммит в append-only workspace.
Конкретно: агент оценивает уверенность в своих решениях и коде (divergence между P(решение|данные) и P(код|данные)), и если уверенность низкая — делает retry с обратной связью, а не тихо коммитит мусор. Изоляция параллельных агентов через версионированные воркспейсы. Durability — через граф памяти только из валидированных шагов.
На практике: Claude Code дал ответ 0.261 (неверно агрегировал данные), ACID-Agent поймал это и пересчитал — 0.206.
https://arxiv.org/abs/2608.13900
Когда LLM-агент выполняет длинную задачу (анализ данных, написание кода), он может упасть на середине и оставить всё в хаосе — файлы изменены, часть шагов выполнена, результат неверный. Авторы из Tsinghua предлагают перенести принципы ACID из баз данных в мир агентов.
Идея: каждый цикл "исследование → выполнение → валидация" — это транзакция. Если валидация провалилась — откат. Если прошла — коммит в append-only workspace.
Конкретно: агент оценивает уверенность в своих решениях и коде (divergence между P(решение|данные) и P(код|данные)), и если уверенность низкая — делает retry с обратной связью, а не тихо коммитит мусор. Изоляция параллельных агентов через версионированные воркспейсы. Durability — через граф памяти только из валидированных шагов.
На практике: Claude Code дал ответ 0.261 (неверно агрегировал данные), ACID-Agent поймал это и пересчитал — 0.206.
https://arxiv.org/abs/2608.13900
MegaParts: генерируем 3D-объекты из 300 деталей авторегрессионно (by Shanghai AI Laboratory)
Генерация 3D-объектов обычно игнорирует их составную природу — объект как единое целое, без деталей и компонентов. Это мешает редактированию и управлению структурой. Авторы предлагают MegaParts — авторегрессионный фреймворк, который генерирует объекты покомпонентно, масштабируясь до 300 частей.
Ключевая идея: адаптивный токенайзер для каждой части объекта. Простые детали кодируются несколькими токенами, сложные — длинными последовательностями. Это решает главный трейдофф между качеством геометрии и длиной контекста.
Генерация идёт как chain-of-thought: сначала bounding box объекта, потом bbox каждой части, потом геометрия внутри. Итого — до 256k токенов на объект.
Результат: качество выше диффузионных методов, а масштаб — в 6 раз больше по числу частей, чем у конкурентов.
https://arxiv.org/abs/2608.14783
Генерация 3D-объектов обычно игнорирует их составную природу — объект как единое целое, без деталей и компонентов. Это мешает редактированию и управлению структурой. Авторы предлагают MegaParts — авторегрессионный фреймворк, который генерирует объекты покомпонентно, масштабируясь до 300 частей.
Ключевая идея: адаптивный токенайзер для каждой части объекта. Простые детали кодируются несколькими токенами, сложные — длинными последовательностями. Это решает главный трейдофф между качеством геометрии и длиной контекста.
Генерация идёт как chain-of-thought: сначала bounding box объекта, потом bbox каждой части, потом геометрия внутри. Итого — до 256k токенов на объект.
Результат: качество выше диффузионных методов, а масштаб — в 6 раз больше по числу частей, чем у конкурентов.
https://arxiv.org/abs/2608.14783