AI сам изучает себя изнутри — и находит скрытые риски
Mechanist — это агентная система, которая автоматически исследует механизмы работы нейросетей. Вместо того чтобы люди вручную копались в активациях, AI сам генерирует гипотезы, ставит эксперименты, верифицирует результаты и итерируется.
Под капотом: граф знаний из 13 000 статей по интерпретируемости + 43 млн статей из 26 дисциплин + библиотека из 32 методов (SAE, causal tracing и др.).
Что нашёл Mechanist на практике:
— Скрытый риск: unsafe-поведение может передаваться через мультимодальные данные, которые выглядят абсолютно безопасными
— Теорию убеждений: отдельные "belief heads" управляют тем, как модель использует знания в сложных контекстах
— Способ управлять биологическими foundation-моделями через каузальное вмешательство в фичи
По сравнению с Claude Code и AI-Scientist — гипотезы новее, точнее и лучше проверяемы. Interpretability на автопилоте.
https://arxiv.org/abs/2608.12036
Mechanist — это агентная система, которая автоматически исследует механизмы работы нейросетей. Вместо того чтобы люди вручную копались в активациях, AI сам генерирует гипотезы, ставит эксперименты, верифицирует результаты и итерируется.
Под капотом: граф знаний из 13 000 статей по интерпретируемости + 43 млн статей из 26 дисциплин + библиотека из 32 методов (SAE, causal tracing и др.).
Что нашёл Mechanist на практике:
— Скрытый риск: unsafe-поведение может передаваться через мультимодальные данные, которые выглядят абсолютно безопасными
— Теорию убеждений: отдельные "belief heads" управляют тем, как модель использует знания в сложных контекстах
— Способ управлять биологическими foundation-моделями через каузальное вмешательство в фичи
По сравнению с Claude Code и AI-Scientist — гипотезы новее, точнее и лучше проверяемы. Interpretability на автопилоте.
https://arxiv.org/abs/2608.12036
👍1
Библиотека навыков агента растёт — и начинает душить контекстное окно. SkillZip решает это умно.
Проблема: когда LLM-агенту нужны навыки из библиотеки, системы тащат целые пакеты целиком. Если два навыка (Clean CSV и Pivot Table) делят общую процедуру — она загружается дважды. При 100K навыков это катастрофа.
SkillZip меняет единицу хранения с "целого навыка" на "секцию с контрактом" (intent, операции, верификаторы). Поверх этого графа работает MotifZip — он находит повторяющиеся подграфы и сворачивает их в макросы, сохраняя контракт (интерфейс + верификаторы + возможность развернуть обратно). PathHydrate достаёт нужный подграф и разворачивает макросы ровно настолько, насколько нужно задаче.
Результат: сжатие 3.46×, -71% активного хранилища, сохранность зависимостей 99.2%. На ALFWorld обходит SkillDAG на 12.2 пункта.
https://arxiv.org/abs/2608.05604
Проблема: когда LLM-агенту нужны навыки из библиотеки, системы тащат целые пакеты целиком. Если два навыка (Clean CSV и Pivot Table) делят общую процедуру — она загружается дважды. При 100K навыков это катастрофа.
SkillZip меняет единицу хранения с "целого навыка" на "секцию с контрактом" (intent, операции, верификаторы). Поверх этого графа работает MotifZip — он находит повторяющиеся подграфы и сворачивает их в макросы, сохраняя контракт (интерфейс + верификаторы + возможность развернуть обратно). PathHydrate достаёт нужный подграф и разворачивает макросы ровно настолько, насколько нужно задаче.
Результат: сжатие 3.46×, -71% активного хранилища, сохранность зависимостей 99.2%. На ALFWorld обходит SkillDAG на 12.2 пункта.
https://arxiv.org/abs/2608.05604
Google DeepMind представила Gemini 3.7 Flash — новую версию своей рабочей модели для кода и агентов.
Релиз вышел всего через три недели после 3.6 Flash. Главное: модель стала заметно умнее в программировании — точность кода с первой попытки выросла, а на бенчмарке DeepSWE результат улетел с 49% до 65.3%. В веб-разработке модель генерирует более функциональные интерфейсы за меньше промптов.
Для работы с документами в юриспруденции, финансах и биологии — тоже прогресс: GDP.pdf benchmark вырос с 22% до 34%.
Цена снижена вдвое относительно 3.6 Flash: $0.75 за миллион входящих токенов и $3.75 за выходящие.
Пользователи Gemini AI Pro и Ultra уже получают 3.7 Flash через агента Spark. Разработчики могут попробовать через Google AI Studio прямо сейчас.
https://deepmind.google/blog/introducing-gemini-3-7-flash/
Релиз вышел всего через три недели после 3.6 Flash. Главное: модель стала заметно умнее в программировании — точность кода с первой попытки выросла, а на бенчмарке DeepSWE результат улетел с 49% до 65.3%. В веб-разработке модель генерирует более функциональные интерфейсы за меньше промптов.
Для работы с документами в юриспруденции, финансах и биологии — тоже прогресс: GDP.pdf benchmark вырос с 22% до 34%.
Цена снижена вдвое относительно 3.6 Flash: $0.75 за миллион входящих токенов и $3.75 за выходящие.
Пользователи Gemini AI Pro и Ultra уже получают 3.7 Flash через агента Spark. Разработчики могут попробовать через Google AI Studio прямо сейчас.
https://deepmind.google/blog/introducing-gemini-3-7-flash/
Google
Introducing Gemini 3.7 Flash
Gemini 3.7 Flash is our most intelligent workhorse model yet for coding and agents.
Nvidia Tech — новая модель для агентных задач
NVIDIA выпустила Nemotron 3.5 Lightning — открытую MoE-модель на 30B параметров (всего 3B активных). Она создана специально для «рабочей лошадки» в AI-агентах: валидация инструментов, делегирование подзадачам, рутинные вызовы — всё то, на что тратится большинство токенов.
Что важно: модель работает в 4 раза быстрее аналогов по размеру и выполняет 10 000 задач на 30% быстрее, чем Qwen3.6 35B при схожей точности. Деплоится как на DGX Spark, так и в датацентрах.
Для разработчиков: веса, данные и рецепты обучения открыты под лицензией OpenMDW-1.1. Поддержка LoRA, SFT и RL из коробки. Плюс новый инструмент NeMo Switchyard — он сам маршрутизирует задачи между моделями: сложное планирование идёт на Nemotron Ultra, а рутина — на Lightning.
Суть проста: зачем гонять frontier-модель на git pull, если есть быстрый и дешёвый специалист?
https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
NVIDIA выпустила Nemotron 3.5 Lightning — открытую MoE-модель на 30B параметров (всего 3B активных). Она создана специально для «рабочей лошадки» в AI-агентах: валидация инструментов, делегирование подзадачам, рутинные вызовы — всё то, на что тратится большинство токенов.
Что важно: модель работает в 4 раза быстрее аналогов по размеру и выполняет 10 000 задач на 30% быстрее, чем Qwen3.6 35B при схожей точности. Деплоится как на DGX Spark, так и в датацентрах.
Для разработчиков: веса, данные и рецепты обучения открыты под лицензией OpenMDW-1.1. Поддержка LoRA, SFT и RL из коробки. Плюс новый инструмент NeMo Switchyard — он сам маршрутизирует задачи между моделями: сложное планирование идёт на Nemotron Ultra, а рутина — на Lightning.
Суть проста: зачем гонять frontier-модель на git pull, если есть быстрый и дешёвый специалист?
https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
NVIDIA Technical Blog
NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents
Long-running AI agents spend most of their time on high-volume execution: tool calls, result validation, and subagent delegation. Using a frontier reasoning model for every execution step adds cost…
Nvidia Tech запустила NeMo Switchyard — инструмент для умной маршрутизации задач между AI-моделями.
Суть простая: не каждую задачу нужно гнать в самую мощную (и дорогую) модель. Классификация, рассуждения, рутинные запросы — каждый шаг агента теперь может уходить к той модели, которая справится лучше и дешевле.
Switchyard анализирует три вещи: возможности модели, её стоимость и состояние инфраструктуры. На основе этого роутер в реальном времени решает, куда отправить запрос.
Важно: SDK не привязан к конкретному провайдеру. Поддерживаются OpenAI, Anthropic и другие API. Смена модели или эндпоинта не ломает логику роутинга.
Реальные тесты с LangChain и Cognition показали: затраты заметно снижаются при сохранении высокой точности.
Для разработчиков агентов это способ перестать переплачивать за каждый токен и строить более управляемые системы.
https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/
Суть простая: не каждую задачу нужно гнать в самую мощную (и дорогую) модель. Классификация, рассуждения, рутинные запросы — каждый шаг агента теперь может уходить к той модели, которая справится лучше и дешевле.
Switchyard анализирует три вещи: возможности модели, её стоимость и состояние инфраструктуры. На основе этого роутер в реальном времени решает, куда отправить запрос.
Важно: SDK не привязан к конкретному провайдеру. Поддерживаются OpenAI, Anthropic и другие API. Смена модели или эндпоинта не ломает логику роутинга.
Реальные тесты с LangChain и Cognition показали: затраты заметно снижаются при сохранении высокой точности.
Для разработчиков агентов это способ перестать переплачивать за каждый токен и строить более управляемые системы.
https://developer.nvidia.com/blog/route-ai-agent-workloads-across-models-with-nvidia-nemo-switchyard/
NVIDIA Technical Blog
Route AI Agent Workloads Across Models with NVIDIA NeMo Switchyard
Learn how NVIDIA NeMo Switchyard routes AI agent workloads across models using tuning-free and tunable routers that balance model capability, cost, and latency.
Зашифрованные мысли AI оказались не такими уж зашифрованными
Anthropic, OpenAI и Google скрывают внутренние рассуждения своих моделей в зашифрованных блоках — чтобы конкуренты не украли цепочки мыслей. Но исследователи нашли дыру: все блоки шифруются одним глобальным ключом и совместимы между разными моделями одного провайдера.
Атака элегантна: берёшь зашифрованный thinking-блок от умной модели (Claude Opus, GPT-5.6 Sol), передаёшь его слабой модели (Claude Haiku, GPT-5.6 Luna) и просишь "перепиши своё рассуждение". Слабая модель послушно расшифровывает чужие мысли — у неё нет защиты от дистилляции.
Авторы собрали 315 320 публично выложенных thinking-блоков из GitHub и нашли там 62 API-ключа, 33 пароля, 30 личных email. Люди постили логи агентов, не подозревая, что внутри зашифрованного мусора — их секреты.
Бонус-атака: можно подсунуть жертве отравленный thinking-блок с инструкциями — модель выполнит их незаметно для пользователя.
https://arxiv.org/abs/2608.09867
Anthropic, OpenAI и Google скрывают внутренние рассуждения своих моделей в зашифрованных блоках — чтобы конкуренты не украли цепочки мыслей. Но исследователи нашли дыру: все блоки шифруются одним глобальным ключом и совместимы между разными моделями одного провайдера.
Атака элегантна: берёшь зашифрованный thinking-блок от умной модели (Claude Opus, GPT-5.6 Sol), передаёшь его слабой модели (Claude Haiku, GPT-5.6 Luna) и просишь "перепиши своё рассуждение". Слабая модель послушно расшифровывает чужие мысли — у неё нет защиты от дистилляции.
Авторы собрали 315 320 публично выложенных thinking-блоков из GitHub и нашли там 62 API-ключа, 33 пароля, 30 личных email. Люди постили логи агентов, не подозревая, что внутри зашифрованного мусора — их секреты.
Бонус-атака: можно подсунуть жертве отравленный thinking-блок с инструкциями — модель выполнит их незаметно для пользователя.
https://arxiv.org/abs/2608.09867
Интерактивный мировой движок, который генерирует без остановки 2 часа подряд
Alaya-EVOKE решает три проблемы сразу: persistent memory, быстрый отклик на команды и бесконечно долгая генерация. Ключевая идея — разделить ответственность. Вместо того чтобы пихать всю историю сессии в контекст диффузионной модели (что делает каждый шаг дороже), авторы выносят геометрию сцены во внешний world state bank, индексированный по позиции камеры. Деноизер всегда работает с фиксированным контекстом — независимо от длины сессии.
Второй трюк — переработанный teacher для дистилляции: chunk-wise sparse attention + отдельный текстовый промпт на каждый чанк. Это позволяет студенту (3 шага, без CFG) менять элементы сцены прямо на лету — добавить фейерверк, убрать воздушный шар — не ломая остальное.
Результат: 1.5-секундный чанк генерируется за 2.11 сек на одном H200, а сессия может длиться хоть 2 часа без деградации.
https://arxiv.org/abs/2608.13546
Alaya-EVOKE решает три проблемы сразу: persistent memory, быстрый отклик на команды и бесконечно долгая генерация. Ключевая идея — разделить ответственность. Вместо того чтобы пихать всю историю сессии в контекст диффузионной модели (что делает каждый шаг дороже), авторы выносят геометрию сцены во внешний world state bank, индексированный по позиции камеры. Деноизер всегда работает с фиксированным контекстом — независимо от длины сессии.
Второй трюк — переработанный teacher для дистилляции: chunk-wise sparse attention + отдельный текстовый промпт на каждый чанк. Это позволяет студенту (3 шага, без CFG) менять элементы сцены прямо на лету — добавить фейерверк, убрать воздушный шар — не ломая остальное.
Результат: 1.5-секундный чанк генерируется за 2.11 сек на одном H200, а сессия может длиться хоть 2 часа без деградации.
https://arxiv.org/abs/2608.13546
Единый фреймворк для роутинга между LLM-моделями
Зачем гонять каждый запрос через дорогой GPT-4, если с 80% задач справится дешёвая модель? Роутинг — выбор нужной LLM под каждый запрос — активно исследуется, но сравнивать подходы почти невозможно: у всех разные кодовые базы, метрики и наборы моделей.
Авторы из UIUC предложили LLMRouter — единую инфраструктуру, где любой роутер описывается пятью компонентами: энкодер контекста, энкодер модели, скоринговая функция, правило выбора и сигнал обучения. Это покрывает три семейства роутеров: single-turn, multi-turn/agentic и персонализированные.
В комплекте — бенчмарк xRouteBench с 18 кандидатами-моделями и 4 ключевых вывода: ни один роутер не побеждает везде; обученный роутинг лучше стратегии "всегда бери самую большую модель"; multi-turn не всегда выигрывает у single-turn; персонализация работает, но только при хорошем моделировании пользователя.
https://arxiv.org/abs/2608.06867
Зачем гонять каждый запрос через дорогой GPT-4, если с 80% задач справится дешёвая модель? Роутинг — выбор нужной LLM под каждый запрос — активно исследуется, но сравнивать подходы почти невозможно: у всех разные кодовые базы, метрики и наборы моделей.
Авторы из UIUC предложили LLMRouter — единую инфраструктуру, где любой роутер описывается пятью компонентами: энкодер контекста, энкодер модели, скоринговая функция, правило выбора и сигнал обучения. Это покрывает три семейства роутеров: single-turn, multi-turn/agentic и персонализированные.
В комплекте — бенчмарк xRouteBench с 18 кандидатами-моделями и 4 ключевых вывода: ни один роутер не побеждает везде; обученный роутинг лучше стратегии "всегда бери самую большую модель"; multi-turn не всегда выигрывает у single-turn; персонализация работает, но только при хорошем моделировании пользователя.
https://arxiv.org/abs/2608.06867
Apple ML представила исследование об ускорении машинного "забывания" данных.
Суть проблемы: когда нужно удалить данные пользователя из обученной модели (например, по запросу GDPR), стандартные методы unlearning обрабатывают все точки данных одинаково — это дорого и долго.
Что придумали в Apple: не все данные одинаково влияют на модель. Некоторые точки практически не оставляют следа в весах — их можно просто пропустить при unlearning без потери качества. Исследователи научились заранее выявлять такие "незначительные" точки через анализ функций влияния.
Результат: сокращение вычислительных затрат до 50% на реальных задачах в области зрения и языка.
Почему важно: право на удаление данных становится стандартом, и делать это эффективно — критично для масштабируемых AI-систем. Apple явно усиливает позиции в теме приватности ML.
https://machinelearning.apple.com/research/unlearning-low-influence-points
Суть проблемы: когда нужно удалить данные пользователя из обученной модели (например, по запросу GDPR), стандартные методы unlearning обрабатывают все точки данных одинаково — это дорого и долго.
Что придумали в Apple: не все данные одинаково влияют на модель. Некоторые точки практически не оставляют следа в весах — их можно просто пропустить при unlearning без потери качества. Исследователи научились заранее выявлять такие "незначительные" точки через анализ функций влияния.
Результат: сокращение вычислительных затрат до 50% на реальных задачах в области зрения и языка.
Почему важно: право на удаление данных становится стандартом, и делать это эффективно — критично для масштабируемых AI-систем. Apple явно усиливает позиции в теме приватности ML.
https://machinelearning.apple.com/research/unlearning-low-influence-points
Apple Machine Learning Research
When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
As concerns around data privacy in machine learning grow, the ability to unlearn, or remove, specific data points from trained models…
PyTorch: FP8-обучение на AMD GPU теперь в основной ветке TorchTitan
AMD совместно с командой PyTorch влила оптимизации из библиотеки Primus-Turbo напрямую в TorchTitan и TorchAO. Теперь AMD Instinct GPU поддерживаются нативно — без сторонних патчей.
Что конкретно улучшилось:
На плотных моделях вроде Llama3-8B прирост пропускной способности составил 13,4% по сравнению с BF16. На MoE-архитектурах (DeepSeek-V3 671B) через слияние Triton-ядер удалось вернуть 89% потерь от FP8-квантизации, а отдельные операции ускорились в 6,2 раза.
Исправлена критическая ошибка: AMD использует формат e4m3fnuz с другим диапазоном значений, чем NVIDIA. Раньше TorchAO молча выдавал неверные результаты — градиенты портились без каких-либо ошибок. Теперь формат определяется автоматически.
Итог: обучение больших моделей на AMD-кластерах стало быстрее, корректнее и доступно из коробки.
https://pytorch.org/blog/fp8-training-on-amd-gpus-with-torchtitan-and-torchao-upstreaming-performance-improvements/
AMD совместно с командой PyTorch влила оптимизации из библиотеки Primus-Turbo напрямую в TorchTitan и TorchAO. Теперь AMD Instinct GPU поддерживаются нативно — без сторонних патчей.
Что конкретно улучшилось:
На плотных моделях вроде Llama3-8B прирост пропускной способности составил 13,4% по сравнению с BF16. На MoE-архитектурах (DeepSeek-V3 671B) через слияние Triton-ядер удалось вернуть 89% потерь от FP8-квантизации, а отдельные операции ускорились в 6,2 раза.
Исправлена критическая ошибка: AMD использует формат e4m3fnuz с другим диапазоном значений, чем NVIDIA. Раньше TorchAO молча выдавал неверные результаты — градиенты портились без каких-либо ошибок. Теперь формат определяется автоматически.
Итог: обучение больших моделей на AMD-кластерах стало быстрее, корректнее и доступно из коробки.
https://pytorch.org/blog/fp8-training-on-amd-gpus-with-torchtitan-and-torchao-upstreaming-performance-improvements/
DreamX-Phi 1.0: робот-манипулятор видит будущее (by Alibaba)
Хотите, чтобы робот не просто выполнял команды, а сначала "воображал" результат? Именно это делает DreamX-Phi — видео-модель мира, которая по одному кадру и заданной траектории рук предсказывает, как будет выглядеть сцена после манипуляции.
Главная проблема предыдущих подходов: красивое видео ≠ правильное движение. Модель могла генерировать реалистичный ролик, но рука двигалась не туда или хватала воздух.
Решение DreamX-Phi — три ключевых компонента:
1. SE(3)-траектории через PRoPE-attention — сохраняют реальную 3D-геометрию движения манипулятора
2. Оптический поток только от робота — явно показывает, где в кадре должно происходить движение
3. Depth + SAM3 маски + V-JEPA — следят за физической согласованностью объекта во времени
Обучение на 10к+ часов данных (Ego4D, AgiBot, симуляция). На WorldArena 2.0 — 1-е место в Track 1.
https://arxiv.org/abs/2608.13489
Хотите, чтобы робот не просто выполнял команды, а сначала "воображал" результат? Именно это делает DreamX-Phi — видео-модель мира, которая по одному кадру и заданной траектории рук предсказывает, как будет выглядеть сцена после манипуляции.
Главная проблема предыдущих подходов: красивое видео ≠ правильное движение. Модель могла генерировать реалистичный ролик, но рука двигалась не туда или хватала воздух.
Решение DreamX-Phi — три ключевых компонента:
1. SE(3)-траектории через PRoPE-attention — сохраняют реальную 3D-геометрию движения манипулятора
2. Оптический поток только от робота — явно показывает, где в кадре должно происходить движение
3. Depth + SAM3 маски + V-JEPA — следят за физической согласованностью объекта во времени
Обучение на 10к+ часов данных (Ego4D, AgiBot, симуляция). На WorldArena 2.0 — 1-е место в Track 1.
https://arxiv.org/abs/2608.13489
DarwinX: эволюция агентов без обучения весов (by Salesforce AI Research)
Что если улучшать агента не дообучением, а эволюцией его "оболочки" — промптов, инструментов и control flow?
DarwinX именно это и делает. Веса модели заморожены навсегда. Эволюционирует только harness вокруг неё. Каждый раз система предлагает небольшое изменение, запускает агента на реальных задачах и принимает правку только если она что-то улучшила, не сломав старое — "preserve-and-extend contract".
Ключевая идея: вместо одной линии улучшений — популяция веток-архив. Ветка, которая проиграла в общем зачёте, не выбрасывается — она может содержать единственный нужный фикс, который в комбинации с другой веткой откроет новые задачи.
Результаты впечатляют: Terminal-Bench 2.1 — 84.7%, WebArena-Infinity вырос с 43.5% до 93.0%, причём harness обученный на синтетике переносится на реальные задачи без дополнительной адаптации.
https://arxiv.org/abs/2608.07545
Что если улучшать агента не дообучением, а эволюцией его "оболочки" — промптов, инструментов и control flow?
DarwinX именно это и делает. Веса модели заморожены навсегда. Эволюционирует только harness вокруг неё. Каждый раз система предлагает небольшое изменение, запускает агента на реальных задачах и принимает правку только если она что-то улучшила, не сломав старое — "preserve-and-extend contract".
Ключевая идея: вместо одной линии улучшений — популяция веток-архив. Ветка, которая проиграла в общем зачёте, не выбрасывается — она может содержать единственный нужный фикс, который в комбинации с другой веткой откроет новые задачи.
Результаты впечатляют: Terminal-Bench 2.1 — 84.7%, WebArena-Infinity вырос с 43.5% до 93.0%, причём harness обученный на синтетике переносится на реальные задачи без дополнительной адаптации.
https://arxiv.org/abs/2608.07545
Intern-S2-Preview: научный агент на 397B параметров
Хотите модель, которая не просто отвечает на вопросы по науке, а реально работает как исследователь — запускает инструменты, итеративно планирует и адаптируется к новым доменам без переобучения?
Intern-S2-Preview-397B — это именно такая попытка. Ключевые фишки:
1. Memory Decoder: вместо дообучения огромного backbone к нему просто "прикручивается" маленькая параметрическая память (4B) с доменными знаниями. Лёгкий роутер на каждом токене решает, сколько брать от базовой модели, а сколько от памяти. Backbone при этом заморожен.
2. Time Series модуль: отдельная ветка для прогнозирования временных рядов поверх стандартного энкодера для длинных сигналов.
3. Agentic RL: специальный фреймворк для обучения с подкреплением на длинных агентских траекториях с верифицируемыми наградами.
По бенчмаркам — конкурентный уровень на научных, мультимодальных и агентских задачах.
https://arxiv.org/abs/2608.13505
Хотите модель, которая не просто отвечает на вопросы по науке, а реально работает как исследователь — запускает инструменты, итеративно планирует и адаптируется к новым доменам без переобучения?
Intern-S2-Preview-397B — это именно такая попытка. Ключевые фишки:
1. Memory Decoder: вместо дообучения огромного backbone к нему просто "прикручивается" маленькая параметрическая память (4B) с доменными знаниями. Лёгкий роутер на каждом токене решает, сколько брать от базовой модели, а сколько от памяти. Backbone при этом заморожен.
2. Time Series модуль: отдельная ветка для прогнозирования временных рядов поверх стандартного энкодера для длинных сигналов.
3. Agentic RL: специальный фреймворк для обучения с подкреплением на длинных агентских траекториях с верифицируемыми наградами.
По бенчмаркам — конкурентный уровень на научных, мультимодальных и агентских задачах.
https://arxiv.org/abs/2608.13505
LiveAnimate: анимация человека в реальном времени на 14B DiT (by Alibaba Qwen)
Все существующие системы pose-driven анимации работают офлайн — минуты или часы на клип. LiveAnimate — первая система, которая делает это в реальном времени (~20 FPS на 2×H100) с 14B-параметрной моделью.
Как это работает:
1. Stage 1 — превращают двунаправленный DiT в каузальный генератор через teacher-forcing: каждый блок обучается на чистой GT-истории, а референсное изображение всегда видно через глобальный Ref Sink.
2. Stage 2 — дистилляция до 3 шагов денойзинга через Block-wise Self-Forcing: сначала полный роллаут без градиентов, потом DMD-лосс блок за блоком. Это позволяет обучать 14B модель на одном узле 8×80GB GPU.
3. PR-Sink — умный KV-кэш: Static Sink (референс), Dynamic Sink (похожая поза из банка памяти по retrieval) + скользящее окно. Это держит внешний вид стабильным на длинных роллаутах.
Результат: трёхминутное видео без дрейфа идентичности, ~20 FPS.
https://arxiv.org/abs/2608.11745
Все существующие системы pose-driven анимации работают офлайн — минуты или часы на клип. LiveAnimate — первая система, которая делает это в реальном времени (~20 FPS на 2×H100) с 14B-параметрной моделью.
Как это работает:
1. Stage 1 — превращают двунаправленный DiT в каузальный генератор через teacher-forcing: каждый блок обучается на чистой GT-истории, а референсное изображение всегда видно через глобальный Ref Sink.
2. Stage 2 — дистилляция до 3 шагов денойзинга через Block-wise Self-Forcing: сначала полный роллаут без градиентов, потом DMD-лосс блок за блоком. Это позволяет обучать 14B модель на одном узле 8×80GB GPU.
3. PR-Sink — умный KV-кэш: Static Sink (референс), Dynamic Sink (похожая поза из банка памяти по retrieval) + скользящее окно. Это держит внешний вид стабильным на длинных роллаутах.
Результат: трёхминутное видео без дрейфа идентичности, ~20 FPS.
https://arxiv.org/abs/2608.11745
Beam Search для мыслей: как перестать тратить GPU впустую на рассуждения
Параллельный сэмплинг reasoning-трасс — стандарт тест-тайм скейлинга. Но это дико неэффективно: сотни длинных трасс, большинство ведут в никуда, GPU то перегружен, то простаивает.
Авторы из Princeton предлагают Gambit — beam search на уровне "мыслей". Идея: не запускать трассы независимо, а периодически оценивать частичные рассуждения, обрезать плохие и ветвиться от лучших префиксов. Zero-sum политика: число активных трасс всегда константно, GPU не простаивает.
Ключевой трюк — warmup threshold: не оценивать трассы слишком рано, когда сигналы ещё шумные. Плюс decoupled memory management, чтобы не схлопнуться в одну "жадную" ветку.
Результат: +6.7% на HMMT-24, +3.3% на AIME-25 vs агрессивного прунинга, при этом на 68.5% меньше токенов vs параллельного сэмплинга. Throughput 2x выше.
https://arxiv.org/abs/2608.08020
Параллельный сэмплинг reasoning-трасс — стандарт тест-тайм скейлинга. Но это дико неэффективно: сотни длинных трасс, большинство ведут в никуда, GPU то перегружен, то простаивает.
Авторы из Princeton предлагают Gambit — beam search на уровне "мыслей". Идея: не запускать трассы независимо, а периодически оценивать частичные рассуждения, обрезать плохие и ветвиться от лучших префиксов. Zero-sum политика: число активных трасс всегда константно, GPU не простаивает.
Ключевой трюк — warmup threshold: не оценивать трассы слишком рано, когда сигналы ещё шумные. Плюс decoupled memory management, чтобы не схлопнуться в одну "жадную" ветку.
Результат: +6.7% на HMMT-24, +3.3% на AIME-25 vs агрессивного прунинга, при этом на 68.5% меньше токенов vs параллельного сэмплинга. Throughput 2x выше.
https://arxiv.org/abs/2608.08020
Specification-first вместо code review: рефакторинг 189 файлов без единого ревьюера
Классическая проблема AI-агентов: код генерируется быстро, но ревью становится бутылочным горлышком. Особенно когда изменение затрагивает сотни взаимозависимых файлов — ни один человек не удержит весь граф зависимостей в голове.
Авторы предлагают перенести контроль РАНЬШЕ генерации. Вместо ревью кода — ревью спецификации. Протокол такой: сначала агент многократно сверяет спецификацию с реальным кодом, пока та не перестаёт давать расхождения. Потом код генерируется против замороженной спецификации. Потом свежая сессия того же агента сверяет результат с той же спецификацией — без памяти о процессе генерации.
Стресс-тест: удаление lifetime-инварианта в стриминговой подсистеме (717k строк TypeScript, 189 файлов, нет тестового оракула). Задача из разряда "проще переписать". Выполнено за 3 дня без единого человеческого ревью кода.
Классическая проблема AI-агентов: код генерируется быстро, но ревью становится бутылочным горлышком. Особенно когда изменение затрагивает сотни взаимозависимых файлов — ни один человек не удержит весь граф зависимостей в голове.
Авторы предлагают перенести контроль РАНЬШЕ генерации. Вместо ревью кода — ревью спецификации. Протокол такой: сначала агент многократно сверяет спецификацию с реальным кодом, пока та не перестаёт давать расхождения. Потом код генерируется против замороженной спецификации. Потом свежая сессия того же агента сверяет результат с той же спецификацией — без памяти о процессе генерации.
Стресс-тест: удаление lifetime-инварианта в стриминговой подсистеме (717k строк TypeScript, 189 файлов, нет тестового оракула). Задача из разряда "проще переписать". Выполнено за 3 дня без единого человеческого ревью кода.
🤔1
ИИ для реальных открытий — не просто "ответить на вопрос", а пройти весь путь до результата
Большинство бенчмарков проверяют, может ли модель дать правильный ответ на заранее сформулированный вопрос. Но реальные научные задачи — разработка терапий, новых материалов — не приходят с готовой постановкой.
Apodex предлагают концепцию "heavy-duty solver" и фреймворк Discoverative AI. Идея: нужны четыре компонента инфраструктуры — формулировка задачи, среда с реальными данными и инструментами, верификация промежуточных и финальных результатов, и петли исправления ошибок.
Они выпускают бенчмарк TRACES с реальными задачами: дизайн капсидов AAV-вирусов, репозиционирование лекарств, анализ клинических данных. Важно: оценивается не только финальный ответ, но и весь trajectory — правильно ли агент декомпозировал задачу, исправлял ли ошибки по ходу.
На задаче дизайна AAV-капсидов их система превзошла опубликованный SOTA. Это ближе к тому, как работает реальная наука.
https://arxiv.org/abs/2608.11341
Большинство бенчмарков проверяют, может ли модель дать правильный ответ на заранее сформулированный вопрос. Но реальные научные задачи — разработка терапий, новых материалов — не приходят с готовой постановкой.
Apodex предлагают концепцию "heavy-duty solver" и фреймворк Discoverative AI. Идея: нужны четыре компонента инфраструктуры — формулировка задачи, среда с реальными данными и инструментами, верификация промежуточных и финальных результатов, и петли исправления ошибок.
Они выпускают бенчмарк TRACES с реальными задачами: дизайн капсидов AAV-вирусов, репозиционирование лекарств, анализ клинических данных. Важно: оценивается не только финальный ответ, но и весь trajectory — правильно ли агент декомпозировал задачу, исправлял ли ошибки по ходу.
На задаче дизайна AAV-капсидов их система превзошла опубликованный SOTA. Это ближе к тому, как работает реальная наука.
https://arxiv.org/abs/2608.11341
ACID для агентов — базы данных уже так умеют, почему агенты нет?
Когда LLM-агент выполняет длинную задачу (анализ данных, написание кода), он может упасть на середине и оставить всё в хаосе — файлы изменены, часть шагов выполнена, результат неверный. Авторы из Tsinghua предлагают перенести принципы ACID из баз данных в мир агентов.
Идея: каждый цикл "исследование → выполнение → валидация" — это транзакция. Если валидация провалилась — откат. Если прошла — коммит в append-only workspace.
Конкретно: агент оценивает уверенность в своих решениях и коде (divergence между P(решение|данные) и P(код|данные)), и если уверенность низкая — делает retry с обратной связью, а не тихо коммитит мусор. Изоляция параллельных агентов через версионированные воркспейсы. Durability — через граф памяти только из валидированных шагов.
На практике: Claude Code дал ответ 0.261 (неверно агрегировал данные), ACID-Agent поймал это и пересчитал — 0.206.
https://arxiv.org/abs/2608.13900
Когда LLM-агент выполняет длинную задачу (анализ данных, написание кода), он может упасть на середине и оставить всё в хаосе — файлы изменены, часть шагов выполнена, результат неверный. Авторы из Tsinghua предлагают перенести принципы ACID из баз данных в мир агентов.
Идея: каждый цикл "исследование → выполнение → валидация" — это транзакция. Если валидация провалилась — откат. Если прошла — коммит в append-only workspace.
Конкретно: агент оценивает уверенность в своих решениях и коде (divergence между P(решение|данные) и P(код|данные)), и если уверенность низкая — делает retry с обратной связью, а не тихо коммитит мусор. Изоляция параллельных агентов через версионированные воркспейсы. Durability — через граф памяти только из валидированных шагов.
На практике: Claude Code дал ответ 0.261 (неверно агрегировал данные), ACID-Agent поймал это и пересчитал — 0.206.
https://arxiv.org/abs/2608.13900
MegaParts: генерируем 3D-объекты из 300 деталей авторегрессионно (by Shanghai AI Laboratory)
Генерация 3D-объектов обычно игнорирует их составную природу — объект как единое целое, без деталей и компонентов. Это мешает редактированию и управлению структурой. Авторы предлагают MegaParts — авторегрессионный фреймворк, который генерирует объекты покомпонентно, масштабируясь до 300 частей.
Ключевая идея: адаптивный токенайзер для каждой части объекта. Простые детали кодируются несколькими токенами, сложные — длинными последовательностями. Это решает главный трейдофф между качеством геометрии и длиной контекста.
Генерация идёт как chain-of-thought: сначала bounding box объекта, потом bbox каждой части, потом геометрия внутри. Итого — до 256k токенов на объект.
Результат: качество выше диффузионных методов, а масштаб — в 6 раз больше по числу частей, чем у конкурентов.
https://arxiv.org/abs/2608.14783
Генерация 3D-объектов обычно игнорирует их составную природу — объект как единое целое, без деталей и компонентов. Это мешает редактированию и управлению структурой. Авторы предлагают MegaParts — авторегрессионный фреймворк, который генерирует объекты покомпонентно, масштабируясь до 300 частей.
Ключевая идея: адаптивный токенайзер для каждой части объекта. Простые детали кодируются несколькими токенами, сложные — длинными последовательностями. Это решает главный трейдофф между качеством геометрии и длиной контекста.
Генерация идёт как chain-of-thought: сначала bounding box объекта, потом bbox каждой части, потом геометрия внутри. Итого — до 256k токенов на объект.
Результат: качество выше диффузионных методов, а масштаб — в 6 раз больше по числу частей, чем у конкурентов.
https://arxiv.org/abs/2608.14783
Nvidia выпустила Nemotron 3.5 Lightning NVFP4 — сжатую версию своей языковой модели с применением нового метода квантизации QAD.
Суть: модель похудела с 66 ГБ до 22 ГБ, а скорость выросла до 4 раз. При этом точность почти не пострадала — и вот как это удалось.
Стандартная квантизация (PTQ) режет веса до 4 бит, но теряет в качестве. QAD идёт дальше: сначала создаётся «сжатый студент», а затем его обучают под руководством оригинальной полноразрядной модели-«учителя» через KL-дивергенцию. Студент буквально учится имитировать поведение учителя, а не просто предсказывать токены.
Результат: QAD стабильно обходит PTQ на агентных и кодинговых бенчмарках, восстанавливая потери точности даже при агрессивном сжатии.
Инструменты доступны через NVIDIA Model Optimizer — разработчики могут воспроизвести весь пайплайн самостоятельно.
https://developer.nvidia.com/blog/developing-nemotron-3-5-lightning-nvfp4-with-qad-using-nvidia-model-optimizer/
Суть: модель похудела с 66 ГБ до 22 ГБ, а скорость выросла до 4 раз. При этом точность почти не пострадала — и вот как это удалось.
Стандартная квантизация (PTQ) режет веса до 4 бит, но теряет в качестве. QAD идёт дальше: сначала создаётся «сжатый студент», а затем его обучают под руководством оригинальной полноразрядной модели-«учителя» через KL-дивергенцию. Студент буквально учится имитировать поведение учителя, а не просто предсказывать токены.
Результат: QAD стабильно обходит PTQ на агентных и кодинговых бенчмарках, восстанавливая потери точности даже при агрессивном сжатии.
Инструменты доступны через NVIDIA Model Optimizer — разработчики могут воспроизвести весь пайплайн самостоятельно.
https://developer.nvidia.com/blog/developing-nemotron-3-5-lightning-nvfp4-with-qad-using-nvidia-model-optimizer/
NVIDIA Technical Blog
Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer
Teams customize their models to hit their targets for latency, speed, memory, and compute. With the open NVIDIA Nemotron family of models, developers can find the right-sized model for their needs.
Агент умеет решать каждый шаг, но всё равно проваливает задачу целиком — знакомо?
Авторы предлагают "harness scaling": вместо того чтобы улучшать модель, улучшай окружение вокруг неё. Их система StateM — это YAML-файл с состояниями, переходами, хуками и правилами восстановления после ошибок. Агент сам управляет этим runbook через CLI, а человек может его редактировать.
Ключевой трюк: каждое состояние — это "контекст + контракт". Войти в состояние = получить свежие инструкции. Выйти = выполнить явные условия. После провала харнесс анализируется и улучшается без изменения весов модели.
Результат: GPT-5.5 с StateM догоняет GPT-5.6 по качеству. GPT-5.6 с замороженным runbook бьёт 95.3% на Terminal-Bench 2.1. А DeepSeek с адаптированным харнессом за $15 обходит референс за $575.
https://arxiv.org/abs/2608.15089
Авторы предлагают "harness scaling": вместо того чтобы улучшать модель, улучшай окружение вокруг неё. Их система StateM — это YAML-файл с состояниями, переходами, хуками и правилами восстановления после ошибок. Агент сам управляет этим runbook через CLI, а человек может его редактировать.
Ключевой трюк: каждое состояние — это "контекст + контракт". Войти в состояние = получить свежие инструкции. Выйти = выполнить явные условия. После провала харнесс анализируется и улучшается без изменения весов модели.
Результат: GPT-5.5 с StateM догоняет GPT-5.6 по качеству. GPT-5.6 с замороженным runbook бьёт 95.3% на Terminal-Bench 2.1. А DeepSeek с адаптированным харнессом за $15 обходит референс за $575.
https://arxiv.org/abs/2608.15089