ИИ для реальных открытий — не просто "ответить на вопрос", а пройти весь путь до результата
Большинство бенчмарков проверяют, может ли модель дать правильный ответ на заранее сформулированный вопрос. Но реальные научные задачи — разработка терапий, новых материалов — не приходят с готовой постановкой.
Apodex предлагают концепцию "heavy-duty solver" и фреймворк Discoverative AI. Идея: нужны четыре компонента инфраструктуры — формулировка задачи, среда с реальными данными и инструментами, верификация промежуточных и финальных результатов, и петли исправления ошибок.
Они выпускают бенчмарк TRACES с реальными задачами: дизайн капсидов AAV-вирусов, репозиционирование лекарств, анализ клинических данных. Важно: оценивается не только финальный ответ, но и весь trajectory — правильно ли агент декомпозировал задачу, исправлял ли ошибки по ходу.
На задаче дизайна AAV-капсидов их система превзошла опубликованный SOTA. Это ближе к тому, как работает реальная наука.
https://arxiv.org/abs/2608.11341
Большинство бенчмарков проверяют, может ли модель дать правильный ответ на заранее сформулированный вопрос. Но реальные научные задачи — разработка терапий, новых материалов — не приходят с готовой постановкой.
Apodex предлагают концепцию "heavy-duty solver" и фреймворк Discoverative AI. Идея: нужны четыре компонента инфраструктуры — формулировка задачи, среда с реальными данными и инструментами, верификация промежуточных и финальных результатов, и петли исправления ошибок.
Они выпускают бенчмарк TRACES с реальными задачами: дизайн капсидов AAV-вирусов, репозиционирование лекарств, анализ клинических данных. Важно: оценивается не только финальный ответ, но и весь trajectory — правильно ли агент декомпозировал задачу, исправлял ли ошибки по ходу.
На задаче дизайна AAV-капсидов их система превзошла опубликованный SOTA. Это ближе к тому, как работает реальная наука.
https://arxiv.org/abs/2608.11341
ACID для агентов — базы данных уже так умеют, почему агенты нет?
Когда LLM-агент выполняет длинную задачу (анализ данных, написание кода), он может упасть на середине и оставить всё в хаосе — файлы изменены, часть шагов выполнена, результат неверный. Авторы из Tsinghua предлагают перенести принципы ACID из баз данных в мир агентов.
Идея: каждый цикл "исследование → выполнение → валидация" — это транзакция. Если валидация провалилась — откат. Если прошла — коммит в append-only workspace.
Конкретно: агент оценивает уверенность в своих решениях и коде (divergence между P(решение|данные) и P(код|данные)), и если уверенность низкая — делает retry с обратной связью, а не тихо коммитит мусор. Изоляция параллельных агентов через версионированные воркспейсы. Durability — через граф памяти только из валидированных шагов.
На практике: Claude Code дал ответ 0.261 (неверно агрегировал данные), ACID-Agent поймал это и пересчитал — 0.206.
https://arxiv.org/abs/2608.13900
Когда LLM-агент выполняет длинную задачу (анализ данных, написание кода), он может упасть на середине и оставить всё в хаосе — файлы изменены, часть шагов выполнена, результат неверный. Авторы из Tsinghua предлагают перенести принципы ACID из баз данных в мир агентов.
Идея: каждый цикл "исследование → выполнение → валидация" — это транзакция. Если валидация провалилась — откат. Если прошла — коммит в append-only workspace.
Конкретно: агент оценивает уверенность в своих решениях и коде (divergence между P(решение|данные) и P(код|данные)), и если уверенность низкая — делает retry с обратной связью, а не тихо коммитит мусор. Изоляция параллельных агентов через версионированные воркспейсы. Durability — через граф памяти только из валидированных шагов.
На практике: Claude Code дал ответ 0.261 (неверно агрегировал данные), ACID-Agent поймал это и пересчитал — 0.206.
https://arxiv.org/abs/2608.13900
MegaParts: генерируем 3D-объекты из 300 деталей авторегрессионно (by Shanghai AI Laboratory)
Генерация 3D-объектов обычно игнорирует их составную природу — объект как единое целое, без деталей и компонентов. Это мешает редактированию и управлению структурой. Авторы предлагают MegaParts — авторегрессионный фреймворк, который генерирует объекты покомпонентно, масштабируясь до 300 частей.
Ключевая идея: адаптивный токенайзер для каждой части объекта. Простые детали кодируются несколькими токенами, сложные — длинными последовательностями. Это решает главный трейдофф между качеством геометрии и длиной контекста.
Генерация идёт как chain-of-thought: сначала bounding box объекта, потом bbox каждой части, потом геометрия внутри. Итого — до 256k токенов на объект.
Результат: качество выше диффузионных методов, а масштаб — в 6 раз больше по числу частей, чем у конкурентов.
https://arxiv.org/abs/2608.14783
Генерация 3D-объектов обычно игнорирует их составную природу — объект как единое целое, без деталей и компонентов. Это мешает редактированию и управлению структурой. Авторы предлагают MegaParts — авторегрессионный фреймворк, который генерирует объекты покомпонентно, масштабируясь до 300 частей.
Ключевая идея: адаптивный токенайзер для каждой части объекта. Простые детали кодируются несколькими токенами, сложные — длинными последовательностями. Это решает главный трейдофф между качеством геометрии и длиной контекста.
Генерация идёт как chain-of-thought: сначала bounding box объекта, потом bbox каждой части, потом геометрия внутри. Итого — до 256k токенов на объект.
Результат: качество выше диффузионных методов, а масштаб — в 6 раз больше по числу частей, чем у конкурентов.
https://arxiv.org/abs/2608.14783
Nvidia выпустила Nemotron 3.5 Lightning NVFP4 — сжатую версию своей языковой модели с применением нового метода квантизации QAD.
Суть: модель похудела с 66 ГБ до 22 ГБ, а скорость выросла до 4 раз. При этом точность почти не пострадала — и вот как это удалось.
Стандартная квантизация (PTQ) режет веса до 4 бит, но теряет в качестве. QAD идёт дальше: сначала создаётся «сжатый студент», а затем его обучают под руководством оригинальной полноразрядной модели-«учителя» через KL-дивергенцию. Студент буквально учится имитировать поведение учителя, а не просто предсказывать токены.
Результат: QAD стабильно обходит PTQ на агентных и кодинговых бенчмарках, восстанавливая потери точности даже при агрессивном сжатии.
Инструменты доступны через NVIDIA Model Optimizer — разработчики могут воспроизвести весь пайплайн самостоятельно.
https://developer.nvidia.com/blog/developing-nemotron-3-5-lightning-nvfp4-with-qad-using-nvidia-model-optimizer/
Суть: модель похудела с 66 ГБ до 22 ГБ, а скорость выросла до 4 раз. При этом точность почти не пострадала — и вот как это удалось.
Стандартная квантизация (PTQ) режет веса до 4 бит, но теряет в качестве. QAD идёт дальше: сначала создаётся «сжатый студент», а затем его обучают под руководством оригинальной полноразрядной модели-«учителя» через KL-дивергенцию. Студент буквально учится имитировать поведение учителя, а не просто предсказывать токены.
Результат: QAD стабильно обходит PTQ на агентных и кодинговых бенчмарках, восстанавливая потери точности даже при агрессивном сжатии.
Инструменты доступны через NVIDIA Model Optimizer — разработчики могут воспроизвести весь пайплайн самостоятельно.
https://developer.nvidia.com/blog/developing-nemotron-3-5-lightning-nvfp4-with-qad-using-nvidia-model-optimizer/
NVIDIA Technical Blog
Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer
Teams customize their models to hit their targets for latency, speed, memory, and compute. With the open NVIDIA Nemotron family of models, developers can find the right-sized model for their needs.
Агент умеет решать каждый шаг, но всё равно проваливает задачу целиком — знакомо?
Авторы предлагают "harness scaling": вместо того чтобы улучшать модель, улучшай окружение вокруг неё. Их система StateM — это YAML-файл с состояниями, переходами, хуками и правилами восстановления после ошибок. Агент сам управляет этим runbook через CLI, а человек может его редактировать.
Ключевой трюк: каждое состояние — это "контекст + контракт". Войти в состояние = получить свежие инструкции. Выйти = выполнить явные условия. После провала харнесс анализируется и улучшается без изменения весов модели.
Результат: GPT-5.5 с StateM догоняет GPT-5.6 по качеству. GPT-5.6 с замороженным runbook бьёт 95.3% на Terminal-Bench 2.1. А DeepSeek с адаптированным харнессом за $15 обходит референс за $575.
https://arxiv.org/abs/2608.15089
Авторы предлагают "harness scaling": вместо того чтобы улучшать модель, улучшай окружение вокруг неё. Их система StateM — это YAML-файл с состояниями, переходами, хуками и правилами восстановления после ошибок. Агент сам управляет этим runbook через CLI, а человек может его редактировать.
Ключевой трюк: каждое состояние — это "контекст + контракт". Войти в состояние = получить свежие инструкции. Выйти = выполнить явные условия. После провала харнесс анализируется и улучшается без изменения весов модели.
Результат: GPT-5.5 с StateM догоняет GPT-5.6 по качеству. GPT-5.6 с замороженным runbook бьёт 95.3% на Terminal-Bench 2.1. А DeepSeek с адаптированным харнессом за $15 обходит референс за $575.
https://arxiv.org/abs/2608.15089
LLM умеет предлагать гипотезы, но не знает, какие из них стоит проверять. Байесовская оптимизация умеет выбирать кандидатов, но не умеет выходить за пределы известного пространства поиска. Large Discovery Model (LDM) объединяет оба подхода.
Идея: LLM генерирует и редактирует структурированные кандидаты, расширяя фронтир поиска. Вероятностный суррогат предсказывает их ценность и неопределённость. Acquisition function решает, куда направить вычисления и дорогие эксперименты.
Авторы разделяют три режима: эксплуатация (лучшие известные кандидаты), исследование (снижение неопределённости), и открытие (выход за пределы текущего пространства поиска). LDM явно управляет переходами между ними.
Проверили на трёх задачах: поиск алгоритмов обучения нейросетей, дизайн антител и многоцелевой дизайн молекул. В каждом случае LDM обходит и чистый LLM, и чистую байесовскую оптимизацию.
https://arxiv.org/abs/2608.15669
Идея: LLM генерирует и редактирует структурированные кандидаты, расширяя фронтир поиска. Вероятностный суррогат предсказывает их ценность и неопределённость. Acquisition function решает, куда направить вычисления и дорогие эксперименты.
Авторы разделяют три режима: эксплуатация (лучшие известные кандидаты), исследование (снижение неопределённости), и открытие (выход за пределы текущего пространства поиска). LDM явно управляет переходами между ними.
Проверили на трёх задачах: поиск алгоритмов обучения нейросетей, дизайн антител и многоцелевой дизайн молекул. В каждом случае LDM обходит и чистый LLM, и чистую байесовскую оптимизацию.
https://arxiv.org/abs/2608.15669
👍1
Модель смотрит видео и отвечает одновременно — не дожидаясь конца записи
Большинство видео-моделей работают офлайн: сначала посмотрел клип целиком, потом ответил. MOSS-VL идёт дальше — модель продолжает воспринимать видео прямо во время генерации ответа и может прервать или исправить себя, если картинка изменилась.
Ключевая архитектурная идея: визуальные токены никогда не попадают в декодируемую последовательность. Вместо этого — gated cross-attention с нулевой инициализацией гейтов (языковой бэкбон Qwen3-8B остаётся нетронутым). Новый фрейм просто дописывается в cross-attention кэш — модель "видит" его без остановки генерации.
Ещё одна фишка — XRoPE: единое трёхосевое позиционное кодирование (t, h, w) для текста и видео, чтобы оба потока жили на одной временной шкале.
Результат: на стриминговых бенчмарках 66.0 vs 37.5 по Proactive Alerting, и в 5x быстрее по time-to-first-token против Qwen3-VL-8B при росте визуального контекста.
https://arxiv.org/abs/2608.15045
Большинство видео-моделей работают офлайн: сначала посмотрел клип целиком, потом ответил. MOSS-VL идёт дальше — модель продолжает воспринимать видео прямо во время генерации ответа и может прервать или исправить себя, если картинка изменилась.
Ключевая архитектурная идея: визуальные токены никогда не попадают в декодируемую последовательность. Вместо этого — gated cross-attention с нулевой инициализацией гейтов (языковой бэкбон Qwen3-8B остаётся нетронутым). Новый фрейм просто дописывается в cross-attention кэш — модель "видит" его без остановки генерации.
Ещё одна фишка — XRoPE: единое трёхосевое позиционное кодирование (t, h, w) для текста и видео, чтобы оба потока жили на одной временной шкале.
Результат: на стриминговых бенчмарках 66.0 vs 37.5 по Proactive Alerting, и в 5x быстрее по time-to-first-token против Qwen3-VL-8B при росте визуального контекста.
https://arxiv.org/abs/2608.15045
Nvidia Tech запустила ALCHEMI Toolkit — инструмент для симуляции материалов с ИИ
NVIDIA выпустила ALCHEMI Toolkit — набор инструментов для учёных, который позволяет запускать сложные атомистические симуляции через обычные текстовые запросы. Под капотом — PyTorch-нативные блоки и GPU-ускорение на картах H200.
Суть проста: исследователь описывает задачу словами («смоделируй диффузию лития»), ИИ-агент генерирует и сразу выполняет код. Специальные «навыки агента» подгружают нужные паттерны API — без них агент мог бы писать правдоподобный, но нерабочий код.
Тесты на 45 пайплайнах показали: детализация промпта влияет на структуру кода, но не на физическую корректность результатов. Все три тестовых сценария дали результаты, совпадающие с эталонными данными.
Важно: автоматизация не заменяет научное суждение. Модели типа MACE-MPA-0 могут ошибаться за пределами обучающих данных, а агент не проверяет физический смысл задачи сам.
https://developer.nvidia.com/blog/how-ai-coding-agents-can-unlock-materials-simulation-with-nvidia-alchemi-toolkit/
NVIDIA выпустила ALCHEMI Toolkit — набор инструментов для учёных, который позволяет запускать сложные атомистические симуляции через обычные текстовые запросы. Под капотом — PyTorch-нативные блоки и GPU-ускорение на картах H200.
Суть проста: исследователь описывает задачу словами («смоделируй диффузию лития»), ИИ-агент генерирует и сразу выполняет код. Специальные «навыки агента» подгружают нужные паттерны API — без них агент мог бы писать правдоподобный, но нерабочий код.
Тесты на 45 пайплайнах показали: детализация промпта влияет на структуру кода, но не на физическую корректность результатов. Все три тестовых сценария дали результаты, совпадающие с эталонными данными.
Важно: автоматизация не заменяет научное суждение. Модели типа MACE-MPA-0 могут ошибаться за пределами обучающих данных, а агент не проверяет физический смысл задачи сам.
https://developer.nvidia.com/blog/how-ai-coding-agents-can-unlock-materials-simulation-with-nvidia-alchemi-toolkit/
NVIDIA Technical Blog
How AI Coding Agents Can Unlock Materials Simulation with NVIDIA ALCHEMI Toolkit
Atomistic simulation requires three things: knowledge of the science, compute-efficient implementation of simulations, and accessible interfaces to the simulation stack. The first remains the…
🔥1
Nvidia Tech: многопоточный UMAP теперь работает на нескольких GPU
NVIDIA выпустила cuML и cuVS 25.06 с поддержкой многопроцессорного UMAP. Раньше самый тяжёлый этап — построение графа ближайших соседей — был ограничен одним GPU. Теперь задача распределяется между несколькими картами.
Как это работает: датасет делится на кластеры, каждый GPU обрабатывает свои независимо, затем локальные графы объединяются в глобальный. Никакой дорогостоящей синхронизации между GPU — только параллельная работа.
Результат: 870 ГБ векторов обрабатываются за 8 минут на 8 GPU H100. Ускорение до 74x по сравнению с CPU. При этом качество эмбеддингов сохраняется.
Кому важно: data scientists, работающие с десятками и сотнями миллионов векторов — в геномике, NLP, анализе данных. То, что раньше занимало часы или дни, теперь укладывается в минуты.
https://developer.nvidia.com/blog/run-massive-scale-umap-in-minutes-using-multiple-gpus-without-losing-accuracy/
NVIDIA выпустила cuML и cuVS 25.06 с поддержкой многопроцессорного UMAP. Раньше самый тяжёлый этап — построение графа ближайших соседей — был ограничен одним GPU. Теперь задача распределяется между несколькими картами.
Как это работает: датасет делится на кластеры, каждый GPU обрабатывает свои независимо, затем локальные графы объединяются в глобальный. Никакой дорогостоящей синхронизации между GPU — только параллельная работа.
Результат: 870 ГБ векторов обрабатываются за 8 минут на 8 GPU H100. Ускорение до 74x по сравнению с CPU. При этом качество эмбеддингов сохраняется.
Кому важно: data scientists, работающие с десятками и сотнями миллионов векторов — в геномике, NLP, анализе данных. То, что раньше занимало часы или дни, теперь укладывается в минуты.
https://developer.nvidia.com/blog/run-massive-scale-umap-in-minutes-using-multiple-gpus-without-losing-accuracy/
NVIDIA Technical Blog
Run Massive-Scale UMAP in Minutes Using Multiple GPUs—Without Losing Accuracy
Uniform Manifold Approximation and Projection (UMAP) is a dimensionality reduction technique widely used for visualization and feature extraction. Applications range across exploratory data analysis…
Apple ML — исследование GRPO за пределами английского языка
Команда Apple ML опубликовала масштабное исследование того, как работает метод обучения GRPO (Group Relative Policy Optimization) в многоязычных условиях. До этого почти все работы по RLVR-обучению языковых моделей были сосредоточены исключительно на английском.
Главные выводы: обучение модели рассуждать на родном языке даёт результаты, лишь незначительно уступающие английскому. Более того, тренировка на одном языке часто улучшает показатели сразу в нескольких других — это называют кросслингвальным переносом.
Но есть и подводные камни: в ряде случаев обучение на конкретном языке резко ухудшает работу модели на других языках, особенно за пределами тренировочного домена. Эффект сильно зависит от конкретной модели и языка.
Практический вывод: GRPO можно эффективно применять для многоязычных моделей, но это требует широкого тестирования, чтобы вовремя поймать регрессии. Для пользователей нон-английских приложений — хорошая новость: качественные модели с рассуждением теперь реальнее и на других языках.
https://machinelearning.apple.com/research/grpo-beyond-english
Команда Apple ML опубликовала масштабное исследование того, как работает метод обучения GRPO (Group Relative Policy Optimization) в многоязычных условиях. До этого почти все работы по RLVR-обучению языковых моделей были сосредоточены исключительно на английском.
Главные выводы: обучение модели рассуждать на родном языке даёт результаты, лишь незначительно уступающие английскому. Более того, тренировка на одном языке часто улучшает показатели сразу в нескольких других — это называют кросслингвальным переносом.
Но есть и подводные камни: в ряде случаев обучение на конкретном языке резко ухудшает работу модели на других языках, особенно за пределами тренировочного домена. Эффект сильно зависит от конкретной модели и языка.
Практический вывод: GRPO можно эффективно применять для многоязычных моделей, но это требует широкого тестирования, чтобы вовремя поймать регрессии. Для пользователей нон-английских приложений — хорошая новость: качественные модели с рассуждением теперь реальнее и на других языках.
https://machinelearning.apple.com/research/grpo-beyond-english
Apple Machine Learning Research
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
Reinforcement Learning with Verifiable Rewards (RLVR), often optimized with Group Relative Policy Optimization (GRPO), has become a central…
Робот учится на своих ошибках прямо во время работы — без переобучения весов
Обычно embodied-агенты "думают" только после завершения эпизода. Zetta делает иначе: в процессе выполнения задачи работают code-based critics, которые мониторят траекторию в реальном времени и триггерят recovery-скиллы при обнаружении сбоя.
Ключевая идея: три вложенных цикла эволюции. Первый — на частоте действий (critic следит за роботом). Второй — между батчами роллаутов (кластеризация отказов, генерация новых critics). Третий — валидация и добавление в память только тех скиллов, что реально улучшают успех.
Результат: с 34.5% до 90.8% на LIBERO-Pro и с 73.6% до 93.6% на RoboCasa за несколько итераций. Скиллы переносятся zero-shot на похожие задачи. Инфраструктура Z-Infra ускорила роллауты в 20.6× (до 35 эпизодов/мин), что напрямую ускоряет эволюцию агента.
https://arxiv.org/abs/2608.16590
Обычно embodied-агенты "думают" только после завершения эпизода. Zetta делает иначе: в процессе выполнения задачи работают code-based critics, которые мониторят траекторию в реальном времени и триггерят recovery-скиллы при обнаружении сбоя.
Ключевая идея: три вложенных цикла эволюции. Первый — на частоте действий (critic следит за роботом). Второй — между батчами роллаутов (кластеризация отказов, генерация новых critics). Третий — валидация и добавление в память только тех скиллов, что реально улучшают успех.
Результат: с 34.5% до 90.8% на LIBERO-Pro и с 73.6% до 93.6% на RoboCasa за несколько итераций. Скиллы переносятся zero-shot на похожие задачи. Инфраструктура Z-Infra ускорила роллауты в 20.6× (до 35 эпизодов/мин), что напрямую ускоряет эволюцию агента.
https://arxiv.org/abs/2608.16590
Запускай 284B-модель на домашнем компьютере — это теперь реально
FreeToken от UC Berkeley — система инференса для MoE-моделей на потребительском железе. Идея: у 100+ млн геймерских ПК уже стоят дискретные GPU, которые простаивают. Почему бы не запускать там DeepSeek-V4-Flash (284B) или GLM-5.2 (753B)?
Три ключевых приёма:
1. Bandwidth-adaptive execution: во время prefill эксперты качаются по PCIe параллельно с вычислениями (double-buffering). Во время decode — алгоритм q* делит cache miss'ы между подгрузкой на GPU и прямым выполнением на CPU.
2. Semantic-aware caching: агентские сессии редактируются на семантических границах (tool calls, thinking). FreeToken кэширует KV-состояние в этих точках и не пересчитывает лишнего.
3. Elastic resource management: кэш GPU динамически ресайзится без перезапуска движка.
Результат: на RTX 5090 — 22-25 tok/s на DeepSeek-V4-Flash, на ноутбуке с 8GB RTX 4060 — 39 tok/s на 35B-модели. Это быстрее, чем Codex в продакшне (33 tok/s медиана).
https://arxiv.org/abs/2608.16157
FreeToken от UC Berkeley — система инференса для MoE-моделей на потребительском железе. Идея: у 100+ млн геймерских ПК уже стоят дискретные GPU, которые простаивают. Почему бы не запускать там DeepSeek-V4-Flash (284B) или GLM-5.2 (753B)?
Три ключевых приёма:
1. Bandwidth-adaptive execution: во время prefill эксперты качаются по PCIe параллельно с вычислениями (double-buffering). Во время decode — алгоритм q* делит cache miss'ы между подгрузкой на GPU и прямым выполнением на CPU.
2. Semantic-aware caching: агентские сессии редактируются на семантических границах (tool calls, thinking). FreeToken кэширует KV-состояние в этих точках и не пересчитывает лишнего.
3. Elastic resource management: кэш GPU динамически ресайзится без перезапуска движка.
Результат: на RTX 5090 — 22-25 tok/s на DeepSeek-V4-Flash, на ноутбуке с 8GB RTX 4060 — 39 tok/s на 35B-модели. Это быстрее, чем Codex в продакшне (33 tok/s медиана).
https://arxiv.org/abs/2608.16157
Робот, который думает только когда нужно (by ZJU-OmniAI)
Главная проблема навигационных агентов: если запускать Chain-of-Thought рассуждение на каждом шаге — медленно, если не запускать — тупо. TAMP-Nav решает это элегантно.
Четыре ключевые идеи:
Point: вместо предсказания 3D-координат или угла поворота агент просто тыкает пальцем в пиксель на картинке, а дальше SLAM сам разбирается с геометрией.
Think: CoT запускается только в критических точках маршрута (~30% шагов), остальное — без рассуждений.
Memorize: ключевые узлы хранятся подробно, промежуточные сжимаются в лёгкие Space-Time токены с координатами и временем через RoPE.
Align: обучение через двухуровневый GRPO — одновременно глобальные награды (дошёл/не дошёл) и пошаговые (не врезался, правильно остановился).
Результат: 66.2% success rate на R2R-CE при обучении всего на 90k траекториях.
https://arxiv.org/abs/2608.17512
Главная проблема навигационных агентов: если запускать Chain-of-Thought рассуждение на каждом шаге — медленно, если не запускать — тупо. TAMP-Nav решает это элегантно.
Четыре ключевые идеи:
Point: вместо предсказания 3D-координат или угла поворота агент просто тыкает пальцем в пиксель на картинке, а дальше SLAM сам разбирается с геометрией.
Think: CoT запускается только в критических точках маршрута (~30% шагов), остальное — без рассуждений.
Memorize: ключевые узлы хранятся подробно, промежуточные сжимаются в лёгкие Space-Time токены с координатами и временем через RoPE.
Align: обучение через двухуровневый GRPO — одновременно глобальные награды (дошёл/не дошёл) и пошаговые (не врезался, правильно остановился).
Результат: 66.2% success rate на R2R-CE при обучении всего на 90k траекториях.
https://arxiv.org/abs/2608.17512
Nvidia FLARE научился обучать мультимодальные AI-модели в федеративном режиме — без передачи сырых данных между организациями.
Суть: вместо передачи полных весов модели (28,6 ГБ за раунд) система теперь обменивается только лёгкими LoRA-адаптерами — всего 0,094 ГБ. Это в 300 раз меньше трафика при сохранении 97% качества централизованного обучения.
Что под капотом: стриминг тензоров, выгрузка агрегации на диск и новый механизм экстернализации крупных объектов. Всё это решает две главные боли федеративного обучения — сетевой трафик и память сервера.
Зачем это важно: больницы, банки и госструктуры смогут совместно обучать мощные vision-language модели, не передавая чувствительные данные за пределы своей инфраструктуры. FedUMM уже получил награду на TheWebConf 2026.
https://developer.nvidia.com/blog/building-federated-multimodal-ai-workflows-with-nvidia-flare/
Суть: вместо передачи полных весов модели (28,6 ГБ за раунд) система теперь обменивается только лёгкими LoRA-адаптерами — всего 0,094 ГБ. Это в 300 раз меньше трафика при сохранении 97% качества централизованного обучения.
Что под капотом: стриминг тензоров, выгрузка агрегации на диск и новый механизм экстернализации крупных объектов. Всё это решает две главные боли федеративного обучения — сетевой трафик и память сервера.
Зачем это важно: больницы, банки и госструктуры смогут совместно обучать мощные vision-language модели, не передавая чувствительные данные за пределы своей инфраструктуры. FedUMM уже получил награду на TheWebConf 2026.
https://developer.nvidia.com/blog/building-federated-multimodal-ai-workflows-with-nvidia-flare/
NVIDIA Technical Blog
Building Federated Multimodal AI Workflows with NVIDIA FLARE
Modern vision-language models (VLMs) can support tasks such as visual question answering, captioning, and image-text reasoning. In practice, however, the data needed to adapt these models may be…
👏1
Nvidia выпустила Cosmos 3 Edge — компактную модель для управления роботами прямо на устройстве.
Cosmos 3 Edge — это 4B-модель из семейства Cosmos 3, достаточно лёгкая, чтобы работать на борту робота на чипе NVIDIA Jetson Thor. Модель предобучена на физических данных реального мира и умеет предсказывать действия робота без подключения к облаку.
Ключевые детали: модель весит около 9 ГБ в формате BF16, генерирует чанк действий за ~1,53 секунды при частоте 15 Гц — и успевает просчитать следующий шаг до завершения текущего, обеспечивая непрерывное движение манипулятора. Успешность в закрытых симуляционных тестах RoboLab — 22,9%.
Чекпоинт доступен на HuggingFace, код открыт в репозитории cosmos-framework. Поддерживаются несколько платформ: Franka, UR, WidowX 250, SO101.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-edge-for-on-device-robot-control/
Cosmos 3 Edge — это 4B-модель из семейства Cosmos 3, достаточно лёгкая, чтобы работать на борту робота на чипе NVIDIA Jetson Thor. Модель предобучена на физических данных реального мира и умеет предсказывать действия робота без подключения к облаку.
Ключевые детали: модель весит около 9 ГБ в формате BF16, генерирует чанк действий за ~1,53 секунды при частоте 15 Гц — и успевает просчитать следующий шаг до завершения текущего, обеспечивая непрерывное движение манипулятора. Успешность в закрытых симуляционных тестах RoboLab — 22,9%.
Чекпоинт доступен на HuggingFace, код открыт в репозитории cosmos-framework. Поддерживаются несколько платформ: Franka, UR, WidowX 250, SO101.
https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-edge-for-on-device-robot-control/
NVIDIA Technical Blog
Post-Train NVIDIA Cosmos 3 Edge for On-Device Robot Control
Robots need policies that can adapt to their sensors, environments, and tasks while running on onboard computing hardware. World models offer a foundation for learning physical interactions…
Nvidia выпустила SkillEvaluator — открытый инструмент для оценки влияния AI-навыков на производительность агентов.
Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.
Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).
Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.
Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.
https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
Что это такое: специальные "скиллы" — пакеты инструкций, примеров и подсказок — помогают AI-агентам быстрее находить нужные инструменты и решать задачи. SkillEvaluator измеряет, насколько они реально помогают.
Как работает: трёхуровневая проверка — статический анализ безопасности, проверка на дублирование, и живые тесты с агентом в изолированной среде (с навыком и без).
Результаты на 300+ скиллах для 30+ продуктов Nvidia впечатляют: средний прирост — 31 пункт по всем метрикам (точность, обнаруживаемость, эффективность). Без учёта безопасности — 39 пунктов.
Скиллы уже доступны для Claude Code, Codex и Cursor. Инструмент открытый — любой может протестировать свои навыки.
https://developer.nvidia.com/blog/evaluating-ai-agent-skill-performance-with-nvidia-skillevaluator/
NVIDIA Technical Blog
Evaluating AI Agent Skill Performance with NVIDIA SkillEvaluator
AI agents are only as effective as the context they receive. Even with capable models and well-documented NVIDIA libraries, agents can spend extra steps finding the right tools, burn tokens on dead…
EnvHarness: «прокачай» среду, а не модель (by Google)
Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.
Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.
Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу
Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.
Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.
https://arxiv.org/abs/2608.19880
Хочешь научить агента новым трюкам — обычно строишь новую среду. Это дорого и долго. Google предлагает другой путь: не трогать среду, а обернуть её в программируемый слой — EnvHarness.
Аналогия простая: agent harness добавляет инструменты и память к замороженной LLM. EnvHarness делает то же самое, но для среды — добавляет к ней плагины, не меняя её код.
Три типа компонентов:
Stage — меняет начальное состояние (спрятать объект, чтобы агент учился его искать)
Contract — фильтрует доступные действия и наблюдения
Chain — соединяет несколько сред в одну длинную задачу
Автоматизацию настройки берёт на себя EnvRigger: наблюдает за провалами агента, генерирует нужные компоненты и итеративно их улучшает.
Результат на 5 бенчмарках (ALFWorld, WebArena, SWE-bench и др.): +9 пунктов на held-out задачах, на 10% меньше шагов при обучении.
https://arxiv.org/abs/2608.19880
CO-RL: как обучить LLM рассуждать без единого лейбла?
Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!
CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.
Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.
https://arxiv.org/abs/2608.17253
Главная боль unsupervised RL для рассуждений — модель учится сама у себя и усиливает собственные ошибки, пока не схлопнется. Авторы из UCSD предлагают простую идею: пусть модели учат друг друга!
CO-RL — это мультиагентный RL без разметки. Несколько независимых моделей (разные архитектуры, размеры, семейства) одновременно обучаются, используя ответы друг друга как награду. Каждый агент сэмплирует ответы, агрегирует их majority voting в псевдо-ответ — и этот псевдо-ответ становится сигналом для соседа. Ключевое: ошибки разных моделей некоррелированы, поэтому каждая получает реально независимую обратную связь.
Результат: +3–8.6% на 7 текстовых бенчмарках (математика, код, знания), +2.3–7.2% на мультимодальных задачах. В ряде случаев догоняет supervised-подходы — без единого ground-truth лейбла.
https://arxiv.org/abs/2608.17253
AI-учёный, который смотрит на данные своими глазами
Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.
Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.
Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.
Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.
https://arxiv.org/abs/2608.13558
Большинство AI-систем для науки работают с данными, которые уже кто-то обработал: написал описание, извлёк признаки, сделал таблицу. OmniScientist из NUS идёт дальше — он воспринимает сырые научные данные напрямую: микроскопию, сейсмограммы, 3D-структуры, аудио, видео, траектории.
Архитектура: три агента (идея → эксперимент → статья), каждый в ReAct-петле, плюс слой perception, который активен на всех стадиях. Добавлены code-enforced проверки против HARKing, утечки данных и неподкреплённых утверждений.
Результат: 36 кейсов из 5 научных областей, все доведены до готовой статьи. Версия с прямым восприятием данных выигрывает у "слепой" версии в 85% парных сравнений.
Главный тезис: важно не только автоматизировать workflow, но и сохранить доступ к исходным данным — иначе агент буквально не видит аномалий, которые могли бы изменить гипотезу.
https://arxiv.org/abs/2608.13558
Microsoft Research обновила Skala до версии 1.1 — своего ИИ-инструмента для квантовохимических расчётов.
Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.
Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.
Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.
https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Что нового: модель обучена на в 2,5 раза большем объёме данных, чем предшественница. На стандартном бенчмарке GMTKN55 Skala 1.1 заняла первое место в 32 из 55 категорий, обойдя дорогостоящие гибридные функционалы — при этом сохранив скорость более простых методов.
Почему важно: DFT-расчёты лежат в основе разработки лекарств, материалов и катализаторов. Skala теперь интегрируется в ключевые научные пакеты — CP2K (уже доступно), а также Psi4, FHI-aims, ORCA и VASP (в процессе). Это значит, что тысячи учёных смогут использовать более точные расчёты без смены привычных инструментов.
Дополнительно Microsoft запускает «живой бенчмарк» для отслеживания прогресса каждой новой версии Skala.
https://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/
Microsoft Research
Broadening access to Skala creates a faster path to predictive DFT
Skala 1.1, the updated deep-learning exchange-correlation functional from Microsoft Research, provides greater accuracy, expanded accessibility across the computational chemistry ecosystem, and a living benchmark to track computational performance.
Nvidia представила новый подход к рекомендательным системам на базе генеративного ИИ.
Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.
Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.
Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.
https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
Компания опубликовала репозиторий recsys-examples с готовыми к продакшену реализациями генеративных рекомендательных систем (GR) на GPU. В основе — архитектуры HSTU от Meta и Semantic IDs от Google, которые переосмысляют рекомендации как задачу предсказания следующего действия пользователя, аналогично LLM.
Ключевые инструменты: DynamicEmb заменяет статичные таблицы эмбеддингов динамическим хеш-таблицами, которые растут вместе с каталогом. nv-embedding-cache обеспечивает многоуровневое кеширование для низкой задержки при работе с петабайтами данных.
Почему важно: традиционные RecSys ломаются при масштабировании — проблемы холодного старта, «длинного хвоста» и строгих требований к задержке в миллисекунды. Генеративный подход потенциально объединяет поиск и ранжирование в одной модели и лучше использует законы масштабирования.
https://developer.nvidia.com/blog/how-generative-recommenders-are-redefining-recsys-at-scale/
NVIDIA Technical Blog
How Generative Recommenders Are Redefining RecSys at Scale
Recommender systems (RecSys) are one of the most ubiquitous machine learning problems in the consumer internet industry yet notoriously difficult to train and serve at scale. The advent of LLMs has…