Nvidia Tech запустила ModelExpress (MX) — систему для ускоренной доставки весов AI-моделей на GPU в кластерах.
Проблема была простой: модели весят сотни гигабайт, и каждый новый воркер тратил минуты на загрузку с нуля. MX решает это умно — сначала проверяет, есть ли уже загруженная копия у соседнего GPU, и если да, передаёт веса напрямую через P2P RDMA, минуя диск и оперативную память.
Результат впечатляет: веса DeepSeek-V4 Pro (806 ГБ) передаются между репликами менее чем за 10 секунд. Общее время запуска сократилось с 8 минут до 1 минуты 44 секунд.
MX также умеет: скачивать чекпоинты из облака без записи на диск, использовать GPUDirect Storage, координировать загрузку так, чтобы кластер из 10 реплик скачивал данные один раз, а не десять. Система интегрирована с vLLM, SGLang и Dynamo.
Для production-деплоев больших моделей это серьёзное ускорение масштабирования.
https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
Проблема была простой: модели весят сотни гигабайт, и каждый новый воркер тратил минуты на загрузку с нуля. MX решает это умно — сначала проверяет, есть ли уже загруженная копия у соседнего GPU, и если да, передаёт веса напрямую через P2P RDMA, минуя диск и оперативную память.
Результат впечатляет: веса DeepSeek-V4 Pro (806 ГБ) передаются между репликами менее чем за 10 секунд. Общее время запуска сократилось с 8 минут до 1 минуты 44 секунд.
MX также умеет: скачивать чекпоинты из облака без записи на диск, использовать GPUDirect Storage, координировать загрузку так, чтобы кластер из 10 реплик скачивал данные один раз, а не десять. Система интегрирована с vLLM, SGLang и Dynamo.
Для production-деплоев больших моделей это серьёзное ускорение масштабирования.
https://developer.nvidia.com/blog/modelexpress-distributing-model-artifacts-at-the-speed-of-light/
NVIDIA Technical Blog
ModelExpress: Distributing Model Artifacts at the Speed of Light
Every byte moved has a cost. As model checkpoints grow to hundreds of gigabytes or even a terabyte, that cost adds up quickly. To make things even worse, moving these model weights around the cluster…
Apple ML выпустила исследование LEAD — новый метод для улучшения длинных цепочек рассуждений в языковых моделях.
Проблема: когда задачу разбивают на слишком мелкие шаги, модель теряет контекст и не может исправить ошибки на «сложных» этапах — они накапливаются и становятся необратимыми.
Решение — метод LEAD (Lookahead-Enhanced Atomic Decomposition): модель заглядывает чуть вперёд и проверяет несколько вариантов развития событий одновременно. Это даёт достаточно изоляции для стабильности и достаточно контекста для исправления ошибок.
Результат на практике: модель o4-mini с LEAD решает головоломку Checkers Jumping до сложности n=13, тогда как без метода ломается уже на n=11.
Пока это академическое исследование, но подход может напрямую улучшить агентные системы и сложные многошаговые задачи в будущих продуктах Apple.
https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
Проблема: когда задачу разбивают на слишком мелкие шаги, модель теряет контекст и не может исправить ошибки на «сложных» этапах — они накапливаются и становятся необратимыми.
Решение — метод LEAD (Lookahead-Enhanced Atomic Decomposition): модель заглядывает чуть вперёд и проверяет несколько вариантов развития событий одновременно. Это даёт достаточно изоляции для стабильности и достаточно контекста для исправления ошибок.
Результат на практике: модель o4-mini с LEAD решает головоломку Checkers Jumping до сложности n=13, тогда как без метода ломается уже на n=11.
Пока это академическое исследование, но подход может напрямую улучшить агентные системы и сложные многошаговые задачи в будущих продуктах Apple.
https://machinelearning.apple.com/research/lead-no-recovery-bottleneck
Apple Machine Learning Research
LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning
Long-horizon execution in Large Language Models (LLMs) remains unstable even when high-level strategies are provided. Evaluating on…
Одна видеомодель — и прямая, и обратная динамика робота
Обычно для предсказания последствий действий робота и для восстановления действий по желаемому результату нужны разные модели. Авторы предлагают Masked Visual Actions: вместо того чтобы подавать в видеомодель низкоразмерные векторы команд, они просто маскируют нужные пиксели в видео.
Идея проста: если показать модели траекторию робота (активная сущность) — она предскажет, что произойдёт с объектами. Если показать желаемое движение объекта (пассивная сущность) — та же модель восстановит, как должен двигаться робот. Один чекпоинт, обученный на 15 часах роботизированных данных, решает обе задачи.
Модель применяется для оценки политик, планирования и обратного моделирования в реальных манипуляционных задачах. Бонус: подход не зависит от типа робота, так как действия закодированы прямо в пикселях.
https://arxiv.org/abs/2607.19343
Обычно для предсказания последствий действий робота и для восстановления действий по желаемому результату нужны разные модели. Авторы предлагают Masked Visual Actions: вместо того чтобы подавать в видеомодель низкоразмерные векторы команд, они просто маскируют нужные пиксели в видео.
Идея проста: если показать модели траекторию робота (активная сущность) — она предскажет, что произойдёт с объектами. Если показать желаемое движение объекта (пассивная сущность) — та же модель восстановит, как должен двигаться робот. Один чекпоинт, обученный на 15 часах роботизированных данных, решает обе задачи.
Модель применяется для оценки политик, планирования и обратного моделирования в реальных манипуляционных задачах. Бонус: подход не зависит от типа робота, так как действия закодированы прямо в пикселях.
https://arxiv.org/abs/2607.19343
Единый принцип интеллекта: ищи то, чему можно научиться
Новизна без структуры — это шум телевизора. Минимизация удивления — это тёмная комната. Оба подхода провалились по одной причине: они не различают "обучаемую" и "необучаемую" новизну.
Авторы предлагают единый принцип: максимизируй learnable novelty — ту часть удивления, которую ограниченный наблюдатель реально может усвоить. Формально это "эпиплексность" (epiplexity): длина описания лучшей модели, которую конечный вычислитель способен подобрать под данные.
Ключевой трюк: вместо дорогого поиска по всем программам используют reservoir computer с ridge regression — закрытая формула, дифференцируемая и быстрая.
Результаты впечатляют: без единой метки нейронный клеточный автомат сам развивает солитоны, MNIST-энкодер разделяет классы цифр, RL-агент исследует среду эффективнее в задачах с редкими наградами. А rule 110 (единственный Тьюринг-полный элементарный КА) занимает первое место в рейтинге сложности.
https://arxiv.org/abs/2607.18433
Новизна без структуры — это шум телевизора. Минимизация удивления — это тёмная комната. Оба подхода провалились по одной причине: они не различают "обучаемую" и "необучаемую" новизну.
Авторы предлагают единый принцип: максимизируй learnable novelty — ту часть удивления, которую ограниченный наблюдатель реально может усвоить. Формально это "эпиплексность" (epiplexity): длина описания лучшей модели, которую конечный вычислитель способен подобрать под данные.
Ключевой трюк: вместо дорогого поиска по всем программам используют reservoir computer с ridge regression — закрытая формула, дифференцируемая и быстрая.
Результаты впечатляют: без единой метки нейронный клеточный автомат сам развивает солитоны, MNIST-энкодер разделяет классы цифр, RL-агент исследует среду эффективнее в задачах с редкими наградами. А rule 110 (единственный Тьюринг-полный элементарный КА) занимает первое место в рейтинге сложности.
https://arxiv.org/abs/2607.18433
3DGS всегда мылит дальние горы и скрытые объекты — и вот почему
3D Gaussian Splatting отлично работает, но упорно размывает далёкие объекты и окклюдированные области. Авторы доказали, что это не баг данных, а структурный изъян оптимизации — и назвали его Blur Trap.
Суть проблемы: градиент позиции каждого гауссиана строго ортогонален лучу зрения. То есть оптимизатор может двигать примитивы только поперёк луча, но никогда вдоль глубины. Плюс alpha-blending гасит сигнал для скрытых гауссианов, не давая им делиться.
Решение намеренно минималистичное — два оператора исследования:
1. Random Seeding — случайно засеиваем новые гауссианы по всей сцене, обходя ортогональность
2. Random Splitting — случайно делим гауссианы без оглядки на градиент, обходя подавление alpha-blending
Оба оператора просты, но именно это и нужно: проверить, что exploration сам по себе — недостающий ингредиент 3DGS. Эксперименты на 5 датасетах подтверждают улучшение при минимальных накладных расходах.
https://arxiv.org/abs/2607.17965
3D Gaussian Splatting отлично работает, но упорно размывает далёкие объекты и окклюдированные области. Авторы доказали, что это не баг данных, а структурный изъян оптимизации — и назвали его Blur Trap.
Суть проблемы: градиент позиции каждого гауссиана строго ортогонален лучу зрения. То есть оптимизатор может двигать примитивы только поперёк луча, но никогда вдоль глубины. Плюс alpha-blending гасит сигнал для скрытых гауссианов, не давая им делиться.
Решение намеренно минималистичное — два оператора исследования:
1. Random Seeding — случайно засеиваем новые гауссианы по всей сцене, обходя ортогональность
2. Random Splitting — случайно делим гауссианы без оглядки на градиент, обходя подавление alpha-blending
Оба оператора просты, но именно это и нужно: проверить, что exploration сам по себе — недостающий ингредиент 3DGS. Эксперименты на 5 датасетах подтверждают улучшение при минимальных накладных расходах.
https://arxiv.org/abs/2607.17965
Molt: фреймворк для agentic RL, который влезает в голову за один вечер (by NVIDIA)
Проблема с существующими RL-фреймворками для LLM: они строились под гиперскейл, и каждое изменение алгоритма требует копаться в слоях трейнера, движка роллаутов и конфигурационной обвязки. Molt говорит: сложность — это не цена производительности, это архитектурный выбор.
Ключевая идея: 4 концепта (agent, generator, trainer, estimators) + один асинхронный цикл. Изменение алгоритма трогает ровно один компонент. Никаких форков vLLM или Ray — апстрим-улучшения прилетают автоматически.
Отдельная фича: token-first граница агента. Агент, написанный под стандартный OpenAI/Anthropic SDK, тренируется без изменений — SDK-трафик перехватывается как token ids через loopback-сервер.
Результат: кодовая база в несколько раз меньше Megatron-стеков, при этом throughput статистически сопоставим. Проверено на 700B MoE с expert parallelism 256 — тот же цикл, что и для 4B dense-модели.
https://arxiv.org/abs/2607.21653
Проблема с существующими RL-фреймворками для LLM: они строились под гиперскейл, и каждое изменение алгоритма требует копаться в слоях трейнера, движка роллаутов и конфигурационной обвязки. Molt говорит: сложность — это не цена производительности, это архитектурный выбор.
Ключевая идея: 4 концепта (agent, generator, trainer, estimators) + один асинхронный цикл. Изменение алгоритма трогает ровно один компонент. Никаких форков vLLM или Ray — апстрим-улучшения прилетают автоматически.
Отдельная фича: token-first граница агента. Агент, написанный под стандартный OpenAI/Anthropic SDK, тренируется без изменений — SDK-трафик перехватывается как token ids через loopback-сервер.
Результат: кодовая база в несколько раз меньше Megatron-стеков, при этом throughput статистически сопоставим. Проверено на 700B MoE с expert parallelism 256 — тот же цикл, что и для 4B dense-модели.
https://arxiv.org/abs/2607.21653
HOPE: сжать нейросеть без единого примера данных (by Google)
Стандартные методы прунинга смотрят на "величину весов" и выкидывают маленькие. Проблема: большие веса — это часто просто артефакты оптимизации, а не реально важные нейроны.
Google предлагает другой подход: перенести анализ из пространства параметров в функциональное пространство. Каждый нейрон рассматривается как оператор Гильберта-Шмидта, и вместо "насколько большой вес?" задаётся вопрос "насколько сильно меняется поведение сети, если убрать этот нейрон?".
Ключевой трюк: для вычисления норм в гильбертовом пространстве нужна статистика входных данных — но авторы берут её прямо из Batch Normalization слоёв. Никаких реальных данных не нужно!
Единый фреймворк объединяет прунинг, слияние нейронов и удаление целых блоков под одним критерием дистortion-cost J. Всё гиперпараметр-фри.
https://arxiv.org/abs/2607.21366
Стандартные методы прунинга смотрят на "величину весов" и выкидывают маленькие. Проблема: большие веса — это часто просто артефакты оптимизации, а не реально важные нейроны.
Google предлагает другой подход: перенести анализ из пространства параметров в функциональное пространство. Каждый нейрон рассматривается как оператор Гильберта-Шмидта, и вместо "насколько большой вес?" задаётся вопрос "насколько сильно меняется поведение сети, если убрать этот нейрон?".
Ключевой трюк: для вычисления норм в гильбертовом пространстве нужна статистика входных данных — но авторы берут её прямо из Batch Normalization слоёв. Никаких реальных данных не нужно!
Единый фреймворк объединяет прунинг, слияние нейронов и удаление целых блоков под одним критерием дистortion-cost J. Всё гиперпараметр-фри.
https://arxiv.org/abs/2607.21366
👍2
Знают ли LLM, что учить ПЕРЕД чем? (by Peking University)
Современные LLM легко решают задачи ЕГЭ и ГАО-КАО. Но понимают ли они структуру учебной программы — что "линейные уравнения" требуют знания арифметики, а не наоборот?
Авторы построили K12-KGraph — граф знаний на основе официальных китайских школьных учебников (математика, физика, химия, биология). Граф содержит 7 типов узлов (концепт, навык, эксперимент, упражнение, раздел...) и рёбра типа "является предпосылкой", "проверяет", "иллюстрирует" и т.д.
Из графа сгенерированы бенчмарк K12-Bench (23 640 вопросов на понимание структуры учебника) и датасет K12-Train (7 335 SFT-примеров). Результат: даже Gemini-2.5-Flash набирает лишь 57% точного совпадения. А файнтюнинг на K12-Train даёт +24 балла на GaokaoBench против лучшего конкурента — при вдвое меньшем объёме данных.
https://arxiv.org/abs/2605.09635
Современные LLM легко решают задачи ЕГЭ и ГАО-КАО. Но понимают ли они структуру учебной программы — что "линейные уравнения" требуют знания арифметики, а не наоборот?
Авторы построили K12-KGraph — граф знаний на основе официальных китайских школьных учебников (математика, физика, химия, биология). Граф содержит 7 типов узлов (концепт, навык, эксперимент, упражнение, раздел...) и рёбра типа "является предпосылкой", "проверяет", "иллюстрирует" и т.д.
Из графа сгенерированы бенчмарк K12-Bench (23 640 вопросов на понимание структуры учебника) и датасет K12-Train (7 335 SFT-примеров). Результат: даже Gemini-2.5-Flash набирает лишь 57% точного совпадения. А файнтюнинг на K12-Train даёт +24 балла на GaokaoBench против лучшего конкурента — при вдвое меньшем объёме данных.
https://arxiv.org/abs/2605.09635
NVIDIA запустила Nemotron 3 Ultra для проектирования чипов
NVIDIA представила модель Nemotron 3 Ultra в связке с агентом ACE-RTL для автоматизации RTL-кодинга — написания кода на уровне регистровых передач при разработке микросхем.
Результаты впечатляют: на бенчмарке CVDP система достигает 97,1% успешных решений в 9 категориях задач. При этом модель использует на 71% меньше токенов за итерацию, чем конкурент Kimi K2.6, и на 28% меньше, чем GLM 5.2.
Агент работает по схеме «генерация → тест → рефлексия»: пишет RTL-код, запускает симуляцию, анализирует ошибки и итеративно исправляет их. Именно так работают реальные инженеры.
Архитектура — гибридная Mamba-Attention MoE на 550B параметров (55B активных), контекст до 1M токенов. Это критично: в одной итерации отладки контекст быстро раздувается до спецификаций, кода, логов симулятора и предыдущих попыток.
Модель совместима с EDA-инструментами Cadence, Siemens и Synopsys.
https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-leads-open-models-on-accuracy-and-efficiency-in-agentic-rtl-coding/
NVIDIA представила модель Nemotron 3 Ultra в связке с агентом ACE-RTL для автоматизации RTL-кодинга — написания кода на уровне регистровых передач при разработке микросхем.
Результаты впечатляют: на бенчмарке CVDP система достигает 97,1% успешных решений в 9 категориях задач. При этом модель использует на 71% меньше токенов за итерацию, чем конкурент Kimi K2.6, и на 28% меньше, чем GLM 5.2.
Агент работает по схеме «генерация → тест → рефлексия»: пишет RTL-код, запускает симуляцию, анализирует ошибки и итеративно исправляет их. Именно так работают реальные инженеры.
Архитектура — гибридная Mamba-Attention MoE на 550B параметров (55B активных), контекст до 1M токенов. Это критично: в одной итерации отладки контекст быстро раздувается до спецификаций, кода, логов симулятора и предыдущих попыток.
Модель совместима с EDA-инструментами Cadence, Siemens и Synopsys.
https://developer.nvidia.com/blog/nvidia-nemotron-3-ultra-leads-open-models-on-accuracy-and-efficiency-in-agentic-rtl-coding/
NVIDIA Technical Blog
NVIDIA Nemotron 3 Ultra Leads Open Models on Accuracy and Efficiency in Agentic RTL Coding
Modern chip design is increasingly limited by engineering time. Register transfer level (RTL) development and verification require specialized hardware knowledge, precise reasoning…
👍2
Amazon инвестирует в Lean FRO — организацию, которая делает математические доказательства корректности ПО доступными для разработчиков.
Суть: обычное тестирование проверяет лишь те случаи, о которых вы подумали. Lean позволяет математически доказать, что система не может вести себя неправильно — при любых входных данных.
Amazon уже использует Lean в продуктах: Bedrock AgentCore проверяет границы поведения AI-агентов, SampCert гарантирует защиту приватности в AWS Clean Rooms, AWS Neuron — корректность компиляции для AI-чипов. Один инженер с помощью LLM+Lean доказал корректность протокола Amazon Aurora за рекордно короткое время.
Почему Lean развивают вне Amazon? Чтобы клиенты, аудиторы и регуляторы могли независимо проверять инструменты — это принципиально для безопасности AI-агентов.
Это крупнейшее пожертвование в истории Lean FRO.
https://www.amazon.science/news/amazon-is-investing-in-the-lean-focused-research-organization
Суть: обычное тестирование проверяет лишь те случаи, о которых вы подумали. Lean позволяет математически доказать, что система не может вести себя неправильно — при любых входных данных.
Amazon уже использует Lean в продуктах: Bedrock AgentCore проверяет границы поведения AI-агентов, SampCert гарантирует защиту приватности в AWS Clean Rooms, AWS Neuron — корректность компиляции для AI-чипов. Один инженер с помощью LLM+Lean доказал корректность протокола Amazon Aurora за рекордно короткое время.
Почему Lean развивают вне Amazon? Чтобы клиенты, аудиторы и регуляторы могли независимо проверять инструменты — это принципиально для безопасности AI-агентов.
Это крупнейшее пожертвование в истории Lean FRO.
https://www.amazon.science/news/amazon-is-investing-in-the-lean-focused-research-organization
Amazon Science
Amazon is investing in the Lean Focused Research Organization
As AI agents take on higher-stakes decisions, Lean programming language makes it possible to mathematically prove they will behave safely.
Skill Self-Play: LLM учит сам себя через эволюцию навыков (by Qwen/Alibaba)
Проблема self-play для LLM: либо ты заперт в узкой среде с жёстким верификатором, либо генерируешь хаотичные задачи без контроля качества — и данные деградируют.
Skill-SP решает это через библиотеку "скиллов" — модульных блоков знаний, которые одновременно направляют генерацию задач И верифицируют ответы. Три агента: Proposer (генерирует задачи, опираясь на скиллы), Solver (решает), Controller (анализирует результаты и эволюционирует библиотеку — уточняет скиллы, удаляет устаревшие, индуцирует новые).
Скилл — это не просто подсказка, а живой интерфейс: он проактивно управляет сложностью задач и отслеживает прогресс модели.
Результат на Qwen3-4B: +42.9 пунктов на tool calling, +12.0 на логических задачах против обычного self-play. Unguided SP вообще не смог сгенерировать валидные логические пазлы.
https://arxiv.org/abs/2607.22529
Проблема self-play для LLM: либо ты заперт в узкой среде с жёстким верификатором, либо генерируешь хаотичные задачи без контроля качества — и данные деградируют.
Skill-SP решает это через библиотеку "скиллов" — модульных блоков знаний, которые одновременно направляют генерацию задач И верифицируют ответы. Три агента: Proposer (генерирует задачи, опираясь на скиллы), Solver (решает), Controller (анализирует результаты и эволюционирует библиотеку — уточняет скиллы, удаляет устаревшие, индуцирует новые).
Скилл — это не просто подсказка, а живой интерфейс: он проактивно управляет сложностью задач и отслеживает прогресс модели.
Результат на Qwen3-4B: +42.9 пунктов на tool calling, +12.0 на логических задачах против обычного self-play. Unguided SP вообще не смог сгенерировать валидные логические пазлы.
https://arxiv.org/abs/2607.22529
Тренируй агента в том же harness, в котором он деплоится
Большая проблема современных агентов: их тренируют в упрощённых условиях, а деплоят через сложные harness-обёртки (Claude Code, Codex, OpenClaw). Это создаёт train-deploy mismatch — модель учится одному, а работает в другом.
OpenForgeRL закрывает этот разрыв двумя компонентами: прокси-сервер перехватывает LLM-вызовы внутри harness и собирает пары prompt-response как обычные RL-сэмплы, а Kubernetes-оркестратор запускает каждый rollout в отдельном контейнере в облаке (Azure).
Результат: агент тренируется прямо в своём реальном harness, а траектории автоматически реконструируются в формат для любого RL-фреймворка (veRL, GRPO и т.д.).
На практике: OpenForge-GUI (8B) бьёт более крупные модели на OSWorld, Mind2Web и WebVoyager. Плюс выяснилось — более простые harness'ы учатся лучше, а error recovery остаётся слабым местом даже после RL.
https://arxiv.org/abs/2607.21557
Большая проблема современных агентов: их тренируют в упрощённых условиях, а деплоят через сложные harness-обёртки (Claude Code, Codex, OpenClaw). Это создаёт train-deploy mismatch — модель учится одному, а работает в другом.
OpenForgeRL закрывает этот разрыв двумя компонентами: прокси-сервер перехватывает LLM-вызовы внутри harness и собирает пары prompt-response как обычные RL-сэмплы, а Kubernetes-оркестратор запускает каждый rollout в отдельном контейнере в облаке (Azure).
Результат: агент тренируется прямо в своём реальном harness, а траектории автоматически реконструируются в формат для любого RL-фреймворка (veRL, GRPO и т.д.).
На практике: OpenForge-GUI (8B) бьёт более крупные модели на OSWorld, Mind2Web и WebVoyager. Плюс выяснилось — более простые harness'ы учатся лучше, а error recovery остаётся слабым местом даже после RL.
https://arxiv.org/abs/2607.21557
Творческий AI-агент с «холстом» вместо чата
Большинство AI-инструментов для творчества работают по схеме «промпт → результат». Но реальный творческий процесс — это черновики, версии, правки, референсы, обратная связь. Где всё это хранить?
JarvisHub предлагает заменить линейный чат на «холст» (canvas) — граф-структуру, где каждый артефакт (изображение, видео, аудио, промпт, UI-элемент) — это узел с историей создания, зависимостями и версиями. Агент не читает историю переписки, а смотрит на текущее состояние проекта на холсте.
Архитектура: canvas state (граф артефактов) + protocol bridge (валидация действий агента) + agent runtime (планирование, вызов инструментов, запись траектории).
Агент может читать холст, создавать/редактировать узлы, вызывать генеративные инструменты и записывать результаты обратно — всё трассируемо и восстанавливаемо.
Демо: генерация sci-fi трейлера с музыкой и озвучкой, интерактивная веб-разработка, создание презентаций.
https://arxiv.org/abs/2607.23588
Большинство AI-инструментов для творчества работают по схеме «промпт → результат». Но реальный творческий процесс — это черновики, версии, правки, референсы, обратная связь. Где всё это хранить?
JarvisHub предлагает заменить линейный чат на «холст» (canvas) — граф-структуру, где каждый артефакт (изображение, видео, аудио, промпт, UI-элемент) — это узел с историей создания, зависимостями и версиями. Агент не читает историю переписки, а смотрит на текущее состояние проекта на холсте.
Архитектура: canvas state (граф артефактов) + protocol bridge (валидация действий агента) + agent runtime (планирование, вызов инструментов, запись траектории).
Агент может читать холст, создавать/редактировать узлы, вызывать генеративные инструменты и записывать результаты обратно — всё трассируемо и восстанавливаемо.
Демо: генерация sci-fi трейлера с музыкой и озвучкой, интерактивная веб-разработка, создание презентаций.
https://arxiv.org/abs/2607.23588
NVIDIA выпустила Ising Calibration 1.5 — ИИ-модель для автоматической калибровки квантовых компьютеров.
Это 31-миллиардная vision-language модель, которая анализирует диагностические данные квантовых процессоров и определяет, как их нужно настраивать. Новая версия стала на 11,4% компактнее и на 86,5% лучше справляется с задачами в режиме in-context learning по сравнению с предшественником.
Главное для пользователей: впервые доступна NVFP4-квантизированная версия, которая запускается на одной потребительской видеокарте или NVIDIA DGX Spark — без дата-центра. По качеству модель обходит все открытые аналоги и конкурирует с закрытыми гигантами вроде GPT 5.6 Sol.
Веса, датасеты, бенчмарк QCalEval и готовые рецепты развёртывания доступны на Hugging Face под лицензией OpenMDW. Квантовые лаборатории теперь могут автоматизировать калибровку прямо на месте.
https://developer.nvidia.com/blog/nvidia-ising-enables-fully-automated-quantum-computer-calibration-with-enhanced-in-context-learning/
Это 31-миллиардная vision-language модель, которая анализирует диагностические данные квантовых процессоров и определяет, как их нужно настраивать. Новая версия стала на 11,4% компактнее и на 86,5% лучше справляется с задачами в режиме in-context learning по сравнению с предшественником.
Главное для пользователей: впервые доступна NVFP4-квантизированная версия, которая запускается на одной потребительской видеокарте или NVIDIA DGX Spark — без дата-центра. По качеству модель обходит все открытые аналоги и конкурирует с закрытыми гигантами вроде GPT 5.6 Sol.
Веса, датасеты, бенчмарк QCalEval и готовые рецепты развёртывания доступны на Hugging Face под лицензией OpenMDW. Квантовые лаборатории теперь могут автоматизировать калибровку прямо на месте.
https://developer.nvidia.com/blog/nvidia-ising-enables-fully-automated-quantum-computer-calibration-with-enhanced-in-context-learning/
NVIDIA Technical Blog
NVIDIA Ising Enables Fully Automated Quantum Computer Calibration with Enhanced In-Context Learning
NVIDIA Ising Calibration is an open source vision language model (VLM) designed to interpret diagnostic outputs from quantum processors and determine how they should be tuned to continue operating.
Apple ML представила GH-ESD — инструмент для поиска системных ошибок в моделях компьютерного зрения.
Проблема: vision-модели часто стабильно ошибаются на определённых типах изображений — например, плохо распознают объекты в специфическом контексте или расположении. Найти такие «зоны провала» вручную крайне сложно.
GH-ESD автоматизирует этот процесс: сначала LLM генерирует гипотезы о возможных паттернах ошибок, затем Vision Language Models ищут реальные примеры, а статистический анализ подтверждает или отвергает гипотезы.
Важно, что метод работает не только для классификации изображений, но и для детекции объектов и сегментации — задач, где ошибки зависят от пространственного контекста.
На новом бенчмарке GESD точность Precision@10 выросла с 0.63 до 0.73 по сравнению с предыдущими подходами.
Для разработчиков это означает более быстрое выявление слабых мест модели и конкретные подсказки для её улучшения. Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/gh-esd
Проблема: vision-модели часто стабильно ошибаются на определённых типах изображений — например, плохо распознают объекты в специфическом контексте или расположении. Найти такие «зоны провала» вручную крайне сложно.
GH-ESD автоматизирует этот процесс: сначала LLM генерирует гипотезы о возможных паттернах ошибок, затем Vision Language Models ищут реальные примеры, а статистический анализ подтверждает или отвергает гипотезы.
Важно, что метод работает не только для классификации изображений, но и для детекции объектов и сегментации — задач, где ошибки зависят от пространственного контекста.
На новом бенчмарке GESD точность Precision@10 выросла с 0.63 до 0.73 по сравнению с предыдущими подходами.
Для разработчиков это означает более быстрое выявление слабых мест модели и конкретные подсказки для её улучшения. Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/gh-esd
Apple Machine Learning Research
GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
Systematic failures of vision models on semantically coherent subsets, known as error slices, reveal limitations in robustness and…
Kimi K3 — 2.8 триллиона параметров в открытом доступе (by Moonshot AI)
Пока open-source модели топчутся в районе 1T параметров, Kimi K3 делает резкий прыжок — 2.8T параметров, 104B активируемых, контекст до 1M токенов. И всё это выложено в открытый доступ.
Ключевые архитектурные трюки: Kimi Delta Attention (линейное внимание с channel-wise forget gate) чередуется с обычным MLA в пропорции 3:1. Attention Residuals позволяют каждому слою тянуть информацию из всех предыдущих слоёв, а не только из соседнего. MoE расширен до 896 экспертов, активируется 16 на токен.
В итоге — примерно 2.5× прирост эффективности масштабирования по сравнению с Kimi K2.
По бенчмаркам модель обходит все открытые аналоги и большинство проприетарных систем, уступая только Claude 4.5 и GPT-5.
https://arxiv.org/abs/2607.24653
Пока open-source модели топчутся в районе 1T параметров, Kimi K3 делает резкий прыжок — 2.8T параметров, 104B активируемых, контекст до 1M токенов. И всё это выложено в открытый доступ.
Ключевые архитектурные трюки: Kimi Delta Attention (линейное внимание с channel-wise forget gate) чередуется с обычным MLA в пропорции 3:1. Attention Residuals позволяют каждому слою тянуть информацию из всех предыдущих слоёв, а не только из соседнего. MoE расширен до 896 экспертов, активируется 16 на токен.
В итоге — примерно 2.5× прирост эффективности масштабирования по сравнению с Kimi K2.
По бенчмаркам модель обходит все открытые аналоги и большинство проприетарных систем, уступая только Claude 4.5 и GPT-5.
https://arxiv.org/abs/2607.24653
Как дистиллировать знания из GPT-5 в открытую модель, если у тебя нет доступа к его логитам?
Стандартный подход — KL-дивергенция по токенам — не работает между разными моделями: у них разные токенизаторы, и логиты проприетарных моделей закрыты. Копировать «сырые» траектории рассуждений тоже плохо: студент начинает имитировать стиль учителя и галлюцинировать.
Авторы предлагают MAPD: между учителем и студентом вставляется структурированный JSON-протокол — нормализованное промежуточное представление с планом рассуждений, найденными фактами и верификацией ответа. Проприетарная мультиагентная система генерирует эти протоколы офлайн. Затем студент обучается через self-distillation: одна ветвь видит протокол как привилегированную информацию, другая — нет. KL между ними считается внутри одной модели, что обходит проблему разных токенизаторов. Сверху — стандартный GRPO.
Эксперименты с Claude Opus, GPT и Gemini как учителями показывают стабильный прирост без перенастройки пайплайна под каждого учителя.
Стандартный подход — KL-дивергенция по токенам — не работает между разными моделями: у них разные токенизаторы, и логиты проприетарных моделей закрыты. Копировать «сырые» траектории рассуждений тоже плохо: студент начинает имитировать стиль учителя и галлюцинировать.
Авторы предлагают MAPD: между учителем и студентом вставляется структурированный JSON-протокол — нормализованное промежуточное представление с планом рассуждений, найденными фактами и верификацией ответа. Проприетарная мультиагентная система генерирует эти протоколы офлайн. Затем студент обучается через self-distillation: одна ветвь видит протокол как привилегированную информацию, другая — нет. KL между ними считается внутри одной модели, что обходит проблему разных токенизаторов. Сверху — стандартный GRPO.
Эксперименты с Claude Opus, GPT и Gemini как учителями показывают стабильный прирост без перенастройки пайплайна под каждого учителя.
Робот учится без робота: HiFi-UMI собирает данные руками человека и сразу деплоит политику
Главная проблема масштабирования робо-манипуляций — дорогая телеоперация: нужен сам робот, риг и оператор. HiFi-UMI предлагает радикальный ответ: вообще убрать робота из сбора данных.
Система — это перчатка-захват с головным стерео-SLAM, GPIO-триггером (синхронизация до 40 мкс) и шестью широкоугольными камерами. Точность траектории — 3 мм. Автоматический пайплайн реконструирует, воспроизводит и валидирует каждую демонстрацию: 98% реконструкций и 98% реплеев проходят проверку (~96% суммарно).
Главный результат: zero-robot post-training — дообучение только на HiFi-UMI данных без единой телеоперированной траектории — на трёх бэкбонах (VLA и WAM) совпадает с in-domain телеоперацией с разницей в −2.5, +3.1 и −0.6 п.п. Лучшая политика достигает 85% на задаче точной вставки.
Открытый датасет HiFi-UMI-2K: 2000 часов, 480+ сцен.
https://arxiv.org/abs/2607.25895
Главная проблема масштабирования робо-манипуляций — дорогая телеоперация: нужен сам робот, риг и оператор. HiFi-UMI предлагает радикальный ответ: вообще убрать робота из сбора данных.
Система — это перчатка-захват с головным стерео-SLAM, GPIO-триггером (синхронизация до 40 мкс) и шестью широкоугольными камерами. Точность траектории — 3 мм. Автоматический пайплайн реконструирует, воспроизводит и валидирует каждую демонстрацию: 98% реконструкций и 98% реплеев проходят проверку (~96% суммарно).
Главный результат: zero-robot post-training — дообучение только на HiFi-UMI данных без единой телеоперированной траектории — на трёх бэкбонах (VLA и WAM) совпадает с in-domain телеоперацией с разницей в −2.5, +3.1 и −0.6 п.п. Лучшая политика достигает 85% на задаче точной вставки.
Открытый датасет HiFi-UMI-2K: 2000 часов, 480+ сцен.
https://arxiv.org/abs/2607.25895
OpenAI публикует полевой отчёт о том, как учёные используют AI-агентов в научных вычислениях.
Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.
Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.
Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.
https://openai.com/index/scientific-computing-agentic-ai
Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.
Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.
Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.
https://openai.com/index/scientific-computing-agentic-ai
OpenAI
Scientific computing in the age of agentic AI
A new field report shows how scientists use AI coding agents to modernize scientific computing, accelerating software development and discovery in genomics and beyond.
Nvidia Tech запускает GPU-симуляцию для медицинской робототехники.
NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).
Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.
Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.
Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.
https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).
Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.
Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.
Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.
https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
NVIDIA Technical Blog
Developing Healthcare Robotics with GPU-Native Medical Physics Simulation
Unlike autonomous driving or industrial robotics, healthcare robotics can’t rely on internet-scale data collection or unlimited real-world experimentation. Every demonstration requires specialized…
Nvidia выпустила NOOA — открытый фреймворк для AI-агентов
NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.
Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.
Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.
Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.
https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.
Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.
Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.
Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.
https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
NVIDIA Technical Blog
Six Agent Harness Capabilities for Higher Model Performance
Building a great AI agent isn’t just about choosing the right models. The harness is the architecture surrounding the model. How it renders context, executes actions, manages state, and decides when a…