OpenAI публикует полевой отчёт о том, как учёные используют AI-агентов в научных вычислениях.
Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.
Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.
Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.
https://openai.com/index/scientific-computing-agentic-ai
Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.
Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.
Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.
https://openai.com/index/scientific-computing-agentic-ai
OpenAI
Scientific computing in the age of agentic AI
A new field report shows how scientists use AI coding agents to modernize scientific computing, accelerating software development and discovery in genomics and beyond.
Nvidia Tech запускает GPU-симуляцию для медицинской робототехники.
NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).
Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.
Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.
Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.
https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).
Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.
Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.
Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.
https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
NVIDIA Technical Blog
Developing Healthcare Robotics with GPU-Native Medical Physics Simulation
Unlike autonomous driving or industrial robotics, healthcare robotics can’t rely on internet-scale data collection or unlimited real-world experimentation. Every demonstration requires specialized…
Nvidia выпустила NOOA — открытый фреймворк для AI-агентов
NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.
Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.
Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.
Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.
https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.
Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.
Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.
Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.
https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
NVIDIA Technical Blog
Six Agent Harness Capabilities for Higher Model Performance
Building a great AI agent isn’t just about choosing the right models. The harness is the architecture surrounding the model. How it renders context, executes actions, manages state, and decides when a…
Зачем гонять робота через миллиарды параметров, если BERT справится?
Все современные VLA-модели для роботов устроены одинаково: берём огромный LLM, пропускаем через него картинку и инструкцию, получаем действие. Красиво, но медленно и прожорливо по памяти.
TurboVLA задаёт неудобный вопрос: а зачем вообще LLM в цикле управления? Когда робот уже знает задачу ("возьми красный кубик"), ему не нужно генерировать текст — нужно просто смотреть и двигаться.
Решение простое: отдельный визуальный энкодер + лёгкий BERT для текста + кросс-аттеншн между ними → предсказание чанка действий за один проход. Никакого авторегрессивного декодинга, никакого LLM в петле.
Результат: 0.2B параметров, меньше 1 ГБ VRAM, 32 Гц на RTX 4090. При этом 97.7% успеха на LIBERO — столько же, сколько у моделей в 6 раз больше (π0.5).
Главный посыл: execution-level control и open-ended reasoning — разные задачи. Не надо смешивать.
https://arxiv.org/abs/2607.27205
Все современные VLA-модели для роботов устроены одинаково: берём огромный LLM, пропускаем через него картинку и инструкцию, получаем действие. Красиво, но медленно и прожорливо по памяти.
TurboVLA задаёт неудобный вопрос: а зачем вообще LLM в цикле управления? Когда робот уже знает задачу ("возьми красный кубик"), ему не нужно генерировать текст — нужно просто смотреть и двигаться.
Решение простое: отдельный визуальный энкодер + лёгкий BERT для текста + кросс-аттеншн между ними → предсказание чанка действий за один проход. Никакого авторегрессивного декодинга, никакого LLM в петле.
Результат: 0.2B параметров, меньше 1 ГБ VRAM, 32 Гц на RTX 4090. При этом 97.7% успеха на LIBERO — столько же, сколько у моделей в 6 раз больше (π0.5).
Главный посыл: execution-level control и open-ended reasoning — разные задачи. Не надо смешивать.
https://arxiv.org/abs/2607.27205
Mage-VL: видеомодель, которая смотрит как мозг, а не как камера (by Microsoft)
Обычные VLM обрабатывают каждый кадр целиком — даже если 90% сцены не изменилось. Mage-VL делает иначе: берёт принципы видеокодеков (как H.265) и кодирует только те патчи, где что-то реально движется. Статичный фон? Пропускаем. Результат — на 75% меньше токенов и ускорение инференса до 3.5x.
Ещё интереснее архитектура: System 1 — лёгкий гейт, который следит за стримом и решает, когда реагировать. System 2 — полная языковая модель, которая включается только при событии. Прямо как в нейробиологии.
Бонус: Mage-ViT обучен с нуля на 560M изображений и 100M видео — без миллиардов пар картинка-текст. И при этом не уступает SigLIP2. Вывод авторов: структурное соответствие данных важнее их масштаба.
https://arxiv.org/abs/2607.24904
Обычные VLM обрабатывают каждый кадр целиком — даже если 90% сцены не изменилось. Mage-VL делает иначе: берёт принципы видеокодеков (как H.265) и кодирует только те патчи, где что-то реально движется. Статичный фон? Пропускаем. Результат — на 75% меньше токенов и ускорение инференса до 3.5x.
Ещё интереснее архитектура: System 1 — лёгкий гейт, который следит за стримом и решает, когда реагировать. System 2 — полная языковая модель, которая включается только при событии. Прямо как в нейробиологии.
Бонус: Mage-ViT обучен с нуля на 560M изображений и 100M видео — без миллиардов пар картинка-текст. И при этом не уступает SigLIP2. Вывод авторов: структурное соответствие данных важнее их масштаба.
https://arxiv.org/abs/2607.24904
Expanding Flow Maps: генерация с переменной размерностью за несколько шагов
Стандартные flow-based модели страдают от одного ограничения: размерность выхода фиксируется при инициализации. Хочешь сгенерировать молекулу неизвестного размера или текст произвольной длины — классический flow не поможет.
Авторы вводят Expanding Flow Maps (EFMs): каждый шаг состоит из двух операций — expand (добавляем новые координаты/токены с шумом) и transport (двигаем расширенное состояние к целевому распределению). Стандартные flow maps — частный случай, где expand — тождественное отображение.
Работает и для непрерывных, и для дискретных данных (через simplex-представление). Эксперименты: генерация молекулярных конформеров, графов молекул и языковое моделирование — всё в рамках единого фреймворка с произвольным бюджетом шагов.
https://arxiv.org/abs/2607.21585
Стандартные flow-based модели страдают от одного ограничения: размерность выхода фиксируется при инициализации. Хочешь сгенерировать молекулу неизвестного размера или текст произвольной длины — классический flow не поможет.
Авторы вводят Expanding Flow Maps (EFMs): каждый шаг состоит из двух операций — expand (добавляем новые координаты/токены с шумом) и transport (двигаем расширенное состояние к целевому распределению). Стандартные flow maps — частный случай, где expand — тождественное отображение.
Работает и для непрерывных, и для дискретных данных (через simplex-представление). Эксперименты: генерация молекулярных конформеров, графов молекул и языковое моделирование — всё в рамках единого фреймворка с произвольным бюджетом шагов.
https://arxiv.org/abs/2607.21585
OpenAI выяснила, как два простых параметра API утроили результаты GPT-5.6 на бенчмарке ARC-AGI-3.
Первый — сохранение цепочки рассуждений между запросами. Модель не начинает думать с нуля каждый раз, а опирается на предыдущие выводы. Второй — компактизация контекста: длинные рассуждения сжимаются, что экономит токены и ускоряет работу.
В итоге — утроение баллов на одном из самых сложных тестов на общий интеллект, плюс заметный рост эффективности.
Для разработчиков это конкретный сигнал: правильная настройка API даёт больше, чем кажется. Два флага — и модель работает принципиально иначе.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
Первый — сохранение цепочки рассуждений между запросами. Модель не начинает думать с нуля каждый раз, а опирается на предыдущие выводы. Второй — компактизация контекста: длинные рассуждения сжимаются, что экономит токены и ускоряет работу.
В итоге — утроение баллов на одном из самых сложных тестов на общий интеллект, плюс заметный рост эффективности.
Для разработчиков это конкретный сигнал: правильная настройка API даёт больше, чем кажется. Два флага — и модель работает принципиально иначе.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
OpenAI
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
How two API settings improved GPT-5.6 performance on ARC-AGI-3, boosting scores and efficiency by retaining reasoning and enabling compaction.
Nvidia Tech запустила туториал по развёртыванию собственного AI-ассистента для кода с защитой через NeMo Guardrails.
Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.
Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.
Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.
https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.
Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.
Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.
https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
NVIDIA Technical Blog
How to Self-Host a Validated AI Coding Assistant with NVIDIA NeMo Guardrails
Deploying an AI coding assistant in a regulated, sovereign, or source-sensitive environment, often comes with challenges. Three common issues are: the source cannot leave the network…
Apple ML представила архитектуру синтеза речи для Siri Expressive Voices, которая работает прямо на устройстве.
Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.
Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.
Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.
Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.
https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.
Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.
Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.
Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.
https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
Apple Machine Learning Research
Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Siri Expressive Voices synthesize rich, configurable speech in real time and entirely on device, powered by AFM 3 Core Advanced, Apple’s…
ИИ, который улучшает ИИ — и учится делать это лучше
Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.
Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).
Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.
Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.
https://arxiv.org/abs/2607.28568
Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.
Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).
Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.
Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.
https://arxiv.org/abs/2607.28568
Память прямо в весах модели — без RAG, без внешних баз
Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.
Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.
Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.
Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.
Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.
Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.
Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Датасет для воплощённого ИИ: записали 150 часов домашней жизни со всех сторон
Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.
Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.
На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.
Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.
Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.
На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.
Microsoft Research выпустила Echoverse — систему тренировочных сред для AI-агентов, работающих с компьютером.
Суть: вместо сотен поверхностных симуляций — 12 глубоких миров, точно воспроизводящих логику реальных приложений (почта, банкинг, внутренние консоли). Каждый мир хранит настоящее состояние базы данных, которое меняется от действий агента.
Результат впечатляет: модель на 9B параметров подняла точность с 36.5% до 67.1% — почти вдвое, отставая от GPT-5.4 всего на 14 пунктов.
Ключевой вывод: качество среды важнее количества. Мелкие, «поверхностные» миры не просто не помогают — они ухудшают результат.
Четыре среды с кодом, данными и верификаторами уже открыты на GitHub и Hugging Face.
https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/
Суть: вместо сотен поверхностных симуляций — 12 глубоких миров, точно воспроизводящих логику реальных приложений (почта, банкинг, внутренние консоли). Каждый мир хранит настоящее состояние базы данных, которое меняется от действий агента.
Результат впечатляет: модель на 9B параметров подняла точность с 36.5% до 67.1% — почти вдвое, отставая от GPT-5.4 всего на 14 пунктов.
Ключевой вывод: качество среды важнее количества. Мелкие, «поверхностные» миры не просто не помогают — они ухудшают результат.
Четыре среды с кодом, данными и верификаторами уже открыты на GitHub и Hugging Face.
https://www.microsoft.com/en-us/research/blog/echoverse-deep-evolving-environments-for-computer-use-agents/
Microsoft Research
Deep, evolving environments for computer-use agents
Computer-use AI agents struggle with multi-step workflows like email and customer support. Echoverse trains agents in realistic environments rather than simply providing more training tasks, helping them improve as the tasks, tests, and environments evolve.
Microsoft Research представила EvoLib — систему, которая учит ИИ накапливать знания из опыта без переобучения модели.
Суть проста: обычная память ИИ — это архив прошлых диалогов и действий. EvoLib идёт дальше: он извлекает из опыта переиспользуемые навыки и выводы, а затем постоянно их уточняет и обобщает. Как человек, который помнит не каждую деталь, а то, что реально работает.
Главное: система не требует обновления весов модели и работает с любыми LLM через API, включая закрытые.
На тестах — математика, написание кода, принятие решений — EvoLib стабильно обходит конкурирующие подходы на основе памяти и эффективнее конвертирует вычисления в рост качества.
Код уже открыт на GitHub.
https://www.microsoft.com/en-us/research/blog/evolib-turning-experience-into-evolving-knowledge/
Суть проста: обычная память ИИ — это архив прошлых диалогов и действий. EvoLib идёт дальше: он извлекает из опыта переиспользуемые навыки и выводы, а затем постоянно их уточняет и обобщает. Как человек, который помнит не каждую деталь, а то, что реально работает.
Главное: система не требует обновления весов модели и работает с любыми LLM через API, включая закрытые.
На тестах — математика, написание кода, принятие решений — EvoLib стабильно обходит конкурирующие подходы на основе памяти и эффективнее конвертирует вычисления в рост качества.
Код уже открыт на GitHub.
https://www.microsoft.com/en-us/research/blog/evolib-turning-experience-into-evolving-knowledge/
Microsoft Research
EvoLib: Teaching LLMs to learn from experience
LLMs do not get smarter just by remembering more. EvoLib turns experience into evolving knowledge, taking reusable skills and insights that help models learn and adapt across tasks long after deployment.
Nvidia выпустила nvmath-python v1.0 — библиотеку, которая открывает Python-разработчикам доступ к мощи CUDA-X математических библиотек (cuFFT, cuBLASLt, cuSPARSE и другим) без написания C/C++ кода.
Что важно: библиотека работает с NumPy, CuPy и PyTorch, поддерживает CPU, GPU и распределённые многоузловые системы. Можно буквально написать три строки кода и получить GPU-ускоренное матричное умножение.
Главные фишки: универсальные разреженные тензоры (UST) с кастомными форматами через DSL, два типа API — универсальные и специализированные для максимальной производительности, JIT-компиляция через numba-cuda, интеграция с Python logging для трассировки вычислений.
Устанавливается через pip, conda или uv. Для кого это важно: исследователи, ML-инженеры и все, кто занимается научными вычислениями и хочет выжать максимум из железа NVIDIA без погружения в низкоуровневые интерфейсы.
https://developer.nvidia.com/blog/run-high-performance-core-math-at-scale-with-nvidia-nvmath-python/
Что важно: библиотека работает с NumPy, CuPy и PyTorch, поддерживает CPU, GPU и распределённые многоузловые системы. Можно буквально написать три строки кода и получить GPU-ускоренное матричное умножение.
Главные фишки: универсальные разреженные тензоры (UST) с кастомными форматами через DSL, два типа API — универсальные и специализированные для максимальной производительности, JIT-компиляция через numba-cuda, интеграция с Python logging для трассировки вычислений.
Устанавливается через pip, conda или uv. Для кого это важно: исследователи, ML-инженеры и все, кто занимается научными вычислениями и хочет выжать максимум из железа NVIDIA без погружения в низкоуровневые интерфейсы.
https://developer.nvidia.com/blog/run-high-performance-core-math-at-scale-with-nvidia-nvmath-python/
NVIDIA Technical Blog
Run High-Performance Core Math at Scale with NVIDIA nvmath-python
NVIDIA nvmath-python is a library designed to bridge the gap between the Python scientific community and NVIDIA CUDA-X math libraries. It gives Python users access to CUDA-X performance for common…
GUI-агент от Alibaba, который реально работает на телефоне, а не только в симуляторе (by TongyiLab / Alibaba)
Большинство GUI-агентов хорошо выглядят на бенчмарках, но ломаются на реальных устройствах. Qwen-UI-Agent строился вокруг одной идеи: настоящая польза, а не симуляция.
Что внутри:
— 100+ физических Android-устройств для сбора данных и обучения
— Гибридное пространство действий: GUI + bash CLI + батчинг (40%+ шагов батчатся)
— Online RL на траекториях длиной 100+ шагов, 10 000 параллельных сред
— AutoResearch: агенты сами генерируют задачи, анализируют ошибки, предлагают следующую итерацию
— Проактивный режим: агент видит уведомление о рейсе и сам предлагает план переезда
Результаты: 92.2% на реальном бенчмарке MobileWorld-Real, обгоняет Claude Opus 4.8, GPT-5.6 Sol и Gemini 3.1 Pro.
https://arxiv.org/abs/2607.28227
Большинство GUI-агентов хорошо выглядят на бенчмарках, но ломаются на реальных устройствах. Qwen-UI-Agent строился вокруг одной идеи: настоящая польза, а не симуляция.
Что внутри:
— 100+ физических Android-устройств для сбора данных и обучения
— Гибридное пространство действий: GUI + bash CLI + батчинг (40%+ шагов батчатся)
— Online RL на траекториях длиной 100+ шагов, 10 000 параллельных сред
— AutoResearch: агенты сами генерируют задачи, анализируют ошибки, предлагают следующую итерацию
— Проактивный режим: агент видит уведомление о рейсе и сам предлагает план переезда
Результаты: 92.2% на реальном бенчмарке MobileWorld-Real, обгоняет Claude Opus 4.8, GPT-5.6 Sol и Gemini 3.1 Pro.
https://arxiv.org/abs/2607.28227
Код как цепочка рассуждений для физически корректных видео
Главная проблема генерации видео — "каузальная непрозрачность": промпт описывает событие сжато, а модель должна сама восстановить полный физический процесс. VideoCoCo решает это радикально: вместо того чтобы генерировать видео напрямую, агент сначала пишет программу на Blender, которая явно кодирует сцену и её эволюцию во времени.
Система работает в два этапа. Сначала Executable Simulation Engine генерирует низкокачественный, но физически корректный черновик через симуляцию. Затем Generative Video Engine превращает этот черновик в фотореалистичное видео через draft-conditioned editing. Физика — за симулятором, внешний вид — за диффузионной моделью.
Для обучения второго движка авторы собрали датасет VideoCoCo-3K из троек (черновик, инструкция, целевое видео). На бенчмарках PhyGenBench и VBench-2.0 метод показывает SOTA, особенно в термодинамике и свойствах материалов.
https://arxiv.org/abs/2607.27380
Главная проблема генерации видео — "каузальная непрозрачность": промпт описывает событие сжато, а модель должна сама восстановить полный физический процесс. VideoCoCo решает это радикально: вместо того чтобы генерировать видео напрямую, агент сначала пишет программу на Blender, которая явно кодирует сцену и её эволюцию во времени.
Система работает в два этапа. Сначала Executable Simulation Engine генерирует низкокачественный, но физически корректный черновик через симуляцию. Затем Generative Video Engine превращает этот черновик в фотореалистичное видео через draft-conditioned editing. Физика — за симулятором, внешний вид — за диффузионной моделью.
Для обучения второго движка авторы собрали датасет VideoCoCo-3K из троек (черновик, инструкция, целевое видео). На бенчмарках PhyGenBench и VBench-2.0 метод показывает SOTA, особенно в термодинамике и свойствах материалов.
https://arxiv.org/abs/2607.27380
(by Adobe) Как применить Chinchilla-scaling к диффузионным моделям?
Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.
Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).
Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
Генерация видео 4K+ — это десятки тысяч токенов, и квадратичный self-attention просто не вывозит. Adobe представили Chimera — гибридный диффузионный трансформер для «token-extensive» режима.
Ключевые идеи:
1. Большинство слоёв используют линейное внимание KDA (O(N)), а не полное — с периодическими MLA-слоями для глобального взаимодействия.
2. Modality-aware свёртки обогащают локальный контекст перед каждым KDA-обновлением — без позиционных эмбеддингов вообще.
3. HeteroP — новый способ переносить гиперпараметры между масштабами модели, учитывая разнородность тензоров в визуальных архитектурах.
4. Chinchilla-style scaling laws для image/video: оптимальный размер модели растёт почти линейно с токенами (N ∝ C^0.48–0.52).
Результат: модель 11B (2B активных) достигает качества Wan 2.1 (2B) за 7.3× меньше FLOPs, поддерживает в 1.68× длиннее последовательности на A100 и генерирует 30-секундные видео, обучившись только на 5-секундных клипах.
OpenAI опубликовала результаты работы своих моделей над давними нерешёнными задачами в математике и теоретической информатике. В числе достижений — прорывы в геометрии, криптографии и теории сложности вычислений.
Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.
Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.
https://openai.com/index/ten-advances-in-mathematics
Это важно: ИИ больше не просто помогает решать задачи из учебников — он двигает вперёд фундаментальную науку, которая лежит в основе современной криптографии и алгоритмов. Некоторые из этих проблем не решались десятилетиями.
Для пользователей это сигнал: модели OpenAI достигают уровня, на котором они способны работать как полноценные научные партнёры, а не просто ассистенты. Следующий шаг — применение этих возможностей в реальных исследованиях и разработках.
https://openai.com/index/ten-advances-in-mathematics
OpenAI
Ten advances in mathematics and theoretical computer science
OpenAI shares new results on long-standing open problems in mathematics and theoretical computer science, including advances in geometry, cryptography, and complexity.
Google DeepMind запустила Gemini Robotics ER 2 — новую модель, которая работает как "мозг высшего уровня" для роботов.
Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.
Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.
Доступно уже сейчас через Gemini API и Google AI Studio.
https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Что нового: модель в реальном времени анализирует видеопоток, отслеживает прогресс выполнения задач и сама исправляет ошибки на ходу. Поддерживается многошаговое планирование без раздражающих пауз "остановился — подумал". Главная фишка — роботы теперь могут работать в команде: например, Apollo 2 от Apptronik и манипулятор Franka F3 Duo совместно выполняют задачи, которые одному роботу не под силу.
Точность определения момента завершения задачи — 91,3%, при этом модель работает в 4 раза быстрее аналогов с куда меньшими вычислительными затратами.
Доступно уже сейчас через Gemini API и Google AI Studio.
https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
Google
Introducing Gemini Robotics ER 2
Gemini Robotics ER 2 is a step change in video understanding, tool orchestration, and multi-robot collaboration for robotic applications.
Nvidia опубликовала технический гайд по co-design архитектуры внимания (attention) для ускорения LLM-инференса на GPU.
Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.
Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.
Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.
Nvidia выпустит отдельный материал по sparse attention — следим.
https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/
Суть: как правильно выбрать group size, размерность головы и длину контекста, чтобы модель работала быстро и интерактивно — особенно при длинных контекстах.
Ключевые выводы:
— Для decode-фазы важен большой group size (G): удвоение G удваивает эффективность. MHA тут проигрывает GQA/MQA.
— Для prefill-фазы решает длина контекста, а не G — менять его бесполезно.
— Оптимальная размерность головы — 128 или 256: лучше выравнивание под GPU-тайлы.
— Tensor Parallelism нельзя превышать число KV-голов, иначе дублирование кэша убивает производительность.
Почему важно: при контексте 128K внимание занимает уже 85% времени prefill (против 18% при 4K). Без грамотного co-design модель просто не масштабируется.
Nvidia выпустит отдельный материал по sparse attention — следим.
https://developer.nvidia.com/blog/co-designing-ai-model-attention-for-fast-interactive-long-context-inference/
NVIDIA Technical Blog
Co-Designing AI Model Attention for Fast, Interactive Long-Context Inference
As agentic and long-context workloads become common, the context lengths increase and attention consumes a larger share of inference time (Figure 1). Because attention now dominates that cost…