Amazon инвестирует в Lean FRO — организацию, которая делает математические доказательства корректности ПО доступными для разработчиков.
Суть: обычное тестирование проверяет лишь те случаи, о которых вы подумали. Lean позволяет математически доказать, что система не может вести себя неправильно — при любых входных данных.
Amazon уже использует Lean в продуктах: Bedrock AgentCore проверяет границы поведения AI-агентов, SampCert гарантирует защиту приватности в AWS Clean Rooms, AWS Neuron — корректность компиляции для AI-чипов. Один инженер с помощью LLM+Lean доказал корректность протокола Amazon Aurora за рекордно короткое время.
Почему Lean развивают вне Amazon? Чтобы клиенты, аудиторы и регуляторы могли независимо проверять инструменты — это принципиально для безопасности AI-агентов.
Это крупнейшее пожертвование в истории Lean FRO.
https://www.amazon.science/news/amazon-is-investing-in-the-lean-focused-research-organization
Суть: обычное тестирование проверяет лишь те случаи, о которых вы подумали. Lean позволяет математически доказать, что система не может вести себя неправильно — при любых входных данных.
Amazon уже использует Lean в продуктах: Bedrock AgentCore проверяет границы поведения AI-агентов, SampCert гарантирует защиту приватности в AWS Clean Rooms, AWS Neuron — корректность компиляции для AI-чипов. Один инженер с помощью LLM+Lean доказал корректность протокола Amazon Aurora за рекордно короткое время.
Почему Lean развивают вне Amazon? Чтобы клиенты, аудиторы и регуляторы могли независимо проверять инструменты — это принципиально для безопасности AI-агентов.
Это крупнейшее пожертвование в истории Lean FRO.
https://www.amazon.science/news/amazon-is-investing-in-the-lean-focused-research-organization
Amazon Science
Amazon is investing in the Lean Focused Research Organization
As AI agents take on higher-stakes decisions, Lean programming language makes it possible to mathematically prove they will behave safely.
Skill Self-Play: LLM учит сам себя через эволюцию навыков (by Qwen/Alibaba)
Проблема self-play для LLM: либо ты заперт в узкой среде с жёстким верификатором, либо генерируешь хаотичные задачи без контроля качества — и данные деградируют.
Skill-SP решает это через библиотеку "скиллов" — модульных блоков знаний, которые одновременно направляют генерацию задач И верифицируют ответы. Три агента: Proposer (генерирует задачи, опираясь на скиллы), Solver (решает), Controller (анализирует результаты и эволюционирует библиотеку — уточняет скиллы, удаляет устаревшие, индуцирует новые).
Скилл — это не просто подсказка, а живой интерфейс: он проактивно управляет сложностью задач и отслеживает прогресс модели.
Результат на Qwen3-4B: +42.9 пунктов на tool calling, +12.0 на логических задачах против обычного self-play. Unguided SP вообще не смог сгенерировать валидные логические пазлы.
https://arxiv.org/abs/2607.22529
Проблема self-play для LLM: либо ты заперт в узкой среде с жёстким верификатором, либо генерируешь хаотичные задачи без контроля качества — и данные деградируют.
Skill-SP решает это через библиотеку "скиллов" — модульных блоков знаний, которые одновременно направляют генерацию задач И верифицируют ответы. Три агента: Proposer (генерирует задачи, опираясь на скиллы), Solver (решает), Controller (анализирует результаты и эволюционирует библиотеку — уточняет скиллы, удаляет устаревшие, индуцирует новые).
Скилл — это не просто подсказка, а живой интерфейс: он проактивно управляет сложностью задач и отслеживает прогресс модели.
Результат на Qwen3-4B: +42.9 пунктов на tool calling, +12.0 на логических задачах против обычного self-play. Unguided SP вообще не смог сгенерировать валидные логические пазлы.
https://arxiv.org/abs/2607.22529
Тренируй агента в том же harness, в котором он деплоится
Большая проблема современных агентов: их тренируют в упрощённых условиях, а деплоят через сложные harness-обёртки (Claude Code, Codex, OpenClaw). Это создаёт train-deploy mismatch — модель учится одному, а работает в другом.
OpenForgeRL закрывает этот разрыв двумя компонентами: прокси-сервер перехватывает LLM-вызовы внутри harness и собирает пары prompt-response как обычные RL-сэмплы, а Kubernetes-оркестратор запускает каждый rollout в отдельном контейнере в облаке (Azure).
Результат: агент тренируется прямо в своём реальном harness, а траектории автоматически реконструируются в формат для любого RL-фреймворка (veRL, GRPO и т.д.).
На практике: OpenForge-GUI (8B) бьёт более крупные модели на OSWorld, Mind2Web и WebVoyager. Плюс выяснилось — более простые harness'ы учатся лучше, а error recovery остаётся слабым местом даже после RL.
https://arxiv.org/abs/2607.21557
Большая проблема современных агентов: их тренируют в упрощённых условиях, а деплоят через сложные harness-обёртки (Claude Code, Codex, OpenClaw). Это создаёт train-deploy mismatch — модель учится одному, а работает в другом.
OpenForgeRL закрывает этот разрыв двумя компонентами: прокси-сервер перехватывает LLM-вызовы внутри harness и собирает пары prompt-response как обычные RL-сэмплы, а Kubernetes-оркестратор запускает каждый rollout в отдельном контейнере в облаке (Azure).
Результат: агент тренируется прямо в своём реальном harness, а траектории автоматически реконструируются в формат для любого RL-фреймворка (veRL, GRPO и т.д.).
На практике: OpenForge-GUI (8B) бьёт более крупные модели на OSWorld, Mind2Web и WebVoyager. Плюс выяснилось — более простые harness'ы учатся лучше, а error recovery остаётся слабым местом даже после RL.
https://arxiv.org/abs/2607.21557
Творческий AI-агент с «холстом» вместо чата
Большинство AI-инструментов для творчества работают по схеме «промпт → результат». Но реальный творческий процесс — это черновики, версии, правки, референсы, обратная связь. Где всё это хранить?
JarvisHub предлагает заменить линейный чат на «холст» (canvas) — граф-структуру, где каждый артефакт (изображение, видео, аудио, промпт, UI-элемент) — это узел с историей создания, зависимостями и версиями. Агент не читает историю переписки, а смотрит на текущее состояние проекта на холсте.
Архитектура: canvas state (граф артефактов) + protocol bridge (валидация действий агента) + agent runtime (планирование, вызов инструментов, запись траектории).
Агент может читать холст, создавать/редактировать узлы, вызывать генеративные инструменты и записывать результаты обратно — всё трассируемо и восстанавливаемо.
Демо: генерация sci-fi трейлера с музыкой и озвучкой, интерактивная веб-разработка, создание презентаций.
https://arxiv.org/abs/2607.23588
Большинство AI-инструментов для творчества работают по схеме «промпт → результат». Но реальный творческий процесс — это черновики, версии, правки, референсы, обратная связь. Где всё это хранить?
JarvisHub предлагает заменить линейный чат на «холст» (canvas) — граф-структуру, где каждый артефакт (изображение, видео, аудио, промпт, UI-элемент) — это узел с историей создания, зависимостями и версиями. Агент не читает историю переписки, а смотрит на текущее состояние проекта на холсте.
Архитектура: canvas state (граф артефактов) + protocol bridge (валидация действий агента) + agent runtime (планирование, вызов инструментов, запись траектории).
Агент может читать холст, создавать/редактировать узлы, вызывать генеративные инструменты и записывать результаты обратно — всё трассируемо и восстанавливаемо.
Демо: генерация sci-fi трейлера с музыкой и озвучкой, интерактивная веб-разработка, создание презентаций.
https://arxiv.org/abs/2607.23588
NVIDIA выпустила Ising Calibration 1.5 — ИИ-модель для автоматической калибровки квантовых компьютеров.
Это 31-миллиардная vision-language модель, которая анализирует диагностические данные квантовых процессоров и определяет, как их нужно настраивать. Новая версия стала на 11,4% компактнее и на 86,5% лучше справляется с задачами в режиме in-context learning по сравнению с предшественником.
Главное для пользователей: впервые доступна NVFP4-квантизированная версия, которая запускается на одной потребительской видеокарте или NVIDIA DGX Spark — без дата-центра. По качеству модель обходит все открытые аналоги и конкурирует с закрытыми гигантами вроде GPT 5.6 Sol.
Веса, датасеты, бенчмарк QCalEval и готовые рецепты развёртывания доступны на Hugging Face под лицензией OpenMDW. Квантовые лаборатории теперь могут автоматизировать калибровку прямо на месте.
https://developer.nvidia.com/blog/nvidia-ising-enables-fully-automated-quantum-computer-calibration-with-enhanced-in-context-learning/
Это 31-миллиардная vision-language модель, которая анализирует диагностические данные квантовых процессоров и определяет, как их нужно настраивать. Новая версия стала на 11,4% компактнее и на 86,5% лучше справляется с задачами в режиме in-context learning по сравнению с предшественником.
Главное для пользователей: впервые доступна NVFP4-квантизированная версия, которая запускается на одной потребительской видеокарте или NVIDIA DGX Spark — без дата-центра. По качеству модель обходит все открытые аналоги и конкурирует с закрытыми гигантами вроде GPT 5.6 Sol.
Веса, датасеты, бенчмарк QCalEval и готовые рецепты развёртывания доступны на Hugging Face под лицензией OpenMDW. Квантовые лаборатории теперь могут автоматизировать калибровку прямо на месте.
https://developer.nvidia.com/blog/nvidia-ising-enables-fully-automated-quantum-computer-calibration-with-enhanced-in-context-learning/
NVIDIA Technical Blog
NVIDIA Ising Enables Fully Automated Quantum Computer Calibration with Enhanced In-Context Learning
NVIDIA Ising Calibration is an open source vision language model (VLM) designed to interpret diagnostic outputs from quantum processors and determine how they should be tuned to continue operating.
Apple ML представила GH-ESD — инструмент для поиска системных ошибок в моделях компьютерного зрения.
Проблема: vision-модели часто стабильно ошибаются на определённых типах изображений — например, плохо распознают объекты в специфическом контексте или расположении. Найти такие «зоны провала» вручную крайне сложно.
GH-ESD автоматизирует этот процесс: сначала LLM генерирует гипотезы о возможных паттернах ошибок, затем Vision Language Models ищут реальные примеры, а статистический анализ подтверждает или отвергает гипотезы.
Важно, что метод работает не только для классификации изображений, но и для детекции объектов и сегментации — задач, где ошибки зависят от пространственного контекста.
На новом бенчмарке GESD точность Precision@10 выросла с 0.63 до 0.73 по сравнению с предыдущими подходами.
Для разработчиков это означает более быстрое выявление слабых мест модели и конкретные подсказки для её улучшения. Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/gh-esd
Проблема: vision-модели часто стабильно ошибаются на определённых типах изображений — например, плохо распознают объекты в специфическом контексте или расположении. Найти такие «зоны провала» вручную крайне сложно.
GH-ESD автоматизирует этот процесс: сначала LLM генерирует гипотезы о возможных паттернах ошибок, затем Vision Language Models ищут реальные примеры, а статистический анализ подтверждает или отвергает гипотезы.
Важно, что метод работает не только для классификации изображений, но и для детекции объектов и сегментации — задач, где ошибки зависят от пространственного контекста.
На новом бенчмарке GESD точность Precision@10 выросла с 0.63 до 0.73 по сравнению с предыдущими подходами.
Для разработчиков это означает более быстрое выявление слабых мест модели и конкретные подсказки для её улучшения. Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/gh-esd
Apple Machine Learning Research
GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks
Systematic failures of vision models on semantically coherent subsets, known as error slices, reveal limitations in robustness and…
Kimi K3 — 2.8 триллиона параметров в открытом доступе (by Moonshot AI)
Пока open-source модели топчутся в районе 1T параметров, Kimi K3 делает резкий прыжок — 2.8T параметров, 104B активируемых, контекст до 1M токенов. И всё это выложено в открытый доступ.
Ключевые архитектурные трюки: Kimi Delta Attention (линейное внимание с channel-wise forget gate) чередуется с обычным MLA в пропорции 3:1. Attention Residuals позволяют каждому слою тянуть информацию из всех предыдущих слоёв, а не только из соседнего. MoE расширен до 896 экспертов, активируется 16 на токен.
В итоге — примерно 2.5× прирост эффективности масштабирования по сравнению с Kimi K2.
По бенчмаркам модель обходит все открытые аналоги и большинство проприетарных систем, уступая только Claude 4.5 и GPT-5.
https://arxiv.org/abs/2607.24653
Пока open-source модели топчутся в районе 1T параметров, Kimi K3 делает резкий прыжок — 2.8T параметров, 104B активируемых, контекст до 1M токенов. И всё это выложено в открытый доступ.
Ключевые архитектурные трюки: Kimi Delta Attention (линейное внимание с channel-wise forget gate) чередуется с обычным MLA в пропорции 3:1. Attention Residuals позволяют каждому слою тянуть информацию из всех предыдущих слоёв, а не только из соседнего. MoE расширен до 896 экспертов, активируется 16 на токен.
В итоге — примерно 2.5× прирост эффективности масштабирования по сравнению с Kimi K2.
По бенчмаркам модель обходит все открытые аналоги и большинство проприетарных систем, уступая только Claude 4.5 и GPT-5.
https://arxiv.org/abs/2607.24653
Как дистиллировать знания из GPT-5 в открытую модель, если у тебя нет доступа к его логитам?
Стандартный подход — KL-дивергенция по токенам — не работает между разными моделями: у них разные токенизаторы, и логиты проприетарных моделей закрыты. Копировать «сырые» траектории рассуждений тоже плохо: студент начинает имитировать стиль учителя и галлюцинировать.
Авторы предлагают MAPD: между учителем и студентом вставляется структурированный JSON-протокол — нормализованное промежуточное представление с планом рассуждений, найденными фактами и верификацией ответа. Проприетарная мультиагентная система генерирует эти протоколы офлайн. Затем студент обучается через self-distillation: одна ветвь видит протокол как привилегированную информацию, другая — нет. KL между ними считается внутри одной модели, что обходит проблему разных токенизаторов. Сверху — стандартный GRPO.
Эксперименты с Claude Opus, GPT и Gemini как учителями показывают стабильный прирост без перенастройки пайплайна под каждого учителя.
Стандартный подход — KL-дивергенция по токенам — не работает между разными моделями: у них разные токенизаторы, и логиты проприетарных моделей закрыты. Копировать «сырые» траектории рассуждений тоже плохо: студент начинает имитировать стиль учителя и галлюцинировать.
Авторы предлагают MAPD: между учителем и студентом вставляется структурированный JSON-протокол — нормализованное промежуточное представление с планом рассуждений, найденными фактами и верификацией ответа. Проприетарная мультиагентная система генерирует эти протоколы офлайн. Затем студент обучается через self-distillation: одна ветвь видит протокол как привилегированную информацию, другая — нет. KL между ними считается внутри одной модели, что обходит проблему разных токенизаторов. Сверху — стандартный GRPO.
Эксперименты с Claude Opus, GPT и Gemini как учителями показывают стабильный прирост без перенастройки пайплайна под каждого учителя.
Робот учится без робота: HiFi-UMI собирает данные руками человека и сразу деплоит политику
Главная проблема масштабирования робо-манипуляций — дорогая телеоперация: нужен сам робот, риг и оператор. HiFi-UMI предлагает радикальный ответ: вообще убрать робота из сбора данных.
Система — это перчатка-захват с головным стерео-SLAM, GPIO-триггером (синхронизация до 40 мкс) и шестью широкоугольными камерами. Точность траектории — 3 мм. Автоматический пайплайн реконструирует, воспроизводит и валидирует каждую демонстрацию: 98% реконструкций и 98% реплеев проходят проверку (~96% суммарно).
Главный результат: zero-robot post-training — дообучение только на HiFi-UMI данных без единой телеоперированной траектории — на трёх бэкбонах (VLA и WAM) совпадает с in-domain телеоперацией с разницей в −2.5, +3.1 и −0.6 п.п. Лучшая политика достигает 85% на задаче точной вставки.
Открытый датасет HiFi-UMI-2K: 2000 часов, 480+ сцен.
https://arxiv.org/abs/2607.25895
Главная проблема масштабирования робо-манипуляций — дорогая телеоперация: нужен сам робот, риг и оператор. HiFi-UMI предлагает радикальный ответ: вообще убрать робота из сбора данных.
Система — это перчатка-захват с головным стерео-SLAM, GPIO-триггером (синхронизация до 40 мкс) и шестью широкоугольными камерами. Точность траектории — 3 мм. Автоматический пайплайн реконструирует, воспроизводит и валидирует каждую демонстрацию: 98% реконструкций и 98% реплеев проходят проверку (~96% суммарно).
Главный результат: zero-robot post-training — дообучение только на HiFi-UMI данных без единой телеоперированной траектории — на трёх бэкбонах (VLA и WAM) совпадает с in-domain телеоперацией с разницей в −2.5, +3.1 и −0.6 п.п. Лучшая политика достигает 85% на задаче точной вставки.
Открытый датасет HiFi-UMI-2K: 2000 часов, 480+ сцен.
https://arxiv.org/abs/2607.25895
OpenAI публикует полевой отчёт о том, как учёные используют AI-агентов в научных вычислениях.
Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.
Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.
Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.
https://openai.com/index/scientific-computing-agentic-ai
Исследователи в области геномики и смежных науках начали активно применять агентные AI-системы для написания и модернизации кода. Вместо того чтобы вручную переписывать устаревшие научные программы, учёные поручают это агентам — и получают результат в разы быстрее.
Главный эффект: сокращается время между гипотезой и экспериментом. Код, на который раньше уходили недели, теперь пишется за часы. Это напрямую ускоряет открытия в медицине и биологии.
Для научного сообщества это сигнал: AI-агенты перестают быть экзотикой и становятся рабочим инструментом в лаборатории. OpenAI явно метит в сегмент научных вычислений как один из ключевых для продвижения своих агентных решений.
https://openai.com/index/scientific-computing-agentic-ai
OpenAI
Scientific computing in the age of agentic AI
A new field report shows how scientists use AI coding agents to modernize scientific computing, accelerating software development and discovery in genomics and beyond.
Nvidia Tech запускает GPU-симуляцию для медицинской робототехники.
NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).
Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.
Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.
Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.
https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
NVIDIA представила Medical Physics Simulation — открытый GPU-фреймворк в составе Isaac for Healthcare. Он решает три ключевые проблемы разработки медроботов: нехватку обучающих данных, слабую обобщаемость моделей и медленные циклы разработки (сейчас — 4–7 лет).
Фреймворк включает два модуля: Endoluminal (симуляция гибких инструментов в сосудах и полостях) и Surgical. Оба работают прямо на GPU, без лишних передач данных между CPU и GPU. Это позволяет одновременно симулировать физику, генерировать медицинские изображения и обучать RL-политики.
Дополнительно интегрирована генеративная модель Cosmos-H — для синтетических данных и предсказания видео с учётом действий робота.
Для разработчиков медроботики это означает возможность тестировать редкие клинические сценарии, ускорять прототипирование и масштабировать обучение без доступа к пациентам.
https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation/
NVIDIA Technical Blog
Developing Healthcare Robotics with GPU-Native Medical Physics Simulation
Unlike autonomous driving or industrial robotics, healthcare robotics can’t rely on internet-scale data collection or unlimited real-world experimentation. Every demonstration requires specialized…
Nvidia выпустила NOOA — открытый фреймворк для AI-агентов
NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.
Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.
Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.
Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.
https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
NVIDIA Labs представила NOOA (Object-Oriented Agents) — опенсорсный фреймворк, где агент — это обычный Python-класс. Методы — это возможности, поля — состояние, докстринги — промпты.
Результаты впечатляют: 82.2% на SWE-bench Verified (лучше предыдущего SOTA 79.2%), 86.8% на CyberGym L1 и 85.1% на ARC-AGI-3 — и всё это вдвое дешевле конкурентов по токенам.
Ключевая идея: агент сам управляет долгосрочной памятью через SQLite, передаёт объекты по ссылке вместо сериализации в контекст, и не требует сжатия контекста вообще. Итог — та же точность при вдвое меньших затратах.
Для разработчиков это значит: агентов теперь можно тестировать, версионировать и ревьюить как обычный код.
https://developer.nvidia.com/blog/six-agent-harness-capabilities-for-higher-model-performance/
NVIDIA Technical Blog
Six Agent Harness Capabilities for Higher Model Performance
Building a great AI agent isn’t just about choosing the right models. The harness is the architecture surrounding the model. How it renders context, executes actions, manages state, and decides when a…
Зачем гонять робота через миллиарды параметров, если BERT справится?
Все современные VLA-модели для роботов устроены одинаково: берём огромный LLM, пропускаем через него картинку и инструкцию, получаем действие. Красиво, но медленно и прожорливо по памяти.
TurboVLA задаёт неудобный вопрос: а зачем вообще LLM в цикле управления? Когда робот уже знает задачу ("возьми красный кубик"), ему не нужно генерировать текст — нужно просто смотреть и двигаться.
Решение простое: отдельный визуальный энкодер + лёгкий BERT для текста + кросс-аттеншн между ними → предсказание чанка действий за один проход. Никакого авторегрессивного декодинга, никакого LLM в петле.
Результат: 0.2B параметров, меньше 1 ГБ VRAM, 32 Гц на RTX 4090. При этом 97.7% успеха на LIBERO — столько же, сколько у моделей в 6 раз больше (π0.5).
Главный посыл: execution-level control и open-ended reasoning — разные задачи. Не надо смешивать.
https://arxiv.org/abs/2607.27205
Все современные VLA-модели для роботов устроены одинаково: берём огромный LLM, пропускаем через него картинку и инструкцию, получаем действие. Красиво, но медленно и прожорливо по памяти.
TurboVLA задаёт неудобный вопрос: а зачем вообще LLM в цикле управления? Когда робот уже знает задачу ("возьми красный кубик"), ему не нужно генерировать текст — нужно просто смотреть и двигаться.
Решение простое: отдельный визуальный энкодер + лёгкий BERT для текста + кросс-аттеншн между ними → предсказание чанка действий за один проход. Никакого авторегрессивного декодинга, никакого LLM в петле.
Результат: 0.2B параметров, меньше 1 ГБ VRAM, 32 Гц на RTX 4090. При этом 97.7% успеха на LIBERO — столько же, сколько у моделей в 6 раз больше (π0.5).
Главный посыл: execution-level control и open-ended reasoning — разные задачи. Не надо смешивать.
https://arxiv.org/abs/2607.27205
Mage-VL: видеомодель, которая смотрит как мозг, а не как камера (by Microsoft)
Обычные VLM обрабатывают каждый кадр целиком — даже если 90% сцены не изменилось. Mage-VL делает иначе: берёт принципы видеокодеков (как H.265) и кодирует только те патчи, где что-то реально движется. Статичный фон? Пропускаем. Результат — на 75% меньше токенов и ускорение инференса до 3.5x.
Ещё интереснее архитектура: System 1 — лёгкий гейт, который следит за стримом и решает, когда реагировать. System 2 — полная языковая модель, которая включается только при событии. Прямо как в нейробиологии.
Бонус: Mage-ViT обучен с нуля на 560M изображений и 100M видео — без миллиардов пар картинка-текст. И при этом не уступает SigLIP2. Вывод авторов: структурное соответствие данных важнее их масштаба.
https://arxiv.org/abs/2607.24904
Обычные VLM обрабатывают каждый кадр целиком — даже если 90% сцены не изменилось. Mage-VL делает иначе: берёт принципы видеокодеков (как H.265) и кодирует только те патчи, где что-то реально движется. Статичный фон? Пропускаем. Результат — на 75% меньше токенов и ускорение инференса до 3.5x.
Ещё интереснее архитектура: System 1 — лёгкий гейт, который следит за стримом и решает, когда реагировать. System 2 — полная языковая модель, которая включается только при событии. Прямо как в нейробиологии.
Бонус: Mage-ViT обучен с нуля на 560M изображений и 100M видео — без миллиардов пар картинка-текст. И при этом не уступает SigLIP2. Вывод авторов: структурное соответствие данных важнее их масштаба.
https://arxiv.org/abs/2607.24904
Expanding Flow Maps: генерация с переменной размерностью за несколько шагов
Стандартные flow-based модели страдают от одного ограничения: размерность выхода фиксируется при инициализации. Хочешь сгенерировать молекулу неизвестного размера или текст произвольной длины — классический flow не поможет.
Авторы вводят Expanding Flow Maps (EFMs): каждый шаг состоит из двух операций — expand (добавляем новые координаты/токены с шумом) и transport (двигаем расширенное состояние к целевому распределению). Стандартные flow maps — частный случай, где expand — тождественное отображение.
Работает и для непрерывных, и для дискретных данных (через simplex-представление). Эксперименты: генерация молекулярных конформеров, графов молекул и языковое моделирование — всё в рамках единого фреймворка с произвольным бюджетом шагов.
https://arxiv.org/abs/2607.21585
Стандартные flow-based модели страдают от одного ограничения: размерность выхода фиксируется при инициализации. Хочешь сгенерировать молекулу неизвестного размера или текст произвольной длины — классический flow не поможет.
Авторы вводят Expanding Flow Maps (EFMs): каждый шаг состоит из двух операций — expand (добавляем новые координаты/токены с шумом) и transport (двигаем расширенное состояние к целевому распределению). Стандартные flow maps — частный случай, где expand — тождественное отображение.
Работает и для непрерывных, и для дискретных данных (через simplex-представление). Эксперименты: генерация молекулярных конформеров, графов молекул и языковое моделирование — всё в рамках единого фреймворка с произвольным бюджетом шагов.
https://arxiv.org/abs/2607.21585
OpenAI выяснила, как два простых параметра API утроили результаты GPT-5.6 на бенчмарке ARC-AGI-3.
Первый — сохранение цепочки рассуждений между запросами. Модель не начинает думать с нуля каждый раз, а опирается на предыдущие выводы. Второй — компактизация контекста: длинные рассуждения сжимаются, что экономит токены и ускоряет работу.
В итоге — утроение баллов на одном из самых сложных тестов на общий интеллект, плюс заметный рост эффективности.
Для разработчиков это конкретный сигнал: правильная настройка API даёт больше, чем кажется. Два флага — и модель работает принципиально иначе.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
Первый — сохранение цепочки рассуждений между запросами. Модель не начинает думать с нуля каждый раз, а опирается на предыдущие выводы. Второй — компактизация контекста: длинные рассуждения сжимаются, что экономит токены и ускоряет работу.
В итоге — утроение баллов на одном из самых сложных тестов на общий интеллект, плюс заметный рост эффективности.
Для разработчиков это конкретный сигнал: правильная настройка API даёт больше, чем кажется. Два флага — и модель работает принципиально иначе.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores
OpenAI
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
How two API settings improved GPT-5.6 performance on ARC-AGI-3, boosting scores and efficiency by retaining reasoning and enabling compaction.
Nvidia Tech запустила туториал по развёртыванию собственного AI-ассистента для кода с защитой через NeMo Guardrails.
Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.
Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.
Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.
https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
Суть: можно поднять StarCoder2-7B на своих GPU, не отправляя исходники за пределы сети. Между IDE и моделью встаёт NeMo Guardrails — он блокирует запросы к "человеческому" коду (авторизация, платежи, крипто). CI-пайплайн ловит галлюцинированные зависимости до мержа, а Prometheus/Grafana показывают, улучшает ли AI-код качество или нет.
Почему важно: для регулируемых отраслей это решает три боли сразу — суверенитет данных, supply-chain риски и аудитируемость. Модель предлагает код, но контроль остаётся в руках команды.
Нужны: NGC API-ключ, GPU от 24 ГБ (A10/L4/A100), Docker и Python 3.10+.
https://developer.nvidia.com/blog/how-to-self-host-a-validated-ai-coding-assistant-with-nvidia-nemo-guardrails/
NVIDIA Technical Blog
How to Self-Host a Validated AI Coding Assistant with NVIDIA NeMo Guardrails
Deploying an AI coding assistant in a regulated, sovereign, or source-sensitive environment, often comes with challenges. Three common issues are: the source cannot leave the network…
Apple ML представила архитектуру синтеза речи для Siri Expressive Voices, которая работает прямо на устройстве.
Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.
Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.
Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.
Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.
https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
Суть: новый детокенизатор превращает семантические аудиотокены в высококачественную речь за ~10 мс на шаг — это примерно в 16 раз быстрее реального времени. При этом пиковое потребление памяти составляет всего 21 МБ.
Ключевое решение — разделение временной и глубинной обработки. Один переиспользуемый декодер с Diffusion Transformer заменяет несколько отдельных декодеров, а скользящее окно внимания с фиксированным кешем даёт постоянное потребление памяти независимо от длины аудио.
Результат в продакшене: MOS вырос на +0.28 в целом и на +0.42 для разговорной речи по сравнению с предыдущей системой. Именно эта архитектура стоит за слайдерами Pace и Expressivity в Siri и поддержкой кастомных голосов на устройствах Apple.
Важно: всё работает на чипе AMX без облака — это прямо влияет на приватность пользователей.
https://machinelearning.apple.com/research/audio-synthesis-diffusion-transformers
Apple Machine Learning Research
Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Siri Expressive Voices synthesize rich, configurable speech in real time and entirely on device, powered by AFM 3 Core Advanced, Apple’s…
ИИ, который улучшает ИИ — и учится делать это лучше
Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.
Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).
Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.
Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.
https://arxiv.org/abs/2607.28568
Frontis AI представила Frontis-MA1 — агента для машинного обучения, который сам пишет ML-код, запускает эксперименты и итеративно улучшает решения. Ключевая идея: замкнуть петлю рекурсивного самоулучшения.
Система состоит из трёх частей: OpenMLE-Gym (5758 верифицируемых задач с изолированным исполнением), OpenMLE-ERL (обучение операторов Draft/Improve/Debug/Crossover через RL на основе фидбека от выполнения кода) и OpenMLE-Evo (эволюционный поиск с памятью опыта).
Фишка в том, что операторы улучшения обучаются на тех же трансформациях, которые потом используются при инференсе — модель становится движком собственной эволюции.
Результат: Frontis-MA1-35B на MLE-Bench Lite достигает 71.21% Medal Average, обходя GPT-5.5 + Codex. Обещают открыть датасеты, код и веса.
https://arxiv.org/abs/2607.28568
Память прямо в весах модели — без RAG, без внешних баз
Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.
Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.
Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.
Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Большинство AI-агентов хранят память снаружи: RAG, векторные базы, явный retrieval. Это создаёт три проблемы: память оторвана от модели, градиенты не проходят через дискретные операции, и всё это тормозит инференс.
Команда MemTensor предлагает Memory Foundation Model — концепцию, где память встроена прямо в параметры модели. Идея: вместо внешнего хранилища модель меняет часть своих весов θ_t на каждом шаге взаимодействия. Remembering, forgetting, updating — всё происходит внутри forward pass.
Первый прототип называется Metis. Архитектура вдохновлена Fast Weight Programming: каждый блок содержит hyper memory block + local memory block. Обучается через специальные задачи: memory reconstruction и memory operation objectives.
Аналогия авторов: это как переход от обычных LLM к reasoning-моделям, где CoT встроен в инференс. Только здесь встроена память.
Датасет для воплощённого ИИ: записали 150 часов домашней жизни со всех сторон
Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.
Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.
На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.
Чтобы роботы научились вести себя дома, им нужны данные о том, как люди реально взаимодействуют с предметами. Но существующие датасеты либо дают видео без точных поз тела, либо точные позы без эгоцентрического вида, либо короткие клипы без долгосрочного контекста.
Авторы построили систему ACE — оснащённые сенсорами реальные квартиры, где 50 участников 150 часов занимались готовкой, уборкой и т.п. Итог: 17М кадров, 75К эпизодов взаимодействий, 200 категорий задач. Ключевое: все модальности синхронизированы — эгоцентрическое видео, 8+ внешних камер, полная поза тела, 6DoF траектории объектов, аудио и тактильные сигналы одновременно и в одной системе координат.
На этих данных построен трёхуровневый бенчмарк: предсказание тактильных сигналов по видео, оценка позы тела и анализ взаимодействия рук с объектами. Тестирование 30+ методов показало, что все они серьёзно проваливаются на реальных домашних сценах.