Как 0.58% параметров сохраняют всю мощь RL-обучения?
RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции).
Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели.
Результат — компактная "матрица перекоммутации" M, где внедиагональные элементы отвечают за настоящее рассуждение (многопремиссный вывод), а мусор за пределами подпространства выбрасывается.
Что даёт SAR:
- сохраняет Pass@1 при использовании лишь ~0.58% параметров
- улучшает Pass@k (больше разнообразия при сэмплинге)
- снижает конфликты доменов в Mix-RL
- при мёрдже экспертов превосходит каждого из них по отдельности
https://arxiv.org/abs/2607.03065
RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции).
Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели.
Результат — компактная "матрица перекоммутации" M, где внедиагональные элементы отвечают за настоящее рассуждение (многопремиссный вывод), а мусор за пределами подпространства выбрасывается.
Что даёт SAR:
- сохраняет Pass@1 при использовании лишь ~0.58% параметров
- улучшает Pass@k (больше разнообразия при сэмплинге)
- снижает конфликты доменов в Mix-RL
- при мёрдже экспертов превосходит каждого из них по отдельности
https://arxiv.org/abs/2607.03065
Nvidia представила NemoClaw — инструмент для интеграции видеоаналитики с корпоративными системами.
Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного.
Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с временными метками и рекомендациями.
Для кого важно: предприятия с большими объёмами видеоданных — склады, производства, ритейл. Вместо просмотра записей вручную система сама фиксирует нарушения и ставит задачи ответственным.
Nvidia позиционирует это как переход от вопроса «что показывает видео?» к «что нужно сделать и как это автоматизировать».
https://developer.nvidia.com/blog/integrating-context-aware-video-ai-agents-into-enterprise-workflows/
Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного.
Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с временными метками и рекомендациями.
Для кого важно: предприятия с большими объёмами видеоданных — склады, производства, ритейл. Вместо просмотра записей вручную система сама фиксирует нарушения и ставит задачи ответственным.
Nvidia позиционирует это как переход от вопроса «что показывает видео?» к «что нужно сделать и как это автоматизировать».
https://developer.nvidia.com/blog/integrating-context-aware-video-ai-agents-into-enterprise-workflows/
NVIDIA Technical Blog
Integrating Context-Aware Video AI Agents Into Enterprise Workflows
A video analytics AI agent that can perceive, reason, and act based on massive amounts of video footage must be integrated with existing workflows and applications to be useful.
Nvidia представила BlueField-4 — новое поколение инфраструктурных процессоров для агентного ИИ.
Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU.
BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных.
Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на борту, PCIe Gen6, в 6 раз больше вычислительной мощности по сравнению с BlueField-3.
Для пользователей это означает меньшую стоимость токена, более предсказуемую задержку и лучшую изоляцию между арендаторами в облаке.
https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU.
BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных.
Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на борту, PCIe Gen6, в 6 раз больше вычислительной мощности по сравнению с BlueField-3.
Для пользователей это означает меньшую стоимость токена, более предсказуемую задержку и лучшую изоляцию между арендаторами в облаке.
https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
NVIDIA Technical Blog
Scaling Agentic AI Factories Through Extreme Co-Design with NVIDIA BlueField
Agentic AI changes the infrastructure pattern for AI factories. One request can trigger many model calls, tool calls, memory lookups, policy checks, storage accesses, and network transfers before a…
Nvidia Tech запускает nanousd-labs — инструмент для быстрой генерации лёгких USD-рантаймов с помощью ИИ-агентов.
Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту.
Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями.
Результат — лёгкий C ABI-слой, который встраивается в существующие OpenUSD-стеки и позволяет менять бэкенды без изменения API.
Проект опубликован в рамках Nvidia Omniverse Labs как открытый эксперимент.
https://developer.nvidia.com/blog/develop-lightweight-usd-runtimes-faster-with-ai-agents/
Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту.
Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями.
Результат — лёгкий C ABI-слой, который встраивается в существующие OpenUSD-стеки и позволяет менять бэкенды без изменения API.
Проект опубликован в рамках Nvidia Omniverse Labs как открытый эксперимент.
https://developer.nvidia.com/blog/develop-lightweight-usd-runtimes-faster-with-ai-agents/
NVIDIA Technical Blog
Develop Lightweight USD Runtimes Faster with AI Agents
OpenUSD is an open, extensible framework that provides a common scene description language for physical AI. It enables teams to bring CAD data, simulation assets, and real-world telemetry into a…
RL на 2M+ токенах с фиксированным бюджетом GPU — это возможно?
Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет.
Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно.
Реализовано для двух архитектур: Qwen (гибрид рекуррентных и attention слоёв) на 8 GPU H20 — контекст до 4.25M токенов, и GLM с MoE на 32 GPU H20 — с выгрузкой состояния промпта на CPU и пословным чекпоинтингом слоёв.
Честный момент: авторы прямо указывают, что распределённые градиенты пока не полностью корректны — это execution probe, а не финальный обученный агент.
https://arxiv.org/abs/2607.14952
Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет.
Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно.
Реализовано для двух архитектур: Qwen (гибрид рекуррентных и attention слоёв) на 8 GPU H20 — контекст до 4.25M токенов, и GLM с MoE на 32 GPU H20 — с выгрузкой состояния промпта на CPU и пословным чекпоинтингом слоёв.
Честный момент: авторы прямо указывают, что распределённые градиенты пока не полностью корректны — это execution probe, а не финальный обученный агент.
https://arxiv.org/abs/2607.14952
UniVR: модель, которая думает картинками, а не словами (by ByteDance)
Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?
Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).
Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.
Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.
https://arxiv.org/abs/2607.12800
Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?
Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).
Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.
Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.
https://arxiv.org/abs/2607.12800
Робот, который не просто думает словами, но и «воображает» картинку будущего
Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.
RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.
Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.
Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.
RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.
Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.
Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека.
Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.
Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.
Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.
После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.
https://deepmind.google/blog/our-approach-to-bioresilience/
Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.
Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.
Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.
После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.
https://deepmind.google/blog/our-approach-to-bioresilience/
Google DeepMind
Google DeepMind and Isomorphic Labs approach to bioresilience
Google DeepMind and Isomorphic Labs approach to bioresilience, using AI models to support prevention, detection and response.
Nvidia Tech — ускорение криптографии в CUDA 13.3
В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.
Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография
Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.
https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.
Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография
Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.
https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
NVIDIA Technical Blog
Building Faster Cryptography with Carryless Multiplication in NVIDIA CUDA 13.3
For over fifteen years, x86 CPUs have shipped with a dedicated hardware instruction for carryless multiplication. It’s a small but stubborn primitive that sits underneath authenticated encryption…
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей.
Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.
Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.
Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.
Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.
https://machinelearning.apple.com/research/simple-self-distillation
Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.
Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.
Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.
Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.
https://machinelearning.apple.com/research/simple-self-distillation
Apple Machine Learning Research
Embarrassingly Simple Self-Distillation Improves Code Generation
Can a large language model (LLM) improve at code generation using only its own raw outputs, without a verifier, a teacher model, or…
👍1
RoboTTT: контекст 8000 шагов для роботов без роста латентности (by NVIDIA)
LLM масштабируют контекст — почему роботы застряли на десятках шагов? NVIDIA решила это с помощью Test-Time Training.
Идея: вместо трансформера с KV-кешем (растёт с историей) используют "быстрые веса" — маленькая нейросеть, которая обновляется градиентным спуском прямо во время инференса, сжимая историю в свои параметры. Инференс — O(1) по памяти независимо от длины контекста.
Результат — RoboTTT с контекстом 8К шагов (в 1000 раз больше SOTA):
- one-shot имитация по видео человека: 6/10 vs 0/10 у базелайнов
- устойчивость к помехам: 83% vs 53%
- сборка за 5+ минут из 10 этапов — ни один базелайн не справился
- +63% к базовой модели с контекстом 1К шагов
Длина контекста — новая ось масштабирования для роботов.
https://arxiv.org/abs/2607.15275
LLM масштабируют контекст — почему роботы застряли на десятках шагов? NVIDIA решила это с помощью Test-Time Training.
Идея: вместо трансформера с KV-кешем (растёт с историей) используют "быстрые веса" — маленькая нейросеть, которая обновляется градиентным спуском прямо во время инференса, сжимая историю в свои параметры. Инференс — O(1) по памяти независимо от длины контекста.
Результат — RoboTTT с контекстом 8К шагов (в 1000 раз больше SOTA):
- one-shot имитация по видео человека: 6/10 vs 0/10 у базелайнов
- устойчивость к помехам: 83% vs 53%
- сборка за 5+ минут из 10 этапов — ни один базелайн не справился
- +63% к базовой модели с контекстом 1К шагов
Длина контекста — новая ось масштабирования для роботов.
https://arxiv.org/abs/2607.15275
Смарт-кэш вместо дообучения: как заставить маленькую модель решать задачи больших
Представьте: модель однажды решила сложную задачу — и больше никогда её не решает заново. Вместо этого результат вычислений (KV-кэш) сохраняется на диск и в следующий раз просто "вставляется" в контекст — побайтово точно, без переобучения и без переcompute.
Именно это делает система Taliesin/Galahad от Corbenic. Ключевой трюк — byte-exact KV grafting: захваченное состояние верифицируется через SHA-256, KL-дивергенция между "свежим" и "grafted" выводом равна ровно нулю. Это не приближение, а буквально идентичное состояние.
Flywheel-протокол прост: решил задачу → проверил → заморозил как KV-блок → при следующем запросе подгружаешь блок вместо пересчёта. Результат: Gemma-4-12B начинает решать задачи AIME 2025, которые раньше не решала, тратя при этом долю токенов.
Ближайшие аналоги (LMCache, CacheBlend) либо приближённые, либо эфемерные. Здесь — точно и навсегда.
https://arxiv.org/abs/2607.14431
Представьте: модель однажды решила сложную задачу — и больше никогда её не решает заново. Вместо этого результат вычислений (KV-кэш) сохраняется на диск и в следующий раз просто "вставляется" в контекст — побайтово точно, без переобучения и без переcompute.
Именно это делает система Taliesin/Galahad от Corbenic. Ключевой трюк — byte-exact KV grafting: захваченное состояние верифицируется через SHA-256, KL-дивергенция между "свежим" и "grafted" выводом равна ровно нулю. Это не приближение, а буквально идентичное состояние.
Flywheel-протокол прост: решил задачу → проверил → заморозил как KV-блок → при следующем запросе подгружаешь блок вместо пересчёта. Результат: Gemma-4-12B начинает решать задачи AIME 2025, которые раньше не решала, тратя при этом долю токенов.
Ближайшие аналоги (LMCache, CacheBlend) либо приближённые, либо эфемерные. Здесь — точно и навсегда.
https://arxiv.org/abs/2607.14431
👍1
Qwen-Music: разделяй и властвуй в генерации музыки (by Alibaba/Qwen)
Главная проблема генерации песен — пропасть между смыслом и звуком. Qwen-Music решает её разделением на два этапа: сначала LLM сочиняет музыку в пространстве компактных семантических токенов (25 Hz, один кодбук), затем отдельный рендерер на DiT превращает их в 48 кГц стерео.
Ключевые фишки:
— Melody-CoT: модель сначала планирует мелодию как промежуточное представление, потом генерирует полный токен-стрим
— Cover generation: можно передать референсную мелодию и получить кавер с новым стилем и голосом
— Band-Mode Refiner корректирует фазу и магнитуду по частотным полосам перед синтезом
Обучено на 5 млн часов музыки. В слепых A/B тестах с профессиональными оценщиками: 66.7% против MiniMax 2.6, 58.3% против Mureka V8, 55.4% против Suno V5. На внешнем лидерборде Artificial Analysis — третье место среди систем с вокалом.
https://arxiv.org/abs/2607.11699
Главная проблема генерации песен — пропасть между смыслом и звуком. Qwen-Music решает её разделением на два этапа: сначала LLM сочиняет музыку в пространстве компактных семантических токенов (25 Hz, один кодбук), затем отдельный рендерер на DiT превращает их в 48 кГц стерео.
Ключевые фишки:
— Melody-CoT: модель сначала планирует мелодию как промежуточное представление, потом генерирует полный токен-стрим
— Cover generation: можно передать референсную мелодию и получить кавер с новым стилем и голосом
— Band-Mode Refiner корректирует фазу и магнитуду по частотным полосам перед синтезом
Обучено на 5 млн часов музыки. В слепых A/B тестах с профессиональными оценщиками: 66.7% против MiniMax 2.6, 58.3% против Mureka V8, 55.4% против Suno V5. На внешнем лидерборде Artificial Analysis — третье место среди систем с вокалом.
https://arxiv.org/abs/2607.11699
Apple ML опубликовала исследование об «умном» удалении данных из обученных моделей.
Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?
Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.
Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.
https://machinelearning.apple.com/research/unlearning-free-low-influence
Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?
Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.
Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.
https://machinelearning.apple.com/research/unlearning-free-low-influence
Apple Machine Learning Research
When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
As concerns around data privacy in machine learning grow, the ability to unlearn—or remove—specific data points from trained models becomes…
Apple ML представила VICIS — новый подход к визуальному мышлению для AI-моделей.
Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.
VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.
Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.
Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/visual-concept-inference
Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.
VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.
Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.
Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/visual-concept-inference
Apple Machine Learning Research
Show Me Examples: Inferring Visual Concepts from Image Sets
Vision-language models (VLMs) can follow complex textual instructions, yet they struggle to reason from purely visual context. In…
Xiaomi научила робота на 100 000 часах реального видео — и это работает (by Xiaomi)
Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.
Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.
Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.
Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.
https://arxiv.org/abs/2607.15330
Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.
Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.
Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.
Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.
https://arxiv.org/abs/2607.15330
RecGPT-V3: LLM-рекомендации на Taobao без тормозов и фильтр-пузырей
Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.
Три ключевых трюка:
1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.
2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.
3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.
Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.
Три ключевых трюка:
1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.
2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.
3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.
Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
GraphRAG без дорогих GPT-4 — реально? (by Novosibirsk State University)
Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.
Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.
Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.
На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.
https://arxiv.org/abs/2607.11683
Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.
Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.
Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.
На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.
https://arxiv.org/abs/2607.11683
👍1
Resource2Skill: учим агентов на туториалах с YouTube (by Microsoft Research)
Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?
Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.
Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.
Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.
https://arxiv.org/abs/2606.29538
Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?
Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.
Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.
Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.
https://arxiv.org/abs/2606.29538
TimeLens2: научить видео-LLM не только ЧТО, но и КОГДА
Представьте: вы спрашиваете у видео-ИИ "когда шеф-повар добавил сыр?", а он отвечает правильно, но без таймстампа. Бесполезно! TimeLens2 решает задачу temporal grounding — точную локализацию моментов в видео по текстовому запросу.
Две ключевые идеи:
1. Качественная разметка (TimeLens2-93K). Вместо одной грубой аннотации — многоступенчатый пайплайн: иерархические субтитры → независимые агенты релокализуют моменты → консенсус и семантическая верификация → уточнение границ. 93K примеров, включая мультиинтервальные.
2. Temporal Wasserstein reward. Стандартный tIoU даёт 0 для непересекающихся интервалов — ближний промах неотличим от далёкого. W1-расстояние между распределениями на объединённых интервалах даёт градиентный сигнал даже для disjoint предсказаний.
Результат: 8B-модель обходит Qwen3.5-397B на всех 7 бенчмарках в среднем на 7.5 mIoU. Компактность против масштаба!
https://arxiv.org/abs/2607.17423
Представьте: вы спрашиваете у видео-ИИ "когда шеф-повар добавил сыр?", а он отвечает правильно, но без таймстампа. Бесполезно! TimeLens2 решает задачу temporal grounding — точную локализацию моментов в видео по текстовому запросу.
Две ключевые идеи:
1. Качественная разметка (TimeLens2-93K). Вместо одной грубой аннотации — многоступенчатый пайплайн: иерархические субтитры → независимые агенты релокализуют моменты → консенсус и семантическая верификация → уточнение границ. 93K примеров, включая мультиинтервальные.
2. Temporal Wasserstein reward. Стандартный tIoU даёт 0 для непересекающихся интервалов — ближний промах неотличим от далёкого. W1-расстояние между распределениями на объединённых интервалах даёт градиентный сигнал даже для disjoint предсказаний.
Результат: 8B-модель обходит Qwen3.5-397B на всех 7 бенчмарках в среднем на 7.5 mIoU. Компактность против масштаба!
https://arxiv.org/abs/2607.17423
Один мозг для всей науки сразу
S1-Omni — это единая мультимодальная модель, которая умеет работать с молекулами (SMILES), белками, материалами (CIF), спектрами и медицинскими изображениями в одном фреймворке. Не набор специализированных инструментов, а один backbone.
Три кита архитектуры: единое представление разнородных научных данных, инъекция научных законов и экспертных знаний прямо в цепочки рассуждений (не только статистические паттерны), и domain-specific декодеры для нативного вывода результатов.
Обучали на S1-Omni-Corpus — 200 научных задач, миллионы примеров с reasoning-цепочками, построенными с учётом научных ограничений.
На 60+ бенчмарках модель обходит GPT-5.5 и Gemini-3.1-Pro на большинстве метрик, а на ряде задач (ADMET, предсказание сайтов связывания белков) дотягивается до специализированных моделей вроде AlphaFold.
Веса и код открыты под Apache-2.0.
https://arxiv.org/abs/2607.15686
S1-Omni — это единая мультимодальная модель, которая умеет работать с молекулами (SMILES), белками, материалами (CIF), спектрами и медицинскими изображениями в одном фреймворке. Не набор специализированных инструментов, а один backbone.
Три кита архитектуры: единое представление разнородных научных данных, инъекция научных законов и экспертных знаний прямо в цепочки рассуждений (не только статистические паттерны), и domain-specific декодеры для нативного вывода результатов.
Обучали на S1-Omni-Corpus — 200 научных задач, миллионы примеров с reasoning-цепочками, построенными с учётом научных ограничений.
На 60+ бенчмарках модель обходит GPT-5.5 и Gemini-3.1-Pro на большинстве метрик, а на ряде задач (ADMET, предсказание сайтов связывания белков) дотягивается до специализированных моделей вроде AlphaFold.
Веса и код открыты под Apache-2.0.
https://arxiv.org/abs/2607.15686