UniVR: модель, которая думает картинками, а не словами (by ByteDance)
Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?
Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).
Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.
Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.
https://arxiv.org/abs/2607.12800
Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?
Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).
Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.
Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.
https://arxiv.org/abs/2607.12800
Робот, который не просто думает словами, но и «воображает» картинку будущего
Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.
RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.
Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.
Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.
RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.
Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.
Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека.
Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.
Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.
Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.
После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.
https://deepmind.google/blog/our-approach-to-bioresilience/
Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.
Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.
Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.
После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.
https://deepmind.google/blog/our-approach-to-bioresilience/
Google DeepMind
Google DeepMind and Isomorphic Labs approach to bioresilience
Google DeepMind and Isomorphic Labs approach to bioresilience, using AI models to support prevention, detection and response.
Nvidia Tech — ускорение криптографии в CUDA 13.3
В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.
Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография
Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.
https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.
Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография
Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.
https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
NVIDIA Technical Blog
Building Faster Cryptography with Carryless Multiplication in NVIDIA CUDA 13.3
For over fifteen years, x86 CPUs have shipped with a dedicated hardware instruction for carryless multiplication. It’s a small but stubborn primitive that sits underneath authenticated encryption…
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей.
Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.
Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.
Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.
Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.
https://machinelearning.apple.com/research/simple-self-distillation
Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.
Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.
Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.
Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.
https://machinelearning.apple.com/research/simple-self-distillation
Apple Machine Learning Research
Embarrassingly Simple Self-Distillation Improves Code Generation
Can a large language model (LLM) improve at code generation using only its own raw outputs, without a verifier, a teacher model, or…
👍1
RoboTTT: контекст 8000 шагов для роботов без роста латентности (by NVIDIA)
LLM масштабируют контекст — почему роботы застряли на десятках шагов? NVIDIA решила это с помощью Test-Time Training.
Идея: вместо трансформера с KV-кешем (растёт с историей) используют "быстрые веса" — маленькая нейросеть, которая обновляется градиентным спуском прямо во время инференса, сжимая историю в свои параметры. Инференс — O(1) по памяти независимо от длины контекста.
Результат — RoboTTT с контекстом 8К шагов (в 1000 раз больше SOTA):
- one-shot имитация по видео человека: 6/10 vs 0/10 у базелайнов
- устойчивость к помехам: 83% vs 53%
- сборка за 5+ минут из 10 этапов — ни один базелайн не справился
- +63% к базовой модели с контекстом 1К шагов
Длина контекста — новая ось масштабирования для роботов.
https://arxiv.org/abs/2607.15275
LLM масштабируют контекст — почему роботы застряли на десятках шагов? NVIDIA решила это с помощью Test-Time Training.
Идея: вместо трансформера с KV-кешем (растёт с историей) используют "быстрые веса" — маленькая нейросеть, которая обновляется градиентным спуском прямо во время инференса, сжимая историю в свои параметры. Инференс — O(1) по памяти независимо от длины контекста.
Результат — RoboTTT с контекстом 8К шагов (в 1000 раз больше SOTA):
- one-shot имитация по видео человека: 6/10 vs 0/10 у базелайнов
- устойчивость к помехам: 83% vs 53%
- сборка за 5+ минут из 10 этапов — ни один базелайн не справился
- +63% к базовой модели с контекстом 1К шагов
Длина контекста — новая ось масштабирования для роботов.
https://arxiv.org/abs/2607.15275
Смарт-кэш вместо дообучения: как заставить маленькую модель решать задачи больших
Представьте: модель однажды решила сложную задачу — и больше никогда её не решает заново. Вместо этого результат вычислений (KV-кэш) сохраняется на диск и в следующий раз просто "вставляется" в контекст — побайтово точно, без переобучения и без переcompute.
Именно это делает система Taliesin/Galahad от Corbenic. Ключевой трюк — byte-exact KV grafting: захваченное состояние верифицируется через SHA-256, KL-дивергенция между "свежим" и "grafted" выводом равна ровно нулю. Это не приближение, а буквально идентичное состояние.
Flywheel-протокол прост: решил задачу → проверил → заморозил как KV-блок → при следующем запросе подгружаешь блок вместо пересчёта. Результат: Gemma-4-12B начинает решать задачи AIME 2025, которые раньше не решала, тратя при этом долю токенов.
Ближайшие аналоги (LMCache, CacheBlend) либо приближённые, либо эфемерные. Здесь — точно и навсегда.
https://arxiv.org/abs/2607.14431
Представьте: модель однажды решила сложную задачу — и больше никогда её не решает заново. Вместо этого результат вычислений (KV-кэш) сохраняется на диск и в следующий раз просто "вставляется" в контекст — побайтово точно, без переобучения и без переcompute.
Именно это делает система Taliesin/Galahad от Corbenic. Ключевой трюк — byte-exact KV grafting: захваченное состояние верифицируется через SHA-256, KL-дивергенция между "свежим" и "grafted" выводом равна ровно нулю. Это не приближение, а буквально идентичное состояние.
Flywheel-протокол прост: решил задачу → проверил → заморозил как KV-блок → при следующем запросе подгружаешь блок вместо пересчёта. Результат: Gemma-4-12B начинает решать задачи AIME 2025, которые раньше не решала, тратя при этом долю токенов.
Ближайшие аналоги (LMCache, CacheBlend) либо приближённые, либо эфемерные. Здесь — точно и навсегда.
https://arxiv.org/abs/2607.14431
👍1
Qwen-Music: разделяй и властвуй в генерации музыки (by Alibaba/Qwen)
Главная проблема генерации песен — пропасть между смыслом и звуком. Qwen-Music решает её разделением на два этапа: сначала LLM сочиняет музыку в пространстве компактных семантических токенов (25 Hz, один кодбук), затем отдельный рендерер на DiT превращает их в 48 кГц стерео.
Ключевые фишки:
— Melody-CoT: модель сначала планирует мелодию как промежуточное представление, потом генерирует полный токен-стрим
— Cover generation: можно передать референсную мелодию и получить кавер с новым стилем и голосом
— Band-Mode Refiner корректирует фазу и магнитуду по частотным полосам перед синтезом
Обучено на 5 млн часов музыки. В слепых A/B тестах с профессиональными оценщиками: 66.7% против MiniMax 2.6, 58.3% против Mureka V8, 55.4% против Suno V5. На внешнем лидерборде Artificial Analysis — третье место среди систем с вокалом.
https://arxiv.org/abs/2607.11699
Главная проблема генерации песен — пропасть между смыслом и звуком. Qwen-Music решает её разделением на два этапа: сначала LLM сочиняет музыку в пространстве компактных семантических токенов (25 Hz, один кодбук), затем отдельный рендерер на DiT превращает их в 48 кГц стерео.
Ключевые фишки:
— Melody-CoT: модель сначала планирует мелодию как промежуточное представление, потом генерирует полный токен-стрим
— Cover generation: можно передать референсную мелодию и получить кавер с новым стилем и голосом
— Band-Mode Refiner корректирует фазу и магнитуду по частотным полосам перед синтезом
Обучено на 5 млн часов музыки. В слепых A/B тестах с профессиональными оценщиками: 66.7% против MiniMax 2.6, 58.3% против Mureka V8, 55.4% против Suno V5. На внешнем лидерборде Artificial Analysis — третье место среди систем с вокалом.
https://arxiv.org/abs/2607.11699
Apple ML опубликовала исследование об «умном» удалении данных из обученных моделей.
Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?
Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.
Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.
https://machinelearning.apple.com/research/unlearning-free-low-influence
Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?
Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.
Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.
https://machinelearning.apple.com/research/unlearning-free-low-influence
Apple Machine Learning Research
When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
As concerns around data privacy in machine learning grow, the ability to unlearn—or remove—specific data points from trained models becomes…
Apple ML представила VICIS — новый подход к визуальному мышлению для AI-моделей.
Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.
VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.
Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.
Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/visual-concept-inference
Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.
VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.
Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.
Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/visual-concept-inference
Apple Machine Learning Research
Show Me Examples: Inferring Visual Concepts from Image Sets
Vision-language models (VLMs) can follow complex textual instructions, yet they struggle to reason from purely visual context. In…
Xiaomi научила робота на 100 000 часах реального видео — и это работает (by Xiaomi)
Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.
Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.
Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.
Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.
https://arxiv.org/abs/2607.15330
Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.
Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.
Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.
Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.
https://arxiv.org/abs/2607.15330
RecGPT-V3: LLM-рекомендации на Taobao без тормозов и фильтр-пузырей
Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.
Три ключевых трюка:
1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.
2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.
3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.
Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.
Три ключевых трюка:
1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.
2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.
3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.
Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
GraphRAG без дорогих GPT-4 — реально? (by Novosibirsk State University)
Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.
Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.
Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.
На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.
https://arxiv.org/abs/2607.11683
Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.
Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.
Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.
На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.
https://arxiv.org/abs/2607.11683
👍1
Resource2Skill: учим агентов на туториалах с YouTube (by Microsoft Research)
Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?
Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.
Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.
Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.
https://arxiv.org/abs/2606.29538
Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?
Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.
Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.
Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.
https://arxiv.org/abs/2606.29538
TimeLens2: научить видео-LLM не только ЧТО, но и КОГДА
Представьте: вы спрашиваете у видео-ИИ "когда шеф-повар добавил сыр?", а он отвечает правильно, но без таймстампа. Бесполезно! TimeLens2 решает задачу temporal grounding — точную локализацию моментов в видео по текстовому запросу.
Две ключевые идеи:
1. Качественная разметка (TimeLens2-93K). Вместо одной грубой аннотации — многоступенчатый пайплайн: иерархические субтитры → независимые агенты релокализуют моменты → консенсус и семантическая верификация → уточнение границ. 93K примеров, включая мультиинтервальные.
2. Temporal Wasserstein reward. Стандартный tIoU даёт 0 для непересекающихся интервалов — ближний промах неотличим от далёкого. W1-расстояние между распределениями на объединённых интервалах даёт градиентный сигнал даже для disjoint предсказаний.
Результат: 8B-модель обходит Qwen3.5-397B на всех 7 бенчмарках в среднем на 7.5 mIoU. Компактность против масштаба!
https://arxiv.org/abs/2607.17423
Представьте: вы спрашиваете у видео-ИИ "когда шеф-повар добавил сыр?", а он отвечает правильно, но без таймстампа. Бесполезно! TimeLens2 решает задачу temporal grounding — точную локализацию моментов в видео по текстовому запросу.
Две ключевые идеи:
1. Качественная разметка (TimeLens2-93K). Вместо одной грубой аннотации — многоступенчатый пайплайн: иерархические субтитры → независимые агенты релокализуют моменты → консенсус и семантическая верификация → уточнение границ. 93K примеров, включая мультиинтервальные.
2. Temporal Wasserstein reward. Стандартный tIoU даёт 0 для непересекающихся интервалов — ближний промах неотличим от далёкого. W1-расстояние между распределениями на объединённых интервалах даёт градиентный сигнал даже для disjoint предсказаний.
Результат: 8B-модель обходит Qwen3.5-397B на всех 7 бенчмарках в среднем на 7.5 mIoU. Компактность против масштаба!
https://arxiv.org/abs/2607.17423
Один мозг для всей науки сразу
S1-Omni — это единая мультимодальная модель, которая умеет работать с молекулами (SMILES), белками, материалами (CIF), спектрами и медицинскими изображениями в одном фреймворке. Не набор специализированных инструментов, а один backbone.
Три кита архитектуры: единое представление разнородных научных данных, инъекция научных законов и экспертных знаний прямо в цепочки рассуждений (не только статистические паттерны), и domain-specific декодеры для нативного вывода результатов.
Обучали на S1-Omni-Corpus — 200 научных задач, миллионы примеров с reasoning-цепочками, построенными с учётом научных ограничений.
На 60+ бенчмарках модель обходит GPT-5.5 и Gemini-3.1-Pro на большинстве метрик, а на ряде задач (ADMET, предсказание сайтов связывания белков) дотягивается до специализированных моделей вроде AlphaFold.
Веса и код открыты под Apache-2.0.
https://arxiv.org/abs/2607.15686
S1-Omni — это единая мультимодальная модель, которая умеет работать с молекулами (SMILES), белками, материалами (CIF), спектрами и медицинскими изображениями в одном фреймворке. Не набор специализированных инструментов, а один backbone.
Три кита архитектуры: единое представление разнородных научных данных, инъекция научных законов и экспертных знаний прямо в цепочки рассуждений (не только статистические паттерны), и domain-specific декодеры для нативного вывода результатов.
Обучали на S1-Omni-Corpus — 200 научных задач, миллионы примеров с reasoning-цепочками, построенными с учётом научных ограничений.
На 60+ бенчмарках модель обходит GPT-5.5 и Gemini-3.1-Pro на большинстве метрик, а на ряде задач (ADMET, предсказание сайтов связывания белков) дотягивается до специализированных моделей вроде AlphaFold.
Веса и код открыты под Apache-2.0.
https://arxiv.org/abs/2607.15686
Nvidia представила шестое поколение NVLink — фирменной сети для связи GPU внутри AI-фабрик.
Что нового: каждый GPU получает до 3,6 ТБ/с пропускной способности, на уровне стойки — 260 ТБ/с, плюс 130 TFLOPS вычислений прямо в сети. По сравнению с обычным Ethernet декодирование у моделей вроде DeepSeek-R1 и Qwen 235B быстрее в 2,3 раза.
Почему важно: современные модели с триллионами параметров и архитектурой MoE требуют, чтобы сотни GPU работали как единый чип. Медленная связь между ними съедает весь выигрыш от параллельных вычислений. NVLink решает именно это.
Для пользователей: дата-центры получат выше утилизацию GPU, меньше стоимость на токен и короче время обучения. Также анонсированы NVLink Fusion — для интеграции сторонних чипов (XPU) и NVLink-C2C — для связи CPU и GPU с общей памятью.
https://developer.nvidia.com/blog/nvidia-nvlink-the-scale-up-network-for-ai-factories/
Что нового: каждый GPU получает до 3,6 ТБ/с пропускной способности, на уровне стойки — 260 ТБ/с, плюс 130 TFLOPS вычислений прямо в сети. По сравнению с обычным Ethernet декодирование у моделей вроде DeepSeek-R1 и Qwen 235B быстрее в 2,3 раза.
Почему важно: современные модели с триллионами параметров и архитектурой MoE требуют, чтобы сотни GPU работали как единый чип. Медленная связь между ними съедает весь выигрыш от параллельных вычислений. NVLink решает именно это.
Для пользователей: дата-центры получат выше утилизацию GPU, меньше стоимость на токен и короче время обучения. Также анонсированы NVLink Fusion — для интеграции сторонних чипов (XPU) и NVLink-C2C — для связи CPU и GPU с общей памятью.
https://developer.nvidia.com/blog/nvidia-nvlink-the-scale-up-network-for-ai-factories/
NVIDIA Technical Blog
NVIDIA NVLink: The Scale-Up Network for AI Factories
The demand for AI continues to accelerate. Workloads are getting larger, models are becoming more complex, and there is mounting pressure to deploy AI compute infrastructure faster than ever.
Nvidia Tech — RTX-симуляция сенсоров теперь встраивается в любые приложения
Nvidia выпустила в prerelease библиотеку ovrtx — лёгкий C/Python SDK для интеграции RTX-симуляции сенсоров (камеры, лидар, радар) прямо в существующие приложения. Это часть обновлённого NVIDIA Agent Toolkit, куда теперь входят Omniverse Libraries.
Суть проста: разработчик загружает OpenUSD-сцену, настраивает нужные выходы, запускает рендер из собственного цикла приложения и получает тензоры на CPU или GPU. Контроль над архитектурой и workflow остаётся у хост-приложения.
Это важно для команд, работающих с робототехникой, цифровыми двойниками, автономными транспортными средствами и физическим ИИ. ovrtx вписывается в CAD-пайплайны, Blender, PLM/PDM-системы и облачные инструменты вроде PTC Onshape.
Библиотека уже доступна на GitHub — можно тестировать API и оценивать интеграцию в свой стек.
https://developer.nvidia.com/blog/integrate-nvidia-omniverse-rtx-sensor-simulation-into-existing-apps/
Nvidia выпустила в prerelease библиотеку ovrtx — лёгкий C/Python SDK для интеграции RTX-симуляции сенсоров (камеры, лидар, радар) прямо в существующие приложения. Это часть обновлённого NVIDIA Agent Toolkit, куда теперь входят Omniverse Libraries.
Суть проста: разработчик загружает OpenUSD-сцену, настраивает нужные выходы, запускает рендер из собственного цикла приложения и получает тензоры на CPU или GPU. Контроль над архитектурой и workflow остаётся у хост-приложения.
Это важно для команд, работающих с робототехникой, цифровыми двойниками, автономными транспортными средствами и физическим ИИ. ovrtx вписывается в CAD-пайплайны, Blender, PLM/PDM-системы и облачные инструменты вроде PTC Onshape.
Библиотека уже доступна на GitHub — можно тестировать API и оценивать интеграцию в свой стек.
https://developer.nvidia.com/blog/integrate-nvidia-omniverse-rtx-sensor-simulation-into-existing-apps/
NVIDIA Technical Blog
Integrate NVIDIA Omniverse RTX Sensor Simulation Into Existing Apps
Developers building 3D, design, simulation, robotics, and industrial digital twin applications need ways to bring physical AI capabilities into the tools and services they already use.
Apple ML представила RayRoPE — новый метод позиционного кодирования для трансформеров, работающих с несколькими изображениями одновременно.
Суть проблемы: когда ИИ обрабатывает фото одной сцены с разных ракурсов, модели нужно понимать, где именно в пространстве находится каждый фрагмент изображения. Старые подходы с этим справлялись плохо.
RayRoPE решает это через лучи — каждый патч изображения привязывается к предсказанной точке в 3D-пространстве вдоль луча обзора. Метод устойчив к поворотам и перемещениям камеры (SE(3)-инвариантность) и учитывает неточности в предсказаниях геометрии.
Результат на практике: на задаче синтеза новых ракурсов (CO3D) метрика качества LPIPS улучшилась на 15% по сравнению с конкурентами. Также RayRoPE поддерживает RGB-D входные данные — то есть изображения с картой глубины.
Работа принята на ECCV 2026 и выполнена совместно с Carnegie Mellon University.
https://machinelearning.apple.com/research/rayrope-projective-ray
Суть проблемы: когда ИИ обрабатывает фото одной сцены с разных ракурсов, модели нужно понимать, где именно в пространстве находится каждый фрагмент изображения. Старые подходы с этим справлялись плохо.
RayRoPE решает это через лучи — каждый патч изображения привязывается к предсказанной точке в 3D-пространстве вдоль луча обзора. Метод устойчив к поворотам и перемещениям камеры (SE(3)-инвариантность) и учитывает неточности в предсказаниях геометрии.
Результат на практике: на задаче синтеза новых ракурсов (CO3D) метрика качества LPIPS улучшилась на 15% по сравнению с конкурентами. Также RayRoPE поддерживает RGB-D входные данные — то есть изображения с картой глубины.
Работа принята на ECCV 2026 и выполнена совместно с Carnegie Mellon University.
https://machinelearning.apple.com/research/rayrope-projective-ray
Apple Machine Learning Research
RayRoPE: Projective Ray Positional Encoding for Multi-View Attention
We study positional encodings for multi-view transformers that process tokens from a set of posed input images, and seek a mechanism that…