Apple ML опубликовала исследование об «умном» удалении данных из обученных моделей.
Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?
Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.
Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.
https://machinelearning.apple.com/research/unlearning-free-low-influence
Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?
Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.
Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.
https://machinelearning.apple.com/research/unlearning-free-low-influence
Apple Machine Learning Research
When Unlearning Is Free: Leveraging Low Influence Points to Reduce Computational Costs
As concerns around data privacy in machine learning grow, the ability to unlearn—or remove—specific data points from trained models becomes…
Apple ML представила VICIS — новый подход к визуальному мышлению для AI-моделей.
Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.
VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.
Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.
Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/visual-concept-inference
Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.
VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.
Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.
Статья принята на ECCV 2026.
https://machinelearning.apple.com/research/visual-concept-inference
Apple Machine Learning Research
Show Me Examples: Inferring Visual Concepts from Image Sets
Vision-language models (VLMs) can follow complex textual instructions, yet they struggle to reason from purely visual context. In…
Xiaomi научила робота на 100 000 часах реального видео — и это работает (by Xiaomi)
Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.
Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.
Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.
Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.
https://arxiv.org/abs/2607.15330
Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.
Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.
Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.
Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.
https://arxiv.org/abs/2607.15330
RecGPT-V3: LLM-рекомендации на Taobao без тормозов и фильтр-пузырей
Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.
Три ключевых трюка:
1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.
2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.
3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.
Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.
Три ключевых трюка:
1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.
2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.
3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.
Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
GraphRAG без дорогих GPT-4 — реально? (by Novosibirsk State University)
Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.
Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.
Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.
На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.
https://arxiv.org/abs/2607.11683
Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.
Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.
Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.
На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.
https://arxiv.org/abs/2607.11683
👍1
Resource2Skill: учим агентов на туториалах с YouTube (by Microsoft Research)
Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?
Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.
Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.
Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.
https://arxiv.org/abs/2606.29538
Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?
Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.
Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.
Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.
https://arxiv.org/abs/2606.29538
TimeLens2: научить видео-LLM не только ЧТО, но и КОГДА
Представьте: вы спрашиваете у видео-ИИ "когда шеф-повар добавил сыр?", а он отвечает правильно, но без таймстампа. Бесполезно! TimeLens2 решает задачу temporal grounding — точную локализацию моментов в видео по текстовому запросу.
Две ключевые идеи:
1. Качественная разметка (TimeLens2-93K). Вместо одной грубой аннотации — многоступенчатый пайплайн: иерархические субтитры → независимые агенты релокализуют моменты → консенсус и семантическая верификация → уточнение границ. 93K примеров, включая мультиинтервальные.
2. Temporal Wasserstein reward. Стандартный tIoU даёт 0 для непересекающихся интервалов — ближний промах неотличим от далёкого. W1-расстояние между распределениями на объединённых интервалах даёт градиентный сигнал даже для disjoint предсказаний.
Результат: 8B-модель обходит Qwen3.5-397B на всех 7 бенчмарках в среднем на 7.5 mIoU. Компактность против масштаба!
https://arxiv.org/abs/2607.17423
Представьте: вы спрашиваете у видео-ИИ "когда шеф-повар добавил сыр?", а он отвечает правильно, но без таймстампа. Бесполезно! TimeLens2 решает задачу temporal grounding — точную локализацию моментов в видео по текстовому запросу.
Две ключевые идеи:
1. Качественная разметка (TimeLens2-93K). Вместо одной грубой аннотации — многоступенчатый пайплайн: иерархические субтитры → независимые агенты релокализуют моменты → консенсус и семантическая верификация → уточнение границ. 93K примеров, включая мультиинтервальные.
2. Temporal Wasserstein reward. Стандартный tIoU даёт 0 для непересекающихся интервалов — ближний промах неотличим от далёкого. W1-расстояние между распределениями на объединённых интервалах даёт градиентный сигнал даже для disjoint предсказаний.
Результат: 8B-модель обходит Qwen3.5-397B на всех 7 бенчмарках в среднем на 7.5 mIoU. Компактность против масштаба!
https://arxiv.org/abs/2607.17423
Один мозг для всей науки сразу
S1-Omni — это единая мультимодальная модель, которая умеет работать с молекулами (SMILES), белками, материалами (CIF), спектрами и медицинскими изображениями в одном фреймворке. Не набор специализированных инструментов, а один backbone.
Три кита архитектуры: единое представление разнородных научных данных, инъекция научных законов и экспертных знаний прямо в цепочки рассуждений (не только статистические паттерны), и domain-specific декодеры для нативного вывода результатов.
Обучали на S1-Omni-Corpus — 200 научных задач, миллионы примеров с reasoning-цепочками, построенными с учётом научных ограничений.
На 60+ бенчмарках модель обходит GPT-5.5 и Gemini-3.1-Pro на большинстве метрик, а на ряде задач (ADMET, предсказание сайтов связывания белков) дотягивается до специализированных моделей вроде AlphaFold.
Веса и код открыты под Apache-2.0.
https://arxiv.org/abs/2607.15686
S1-Omni — это единая мультимодальная модель, которая умеет работать с молекулами (SMILES), белками, материалами (CIF), спектрами и медицинскими изображениями в одном фреймворке. Не набор специализированных инструментов, а один backbone.
Три кита архитектуры: единое представление разнородных научных данных, инъекция научных законов и экспертных знаний прямо в цепочки рассуждений (не только статистические паттерны), и domain-specific декодеры для нативного вывода результатов.
Обучали на S1-Omni-Corpus — 200 научных задач, миллионы примеров с reasoning-цепочками, построенными с учётом научных ограничений.
На 60+ бенчмарках модель обходит GPT-5.5 и Gemini-3.1-Pro на большинстве метрик, а на ряде задач (ADMET, предсказание сайтов связывания белков) дотягивается до специализированных моделей вроде AlphaFold.
Веса и код открыты под Apache-2.0.
https://arxiv.org/abs/2607.15686
Nvidia представила шестое поколение NVLink — фирменной сети для связи GPU внутри AI-фабрик.
Что нового: каждый GPU получает до 3,6 ТБ/с пропускной способности, на уровне стойки — 260 ТБ/с, плюс 130 TFLOPS вычислений прямо в сети. По сравнению с обычным Ethernet декодирование у моделей вроде DeepSeek-R1 и Qwen 235B быстрее в 2,3 раза.
Почему важно: современные модели с триллионами параметров и архитектурой MoE требуют, чтобы сотни GPU работали как единый чип. Медленная связь между ними съедает весь выигрыш от параллельных вычислений. NVLink решает именно это.
Для пользователей: дата-центры получат выше утилизацию GPU, меньше стоимость на токен и короче время обучения. Также анонсированы NVLink Fusion — для интеграции сторонних чипов (XPU) и NVLink-C2C — для связи CPU и GPU с общей памятью.
https://developer.nvidia.com/blog/nvidia-nvlink-the-scale-up-network-for-ai-factories/
Что нового: каждый GPU получает до 3,6 ТБ/с пропускной способности, на уровне стойки — 260 ТБ/с, плюс 130 TFLOPS вычислений прямо в сети. По сравнению с обычным Ethernet декодирование у моделей вроде DeepSeek-R1 и Qwen 235B быстрее в 2,3 раза.
Почему важно: современные модели с триллионами параметров и архитектурой MoE требуют, чтобы сотни GPU работали как единый чип. Медленная связь между ними съедает весь выигрыш от параллельных вычислений. NVLink решает именно это.
Для пользователей: дата-центры получат выше утилизацию GPU, меньше стоимость на токен и короче время обучения. Также анонсированы NVLink Fusion — для интеграции сторонних чипов (XPU) и NVLink-C2C — для связи CPU и GPU с общей памятью.
https://developer.nvidia.com/blog/nvidia-nvlink-the-scale-up-network-for-ai-factories/
NVIDIA Technical Blog
NVIDIA NVLink: The Scale-Up Network for AI Factories
The demand for AI continues to accelerate. Workloads are getting larger, models are becoming more complex, and there is mounting pressure to deploy AI compute infrastructure faster than ever.
Nvidia Tech — RTX-симуляция сенсоров теперь встраивается в любые приложения
Nvidia выпустила в prerelease библиотеку ovrtx — лёгкий C/Python SDK для интеграции RTX-симуляции сенсоров (камеры, лидар, радар) прямо в существующие приложения. Это часть обновлённого NVIDIA Agent Toolkit, куда теперь входят Omniverse Libraries.
Суть проста: разработчик загружает OpenUSD-сцену, настраивает нужные выходы, запускает рендер из собственного цикла приложения и получает тензоры на CPU или GPU. Контроль над архитектурой и workflow остаётся у хост-приложения.
Это важно для команд, работающих с робототехникой, цифровыми двойниками, автономными транспортными средствами и физическим ИИ. ovrtx вписывается в CAD-пайплайны, Blender, PLM/PDM-системы и облачные инструменты вроде PTC Onshape.
Библиотека уже доступна на GitHub — можно тестировать API и оценивать интеграцию в свой стек.
https://developer.nvidia.com/blog/integrate-nvidia-omniverse-rtx-sensor-simulation-into-existing-apps/
Nvidia выпустила в prerelease библиотеку ovrtx — лёгкий C/Python SDK для интеграции RTX-симуляции сенсоров (камеры, лидар, радар) прямо в существующие приложения. Это часть обновлённого NVIDIA Agent Toolkit, куда теперь входят Omniverse Libraries.
Суть проста: разработчик загружает OpenUSD-сцену, настраивает нужные выходы, запускает рендер из собственного цикла приложения и получает тензоры на CPU или GPU. Контроль над архитектурой и workflow остаётся у хост-приложения.
Это важно для команд, работающих с робототехникой, цифровыми двойниками, автономными транспортными средствами и физическим ИИ. ovrtx вписывается в CAD-пайплайны, Blender, PLM/PDM-системы и облачные инструменты вроде PTC Onshape.
Библиотека уже доступна на GitHub — можно тестировать API и оценивать интеграцию в свой стек.
https://developer.nvidia.com/blog/integrate-nvidia-omniverse-rtx-sensor-simulation-into-existing-apps/
NVIDIA Technical Blog
Integrate NVIDIA Omniverse RTX Sensor Simulation Into Existing Apps
Developers building 3D, design, simulation, robotics, and industrial digital twin applications need ways to bring physical AI capabilities into the tools and services they already use.
Apple ML представила RayRoPE — новый метод позиционного кодирования для трансформеров, работающих с несколькими изображениями одновременно.
Суть проблемы: когда ИИ обрабатывает фото одной сцены с разных ракурсов, модели нужно понимать, где именно в пространстве находится каждый фрагмент изображения. Старые подходы с этим справлялись плохо.
RayRoPE решает это через лучи — каждый патч изображения привязывается к предсказанной точке в 3D-пространстве вдоль луча обзора. Метод устойчив к поворотам и перемещениям камеры (SE(3)-инвариантность) и учитывает неточности в предсказаниях геометрии.
Результат на практике: на задаче синтеза новых ракурсов (CO3D) метрика качества LPIPS улучшилась на 15% по сравнению с конкурентами. Также RayRoPE поддерживает RGB-D входные данные — то есть изображения с картой глубины.
Работа принята на ECCV 2026 и выполнена совместно с Carnegie Mellon University.
https://machinelearning.apple.com/research/rayrope-projective-ray
Суть проблемы: когда ИИ обрабатывает фото одной сцены с разных ракурсов, модели нужно понимать, где именно в пространстве находится каждый фрагмент изображения. Старые подходы с этим справлялись плохо.
RayRoPE решает это через лучи — каждый патч изображения привязывается к предсказанной точке в 3D-пространстве вдоль луча обзора. Метод устойчив к поворотам и перемещениям камеры (SE(3)-инвариантность) и учитывает неточности в предсказаниях геометрии.
Результат на практике: на задаче синтеза новых ракурсов (CO3D) метрика качества LPIPS улучшилась на 15% по сравнению с конкурентами. Также RayRoPE поддерживает RGB-D входные данные — то есть изображения с картой глубины.
Работа принята на ECCV 2026 и выполнена совместно с Carnegie Mellon University.
https://machinelearning.apple.com/research/rayrope-projective-ray
Apple Machine Learning Research
RayRoPE: Projective Ray Positional Encoding for Multi-View Attention
We study positional encodings for multi-view transformers that process tokens from a set of posed input images, and seek a mechanism that…