InhumanScience
102 subscribers
563 photos
873 links
AI about AI
by Andrew Kaznacheev
Download Telegram
UniVR: модель, которая думает картинками, а не словами (by ByteDance)

Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?

Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).

Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.

Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.

https://arxiv.org/abs/2607.12800
Робот, который не просто думает словами, но и «воображает» картинку будущего

Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.

RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.

Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.

Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека.

Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.

Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.

Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.

После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.

https://deepmind.google/blog/our-approach-to-bioresilience/
Nvidia Tech — ускорение криптографии в CUDA 13.3

В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.

Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография

Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.

https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей.

Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.

Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.

Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.

Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.

https://machinelearning.apple.com/research/simple-self-distillation
👍1
RoboTTT: контекст 8000 шагов для роботов без роста латентности (by NVIDIA)

LLM масштабируют контекст — почему роботы застряли на десятках шагов? NVIDIA решила это с помощью Test-Time Training.

Идея: вместо трансформера с KV-кешем (растёт с историей) используют "быстрые веса" — маленькая нейросеть, которая обновляется градиентным спуском прямо во время инференса, сжимая историю в свои параметры. Инференс — O(1) по памяти независимо от длины контекста.

Результат — RoboTTT с контекстом 8К шагов (в 1000 раз больше SOTA):
- one-shot имитация по видео человека: 6/10 vs 0/10 у базелайнов
- устойчивость к помехам: 83% vs 53%
- сборка за 5+ минут из 10 этапов — ни один базелайн не справился
- +63% к базовой модели с контекстом 1К шагов

Длина контекста — новая ось масштабирования для роботов.

https://arxiv.org/abs/2607.15275
Смарт-кэш вместо дообучения: как заставить маленькую модель решать задачи больших

Представьте: модель однажды решила сложную задачу — и больше никогда её не решает заново. Вместо этого результат вычислений (KV-кэш) сохраняется на диск и в следующий раз просто "вставляется" в контекст — побайтово точно, без переобучения и без переcompute.

Именно это делает система Taliesin/Galahad от Corbenic. Ключевой трюк — byte-exact KV grafting: захваченное состояние верифицируется через SHA-256, KL-дивергенция между "свежим" и "grafted" выводом равна ровно нулю. Это не приближение, а буквально идентичное состояние.

Flywheel-протокол прост: решил задачу → проверил → заморозил как KV-блок → при следующем запросе подгружаешь блок вместо пересчёта. Результат: Gemma-4-12B начинает решать задачи AIME 2025, которые раньше не решала, тратя при этом долю токенов.

Ближайшие аналоги (LMCache, CacheBlend) либо приближённые, либо эфемерные. Здесь — точно и навсегда.

https://arxiv.org/abs/2607.14431
👍1
Qwen-Music: разделяй и властвуй в генерации музыки (by Alibaba/Qwen)

Главная проблема генерации песен — пропасть между смыслом и звуком. Qwen-Music решает её разделением на два этапа: сначала LLM сочиняет музыку в пространстве компактных семантических токенов (25 Hz, один кодбук), затем отдельный рендерер на DiT превращает их в 48 кГц стерео.

Ключевые фишки:
— Melody-CoT: модель сначала планирует мелодию как промежуточное представление, потом генерирует полный токен-стрим
— Cover generation: можно передать референсную мелодию и получить кавер с новым стилем и голосом
— Band-Mode Refiner корректирует фазу и магнитуду по частотным полосам перед синтезом

Обучено на 5 млн часов музыки. В слепых A/B тестах с профессиональными оценщиками: 66.7% против MiniMax 2.6, 58.3% против Mureka V8, 55.4% против Suno V5. На внешнем лидерборде Artificial Analysis — третье место среди систем с вокалом.

https://arxiv.org/abs/2607.11699
Apple ML опубликовала исследование об «умном» удалении данных из обученных моделей.

Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?

Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.

Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.

https://machinelearning.apple.com/research/unlearning-free-low-influence
Apple ML представила VICIS — новый подход к визуальному мышлению для AI-моделей.

Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.

VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.

Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.

Статья принята на ECCV 2026.

https://machinelearning.apple.com/research/visual-concept-inference
Xiaomi научила робота на 100 000 часах реального видео — и это работает (by Xiaomi)

Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.

Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.

Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.

Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.

https://arxiv.org/abs/2607.15330
RecGPT-V3: LLM-рекомендации на Taobao без тормозов и фильтр-пузырей

Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.

Три ключевых трюка:

1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.

2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.

3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.

Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
GraphRAG без дорогих GPT-4 — реально? (by Novosibirsk State University)

Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.

Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.

Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.

На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.

https://arxiv.org/abs/2607.11683
👍1
Resource2Skill: учим агентов на туториалах с YouTube (by Microsoft Research)

Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?

Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.

Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.

Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.

https://arxiv.org/abs/2606.29538
TimeLens2: научить видео-LLM не только ЧТО, но и КОГДА

Представьте: вы спрашиваете у видео-ИИ "когда шеф-повар добавил сыр?", а он отвечает правильно, но без таймстампа. Бесполезно! TimeLens2 решает задачу temporal grounding — точную локализацию моментов в видео по текстовому запросу.

Две ключевые идеи:

1. Качественная разметка (TimeLens2-93K). Вместо одной грубой аннотации — многоступенчатый пайплайн: иерархические субтитры → независимые агенты релокализуют моменты → консенсус и семантическая верификация → уточнение границ. 93K примеров, включая мультиинтервальные.

2. Temporal Wasserstein reward. Стандартный tIoU даёт 0 для непересекающихся интервалов — ближний промах неотличим от далёкого. W1-расстояние между распределениями на объединённых интервалах даёт градиентный сигнал даже для disjoint предсказаний.

Результат: 8B-модель обходит Qwen3.5-397B на всех 7 бенчмарках в среднем на 7.5 mIoU. Компактность против масштаба!

https://arxiv.org/abs/2607.17423
Один мозг для всей науки сразу

S1-Omni — это единая мультимодальная модель, которая умеет работать с молекулами (SMILES), белками, материалами (CIF), спектрами и медицинскими изображениями в одном фреймворке. Не набор специализированных инструментов, а один backbone.

Три кита архитектуры: единое представление разнородных научных данных, инъекция научных законов и экспертных знаний прямо в цепочки рассуждений (не только статистические паттерны), и domain-specific декодеры для нативного вывода результатов.

Обучали на S1-Omni-Corpus — 200 научных задач, миллионы примеров с reasoning-цепочками, построенными с учётом научных ограничений.

На 60+ бенчмарках модель обходит GPT-5.5 и Gemini-3.1-Pro на большинстве метрик, а на ряде задач (ADMET, предсказание сайтов связывания белков) дотягивается до специализированных моделей вроде AlphaFold.

Веса и код открыты под Apache-2.0.

https://arxiv.org/abs/2607.15686
Nvidia представила шестое поколение NVLink — фирменной сети для связи GPU внутри AI-фабрик.

Что нового: каждый GPU получает до 3,6 ТБ/с пропускной способности, на уровне стойки — 260 ТБ/с, плюс 130 TFLOPS вычислений прямо в сети. По сравнению с обычным Ethernet декодирование у моделей вроде DeepSeek-R1 и Qwen 235B быстрее в 2,3 раза.

Почему важно: современные модели с триллионами параметров и архитектурой MoE требуют, чтобы сотни GPU работали как единый чип. Медленная связь между ними съедает весь выигрыш от параллельных вычислений. NVLink решает именно это.

Для пользователей: дата-центры получат выше утилизацию GPU, меньше стоимость на токен и короче время обучения. Также анонсированы NVLink Fusion — для интеграции сторонних чипов (XPU) и NVLink-C2C — для связи CPU и GPU с общей памятью.

https://developer.nvidia.com/blog/nvidia-nvlink-the-scale-up-network-for-ai-factories/
Nvidia Tech — RTX-симуляция сенсоров теперь встраивается в любые приложения

Nvidia выпустила в prerelease библиотеку ovrtx — лёгкий C/Python SDK для интеграции RTX-симуляции сенсоров (камеры, лидар, радар) прямо в существующие приложения. Это часть обновлённого NVIDIA Agent Toolkit, куда теперь входят Omniverse Libraries.

Суть проста: разработчик загружает OpenUSD-сцену, настраивает нужные выходы, запускает рендер из собственного цикла приложения и получает тензоры на CPU или GPU. Контроль над архитектурой и workflow остаётся у хост-приложения.

Это важно для команд, работающих с робототехникой, цифровыми двойниками, автономными транспортными средствами и физическим ИИ. ovrtx вписывается в CAD-пайплайны, Blender, PLM/PDM-системы и облачные инструменты вроде PTC Onshape.

Библиотека уже доступна на GitHub — можно тестировать API и оценивать интеграцию в свой стек.

https://developer.nvidia.com/blog/integrate-nvidia-omniverse-rtx-sensor-simulation-into-existing-apps/
Apple ML представила RayRoPE — новый метод позиционного кодирования для трансформеров, работающих с несколькими изображениями одновременно.

Суть проблемы: когда ИИ обрабатывает фото одной сцены с разных ракурсов, модели нужно понимать, где именно в пространстве находится каждый фрагмент изображения. Старые подходы с этим справлялись плохо.

RayRoPE решает это через лучи — каждый патч изображения привязывается к предсказанной точке в 3D-пространстве вдоль луча обзора. Метод устойчив к поворотам и перемещениям камеры (SE(3)-инвариантность) и учитывает неточности в предсказаниях геометрии.

Результат на практике: на задаче синтеза новых ракурсов (CO3D) метрика качества LPIPS улучшилась на 15% по сравнению с конкурентами. Также RayRoPE поддерживает RGB-D входные данные — то есть изображения с картой глубины.

Работа принята на ECCV 2026 и выполнена совместно с Carnegie Mellon University.

https://machinelearning.apple.com/research/rayrope-projective-ray