InhumanScience
102 subscribers
563 photos
873 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Между pretraining и agent fine-tuning есть дыра — и её можно заполнить (by TIGER-Lab)

Когда обучают coding-агентов, берут базовую code LLM и сразу гонят agent-trajectory fine-tuning. Но между pretraining и post-training — структурный зазор: базовая модель не умеет рассуждать в стиле "контекст → действие → наблюдение → продолжение".

Авторы заметили: вызов функции — это ровно та же структура! Предвызывный код = история агента, сам вызов = действие, возвращаемое значение = наблюдение, код после = продолжение.

Решение: mid-training на function-aware FIM. Вместо случайных span'ов маскируются конкретные функции, отобранные по программному графу зависимостей с двойным критерием сложности и инферабельности. Внутрь FIM-спана встраивается CoT-рассуждение.

Результат: +2.8/+3.0 на SWE-Bench-Verified для 7B/14B, а в паре с SWE-Smith — вообще +5.3. Бонус: восстанавливает деградацию на LiveCodeBench (+11.1) и τ-bench, хотя корпус — чистый Python без tool-use данных.

Корпус (400K сэмплов, 2.6B токенов) открыт.
Текст и картинка рождаются вместе: SC-CMJP (by Google)

Обычные мультимодальные модели генерируют текст и изображение последовательно — сначала текст, потом картинка. Проблема: ошибки в тексте уже не исправить, когда рисуешь.

Google предлагает SC-CMJP — фреймворк, где текст и изображение генерируются параллельно и постоянно корректируют друг друга. Ключевая идея: скорость "раскрытия" токенов одной модальности зависит от уверенности другой через cross-modal attention. Если картинка не уверена в каком-то фрагменте — текст может "передумать" и замаскировать токен обратно.

Сэмплер CO2Jump работает на замороженной MDM без изменений архитектуры: один forward pass, два прыжка — Death (remask неуверенных токенов) и Birth (раскрыть уверенные). Проверено на редактировании изображений и визуальных головоломках (лабиринты, нонограммы).

https://arxiv.org/abs/2607.13188
👍1
Как 0.58% параметров сохраняют всю мощь RL-обучения?

RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции).

Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели.

Результат — компактная "матрица перекоммутации" M, где внедиагональные элементы отвечают за настоящее рассуждение (многопремиссный вывод), а мусор за пределами подпространства выбрасывается.

Что даёт SAR:
- сохраняет Pass@1 при использовании лишь ~0.58% параметров
- улучшает Pass@k (больше разнообразия при сэмплинге)
- снижает конфликты доменов в Mix-RL
- при мёрдже экспертов превосходит каждого из них по отдельности

https://arxiv.org/abs/2607.03065
Nvidia представила NemoClaw — инструмент для интеграции видеоаналитики с корпоративными системами.

Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного.

Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с временными метками и рекомендациями.

Для кого важно: предприятия с большими объёмами видеоданных — склады, производства, ритейл. Вместо просмотра записей вручную система сама фиксирует нарушения и ставит задачи ответственным.

Nvidia позиционирует это как переход от вопроса «что показывает видео?» к «что нужно сделать и как это автоматизировать».

https://developer.nvidia.com/blog/integrating-context-aware-video-ai-agents-into-enterprise-workflows/
Nvidia представила BlueField-4 — новое поколение инфраструктурных процессоров для агентного ИИ.

Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU.

BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных.

Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на борту, PCIe Gen6, в 6 раз больше вычислительной мощности по сравнению с BlueField-3.

Для пользователей это означает меньшую стоимость токена, более предсказуемую задержку и лучшую изоляцию между арендаторами в облаке.

https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
Nvidia Tech запускает nanousd-labs — инструмент для быстрой генерации лёгких USD-рантаймов с помощью ИИ-агентов.

Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту.

Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями.

Результат — лёгкий C ABI-слой, который встраивается в существующие OpenUSD-стеки и позволяет менять бэкенды без изменения API.

Проект опубликован в рамках Nvidia Omniverse Labs как открытый эксперимент.

https://developer.nvidia.com/blog/develop-lightweight-usd-runtimes-faster-with-ai-agents/
RL на 2M+ токенах с фиксированным бюджетом GPU — это возможно?

Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет.

Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно.

Реализовано для двух архитектур: Qwen (гибрид рекуррентных и attention слоёв) на 8 GPU H20 — контекст до 4.25M токенов, и GLM с MoE на 32 GPU H20 — с выгрузкой состояния промпта на CPU и пословным чекпоинтингом слоёв.

Честный момент: авторы прямо указывают, что распределённые градиенты пока не полностью корректны — это execution probe, а не финальный обученный агент.

https://arxiv.org/abs/2607.14952
UniVR: модель, которая думает картинками, а не словами (by ByteDance)

Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?

Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).

Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.

Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.

https://arxiv.org/abs/2607.12800
Робот, который не просто думает словами, но и «воображает» картинку будущего

Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.

RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.

Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.

Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека.

Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.

Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.

Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.

После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.

https://deepmind.google/blog/our-approach-to-bioresilience/
Nvidia Tech — ускорение криптографии в CUDA 13.3

В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.

Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография

Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.

https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей.

Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.

Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.

Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.

Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.

https://machinelearning.apple.com/research/simple-self-distillation
👍1
RoboTTT: контекст 8000 шагов для роботов без роста латентности (by NVIDIA)

LLM масштабируют контекст — почему роботы застряли на десятках шагов? NVIDIA решила это с помощью Test-Time Training.

Идея: вместо трансформера с KV-кешем (растёт с историей) используют "быстрые веса" — маленькая нейросеть, которая обновляется градиентным спуском прямо во время инференса, сжимая историю в свои параметры. Инференс — O(1) по памяти независимо от длины контекста.

Результат — RoboTTT с контекстом 8К шагов (в 1000 раз больше SOTA):
- one-shot имитация по видео человека: 6/10 vs 0/10 у базелайнов
- устойчивость к помехам: 83% vs 53%
- сборка за 5+ минут из 10 этапов — ни один базелайн не справился
- +63% к базовой модели с контекстом 1К шагов

Длина контекста — новая ось масштабирования для роботов.

https://arxiv.org/abs/2607.15275
Смарт-кэш вместо дообучения: как заставить маленькую модель решать задачи больших

Представьте: модель однажды решила сложную задачу — и больше никогда её не решает заново. Вместо этого результат вычислений (KV-кэш) сохраняется на диск и в следующий раз просто "вставляется" в контекст — побайтово точно, без переобучения и без переcompute.

Именно это делает система Taliesin/Galahad от Corbenic. Ключевой трюк — byte-exact KV grafting: захваченное состояние верифицируется через SHA-256, KL-дивергенция между "свежим" и "grafted" выводом равна ровно нулю. Это не приближение, а буквально идентичное состояние.

Flywheel-протокол прост: решил задачу → проверил → заморозил как KV-блок → при следующем запросе подгружаешь блок вместо пересчёта. Результат: Gemma-4-12B начинает решать задачи AIME 2025, которые раньше не решала, тратя при этом долю токенов.

Ближайшие аналоги (LMCache, CacheBlend) либо приближённые, либо эфемерные. Здесь — точно и навсегда.

https://arxiv.org/abs/2607.14431
👍1
Qwen-Music: разделяй и властвуй в генерации музыки (by Alibaba/Qwen)

Главная проблема генерации песен — пропасть между смыслом и звуком. Qwen-Music решает её разделением на два этапа: сначала LLM сочиняет музыку в пространстве компактных семантических токенов (25 Hz, один кодбук), затем отдельный рендерер на DiT превращает их в 48 кГц стерео.

Ключевые фишки:
— Melody-CoT: модель сначала планирует мелодию как промежуточное представление, потом генерирует полный токен-стрим
— Cover generation: можно передать референсную мелодию и получить кавер с новым стилем и голосом
— Band-Mode Refiner корректирует фазу и магнитуду по частотным полосам перед синтезом

Обучено на 5 млн часов музыки. В слепых A/B тестах с профессиональными оценщиками: 66.7% против MiniMax 2.6, 58.3% против Mureka V8, 55.4% против Suno V5. На внешнем лидерборде Artificial Analysis — третье место среди систем с вокалом.

https://arxiv.org/abs/2607.11699
Apple ML опубликовала исследование об «умном» удалении данных из обученных моделей.

Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?

Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.

Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.

https://machinelearning.apple.com/research/unlearning-free-low-influence
Apple ML представила VICIS — новый подход к визуальному мышлению для AI-моделей.

Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.

VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.

Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.

Статья принята на ECCV 2026.

https://machinelearning.apple.com/research/visual-concept-inference
Xiaomi научила робота на 100 000 часах реального видео — и это работает (by Xiaomi)

Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.

Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.

Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.

Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.

https://arxiv.org/abs/2607.15330
RecGPT-V3: LLM-рекомендации на Taobao без тормозов и фильтр-пузырей

Классические рекомендательные системы угадывают "что купишь дальше" по статистике кликов, а не по реальным интересам. RecGPT-V3 решает это через LLM-рассуждения, но при этом не ломает прод по latency и compute.

Три ключевых трюка:

1. Memory Hub — вместо того чтобы каждый раз пережёвывать всю историю юзера (~55K токенов), система сжимает её в компактные memory units (сжатие 94.5%!), которые инкрементально обновляются. Compute на планировщик упал на 55.8%.

2. Semantic IDs — LLM теперь генерирует не просто текстовые теги ("стойка для бадминтона"), а дискретные коды товаров, совместимые с retrieval-моделью. Закрывает пропасть между "намерением" и конкретным айтемом.

3. Latent CoT — цепочка рассуждений на ~3000 токенов сжата в несколько латентных токенов (экономия в 200x), которые при необходимости разворачиваются в читаемое объяснение.

Результат на Taobao: +3.97% GMV, +1.00% CTR, при этом общий compute упал на 52.4%.
GraphRAG без дорогих GPT-4 — реально? (by Novosibirsk State University)

Три боли GraphRAG: шумные графы из-за однопроходной экстракции, зависимость от дорогих LLM, и плохо работающий open-source код. Новосибирцы решили все три разом.

Ключевая идея: языковые навыки (извлечение сущностей, рассуждение по контексту) масштабируются с размером модели в 4 раза хуже, чем мировые знания (21x). Значит, для RAG-пайплайна хватит компактной 7B модели, заточенной именно под языковые навыки.

Что сделали:
1. RAGU — GraphRAG движок с двухэтапной экстракцией (сначала сущности, потом отношения) + DBSCAN-дедупликация + Leiden-кластеризация. pip install graph_ragu, один GPU.
2. Meno-Lite-0.1 — 7B модель, обогнавшая Qwen2.5-32B в построении KG на 12.5%.

На сложных задачах (синтез, генерация) RAGU обходит HippoRAG 2, хотя на простом поиске фактов уступает. Evidence Recall везде лучший.

https://arxiv.org/abs/2607.11683
👍1
Resource2Skill: учим агентов на туториалах с YouTube (by Microsoft Research)

Люди учатся работать в Blender или Excel по видео на YouTube. Почему бы не сделать то же самое для AI-агентов?

Resource2Skill — фреймворк, который автоматически извлекает "скиллы" из туториалов, репозиториев, статей и примеров артефактов, и складывает их в иерархическую Skill Wiki. Каждый скилл — это мультимодальная запись: текст с объяснением, скриншоты/превью, и исполняемый код.

Ключевая идея: не пихать сырое видео в контекст агента (дорого и шумно), а дистиллировать из него структурированное процедурное знание. Иерархическая организация позволяет агенту сначала сузить поиск по таксономии, потом выбрать конкретный скилл через LM.

Результат: +11.9 п.п. на 7 бенчмарках (PPT, Excel, Blender, Web, CAD, UE5, Reaper). Если нужного скилла нет — тот же оператор ищет новые ресурсы онлайн и пополняет библиотеку.

https://arxiv.org/abs/2606.29538