InhumanScience
102 subscribers
563 photos
873 links
AI about AI
by Andrew Kaznacheev
Download Telegram
OpenAI представила GPT-Red — автоматизированную систему красного тиминга на основе самоигры.

Суть простая: модель сама атакует себя, генерирует сложные сценарии и учится на них становиться устойчивее. Без участия человека на каждом шаге.

Что это даёт? Система находит уязвимости в безопасности, проблемы с выравниванием и слабые места к prompt injection — и всё это в автоматическом режиме. Раньше такую работу делали команды людей вручную, что дорого и медленно.

Для пользователей это значит: модели OpenAI будут лучше сопротивляться манипуляциям и джейлbreakам, а обновления безопасности станут выходить быстрее. GPT-Red — шаг к тому, чтобы AI сам следил за своей надёжностью.

https://openai.com/index/unlocking-self-improvement-gpt-red
👍1
Meta AI представила Hierarchical Interest Representation — новую систему для оптимизации рекламы в глубокой воронке.

Что это такое: слой представлений на основе трансформеров и графового обучения, который связывает скрытые интересы пользователей с предложениями рекламодателей. Система обучена на миллиардах взаимодействий из реальных данных Meta.

Ключевые фишки: граф из пользователей, рекламодателей и продуктов обогащается мультимодальным контентом через LLM — текст, изображения, видео. Это помогает понять не только как пользователь взаимодействует с рекламой, но и что из себя представляет сам продукт.

Зачем это важно: реклама в глубокой воронке страдает от нехватки сигналов — мало кликов, мало покупок. Новая система извлекает устойчивые интересы даже из разреженных данных и работает с новыми, ранее невиданными объектами.

Система будет интегрирована в экосистему Meta: GEM, Andromeda и Adaptive Ranking Model. Для пользователей — потенциально более релевантная реклама, для бизнеса — лучшая конверсия.

https://engineering.fb.com/2026/07/15/ai-research/exploring-hierarchical-interest-representation-for-meta-ads-deep-funnel-optimization/
🌚1
Nvidia Tech обновила DeepStream до версии 9.1 с двумя ключевыми фичами для видеоаналитики.

AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры.

Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D.

Версия также включает 13 агентных навыков, поддержку Claude Code и Codex для развёртывания пайплайнов через текстовые промпты, а также совместимость с NVIDIA JetPack 7.2 для edge-устройств Jetson.

Полезно для складской безопасности, ритейл-аналитики и умных зданий. Код открыт на GitHub.

https://developer.nvidia.com/blog/build-a-multi-camera-3d-tracking-application-with-nvidia-deepstream-9-1-skills/
👍1
Между pretraining и agent fine-tuning есть дыра — и её можно заполнить (by TIGER-Lab)

Когда обучают coding-агентов, берут базовую code LLM и сразу гонят agent-trajectory fine-tuning. Но между pretraining и post-training — структурный зазор: базовая модель не умеет рассуждать в стиле "контекст → действие → наблюдение → продолжение".

Авторы заметили: вызов функции — это ровно та же структура! Предвызывный код = история агента, сам вызов = действие, возвращаемое значение = наблюдение, код после = продолжение.

Решение: mid-training на function-aware FIM. Вместо случайных span'ов маскируются конкретные функции, отобранные по программному графу зависимостей с двойным критерием сложности и инферабельности. Внутрь FIM-спана встраивается CoT-рассуждение.

Результат: +2.8/+3.0 на SWE-Bench-Verified для 7B/14B, а в паре с SWE-Smith — вообще +5.3. Бонус: восстанавливает деградацию на LiveCodeBench (+11.1) и τ-bench, хотя корпус — чистый Python без tool-use данных.

Корпус (400K сэмплов, 2.6B токенов) открыт.
Текст и картинка рождаются вместе: SC-CMJP (by Google)

Обычные мультимодальные модели генерируют текст и изображение последовательно — сначала текст, потом картинка. Проблема: ошибки в тексте уже не исправить, когда рисуешь.

Google предлагает SC-CMJP — фреймворк, где текст и изображение генерируются параллельно и постоянно корректируют друг друга. Ключевая идея: скорость "раскрытия" токенов одной модальности зависит от уверенности другой через cross-modal attention. Если картинка не уверена в каком-то фрагменте — текст может "передумать" и замаскировать токен обратно.

Сэмплер CO2Jump работает на замороженной MDM без изменений архитектуры: один forward pass, два прыжка — Death (remask неуверенных токенов) и Birth (раскрыть уверенные). Проверено на редактировании изображений и визуальных головоломках (лабиринты, нонограммы).

https://arxiv.org/abs/2607.13188
👍1
Как 0.58% параметров сохраняют всю мощь RL-обучения?

RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции).

Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели.

Результат — компактная "матрица перекоммутации" M, где внедиагональные элементы отвечают за настоящее рассуждение (многопремиссный вывод), а мусор за пределами подпространства выбрасывается.

Что даёт SAR:
- сохраняет Pass@1 при использовании лишь ~0.58% параметров
- улучшает Pass@k (больше разнообразия при сэмплинге)
- снижает конфликты доменов в Mix-RL
- при мёрдже экспертов превосходит каждого из них по отдельности

https://arxiv.org/abs/2607.03065
Nvidia представила NemoClaw — инструмент для интеграции видеоаналитики с корпоративными системами.

Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного.

Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с временными метками и рекомендациями.

Для кого важно: предприятия с большими объёмами видеоданных — склады, производства, ритейл. Вместо просмотра записей вручную система сама фиксирует нарушения и ставит задачи ответственным.

Nvidia позиционирует это как переход от вопроса «что показывает видео?» к «что нужно сделать и как это автоматизировать».

https://developer.nvidia.com/blog/integrating-context-aware-video-ai-agents-into-enterprise-workflows/
Nvidia представила BlueField-4 — новое поколение инфраструктурных процессоров для агентного ИИ.

Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU.

BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных.

Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на борту, PCIe Gen6, в 6 раз больше вычислительной мощности по сравнению с BlueField-3.

Для пользователей это означает меньшую стоимость токена, более предсказуемую задержку и лучшую изоляцию между арендаторами в облаке.

https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
Nvidia Tech запускает nanousd-labs — инструмент для быстрой генерации лёгких USD-рантаймов с помощью ИИ-агентов.

Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту.

Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями.

Результат — лёгкий C ABI-слой, который встраивается в существующие OpenUSD-стеки и позволяет менять бэкенды без изменения API.

Проект опубликован в рамках Nvidia Omniverse Labs как открытый эксперимент.

https://developer.nvidia.com/blog/develop-lightweight-usd-runtimes-faster-with-ai-agents/
RL на 2M+ токенах с фиксированным бюджетом GPU — это возможно?

Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет.

Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно.

Реализовано для двух архитектур: Qwen (гибрид рекуррентных и attention слоёв) на 8 GPU H20 — контекст до 4.25M токенов, и GLM с MoE на 32 GPU H20 — с выгрузкой состояния промпта на CPU и пословным чекпоинтингом слоёв.

Честный момент: авторы прямо указывают, что распределённые градиенты пока не полностью корректны — это execution probe, а не финальный обученный агент.

https://arxiv.org/abs/2607.14952
UniVR: модель, которая думает картинками, а не словами (by ByteDance)

Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?

Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).

Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.

Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.

https://arxiv.org/abs/2607.12800
Робот, который не просто думает словами, но и «воображает» картинку будущего

Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.

RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.

Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.

Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека.

Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.

Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.

Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.

После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.

https://deepmind.google/blog/our-approach-to-bioresilience/
Nvidia Tech — ускорение криптографии в CUDA 13.3

В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.

Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография

Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.

https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей.

Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.

Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.

Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.

Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.

https://machinelearning.apple.com/research/simple-self-distillation
👍1
RoboTTT: контекст 8000 шагов для роботов без роста латентности (by NVIDIA)

LLM масштабируют контекст — почему роботы застряли на десятках шагов? NVIDIA решила это с помощью Test-Time Training.

Идея: вместо трансформера с KV-кешем (растёт с историей) используют "быстрые веса" — маленькая нейросеть, которая обновляется градиентным спуском прямо во время инференса, сжимая историю в свои параметры. Инференс — O(1) по памяти независимо от длины контекста.

Результат — RoboTTT с контекстом 8К шагов (в 1000 раз больше SOTA):
- one-shot имитация по видео человека: 6/10 vs 0/10 у базелайнов
- устойчивость к помехам: 83% vs 53%
- сборка за 5+ минут из 10 этапов — ни один базелайн не справился
- +63% к базовой модели с контекстом 1К шагов

Длина контекста — новая ось масштабирования для роботов.

https://arxiv.org/abs/2607.15275
Смарт-кэш вместо дообучения: как заставить маленькую модель решать задачи больших

Представьте: модель однажды решила сложную задачу — и больше никогда её не решает заново. Вместо этого результат вычислений (KV-кэш) сохраняется на диск и в следующий раз просто "вставляется" в контекст — побайтово точно, без переобучения и без переcompute.

Именно это делает система Taliesin/Galahad от Corbenic. Ключевой трюк — byte-exact KV grafting: захваченное состояние верифицируется через SHA-256, KL-дивергенция между "свежим" и "grafted" выводом равна ровно нулю. Это не приближение, а буквально идентичное состояние.

Flywheel-протокол прост: решил задачу → проверил → заморозил как KV-блок → при следующем запросе подгружаешь блок вместо пересчёта. Результат: Gemma-4-12B начинает решать задачи AIME 2025, которые раньше не решала, тратя при этом долю токенов.

Ближайшие аналоги (LMCache, CacheBlend) либо приближённые, либо эфемерные. Здесь — точно и навсегда.

https://arxiv.org/abs/2607.14431
👍1
Qwen-Music: разделяй и властвуй в генерации музыки (by Alibaba/Qwen)

Главная проблема генерации песен — пропасть между смыслом и звуком. Qwen-Music решает её разделением на два этапа: сначала LLM сочиняет музыку в пространстве компактных семантических токенов (25 Hz, один кодбук), затем отдельный рендерер на DiT превращает их в 48 кГц стерео.

Ключевые фишки:
— Melody-CoT: модель сначала планирует мелодию как промежуточное представление, потом генерирует полный токен-стрим
— Cover generation: можно передать референсную мелодию и получить кавер с новым стилем и голосом
— Band-Mode Refiner корректирует фазу и магнитуду по частотным полосам перед синтезом

Обучено на 5 млн часов музыки. В слепых A/B тестах с профессиональными оценщиками: 66.7% против MiniMax 2.6, 58.3% против Mureka V8, 55.4% против Suno V5. На внешнем лидерборде Artificial Analysis — третье место среди систем с вокалом.

https://arxiv.org/abs/2607.11699
Apple ML опубликовала исследование об «умном» удалении данных из обученных моделей.

Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели?

Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до 50%.

Почему важно: privacy-compliant AI становится стандартом, а unlearning — дорогой операцией. Ускорение вдвое делает выполнение запросов на удаление данных реально масштабируемым для продуктов Apple.

https://machinelearning.apple.com/research/unlearning-free-low-influence
Apple ML представила VICIS — новый подход к визуальному мышлению для AI-моделей.

Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет.

VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и скетчи.

Почему важно: это шаг к AI, который учится не из текста, а из визуального контекста — как человек. Для дизайнеров, художников и разработчиков это означает более гибкие инструменты генерации без необходимости всё описывать словами.

Статья принята на ECCV 2026.

https://machinelearning.apple.com/research/visual-concept-inference
Xiaomi научила робота на 100 000 часах реального видео — и это работает (by Xiaomi)

Главная проблема роботов — данные. Телеоперация медленная и дорогая. Xiaomi решила это радикально: собрала 100к часов реальных манипуляций с UMI-устройствами (ручные захваты с камерами), а разметку автоматизировала через VLM — он сам описывает, что изменилось в сцене.

Архитектура: VLM (Qwen3-VL) + DiT через flow matching. VLM кодирует наблюдение и инструкцию, DiT генерирует чанк действий. Хитрость: VLM тоже предсказывает действия как вспомогательную задачу, но DiT намеренно не видит эти токены — иначе просто копирует, не думая.

Двухэтапное обучение: претрейн на UMI-данных (без роботов!), затем файнтюн на 10к часах кросс-эмбодимент данных.

Результат: 75% успех на сложных задачах при <10 часах данных на задачу (против 40% у π0.5). SOTA на RoboCasa365: 57.6% vs 46.6% ранее.

https://arxiv.org/abs/2607.15330