InhumanScience
102 subscribers
563 photos
873 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Nvidia Tech запускает автономный RL-исследовательский воркфлоу

Nvidia показала, как кодинг-агент Codex (GPT 5.5) может полностью самостоятельно вести цикл RL-исследований — от настройки окружения до анализа результатов — используя NeMo RL и NeMo Gym на GPU-инстансах Brev.

Что умеет агент: разворачивает стек зависимостей, запускает эксперименты, отлаживает баги, читает научные статьи и переводит алгоритмы в рабочий код. Например, агент создал новую визуальную среду для обучения модели Qwen3-VL-2B и поднял её точность с 25% до 96,9%.

Три специальных навыка держат агента в рамках: Brev-etiquette (порядок на машине), session-memory (дневник сессии) и autoresearch (управление гипотезами и экспериментами).

Исследователь по-прежнему ставит цели и принимает финальные решения — рутину берёт на себя агент.

https://developer.nvidia.com/blog/how-to-run-an-autoresearch-workflow-with-rl-agent-skills-and-nvidia-nemo/
Nvidia выпустила инструкцию по дообучению Cosmos 3 за один день

Nvidia показала, как с помощью TAO Agent Skills и LoRA можно дообучить модель Cosmos 3 Nano под конкретную задачу почти без ручного труда. На датасете Woven Traffic Safety точность выросла с 54% до 93% — и всё это за один день вместо нескольких.

Cosmos 3 — мультимодальная модель для физического AI: понимает видео, текст, звук и действия. Но любой реальный деплой требует адаптации под конкретные условия — углы камер, специфику среды.

TAO Agent Skills автоматизируют весь пайплайн: подготовку данных, настройку LoRA, оценку и подбор гиперпараметров через AutoML. Разработчику достаточно пары текстовых промптов. Готовая модель сразу разворачивается через Cosmos 3 Reasoner NIM как OpenAI-совместимый эндпоинт.

Для команд, адаптирующих vision-модели под производство, это серьёзное ускорение.

https://developer.nvidia.com/blog/post-train-nvidia-cosmos-3-in-one-day-using-agent-skills/
Apple ML представила PARE — фреймворк для оценки проактивных ИИ-ассистентов.

Суть: существующие подходы моделируют приложения как плоские API, не учитывая последовательность действий пользователя. PARE решает это, представляя приложения как конечные автоматы с состояниями — это делает симуляцию реального поведения пользователя возможной.

В комплекте идёт PARE-Bench: 143 задачи из коммуникации, продуктивности, планирования и лайфстайл-приложений. Бенчмарк тестирует четыре ключевых навыка агента: наблюдение за контекстом, вывод о целях пользователя, выбор момента для вмешательства и оркестрацию нескольких приложений.

Почему важно: без реалистичных симуляторов пользователей сложно обучать и оценивать проактивных ассистентов. PARE закрывает этот пробел и может ускорить разработку по-настоящему умных цифровых помощников — включая будущие версии Siri.

https://machinelearning.apple.com/research/proactive-agent-research-environment
Поисковик для генератора картинок — когда нейросеть не знает, как выглядит талисман Экспо-2025

Современные генераторы изображений отлично рисуют, но плохо знают мир: свежие персонажи, нишевые символы, исторические артефакты — всё это за пределами их обучающей выборки. Авторы из TIGER-Lab собрали 20к реальных промптов с production-платформ и обнаружили: топовые open-source генераторы набирают лишь 21–28 из 100 на их бенчмарке.

Казалось бы — добавь поиск и всё! Но наивный поиск ломает генерацию: лишние детали, стилистический шум, "copy effects". Авторы предлагают систему gate–filter–integrate: агент сначала решает, нужен ли поиск вообще, затем фильтрует шум из результатов, и только потом интегрирует знания в генерацию.

Ключевая идея — совместное обучение агента-поисковика и генератора через DPO: генератор учится усваивать то, что можно выучить, а агент — искать только то, что выучить нельзя. Граница между ними динамическая и специфична для каждой модели.

https://arxiv.org/abs/2607.05382
Zero RL на триллион параметров — и мозг модели начал работать сам по себе

Почти все исследования zero RL (обучение с подкреплением прямо с базовой модели, без SFT) ограничены небольшими моделями. inclusionAI решили проверить: что будет, если масштабировать до 1T параметров?

Результат: Ring-2.5-1T-Zero обучили через трёхступенчатый пайплайн — сначала RL для пробуждения рассуждений, затем self-distillation для сжатия CoT-трейсов, потом адаптивное обучение под разную глубину мышления. Никаких человеческих аннотаций.

Главный сюрприз — спонтанно возникшие когнитивные стратегии: структурированное форматирование, самопроверка, параллельное рассуждение, "context anxiety" (модель сама признаёт неопределённость). Никто это не программировал — появилось само.

Авторы также предложили новый фреймворк оценки качества CoT по трём осям: читаемость, воспроизводимость и эффективность — вместо привычной точности ответа.

Горький урок Саттона подтверждён ещё раз: масштаб бьёт инженерные эвристики.
🔥2
LLM запомнил факт — но не умеет им пользоваться. Почему?

Феномен "Knowing-Using Gap": модель после файнтюнинга отлично воспроизводит новый факт ("Сидней находится в Австралии"), но проваливается на многошаговых вопросах ("Какая столица страны, где Сидней?"). Авторы разобрались в механике этого провала.

Ключевой инструмент — self-patching: берём скрытое представление нужного токена из одного прогона и "вставляем" его в другой прогон на нужный слой. Сканируя все слои и шаги обучения, можно буквально видеть, где "застряло" знание и когда оно начинает участвовать в рассуждениях.

Гипотеза: знание есть в активациях, но не попадает в нужную цепочку вычислений (knowledge-circuit misalignment). Принудительная "переброска" представлений даёт немедленный прирост точности — даже после полной сходимости обучения. Простая эвристика без оракула восстанавливает 58–75% потенциального улучшения.

https://arxiv.org/abs/2607.08393
OpenAI представила GPT-Red — автоматизированную систему красного тиминга на основе самоигры.

Суть простая: модель сама атакует себя, генерирует сложные сценарии и учится на них становиться устойчивее. Без участия человека на каждом шаге.

Что это даёт? Система находит уязвимости в безопасности, проблемы с выравниванием и слабые места к prompt injection — и всё это в автоматическом режиме. Раньше такую работу делали команды людей вручную, что дорого и медленно.

Для пользователей это значит: модели OpenAI будут лучше сопротивляться манипуляциям и джейлbreakам, а обновления безопасности станут выходить быстрее. GPT-Red — шаг к тому, чтобы AI сам следил за своей надёжностью.

https://openai.com/index/unlocking-self-improvement-gpt-red
👍1
Meta AI представила Hierarchical Interest Representation — новую систему для оптимизации рекламы в глубокой воронке.

Что это такое: слой представлений на основе трансформеров и графового обучения, который связывает скрытые интересы пользователей с предложениями рекламодателей. Система обучена на миллиардах взаимодействий из реальных данных Meta.

Ключевые фишки: граф из пользователей, рекламодателей и продуктов обогащается мультимодальным контентом через LLM — текст, изображения, видео. Это помогает понять не только как пользователь взаимодействует с рекламой, но и что из себя представляет сам продукт.

Зачем это важно: реклама в глубокой воронке страдает от нехватки сигналов — мало кликов, мало покупок. Новая система извлекает устойчивые интересы даже из разреженных данных и работает с новыми, ранее невиданными объектами.

Система будет интегрирована в экосистему Meta: GEM, Andromeda и Adaptive Ranking Model. Для пользователей — потенциально более релевантная реклама, для бизнеса — лучшая конверсия.

https://engineering.fb.com/2026/07/15/ai-research/exploring-hierarchical-interest-representation-for-meta-ads-deep-funnel-optimization/
🌚1
Nvidia Tech обновила DeepStream до версии 9.1 с двумя ключевыми фичами для видеоаналитики.

AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры.

Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D.

Версия также включает 13 агентных навыков, поддержку Claude Code и Codex для развёртывания пайплайнов через текстовые промпты, а также совместимость с NVIDIA JetPack 7.2 для edge-устройств Jetson.

Полезно для складской безопасности, ритейл-аналитики и умных зданий. Код открыт на GitHub.

https://developer.nvidia.com/blog/build-a-multi-camera-3d-tracking-application-with-nvidia-deepstream-9-1-skills/
👍1
Между pretraining и agent fine-tuning есть дыра — и её можно заполнить (by TIGER-Lab)

Когда обучают coding-агентов, берут базовую code LLM и сразу гонят agent-trajectory fine-tuning. Но между pretraining и post-training — структурный зазор: базовая модель не умеет рассуждать в стиле "контекст → действие → наблюдение → продолжение".

Авторы заметили: вызов функции — это ровно та же структура! Предвызывный код = история агента, сам вызов = действие, возвращаемое значение = наблюдение, код после = продолжение.

Решение: mid-training на function-aware FIM. Вместо случайных span'ов маскируются конкретные функции, отобранные по программному графу зависимостей с двойным критерием сложности и инферабельности. Внутрь FIM-спана встраивается CoT-рассуждение.

Результат: +2.8/+3.0 на SWE-Bench-Verified для 7B/14B, а в паре с SWE-Smith — вообще +5.3. Бонус: восстанавливает деградацию на LiveCodeBench (+11.1) и τ-bench, хотя корпус — чистый Python без tool-use данных.

Корпус (400K сэмплов, 2.6B токенов) открыт.
Текст и картинка рождаются вместе: SC-CMJP (by Google)

Обычные мультимодальные модели генерируют текст и изображение последовательно — сначала текст, потом картинка. Проблема: ошибки в тексте уже не исправить, когда рисуешь.

Google предлагает SC-CMJP — фреймворк, где текст и изображение генерируются параллельно и постоянно корректируют друг друга. Ключевая идея: скорость "раскрытия" токенов одной модальности зависит от уверенности другой через cross-modal attention. Если картинка не уверена в каком-то фрагменте — текст может "передумать" и замаскировать токен обратно.

Сэмплер CO2Jump работает на замороженной MDM без изменений архитектуры: один forward pass, два прыжка — Death (remask неуверенных токенов) и Birth (раскрыть уверенные). Проверено на редактировании изображений и визуальных головоломках (лабиринты, нонограммы).

https://arxiv.org/abs/2607.13188
👍1
Как 0.58% параметров сохраняют всю мощь RL-обучения?

RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции).

Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели.

Результат — компактная "матрица перекоммутации" M, где внедиагональные элементы отвечают за настоящее рассуждение (многопремиссный вывод), а мусор за пределами подпространства выбрасывается.

Что даёт SAR:
- сохраняет Pass@1 при использовании лишь ~0.58% параметров
- улучшает Pass@k (больше разнообразия при сэмплинге)
- снижает конфликты доменов в Mix-RL
- при мёрдже экспертов превосходит каждого из них по отдельности

https://arxiv.org/abs/2607.03065
Nvidia представила NemoClaw — инструмент для интеграции видеоаналитики с корпоративными системами.

Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного.

Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с временными метками и рекомендациями.

Для кого важно: предприятия с большими объёмами видеоданных — склады, производства, ритейл. Вместо просмотра записей вручную система сама фиксирует нарушения и ставит задачи ответственным.

Nvidia позиционирует это как переход от вопроса «что показывает видео?» к «что нужно сделать и как это автоматизировать».

https://developer.nvidia.com/blog/integrating-context-aware-video-ai-agents-into-enterprise-workflows/
Nvidia представила BlueField-4 — новое поколение инфраструктурных процессоров для агентного ИИ.

Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU.

BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных.

Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на борту, PCIe Gen6, в 6 раз больше вычислительной мощности по сравнению с BlueField-3.

Для пользователей это означает меньшую стоимость токена, более предсказуемую задержку и лучшую изоляцию между арендаторами в облаке.

https://developer.nvidia.com/blog/scaling-agentic-ai-factories-through-extreme-co-design-with-nvidia-bluefield/
Nvidia Tech запускает nanousd-labs — инструмент для быстрой генерации лёгких USD-рантаймов с помощью ИИ-агентов.

Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту.

Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями.

Результат — лёгкий C ABI-слой, который встраивается в существующие OpenUSD-стеки и позволяет менять бэкенды без изменения API.

Проект опубликован в рамках Nvidia Omniverse Labs как открытый эксперимент.

https://developer.nvidia.com/blog/develop-lightweight-usd-runtimes-faster-with-ai-agents/
RL на 2M+ токенах с фиксированным бюджетом GPU — это возможно?

Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет.

Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно.

Реализовано для двух архитектур: Qwen (гибрид рекуррентных и attention слоёв) на 8 GPU H20 — контекст до 4.25M токенов, и GLM с MoE на 32 GPU H20 — с выгрузкой состояния промпта на CPU и пословным чекпоинтингом слоёв.

Честный момент: авторы прямо указывают, что распределённые градиенты пока не полностью корректны — это execution probe, а не финальный обученный агент.

https://arxiv.org/abs/2607.14952
UniVR: модель, которая думает картинками, а не словами (by ByteDance)

Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове?

Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия).

Результат: 34B-модель приближается к пайплайну Gemini 3 Pro + генеративная модель, а в задачах долгосрочного планирования даже превосходит Gemini 3.

Также вводят бенчмарк VR-X — от завязывания узлов до навигации роботов.

https://arxiv.org/abs/2607.12800
Робот, который не просто думает словами, но и «воображает» картинку будущего

Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота.

RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими QKV-проекциями.

Ключевая проблема — данные. Авторы придумали пайплайн: берут видео с роботами, нарезают на action-centric сегменты, автоматически связывают каждое действие с визуальным переходом состояния, фильтруют мусор — и получают совместную text-visual supervision.

Плюс новый бенч RxBrain-Bench, который оценивает именно совместное языково-визуальное планирование, а не понимание и генерацию по отдельности.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека.

Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток.

Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени.

Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству противостоять биологическим угрозам, в том числе пандемиям.

После AlphaFold, который произвёл революцию в предсказании структуры белков, AlphaGenome может стать следующим большим прорывом в биомедицине.

https://deepmind.google/blog/our-approach-to-bioresilience/
Nvidia Tech — ускорение криптографии в CUDA 13.3

В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет.

Что это даёт на практике:
— Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с
— Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз
— Также ускоряются коды Рида-Соломона, CRC, квантовые стабилизаторные коды и постквантовая криптография

Для разработчиков: инструкция доступна прямо через inline PTX в CUDA-ядрах. Важно, что ускорение работает на всех уже развёрнутых системах с Ampere+, без замены железа.

https://developer.nvidia.com/blog/building-faster-cryptography-with-carryless-multiplication-in-nvidia-cuda-13-3/
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей.

Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning.

Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B.

Почему это работает? Исследователи выяснили, что SSD по-умному перераспределяет вероятности токенов: подавляет лишние варианты там, где нужна точность, и сохраняет разнообразие там, где важна гибкость.

Для разработчиков это означает: дешёвый и доступный способ прокачать кодовые модели без дорогостоящей инфраструктуры.

https://machinelearning.apple.com/research/simple-self-distillation
👍1