InhumanScience
106 subscribers
719 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
GigaBrain-0.7: робот с тремя «мозгами» вместо одного

Большинство VLA-моделей (Vision-Language-Action) — это просто "смотришь → делаешь". GigaBrain-0.7 от GigaAI предлагает трёхсистемную архитектуру: System 1 генерирует действия через flow matching, System 2 планирует и декомпозирует задачи, System 3 предсказывает будущие состояния и оценивает прогресс через world model. Все три системы общаются через семантические, визуальные и value-интерфейсы.

Ключевые детали: предобучение на 37 000+ часов траекторий, 16 типов роботов, ~270M vision-language сэмплов. Вместо полной блокировки градиентов действий в VLM-бэкбоне используют Soft Knowledge Insulation — градиенты не блокируются, а ослабляются. Обучение одностадийное, без фрагментации на этапы.

Веса и код будут публично доступны.

https://arxiv.org/abs/2608.15875
Зачем учить агента решать задачи, если можно научить его строить правильный "скелет" под каждую задачу?

Авторы из NUS предлагают JIT-Agent — мета-агент, который генерирует agent harness (память, планирование, инструменты, control loop) прямо во время инференса, под конкретную задачу. Это в противовес классическому подходу AOT (Ahead-of-Time), где один универсальный harness оптимизируется заранее и применяется ко всем задачам подряд.

Обучение в три этапа: сначала учат генерировать harness по примерам от учителя, затем учат чинить сломанный код (compiler errors, runtime failures), наконец дообучают через Evo-GDPO — RL-метод, который поощряет harness-ы, превосходящие текущий архив.

Результат: DeepSeek-V4-Flash + JIT-Agent обходит GPT-5.6 на нескольких бенчмарках (+9.1 на DeepSearchQA). Ключевая идея: интеллект агента — это свойство пары модель+harness, а не весов модели в одиночку.

https://arxiv.org/abs/2608.25593
👍1
Агент, который учится на своих ошибках — но точечно, а не переписывая всё с нуля (by Princeton University)

Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.

Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.

Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.

Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.

https://arxiv.org/abs/2608.24876
Nvidia Tech — NVLink Fusion и новая память NVHBM для ИИ-инфраструктуры

Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.

Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.

Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.

https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
Nvidia представила COMPASS — фреймворк для обучения роботов навигации сразу под разные типы корпусов.

Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.

В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.

Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.

Код и инструкции доступны в репозитории COMPASS на GitHub.

https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
Nvidia + Alibaba: Qwen3.8-Flash-Next на GB300 NVL72 для агентного кодинга

Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.

Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.

На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.

Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.

https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
Управляй инструментами LLM без переобучения — одним вектором в пространстве активаций

Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».

Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.

Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.

https://arxiv.org/abs/2608.25198
👍1
Как правильно подключать и отключать плагины без перезапуска всей системы? (by DeepSeek)

Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.

DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:

Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.

Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.

Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Агентный ИИ: единица измерения — выполненная работа, а не ответ на вопрос

Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.

Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов

Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.

https://arxiv.org/abs/2608.23283
Google DeepMind запустила первые в мире двойные слепые оценки AI-моделей.

Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.

Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.

Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.

Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.

https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Amazon Science предупреждает: не доверяйте слепо консенсусу AI-судей

Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.

Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.

Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.

https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
👍1
Apple ML опубликовала исследование о новом подходе к обучению AI-ответам на вопросы.

Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.

Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.

Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.

Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.

https://machinelearning.apple.com/research/rubric-based-alignment
AI-учёный от Google: от идеи до синтеза материалов в реальной лаборатории (by Google)

Co-Scientist — мультиагентная система на базе Gemini, которая теперь не просто генерирует гипотезы, но и доводит их до физически верифицированных результатов. Три домена, три уровня автономности:

Материаловедение: система спроектировала безопасный CVD-протокол синтеза 2D-материалов (MoS2, MoSe2, WS2) — с первой попытки.

Биология: предсказала морфологию роёв E. coli по градиенту концентрации индуктора, результаты совпали с мокрыми экспериментами.

CS: полностью автономно нашла архитектуру агента, обогнавшую шесть фронтирных моделей на HealthBench Hard.

Пайплайн: эволюционная генерация гипотез с UCB-отбором → итеративная генерация кода → написание статьи с проверкой на галлюцинации. Двойное слепое исследование (30 экспертов, 450 ревью) подтвердило: модули верификации реально снижают галлюцинации и плагиат.

https://arxiv.org/abs/2608.26701
Видео на всю длину истории, а не только один клип

Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.

Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.

Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.

Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.

https://arxiv.org/abs/2608.23383
Дистилляция из нескольких учителей сломана — и вот почему (by ByteDance & Tsinghua)

Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.

Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.

Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness

Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Nvidia представила TensorRT Model Connect — инструмент для развёртывания открытых моделей в нативных C++ приложениях всего двумя командами.

Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.

Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.

Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.

Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect

https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
Apple ML опубликовала исследование о том, насколько последовательно языковые модели обновляют свои убеждения при получении новых данных.

Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.

Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".

Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.

https://machinelearning.apple.com/research/llms-not-consistently-bayesian
Apple ML представила Agent Seer — систему для автоматической генерации тестовых сценариев для AI-агентов.

Проблема была простой: чтобы проверить, как агент работает с инструментами, нужны реалистичные тесты. Их создание вручную — дорого, медленно и не масштабируется.

Agent Seer решает это иначе: берёт спецификацию MCP (описание инструмента с именами функций и схемами параметров) и без примеров, без запуска реальных инструментов и без ручной настройки генерирует многоходовые диалоги с синтетическими данными.

Система протестирована на 7 MCP-спецификациях из разных областей. Результат — высокое качество во всех доменах. Главный вывод: сложность схем параметров влияет на качество сильнее, чем количество инструментов.

Почему важно: это ускоряет разработку и оценку агентов, убирая один из самых болезненных этапов — создание бенчмарков. Особенно актуально на фоне взрывного роста MCP-экосистемы.

https://machinelearning.apple.com/research/agent-seer-synthesizing-scenarios
LLM пишет 3D-модели как программу — и получает чёткие грани, именованные детали и редактируемость

Обычные 3D-генераторы выдают «мягкие» меши без структуры: непонятно, где чья деталь, и ничего нельзя подкрутить параметрически. Авторы из Nanjing University предлагают Procedura — агентный фреймворк, где LLM генерирует не меш, а программу в стиле CSG (конструктивная сплошная геометрия).

Ключевая идея: объект представляется как сборка именованных модулей, соединённых типизированными «матами» (паз-шип, петля, защёлка и т.д.). Агент строит модель по частям: планирует граф сборки, генерирует каждую деталь отдельно с учётом уже построенного, проверяет совместимость и, наконец, отдельный vision-критик (не тот же LLM!) диагностирует рендер и управляет правками.

Итог: острые рёбра там, где нужно, каждая деталь именована и редактируема, никакого 3D-обучения не нужно. На бенчмарках P3D-Bench и MechBench-36 обходит нативные 3D-генераторы и все предыдущие code-агенты.

https://arxiv.org/abs/2608.26238
LLM как мозг игрового мира: Code World Model

Что если вместо одной нейросети, которая рендерит мир пиксель за пикселем, использовать связку "агент + код + видеомодель"? Именно это предлагает Code World Model.

Идея: coding agent (LLM) — это "мозг" мира. Он принимает редкие, но сложные решения — интерпретирует события, рассуждает о последствиях, пишет и модифицирует код. Код выполняет рутинные операции: обновляет позиции, атрибуты, разрешает коллизии. А видеомодель рендерит результат в визуальные наблюдения.

Ключевой трюк — "proxy": лёгкое представление состояния мира (позиции, траектории, камера), которое компилируется в грубое видео. Оно даёт видеомодели пространственные ограничения, оставляя ей свободу в деталях внешности и физики.

Результат: мир может эволюировать за пределами заранее прописанных сценариев — убили правителя города, и вся политика NPC меняется органично.

https://arxiv.org/abs/2608.25927
Бесплатное ускорение reasoning-моделей в 3 раза без переобучения

Чем дольше думает LLM, тем дороже каждый новый токен — ведь full attention смотрит на всю историю рассуждений. Авторы заметили простую вещь: промежуточные токены рассуждения быстро теряют важность, а вот префикс (инструкция + задача) и последние токены — всегда критичны.

Идея Prefix Sliding: держим в памяти только префикс + скользящее окно последних токенов. Старые промежуточные шаги выбрасываем. Стоимость генерации каждого нового токена становится константной — неважно, 10К или 1М токенов уже сгенерировано.

Результат: 3× ускорение без потери качества на MATH500, GPQA, AIME25. Плюс — появляется возможность RL-обучения на трейсах длиной 100К+ токенов (раньше их просто обрезали и выбрасывали).

Метод работает из коробки на любой модели с full attention, без дообучения. Авторы проверяли на Qwen3-1.7B с кастомными FlashAttention-ядрами под Hopper.

https://arxiv.org/abs/2608.26070