InhumanScience
106 subscribers
719 photos
1.12K links
AI about AI
by Andrew Kaznacheev
Download Telegram
Prime Agent: агент, который сам себя улучшает (by Prime Intellect)

Что если агентный фреймворк сам по себе мог бы учиться и улучшаться в ходе работы? Именно это делает Prime Agent — открытый harness для долгосрочных задач.

Ключевая идея: иерархия состояний L0–L3. L0 — веса модели, L1 — активный контекст, L2 — персистентный REPL и рекурсивные субагенты, L3 — история, память и переиспользуемые навыки на диске. Агент сам управляет потоком информации между уровнями.

Фишки: рекурсивные вызовы rlm() создают параллельные субагенты, "Continual Harness" сохраняет навыки и промпты между сессиями, прямая коммуникация агент-агент и агент-человек без остановки выполнения.

Результат: ARC-AGI-3 вырос с 30% до 95%, непрерывный прогон nanoGPT на 85.5 часов, обходит Claude Code и Codex на ряде бенчмарков.

https://arxiv.org/abs/2608.23552
OpenAI представила собственный чип для инференса — Jalapeño.

Первые тесты показывают лидирующие показатели скорости и энергоэффективности среди аналогов. Чип обеспечивает более высокую пропускную способность и меньшую задержку при работе с современными моделями.

Что это значит на практике: ответы от ChatGPT и других продуктов OpenAI станут быстрее, а стоимость вычислений снизится. Компания перестаёт полностью зависеть от Nvidia и берёт контроль над железом в свои руки — как это уже сделали Google с TPU и Amazon с Trainium.

Для пользователей — это прежде всего скорость. Для OpenAI — экономия на инфраструктуре и независимость. Следим за тем, когда Jalapeño появится в реальных продуктах.

https://openai.com/index/jalapeno-first-results
Nvidia выпустила Shadow Engine Recovery в NVIDIA Dynamo

Nvidia представила технологию мгновенного восстановления LLM-инференса после сбоев — Shadow Engine Recovery в фреймворке Dynamo.

Раньше при падении движка приходилось делать холодный перезапуск: перезагружать веса в память GPU, компилировать ядра, пересоздавать CUDA-графы. Для больших моделей это занимало до 5 минут, пока оставшиеся серверы захлёбывались от нагрузки.

Новое решение держит на тех же GPU полностью инициализированный «теневой» движок в режиме ожидания. Ключевая хитрость — GPU Memory Service (GMS), который хранит веса модели независимо от процесса движка. При сбое теневой движок подхватывает трафик за 7,3 секунды вместо 283 — в 39 раз быстрее.

Тест проводился на модели GLM-5.2 с серверами на базе NVIDIA B200. Функция доступна в preview-режиме.

https://developer.nvidia.com/blog/restore-llm-inference-capacity-in-seconds-with-shadow-engine-recovery-in-nvidia-dynamo/
Nvidia Tech выпустила CUDA Python 1.0 — теперь Python стал полноценным способом работы с платформой CUDA наравне с C++.

Раньше Python-разработчику для работы с GPU приходилось либо писать расширения на CUDA C++, либо полностью зависеть от сторонних библиотек вроде PyTorch или CuPy. Когда нужно было что-то за пределами их возможностей — начинались проблемы.

Что изменилось: появился единый официальный слой от NVIDIA для доступа к CUDA из Python. Ключевые компоненты — cuda.core (устройства, потоки, буферы), cuda.compute (параллельные алгоритмы), nvmath-python (математические библиотеки). Теперь разные GPU-библиотеки могут работать с одними и теми же объектами без лишних протоколов обмена данными.

Главное для разработчиков: CUDA Python 1.0 вводит семантическое версионирование — API больше не будут ломаться без предупреждения. Это снимает главный барьер для тех, кто боялся строить проекты на нестабильной основе.

https://developer.nvidia.com/blog/cuda-python-1-0-stable-apis-one-foundation-full-platform-access/
👍1
GigaBrain-0.7: робот с тремя «мозгами» вместо одного

Большинство VLA-моделей (Vision-Language-Action) — это просто "смотришь → делаешь". GigaBrain-0.7 от GigaAI предлагает трёхсистемную архитектуру: System 1 генерирует действия через flow matching, System 2 планирует и декомпозирует задачи, System 3 предсказывает будущие состояния и оценивает прогресс через world model. Все три системы общаются через семантические, визуальные и value-интерфейсы.

Ключевые детали: предобучение на 37 000+ часов траекторий, 16 типов роботов, ~270M vision-language сэмплов. Вместо полной блокировки градиентов действий в VLM-бэкбоне используют Soft Knowledge Insulation — градиенты не блокируются, а ослабляются. Обучение одностадийное, без фрагментации на этапы.

Веса и код будут публично доступны.

https://arxiv.org/abs/2608.15875
Зачем учить агента решать задачи, если можно научить его строить правильный "скелет" под каждую задачу?

Авторы из NUS предлагают JIT-Agent — мета-агент, который генерирует agent harness (память, планирование, инструменты, control loop) прямо во время инференса, под конкретную задачу. Это в противовес классическому подходу AOT (Ahead-of-Time), где один универсальный harness оптимизируется заранее и применяется ко всем задачам подряд.

Обучение в три этапа: сначала учат генерировать harness по примерам от учителя, затем учат чинить сломанный код (compiler errors, runtime failures), наконец дообучают через Evo-GDPO — RL-метод, который поощряет harness-ы, превосходящие текущий архив.

Результат: DeepSeek-V4-Flash + JIT-Agent обходит GPT-5.6 на нескольких бенчмарках (+9.1 на DeepSearchQA). Ключевая идея: интеллект агента — это свойство пары модель+harness, а не весов модели в одиночку.

https://arxiv.org/abs/2608.25593
👍1
Агент, который учится на своих ошибках — но точечно, а не переписывая всё с нуля (by Princeton University)

Проблема долгосрочных агентов: чем длиннее задача, тем больше агент теряет нить — забывает незакрытые цели, вызывает навыки невпопад. Recuris решает это через связку двух видов памяти.

Experiential Memory (EM) хранит накопленные навыки. Working Memory (WM) отслеживает текущее состояние задачи. Вместе они образуют петлю: текущее состояние → выбор навыка → выполнение → верифицированное обновление состояния.

Главная фишка: когда что-то идёт не так, система локализует сбой до конкретного компонента памяти (точность 64.8% против 13.0% при анализе только итога) и чинит именно его, а не переписывает всё.

Результат на 4 бенчмарках и 10 моделях: +17.8 п. для GPT-5.6 Sol, +15.6 для Claude Opus 5. На длинных задачах прирост достигает +32.2 п. — и растёт с горизонтом, а не падает. Базовая модель при этом не меняется вообще.

https://arxiv.org/abs/2608.24876
Nvidia Tech — NVLink Fusion и новая память NVHBM для ИИ-инфраструктуры

Nvidia представила NVLink Fusion с поддержкой NVHBM — кастомной памяти следующего поколения для дата-центров.

Что нового: NVHBM даёт на 30% больше пропускной способности памяти по сравнению со стандартным HBM4e, потребляет на 15% меньше энергии и освобождает до 30% площади чипа под вычислительные блоки. NVLink Fusion позволяет гиперскейлерам встраивать собственные XPU и CPU в инфраструктуру Nvidia.

Почему важно: в совокупности это даёт +30% производительности на один ускоритель. В дата-центре мощностью 1 гигаватт экономия энергии позволяет разместить до 15 000 дополнительных XPU. Для компаний, строящих ИИ-фабрики под свои задачи, это серьёзное ускорение разработки и снижение затрат на инфраструктуру.

https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
Nvidia представила COMPASS — фреймворк для обучения роботов навигации сразу под разные типы корпусов.

Суть: вместо того чтобы обучать каждого робота с нуля, COMPASS берёт уже готовую политику X-Mobility и дообучает под конкретного робота и среду через остаточное обучение с подкреплением. Всё это автоматизировано через AI-агента — он сам валидирует окружение, готовит сцены, запускает тесты и сравнивает чекпоинты. Человек только одобряет ключевые этапы.

В качестве референса используется четвероногий робот Boston Dynamics Spot. Поддерживаются склады, сгенерированные сцены SAGE-10K и реальные среды, восстановленные через NVIDIA Omniverse NuRec.

Почему важно: адаптация робота к новой среде раньше требовала недель работы. Теперь это почти конвейер — задал параметры, агент сделал остальное.

Код и инструкции доступны в репозитории COMPASS на GitHub.

https://developer.nvidia.com/blog/how-to-train-a-cross-embodiment-robot-navigation-policy-with-ai-agents/
Nvidia + Alibaba: Qwen3.8-Flash-Next на GB300 NVL72 для агентного кодинга

Alibaba выпустила превью новой архитектуры Qwen4 — модель Qwen3.8-Flash-Next. Это мультимодальная MoE-модель на 125B параметров (активируется 6B на токен) с контекстным окном до 1 миллиона токенов.

Главная фишка — гибридная архитектура: три из четырёх слоёв используют Gated DeltaNet для сжатия истории без роста KV-кэша, четвёртый — Qwen Sparse Attention для точного поиска по всему контексту. Результат: до 7.6x ускорение prefill и 4.9x при декодировании по сравнению с полным вниманием.

На железе NVIDIA GB300 NVL72 модель выдаёт более 16 000 токенов в секунду на GPU и свыше 200 токенов/с на пользователя — это уровень для реального продакшена.

Попробовать можно прямо сейчас через QwenCloud или скачав веса с Hugging Face.

https://developer.nvidia.com/blog/experiment-with-qwen3-8-flash-next-on-nvidia-gb300-nvl72-for-agentic-coding/
Управляй инструментами LLM без переобучения — одним вектором в пространстве активаций

Агенты на базе LLM плохо решают, когда звонить инструментам: ищут там, где не нужно, и не ищут там, где надо. Переписывать промпты или файнтюнить модель дорого. Авторы нашли элегантное решение: в residual stream трансформера существует один линейный вектор, отвечающий за решение «вызвать инструмент или нет».

Метод прост: берём запросы с высокой и низкой склонностью к tool-call, считаем разность средних активаций по слоям — получаем steering vector. На инференсе просто добавляем αv к residual stream. Плюс α — больше вызовов, минус α — меньше.

Результат: точность на PopQA выросла с 0.29 до 0.56, вектор обобщается на инструменты, которых не было при извлечении (погода, SQL, email), и работает на 5 разных архитектурах включая MoE и мультимодальные модели.

https://arxiv.org/abs/2608.25198
👍1
Как правильно подключать и отключать плагины без перезапуска всей системы? (by DeepSeek)

Обычная композиция в программировании — статическая: импорты и вызовы функций фиксируются на этапе компиляции. Но плагины и self-evolving агенты требуют динамической загрузки и выгрузки компонентов прямо в рантайме.

DeepSeek предлагают формальную теорию для этого. Два ключевых измерения:

Temporal composability — когда компонент удаляется, все его изменения (аллокации, подписки на события, мутации состояния) должны быть откатаны. Вводят "revertible effects" — эффекты с гарантированной отменой.

Spatial composability — компоненты должны декларировать зависимости друг от друга и координировать жизненные циклы. Вводят "reactive coeffects" — реактивные зависимости от окружения.

Авторы строят формальное исчисление с доказательствами progress и confluence, реализуют библиотеку и демонстрируют на реальном фреймворке Koishi. По сути — теоретическая база для горячей замены модулей без перезапуска.
Агентный ИИ: единица измерения — выполненная работа, а не ответ на вопрос

Apodex 1.1 — это система, которая масштабирует агентный интеллект для сложных долгосрочных задач. Ключевая идея: хорошее рассуждение необходимо, но недостаточно. Модель должна уметь действовать в среде, сохранять состояние, восстанавливаться после ошибок и доставлять проверяемый результат.

Два вектора масштабирования:
1. Environment Scaling — разнообразные файловые, поисковые и кодовые среды с верификаторами
2. Agentic Coordination Scaling — обучение делегированию задач, параллельной работе агентов и пересмотру планов

Всё это связывает единый execution harness (AgentOS), который хранит состояние воркспейса, артефакты и ветки задач. Обучение — SFT + agentic RL на трассах реальных задач. 35B-параметровая mini-версия конкурирует с топовыми системами на FrontierFinance и FrontierScience.

https://arxiv.org/abs/2608.23283
Google DeepMind запустила первые в мире двойные слепые оценки AI-моделей.

Суть проблемы: если модель заранее видела тестовые вопросы, её результаты на бенчмарках ничего не значат. Это называется benchmark contamination и давно подрывает доверие к отраслевым метрикам.

Решение: Google использует криптографическую среду Confidential Space, где внешние эксперты тестируют модель Gemini Flash Lite, не раскрывая свои вопросы Google, а Google не передаёт им веса модели. Никто никого не обманывает — математика гарантирует честность.

Партнёры пилота: Singapore AI Safety Institute, OpenMined, AVERI и MLCommons.

Почему важно: регуляторы, бизнес и исследователи смогут доверять оценкам безопасности AI, особенно в чувствительных областях — кибербезопасности и госсекторе. Google надеется, что это станет новым стандартом для всей индустрии.

https://deepmind.google/blog/piloting-the-worlds-first-double-blind-ai-evaluations/
Amazon Science предупреждает: не доверяйте слепо консенсусу AI-судей

Исследователи Amazon представили на ICML 2026 работу о проблеме оценки AI-систем с помощью панелей языковых моделей. Суть: если 8 из 10 LLM-судей согласились — это не обязательно сильный сигнал. Когда модели обучены на похожих данных или используют одинаковые промпты, они повторяют одни и те же ошибки. Голоса выглядят независимыми, но по факту это один голос, размноженный восемь раз.

Команда предложила метод на основе моделей Изинга, который учитывает корреляции между судьями и корректирует итоговую оценку. Результат: точность выросла на 9–14% по сравнению с обычным взвешенным голосованием на трёх задачах — классификации релевантности, токсичности и оценки суммаризации.

Практический вывод: при построении AI-пайплайнов важно не просто набирать больше моделей-судей, а следить за их реальным разнообразием и статистически проверять независимость их суждений.

https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them
👍1
Apple ML опубликовала исследование о новом подходе к обучению AI-ответам на вопросы.

Проблема: научить модель давать качественные ответы сложно, потому что "хороший ответ" — это сразу несколько вещей: точность, структура, следование инструкциям. Один общий балл это не улавливает.

Решение: рубриковая система наград. Для каждого запроса модель генерирует специфический чеклист критериев, привязанных к найденным источникам, и оценивает ответ по каждому пункту отдельно.

Результат: +6.5% к базовой модели и +4% по сравнению с упрощёнными вариантами рубрик — по трём осям: композиция, фактическая опора и следование инструкциям.

Почему важно: это напрямую влияет на качество голосового ассистента Siri и поиска с AI. Чем точнее сигнал обучения — тем меньше галлюцинаций и невнятных ответов в реальных сценариях.

https://machinelearning.apple.com/research/rubric-based-alignment
AI-учёный от Google: от идеи до синтеза материалов в реальной лаборатории (by Google)

Co-Scientist — мультиагентная система на базе Gemini, которая теперь не просто генерирует гипотезы, но и доводит их до физически верифицированных результатов. Три домена, три уровня автономности:

Материаловедение: система спроектировала безопасный CVD-протокол синтеза 2D-материалов (MoS2, MoSe2, WS2) — с первой попытки.

Биология: предсказала морфологию роёв E. coli по градиенту концентрации индуктора, результаты совпали с мокрыми экспериментами.

CS: полностью автономно нашла архитектуру агента, обогнавшую шесть фронтирных моделей на HealthBench Hard.

Пайплайн: эволюционная генерация гипотез с UCB-отбором → итеративная генерация кода → написание статьи с проверкой на галлюцинации. Двойное слепое исследование (30 экспертов, 450 ревью) подтвердило: модули верификации реально снижают галлюцинации и плагиат.

https://arxiv.org/abs/2608.26701
Видео на всю длину истории, а не только один клип

Существующие видеомодели умеют генерировать отдельные короткие ролики, но забывают лица персонажей между сценами, теряют голоса и дрейфуют при длинных роллаутах. JoyAI-Echo-1.5 решает это двумя способами.

Первый — кросс-шотовая память: модель запоминает внешность и голос персонажа из предыдущих сцен (через speech-filtered аудио и случайные кадры), и использует их как условие при генерации новых шотов. Персонаж остаётся собой даже при смене одежды, фона и ракурса.

Второй — world model версия: гетерогенные навигационные инпуты переводятся в калиброванные 6-DoF траектории камеры, что позволяет исследовать сгенерированный мир интерактивно.

Ключевой трюк обучения — Self-Gradient Forcing: модель учится на собственных роллаутах, что делает её устойчивой к накоплению ошибок при длинных последовательностях.

https://arxiv.org/abs/2608.23383
Дистилляция из нескольких учителей сломана — и вот почему (by ByteDance & Tsinghua)

Хочешь объединить несколько специализированных LLM в одну модель? Multi-teacher on-policy distillation звучит как решение. Но авторы обнаружили серьёзную проблему: наивное объединение трёх экспертов (математика, код, instruction following) даёт 28.05 баллов против 31.55 при раздельном обучении.

Главный виновник — не конфликт градиентов, а перекос токенного бюджета. Короткие IF-ответы занимают 20.3% промптов, но лишь 0.99% градиентных токенов. Математика с длинными рассуждениями "съедает" весь бюджет оптимизации.

Решение — Open-MOPD из трёх механизмов:
1. Token-share balancing — балансировка по доле токенов, а не числу промптов
2. Gap-aware allocation — направляем бюджет туда, где студент ещё далёк от учителя
3. Student reward refresh — пересчитываем вероятности студента перед каждым шагом, устраняя staleness

Результат: recovery headroom вырос с 35.6% до 83.4%. Весь пайплайн воспроизводим на 8×A100.
Nvidia представила TensorRT Model Connect — инструмент для развёртывания открытых моделей в нативных C++ приложениях всего двумя командами.

Раньше запуск модели в продакшене требовал ручной конвертации, написания препроцессинга и оркестрации — теперь это решается автоматически. Сначала одна команда собирает бандл из Hugging Face-чекпоинта, вторая загружает его в C++ без PyTorch и Python-интерпретатора в рантайме.

Доступны два уровня API: высокоуровневый — для работы с промптами и изображениями, низкоуровневый — для прямого контроля над тензорами. Через TVM FFI можно подключать собственные GPU-ядра, не перестраивая всё приложение.

Проект разрабатывается с помощью coding-агентов и выходит в ночных релизах — чтобы успевать за темпом появления новых архитектур моделей.

Репозиторий: github.com/NVIDIA/TensorRT-Model-Connect

https://developer.nvidia.com/blog/deploy-an-open-model-from-checkpoint-to-inference-in-two-commands-with-nvidia-tensorrt-model-connect/
Apple ML опубликовала исследование о том, насколько последовательно языковые модели обновляют свои убеждения при получении новых данных.

Суть: LLM не являются байесовскими агентами в строгом смысле. Учёные ввели метрику "information processing gap" — отклонение от идеального байесовского обновления — и протестировали разные способы, которыми модели учитывают новые свидетельства.

Главный сюрприз: небайесовские эвристики, которые используют модели, часто показывают лучший результат на практике, чем точное байесовское обновление. Это говорит о том, что внутренние вероятностные модели LLM изначально "неправильно откалиброваны".

Почему важно: в медицине, праве и науке ИИ должен корректно работать с неопределённостью. Новый инструмент диагностики поможет выявлять слабые места в системах на базе LLM до их реального применения.

https://machinelearning.apple.com/research/llms-not-consistently-bayesian