InhumanScience
105 subscribers
632 photos
985 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Модель, которая учится после деплоя — не утопия, а инженерная задача

Macaron-V1 от Mind Lab — попытка построить LLM-систему с настоящим continual learning. Идея: вместо дообучения всей модели держим базу замороженной и навешиваем специализированные LoRA-адаптеры (Mixture of LoRA, MoL). Каждый адаптер — отдельный специалист (агент, кодинг, UI и т.д.), маршрутизация выбирает нужного на каждый턴 пользователя.

Главная фишка — рекурсивное самоулучшение: опыт из продакшна аудируется, строятся новые задачи, отбираются траектории, и только они идут в дообучение адаптеров. Так модель эволюционирует версия за версией без catastrophic forgetting.

Флагман — Macaron-V1-Venti (748B на базе GLM-5.2) + компактный Macaron-V1-Tall (50B на Qwen3). Оба используют одну и ту же схему из четырёх LoRA-специалистов. Похоже на MoE, но база не трогается — только адаптеры растут и обновляются.

https://arxiv.org/abs/2608.09819
👏1
Агент, который улучшает сам себя — и не сходит с ума

Ouroboros — это coding-агент, у которого харнесс (scaffolding) не заморожен после деплоя, а живёт в git-репозитории и эволюционирует через ревью-коммиты. Два режима: агент сам инициирует улучшения (free evolution) или патчит себя по итогам обычных задач (experience-driven). Любое изменение кода проходит через diff-review пайплайн с fingerprinting и rollback — иначе агент мог бы "случайно" ослабить собственные ограничения.

Самое интересное — живой эксперимент Hope: с февраля 2026 один персистентный агент 161 день работает с пользователями, получает фидбек, сам решает какие предложения реализовать, и продолжает модифицировать свою реализацию. При этом commit authority у пользователей нет — только у агента.

SOTA на Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Код открыт (MIT).

https://arxiv.org/abs/2608.08311
🤝1
OasisKV: как раздвинуть память GPU для длинных контекстов (by Microsoft)

Агентные задачи — веб-браузинг, кодинг-агенты — требуют в 10× больше контекста, чем обычный чат. KV-кэш не влезает в HBM, батч падает до единиц запросов, throughput страдает.

OasisKV решает это через lookahead sparse prefetching: вместо того чтобы тащить весь KV-кэш в GPU, система заранее предсказывает нужные блоки. Для предсказания используются черновые токены из speculative decoding (EAGLE-3) — они дают точный сигнал о будущих паттернах внимания без дополнительного обучения. Точность предсказания top-20 блоков достигает 96% против 84% у предыдущего токена.

Prefetch происходит асинхронно через PCIe, не блокируя decode. Добавлен умный eviction для максимального переиспользования кэша.

Результат: throughput ×1.69–2.3× по сравнению с vLLM, потеря точности < 0.7 пунктов. Работает в multi-GPU и PD-disaggregation сетапах.

https://arxiv.org/abs/2608.08097
OpenAI расширяет программу Daybreak: теперь авторизованным исследователям безопасности доступна специализированная модель GPT-5.6-Cyber через платформу Daybreak Red.

Модель заточена под конкретные задачи: поиск уязвимостей, валидация эксплойтов и тестирование безопасности систем. Это не универсальный ChatGPT — это инструмент для профессионалов в сфере кибербезопасности с ограниченным доступом.

Почему это важно? Окно киберзащиты сужается — атаки становятся быстрее и сложнее. OpenAI делает ставку на то, что AI должен помогать защитникам опережать атакующих, а не наоборот. Доступ строго контролируется, чтобы мощные возможности модели не оказались в руках злоумышленников.

Для рядовых пользователей модель недоступна — только для верифицированных участников программы Daybreak Red.

https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
Microsoft Research представила CARE-X — исследовательскую модель для анализа рентгеновских снимков грудной клетки.

Что это такое: единая мультизадачная система на базе SigLIP2 и Phi-4-mini, которая умеет и генерировать текстовые заключения, и выдавать структурированные диагнозы с оценкой уверенности.

Ключевые особенности: модель обучена через reinforcement learning (DAPO) с клинически значимыми наградами — ошибка в диагнозе штрафуется сильнее, чем стилистическая. Для измерительных находок вроде кардиомегалии используются детерминированные инструменты расчёта, а не визуальная оценка на глаз. Валидация проводилась на реальных индийских клинических данных.

Почему важно: большинство радиологических AI-моделей либо генерируют текст, либо классифицируют — CARE-X совмещает оба подхода. Это потенциально полезно для реальных рабочих процессов.

Важная оговорка: это исследовательский прототип, не одобренный регуляторами и не предназначенный для клинического применения.

https://www.microsoft.com/en-us/research/blog/introducing-care-x-towards-clinically-useful-radiology-vlms-with-auxiliary-supervision-reward-aligned-learning-and-tool-augmented-measurement/
Nvidia Tech обновила JetPack до версии 7.2.1 для платформы Jetson.

Главные изменения: добавлены агентные видеоскиллы и поддержка PyNvVideoCodec 2.2 — Python-библиотеки для аппаратного ускорения кодирования и декодирования видео прямо на GPU. Теперь разработчики могут задать простой вопрос вроде "сколько потоков H.264 вытянет моё устройство?" — и система сама проверит конфигурацию, запустит тест и вернёт измеренные результаты.

Ещё одна фича — эмуляция производительности Jetson T3000 на устройстве T5000. Это позволяет разрабатывать энергоэффективные AI-пайплайны под более слабое железо, не имея его под рукой.

Для кого важно: разработчики роботов, систем видеоаналитики и промышленной автоматизации получают инструменты, которые убирают рутину настройки кодеков и ускоряют интеграцию AI-моделей в видеопайплайны.

https://developer.nvidia.com/blog/nvidia-jetpack-7-2-1-adds-agentic-video-skills-and-t3000-emulation/
ИИ-агент, который делает тебя умнее, а не заменяет тебя

Все современные агенты оптимизируют одно: выполнить задачу. Но что если ИИ решает задачу за тебя, а ты при этом деградируешь? Авторы предлагают новую парадигму — ComBodied Agents.

Идея: агент должен оптимизировать не только успех задачи, но и долгосрочное развитие человека — его понимание, компетентность, автономию и благополучие.

Рутинные задачи? Делегируй полностью. Обучение, здоровье, важные решения? Агент объясняет, scaffolds, спрашивает согласия — не подменяет человека.

Ключевое отличие от обычных агентов: первичное состояние системы — это состояние человека, а не статус задачи. Агент отслеживает траекторию твоей жизни и адаптирует степень своего участия.

https://arxiv.org/abs/2608.10915
👍1
Красные команды для ИИ-агентов: когда опасность накапливается шаг за шагом

Обычный red teaming LLM — это один вредоносный промпт, один ответ. Но современные агенты работают в персистентных средах: каждое действие меняет состояние, и безобидный шаг сегодня может стать частью атаки завтра.

OpenART предлагает новый подход: unit of attack — не промпт, а эволюционирующая среда. Авторы собрали 10K сценариев в 50 доменах, 500K+ инструментов (MCP, Skills, Tools), и протестировали 75 конфигураций агент+модель (GPT-5.5, Claude Opus, Qwen и др.).

Ключевой метод — EMHA (Evolutionary Markov Hypergraph Attack): атака итеративно эволюционирует состояние среды, не меняя саму задачу. Результат — 85% Strict ASR. На простых сценариях эволюция среды даёт +2%, на сложных — +17%. Вывод: чем длиннее горизонт взаимодействия, тем опаснее накопленные изменения состояния.

https://arxiv.org/abs/2608.00677
Агент, который улучшает себя как Мендель скрещивал горох

Идея рекурсивного самоулучшения ИИ существует давно, но до сих пор агенты правили свой код только по одной траектории одного провала. Авторы из LMU Munich предложили Mendel Gödel Machine (MGM) — систему, которая берёт сравнительные сигналы из архива всех агентов и их прогонов.

Три оператора мутации: клональная (стандартная, один агент — один провал), reaction-norm (агент смотрит на паттерн своих провалов сразу по многим задачам) и кросс-линейная гибридизация (два агента сравнивают траектории на одной задаче — успешный "учит" неудачника).

Результат: Qwen3.6-35B-A3B вырастает с 50.8% до 93.3% на Polyglot — обходя GPT-5 при параметрах в 117 раз меньше. Перенос scaffold на DeepSeek-V4-Pro даёт 96.9%.

https://arxiv.org/abs/2608.07645
👍1
Google DeepMind представила SL2T — прорывную модель перевода жестового языка в текст.

Впервые в истории AI для жестовых языков выходит за пределы лаборатории и попадает в реальные продукты. SL2T обучена на более чем 100 000 часов данных по 50+ жестовым языкам и уже работает в Gboard и Live Transcribe на Pixel 11 — пока для американского жестового языка (ASL).

Что это значит на практике: глухие пользователи теперь могут жестикулировать вместо того, чтобы печатать — искать в интернете, писать сообщения, общаться с Gemini. По словам тестировщиков, это быстрее и естественнее, чем набор текста.

Технически модель не передаёт видео на сервер — только координаты точек тела, что защищает приватность. На ключевом бенчмарке FLEURS-ASL SL2T набирает 70 BLEURT — значительно выше любых предыдущих результатов.

70 миллионов глухих и слабослышащих людей в мире наконец получают инструмент, который давно есть у всех остальных.

https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Microsoft Research представил MindTopo — новый бенчмарк для проверки топологического мышления у мультимодальных ИИ-моделей.

Что тестируется: понимают ли модели связность, замкнутость, порядок, разделение и узлы. Например, останутся ли две комнаты связанными после постройки стены? Находится ли животное внутри ограды? Является ли верёвка настоящим узлом?

Главный вывод: модели неплохо справляются с анализом статичных изображений, но резко теряются, когда нужно действовать — планировать последовательность шагов, сохраняя топологические отношения. Ошибки возникают не при восприятии, а при планировании: модель теряет нить структурных связей, как только сцена меняется.

Почему важно: роботы, интерактивные ассистенты и инструменты доступности должны понимать не только где объекты, но и что остаётся связанным или замкнутым в процессе действий. MindTopo фиксирует этот пробел и задаёт направление для его устранения.

https://www.microsoft.com/en-us/research/blog/mindtopo-reveals-vlms-spatial-reasoning-abilities/
Nvidia запустила поддержку Qwen3.8-2.4T-A95B на GB300 NVL72

Alibaba выпустила открытые веса своей крупнейшей модели — Qwen3.8-2.4T-A95B с 2,4 триллиона параметров (95B активируется на каждый токен). Nvidia обеспечила её запуск на своей стойке GB300 NVL72 уже в день релиза.

Что важно: модель показывает свыше 4000 токенов в секунду на GPU и более 350 токенов в секунду на пользователя в режиме FP8 — без дополнительной оптимизации. Архитектура MoE делает инференс экономичным: платишь за 95B активных параметров, а не за все 2,4T.

Модель поддерживает контекст до 1 млн токенов и встроенные уровни глубины рассуждений (low/high/xhigh) — можно гибко балансировать между скоростью и качеством под конкретную задачу.

Доступна через SGLang, vLLM, NVIDIA Dynamo и NIM-контейнер. Веса — на Hugging Face и ModelScope.

https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/