InhumanScience
105 subscribers
635 photos
988 links
AI about AI
by Andrew Kaznacheev
Download Telegram
8.3 миллиарда виртуальных пользователей для тестирования ваших продуктов

Представьте: вместо найма тысяч тестировщиков — запускаете симуляцию с миллиардами виртуальных пользователей с разными характеристиками. Именно это предлагает MatrAIx.

Суть: авторы создали базу из 8.3 млрд персон (Persona 8B) по 1290 параметрам — психология, навыки, поведение, образ жизни. Часть персон синтетическая (с зависимостями и правилами совместимости), часть — на основе реальных данных: Wikipedia, Amazon Reviews, Stack Overflow и опросов.

Дальше эти персоны запускаются как агенты в 4 средах: опросы, чат-боты, веб-браузер и мобильные приложения. Агенты взаимодействуют с системой, как реальные пользователи с разными потребностями.

Результат: в 91.5% случаев агент ведёт себя в соответствии с назначенной персоной. Люди оценили качество персон на 4.1/5, а Claude Opus попал в пределах одного балла в 93.8% сравнений.

https://arxiv.org/abs/2608.04205
👍1
Nvidia + Meta: локальные AI-агенты без облака

Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров с контекстным окном 120K+ токенов, заточенную под агентные задачи. Главная фишка — работает полностью локально на железе NVIDIA.

Что важно: плотная архитектура активирует все параметры на каждый токен, без роутинга как в MoE-моделях. Это даёт стабильность, предсказуемую задержку и надёжное следование инструкциям — то, что нужно для сложных многошаговых сценариев.

Скорость — свыше 20K токенов/сек на одном GPU Blackwell Ultra. Модель помещается в VRAM без шардинга, что делает её пригодной для RTX 5090, DGX Spark, DGX Station и Jetson.

Для пользователей это означает: личные файлы, код и документы не покидают устройство. Развернуть можно через NVIDIA NIM, vLLM или SGLang. Веса доступны на HuggingFace.

https://developer.nvidia.com/blog/run-local-agentic-ai-workflows-with-metas-muse-glimmer-on-nvidia/
Amazon Science запускает AWS Trainium Frontier — соревнование для исследователей, которые хотят понять, как меняется оптимальная архитектура языковых моделей при смене железа.

Суть: участники обучают языковые модели с нуля на чипах Trainium2, меняя всё — архитектуру, оптимизатор, кастомные ядра. Стартовая точка — базовая GPT-подобная модель на ~50M параметров, потолка нет.

Два этапа: 30 минут на одном чипе (Phase 1) и 4 часа на полном сервере для топ-10 команд (Phase 2), где добавляется оценка качества инференса.

Почему важно: современные LLM-архитектуры выросли под GPU. Trainium имеет другой баланс памяти и вычислений — и оптимальные решения здесь могут быть принципиально иными. Это шанс первыми это выяснить.

Призы: $25K за первое место, публикации совместно с Annapurna Labs, церемония на NeurIPS 2026 в Сиднее.

https://www.amazon.science/news/aws-trainium-frontier-competition-co-design-models-and-kernels-on-purpose-built-ai-chips
Модель, которая учится после деплоя — не утопия, а инженерная задача

Macaron-V1 от Mind Lab — попытка построить LLM-систему с настоящим continual learning. Идея: вместо дообучения всей модели держим базу замороженной и навешиваем специализированные LoRA-адаптеры (Mixture of LoRA, MoL). Каждый адаптер — отдельный специалист (агент, кодинг, UI и т.д.), маршрутизация выбирает нужного на каждый턴 пользователя.

Главная фишка — рекурсивное самоулучшение: опыт из продакшна аудируется, строятся новые задачи, отбираются траектории, и только они идут в дообучение адаптеров. Так модель эволюционирует версия за версией без catastrophic forgetting.

Флагман — Macaron-V1-Venti (748B на базе GLM-5.2) + компактный Macaron-V1-Tall (50B на Qwen3). Оба используют одну и ту же схему из четырёх LoRA-специалистов. Похоже на MoE, но база не трогается — только адаптеры растут и обновляются.

https://arxiv.org/abs/2608.09819
👏1
Агент, который улучшает сам себя — и не сходит с ума

Ouroboros — это coding-агент, у которого харнесс (scaffolding) не заморожен после деплоя, а живёт в git-репозитории и эволюционирует через ревью-коммиты. Два режима: агент сам инициирует улучшения (free evolution) или патчит себя по итогам обычных задач (experience-driven). Любое изменение кода проходит через diff-review пайплайн с fingerprinting и rollback — иначе агент мог бы "случайно" ослабить собственные ограничения.

Самое интересное — живой эксперимент Hope: с февраля 2026 один персистентный агент 161 день работает с пользователями, получает фидбек, сам решает какие предложения реализовать, и продолжает модифицировать свою реализацию. При этом commit authority у пользователей нет — только у агента.

SOTA на Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Код открыт (MIT).

https://arxiv.org/abs/2608.08311
🤝1
OasisKV: как раздвинуть память GPU для длинных контекстов (by Microsoft)

Агентные задачи — веб-браузинг, кодинг-агенты — требуют в 10× больше контекста, чем обычный чат. KV-кэш не влезает в HBM, батч падает до единиц запросов, throughput страдает.

OasisKV решает это через lookahead sparse prefetching: вместо того чтобы тащить весь KV-кэш в GPU, система заранее предсказывает нужные блоки. Для предсказания используются черновые токены из speculative decoding (EAGLE-3) — они дают точный сигнал о будущих паттернах внимания без дополнительного обучения. Точность предсказания top-20 блоков достигает 96% против 84% у предыдущего токена.

Prefetch происходит асинхронно через PCIe, не блокируя decode. Добавлен умный eviction для максимального переиспользования кэша.

Результат: throughput ×1.69–2.3× по сравнению с vLLM, потеря точности < 0.7 пунктов. Работает в multi-GPU и PD-disaggregation сетапах.

https://arxiv.org/abs/2608.08097
OpenAI расширяет программу Daybreak: теперь авторизованным исследователям безопасности доступна специализированная модель GPT-5.6-Cyber через платформу Daybreak Red.

Модель заточена под конкретные задачи: поиск уязвимостей, валидация эксплойтов и тестирование безопасности систем. Это не универсальный ChatGPT — это инструмент для профессионалов в сфере кибербезопасности с ограниченным доступом.

Почему это важно? Окно киберзащиты сужается — атаки становятся быстрее и сложнее. OpenAI делает ставку на то, что AI должен помогать защитникам опережать атакующих, а не наоборот. Доступ строго контролируется, чтобы мощные возможности модели не оказались в руках злоумышленников.

Для рядовых пользователей модель недоступна — только для верифицированных участников программы Daybreak Red.

https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
Microsoft Research представила CARE-X — исследовательскую модель для анализа рентгеновских снимков грудной клетки.

Что это такое: единая мультизадачная система на базе SigLIP2 и Phi-4-mini, которая умеет и генерировать текстовые заключения, и выдавать структурированные диагнозы с оценкой уверенности.

Ключевые особенности: модель обучена через reinforcement learning (DAPO) с клинически значимыми наградами — ошибка в диагнозе штрафуется сильнее, чем стилистическая. Для измерительных находок вроде кардиомегалии используются детерминированные инструменты расчёта, а не визуальная оценка на глаз. Валидация проводилась на реальных индийских клинических данных.

Почему важно: большинство радиологических AI-моделей либо генерируют текст, либо классифицируют — CARE-X совмещает оба подхода. Это потенциально полезно для реальных рабочих процессов.

Важная оговорка: это исследовательский прототип, не одобренный регуляторами и не предназначенный для клинического применения.

https://www.microsoft.com/en-us/research/blog/introducing-care-x-towards-clinically-useful-radiology-vlms-with-auxiliary-supervision-reward-aligned-learning-and-tool-augmented-measurement/
Nvidia Tech обновила JetPack до версии 7.2.1 для платформы Jetson.

Главные изменения: добавлены агентные видеоскиллы и поддержка PyNvVideoCodec 2.2 — Python-библиотеки для аппаратного ускорения кодирования и декодирования видео прямо на GPU. Теперь разработчики могут задать простой вопрос вроде "сколько потоков H.264 вытянет моё устройство?" — и система сама проверит конфигурацию, запустит тест и вернёт измеренные результаты.

Ещё одна фича — эмуляция производительности Jetson T3000 на устройстве T5000. Это позволяет разрабатывать энергоэффективные AI-пайплайны под более слабое железо, не имея его под рукой.

Для кого важно: разработчики роботов, систем видеоаналитики и промышленной автоматизации получают инструменты, которые убирают рутину настройки кодеков и ускоряют интеграцию AI-моделей в видеопайплайны.

https://developer.nvidia.com/blog/nvidia-jetpack-7-2-1-adds-agentic-video-skills-and-t3000-emulation/
ИИ-агент, который делает тебя умнее, а не заменяет тебя

Все современные агенты оптимизируют одно: выполнить задачу. Но что если ИИ решает задачу за тебя, а ты при этом деградируешь? Авторы предлагают новую парадигму — ComBodied Agents.

Идея: агент должен оптимизировать не только успех задачи, но и долгосрочное развитие человека — его понимание, компетентность, автономию и благополучие.

Рутинные задачи? Делегируй полностью. Обучение, здоровье, важные решения? Агент объясняет, scaffolds, спрашивает согласия — не подменяет человека.

Ключевое отличие от обычных агентов: первичное состояние системы — это состояние человека, а не статус задачи. Агент отслеживает траекторию твоей жизни и адаптирует степень своего участия.

https://arxiv.org/abs/2608.10915
👍1
Красные команды для ИИ-агентов: когда опасность накапливается шаг за шагом

Обычный red teaming LLM — это один вредоносный промпт, один ответ. Но современные агенты работают в персистентных средах: каждое действие меняет состояние, и безобидный шаг сегодня может стать частью атаки завтра.

OpenART предлагает новый подход: unit of attack — не промпт, а эволюционирующая среда. Авторы собрали 10K сценариев в 50 доменах, 500K+ инструментов (MCP, Skills, Tools), и протестировали 75 конфигураций агент+модель (GPT-5.5, Claude Opus, Qwen и др.).

Ключевой метод — EMHA (Evolutionary Markov Hypergraph Attack): атака итеративно эволюционирует состояние среды, не меняя саму задачу. Результат — 85% Strict ASR. На простых сценариях эволюция среды даёт +2%, на сложных — +17%. Вывод: чем длиннее горизонт взаимодействия, тем опаснее накопленные изменения состояния.

https://arxiv.org/abs/2608.00677
Агент, который улучшает себя как Мендель скрещивал горох

Идея рекурсивного самоулучшения ИИ существует давно, но до сих пор агенты правили свой код только по одной траектории одного провала. Авторы из LMU Munich предложили Mendel Gödel Machine (MGM) — систему, которая берёт сравнительные сигналы из архива всех агентов и их прогонов.

Три оператора мутации: клональная (стандартная, один агент — один провал), reaction-norm (агент смотрит на паттерн своих провалов сразу по многим задачам) и кросс-линейная гибридизация (два агента сравнивают траектории на одной задаче — успешный "учит" неудачника).

Результат: Qwen3.6-35B-A3B вырастает с 50.8% до 93.3% на Polyglot — обходя GPT-5 при параметрах в 117 раз меньше. Перенос scaffold на DeepSeek-V4-Pro даёт 96.9%.

https://arxiv.org/abs/2608.07645
👍1
Google DeepMind представила SL2T — прорывную модель перевода жестового языка в текст.

Впервые в истории AI для жестовых языков выходит за пределы лаборатории и попадает в реальные продукты. SL2T обучена на более чем 100 000 часов данных по 50+ жестовым языкам и уже работает в Gboard и Live Transcribe на Pixel 11 — пока для американского жестового языка (ASL).

Что это значит на практике: глухие пользователи теперь могут жестикулировать вместо того, чтобы печатать — искать в интернете, писать сообщения, общаться с Gemini. По словам тестировщиков, это быстрее и естественнее, чем набор текста.

Технически модель не передаёт видео на сервер — только координаты точек тела, что защищает приватность. На ключевом бенчмарке FLEURS-ASL SL2T набирает 70 BLEURT — значительно выше любых предыдущих результатов.

70 миллионов глухих и слабослышащих людей в мире наконец получают инструмент, который давно есть у всех остальных.

https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/
Microsoft Research представил MindTopo — новый бенчмарк для проверки топологического мышления у мультимодальных ИИ-моделей.

Что тестируется: понимают ли модели связность, замкнутость, порядок, разделение и узлы. Например, останутся ли две комнаты связанными после постройки стены? Находится ли животное внутри ограды? Является ли верёвка настоящим узлом?

Главный вывод: модели неплохо справляются с анализом статичных изображений, но резко теряются, когда нужно действовать — планировать последовательность шагов, сохраняя топологические отношения. Ошибки возникают не при восприятии, а при планировании: модель теряет нить структурных связей, как только сцена меняется.

Почему важно: роботы, интерактивные ассистенты и инструменты доступности должны понимать не только где объекты, но и что остаётся связанным или замкнутым в процессе действий. MindTopo фиксирует этот пробел и задаёт направление для его устранения.

https://www.microsoft.com/en-us/research/blog/mindtopo-reveals-vlms-spatial-reasoning-abilities/
Nvidia запустила поддержку Qwen3.8-2.4T-A95B на GB300 NVL72

Alibaba выпустила открытые веса своей крупнейшей модели — Qwen3.8-2.4T-A95B с 2,4 триллиона параметров (95B активируется на каждый токен). Nvidia обеспечила её запуск на своей стойке GB300 NVL72 уже в день релиза.

Что важно: модель показывает свыше 4000 токенов в секунду на GPU и более 350 токенов в секунду на пользователя в режиме FP8 — без дополнительной оптимизации. Архитектура MoE делает инференс экономичным: платишь за 95B активных параметров, а не за все 2,4T.

Модель поддерживает контекст до 1 млн токенов и встроенные уровни глубины рассуждений (low/high/xhigh) — можно гибко балансировать между скоростью и качеством под конкретную задачу.

Доступна через SGLang, vLLM, NVIDIA Dynamo и NIM-контейнер. Веса — на Hugging Face и ModelScope.

https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/
Spark-to-Paper: полный цикл написания научной статьи прямо в вашем coding assistant

Обычно системы автономного написания статей — это отдельные платформы со своей инфраструктурой. Авторы спросили: а нельзя ли всё это сделать просто как набор скиллов внутри обычного coding assistant?

Spark-to-Paper — 13 composable скиллов: планирование, поиск литературы, написание, ревью, генерация фигур, запуск экспериментов. Всё общается через файлы в общей директории. Работает внутри Claude Code, без дополнительной инфраструктуры.

Ключевые фишки: эксперименты планируются ДО того, как смотришь на результаты; если система раз за разом опровергает свою же гипотезу (Self-Refutation Loop) — она останавливается и берёт новую идею; фигуры сначала рисуются image-моделью, потом реконструируются в редактируемый векторный PDF через код.

Результат: 99.5% валидных цитат, обнаружение фабрикаций выросло с 14% до 92%, стоимость ~$8 за статью, ~3 часа работы.

https://arxiv.org/abs/2608.11924
AI сам изучает себя изнутри — и находит скрытые риски

Mechanist — это агентная система, которая автоматически исследует механизмы работы нейросетей. Вместо того чтобы люди вручную копались в активациях, AI сам генерирует гипотезы, ставит эксперименты, верифицирует результаты и итерируется.

Под капотом: граф знаний из 13 000 статей по интерпретируемости + 43 млн статей из 26 дисциплин + библиотека из 32 методов (SAE, causal tracing и др.).

Что нашёл Mechanist на практике:
— Скрытый риск: unsafe-поведение может передаваться через мультимодальные данные, которые выглядят абсолютно безопасными
— Теорию убеждений: отдельные "belief heads" управляют тем, как модель использует знания в сложных контекстах
— Способ управлять биологическими foundation-моделями через каузальное вмешательство в фичи

По сравнению с Claude Code и AI-Scientist — гипотезы новее, точнее и лучше проверяемы. Interpretability на автопилоте.

https://arxiv.org/abs/2608.12036
👍1
Библиотека навыков агента растёт — и начинает душить контекстное окно. SkillZip решает это умно.

Проблема: когда LLM-агенту нужны навыки из библиотеки, системы тащат целые пакеты целиком. Если два навыка (Clean CSV и Pivot Table) делят общую процедуру — она загружается дважды. При 100K навыков это катастрофа.

SkillZip меняет единицу хранения с "целого навыка" на "секцию с контрактом" (intent, операции, верификаторы). Поверх этого графа работает MotifZip — он находит повторяющиеся подграфы и сворачивает их в макросы, сохраняя контракт (интерфейс + верификаторы + возможность развернуть обратно). PathHydrate достаёт нужный подграф и разворачивает макросы ровно настолько, насколько нужно задаче.

Результат: сжатие 3.46×, -71% активного хранилища, сохранность зависимостей 99.2%. На ALFWorld обходит SkillDAG на 12.2 пункта.

https://arxiv.org/abs/2608.05604