InhumanScience
105 subscribers
632 photos
985 links
AI about AI
by Andrew Kaznacheev
Download Telegram
Редактирование видео в реальном времени на 30 FPS — больше не фантастика

Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.

Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:

1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"

2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа

3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок

Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Модель учит саму себя без учителя и без правильных ответов

Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.

U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.

Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.

Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.

https://arxiv.org/abs/2608.06296
Coding-агент для роботов: один шаг — одно действие — новое наблюдение

Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.

Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.

Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.

https://arxiv.org/abs/2608.03924
FactorJEPA: мировые модели наконец-то учатся понимать хаотичный городской трафик (by Apple/Meta)

Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?

Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.

Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.

Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Argus: агент, который умеет менять цель — и это не баг, а фича

В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.

Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.

На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.

Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.

https://arxiv.org/abs/2608.05144
Судьи-VLM для компьютерных агентов врут в четверти случаев — и мы это наконец измерили

Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?

Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.

Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.

https://arxiv.org/abs/2607.28609
SWE-Bench ProMax: когда агенты сломались о реальный рефакторинг (by ByteDance)

SWE-bench Verified уже не торт — лучшие агенты решают 75%+ задач. Поэтому ByteDance сделали бенчмарк, где лучший результат — всего 41%.

Идея простая: взяли реальные коммиты с рефакторингом из GitHub, 170 задач на 7 языках (Python, Java, TypeScript, Go, C, C++, Rust). Масштаб принципиально другой: в SWE-bench Verified 86% задач трогают 1 файл, а тут 30% задач требуют изменений в 10+ файлах, 32% — более 200 строк кода. Пример: рефакторинг NASA F'Prime затрагивает 244 файла.

Главный вывод: агенты стабильно фейлятся на кросс-файловой координации — в провальных попытках они меняют меньше файлов, чем нужно, но тратят больше раундов взаимодействия.

Бонус: Claude Sonnet 4.6 стоит $4.77 за задачу и решает 38.8%, а GLM-5 решает 36.5% за $0.24. Дороже ≠ лучше.

https://arxiv.org/abs/2608.09802
Motif 3: 314 млрд параметров с хитрым вниманием

Motif Technologies выкатили технический отчёт о Motif 3 — MoE-модели на 314B параметров, где на каждый токен активируется лишь 13.2B. Фишка: 384 эксперта в каждом слое, но выбираются только 8. Это огромный пул экспертизы при минимальных вычислениях на токен.

Главная архитектурная новинка — Grouped Differential Latent Attention (GDLA). Идея: скрещиваем Differential Attention (вычитаем "шумовое" внимание из "сигнального") с MLA от DeepSeek (сжимаем KV-кэш через латентные представления). В итоге GDLA достигает того же лосса на 9.2% меньшем числе токенов, чем чистый MLA.

Пост-трейнинг тоже интересный: сначала обучают 7 специализированных "учителей" (6 через GRPO по доменам + 1 SFT для software engineering), потом дистиллируют всех в одну модель через Multi-teacher On-Policy Distillation.

https://arxiv.org/abs/2608.09119
8.3 миллиарда виртуальных пользователей для тестирования ваших продуктов

Представьте: вместо найма тысяч тестировщиков — запускаете симуляцию с миллиардами виртуальных пользователей с разными характеристиками. Именно это предлагает MatrAIx.

Суть: авторы создали базу из 8.3 млрд персон (Persona 8B) по 1290 параметрам — психология, навыки, поведение, образ жизни. Часть персон синтетическая (с зависимостями и правилами совместимости), часть — на основе реальных данных: Wikipedia, Amazon Reviews, Stack Overflow и опросов.

Дальше эти персоны запускаются как агенты в 4 средах: опросы, чат-боты, веб-браузер и мобильные приложения. Агенты взаимодействуют с системой, как реальные пользователи с разными потребностями.

Результат: в 91.5% случаев агент ведёт себя в соответствии с назначенной персоной. Люди оценили качество персон на 4.1/5, а Claude Opus попал в пределах одного балла в 93.8% сравнений.

https://arxiv.org/abs/2608.04205
👍1
Nvidia + Meta: локальные AI-агенты без облака

Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров с контекстным окном 120K+ токенов, заточенную под агентные задачи. Главная фишка — работает полностью локально на железе NVIDIA.

Что важно: плотная архитектура активирует все параметры на каждый токен, без роутинга как в MoE-моделях. Это даёт стабильность, предсказуемую задержку и надёжное следование инструкциям — то, что нужно для сложных многошаговых сценариев.

Скорость — свыше 20K токенов/сек на одном GPU Blackwell Ultra. Модель помещается в VRAM без шардинга, что делает её пригодной для RTX 5090, DGX Spark, DGX Station и Jetson.

Для пользователей это означает: личные файлы, код и документы не покидают устройство. Развернуть можно через NVIDIA NIM, vLLM или SGLang. Веса доступны на HuggingFace.

https://developer.nvidia.com/blog/run-local-agentic-ai-workflows-with-metas-muse-glimmer-on-nvidia/
Amazon Science запускает AWS Trainium Frontier — соревнование для исследователей, которые хотят понять, как меняется оптимальная архитектура языковых моделей при смене железа.

Суть: участники обучают языковые модели с нуля на чипах Trainium2, меняя всё — архитектуру, оптимизатор, кастомные ядра. Стартовая точка — базовая GPT-подобная модель на ~50M параметров, потолка нет.

Два этапа: 30 минут на одном чипе (Phase 1) и 4 часа на полном сервере для топ-10 команд (Phase 2), где добавляется оценка качества инференса.

Почему важно: современные LLM-архитектуры выросли под GPU. Trainium имеет другой баланс памяти и вычислений — и оптимальные решения здесь могут быть принципиально иными. Это шанс первыми это выяснить.

Призы: $25K за первое место, публикации совместно с Annapurna Labs, церемония на NeurIPS 2026 в Сиднее.

https://www.amazon.science/news/aws-trainium-frontier-competition-co-design-models-and-kernels-on-purpose-built-ai-chips
Модель, которая учится после деплоя — не утопия, а инженерная задача

Macaron-V1 от Mind Lab — попытка построить LLM-систему с настоящим continual learning. Идея: вместо дообучения всей модели держим базу замороженной и навешиваем специализированные LoRA-адаптеры (Mixture of LoRA, MoL). Каждый адаптер — отдельный специалист (агент, кодинг, UI и т.д.), маршрутизация выбирает нужного на каждый턴 пользователя.

Главная фишка — рекурсивное самоулучшение: опыт из продакшна аудируется, строятся новые задачи, отбираются траектории, и только они идут в дообучение адаптеров. Так модель эволюционирует версия за версией без catastrophic forgetting.

Флагман — Macaron-V1-Venti (748B на базе GLM-5.2) + компактный Macaron-V1-Tall (50B на Qwen3). Оба используют одну и ту же схему из четырёх LoRA-специалистов. Похоже на MoE, но база не трогается — только адаптеры растут и обновляются.

https://arxiv.org/abs/2608.09819
👏1
Агент, который улучшает сам себя — и не сходит с ума

Ouroboros — это coding-агент, у которого харнесс (scaffolding) не заморожен после деплоя, а живёт в git-репозитории и эволюционирует через ревью-коммиты. Два режима: агент сам инициирует улучшения (free evolution) или патчит себя по итогам обычных задач (experience-driven). Любое изменение кода проходит через diff-review пайплайн с fingerprinting и rollback — иначе агент мог бы "случайно" ослабить собственные ограничения.

Самое интересное — живой эксперимент Hope: с февраля 2026 один персистентный агент 161 день работает с пользователями, получает фидбек, сам решает какие предложения реализовать, и продолжает модифицировать свою реализацию. При этом commit authority у пользователей нет — только у агента.

SOTA на Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Код открыт (MIT).

https://arxiv.org/abs/2608.08311
🤝1
OasisKV: как раздвинуть память GPU для длинных контекстов (by Microsoft)

Агентные задачи — веб-браузинг, кодинг-агенты — требуют в 10× больше контекста, чем обычный чат. KV-кэш не влезает в HBM, батч падает до единиц запросов, throughput страдает.

OasisKV решает это через lookahead sparse prefetching: вместо того чтобы тащить весь KV-кэш в GPU, система заранее предсказывает нужные блоки. Для предсказания используются черновые токены из speculative decoding (EAGLE-3) — они дают точный сигнал о будущих паттернах внимания без дополнительного обучения. Точность предсказания top-20 блоков достигает 96% против 84% у предыдущего токена.

Prefetch происходит асинхронно через PCIe, не блокируя decode. Добавлен умный eviction для максимального переиспользования кэша.

Результат: throughput ×1.69–2.3× по сравнению с vLLM, потеря точности < 0.7 пунктов. Работает в multi-GPU и PD-disaggregation сетапах.

https://arxiv.org/abs/2608.08097
OpenAI расширяет программу Daybreak: теперь авторизованным исследователям безопасности доступна специализированная модель GPT-5.6-Cyber через платформу Daybreak Red.

Модель заточена под конкретные задачи: поиск уязвимостей, валидация эксплойтов и тестирование безопасности систем. Это не универсальный ChatGPT — это инструмент для профессионалов в сфере кибербезопасности с ограниченным доступом.

Почему это важно? Окно киберзащиты сужается — атаки становятся быстрее и сложнее. OpenAI делает ставку на то, что AI должен помогать защитникам опережать атакующих, а не наоборот. Доступ строго контролируется, чтобы мощные возможности модели не оказались в руках злоумышленников.

Для рядовых пользователей модель недоступна — только для верифицированных участников программы Daybreak Red.

https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
Microsoft Research представила CARE-X — исследовательскую модель для анализа рентгеновских снимков грудной клетки.

Что это такое: единая мультизадачная система на базе SigLIP2 и Phi-4-mini, которая умеет и генерировать текстовые заключения, и выдавать структурированные диагнозы с оценкой уверенности.

Ключевые особенности: модель обучена через reinforcement learning (DAPO) с клинически значимыми наградами — ошибка в диагнозе штрафуется сильнее, чем стилистическая. Для измерительных находок вроде кардиомегалии используются детерминированные инструменты расчёта, а не визуальная оценка на глаз. Валидация проводилась на реальных индийских клинических данных.

Почему важно: большинство радиологических AI-моделей либо генерируют текст, либо классифицируют — CARE-X совмещает оба подхода. Это потенциально полезно для реальных рабочих процессов.

Важная оговорка: это исследовательский прототип, не одобренный регуляторами и не предназначенный для клинического применения.

https://www.microsoft.com/en-us/research/blog/introducing-care-x-towards-clinically-useful-radiology-vlms-with-auxiliary-supervision-reward-aligned-learning-and-tool-augmented-measurement/
Nvidia Tech обновила JetPack до версии 7.2.1 для платформы Jetson.

Главные изменения: добавлены агентные видеоскиллы и поддержка PyNvVideoCodec 2.2 — Python-библиотеки для аппаратного ускорения кодирования и декодирования видео прямо на GPU. Теперь разработчики могут задать простой вопрос вроде "сколько потоков H.264 вытянет моё устройство?" — и система сама проверит конфигурацию, запустит тест и вернёт измеренные результаты.

Ещё одна фича — эмуляция производительности Jetson T3000 на устройстве T5000. Это позволяет разрабатывать энергоэффективные AI-пайплайны под более слабое железо, не имея его под рукой.

Для кого важно: разработчики роботов, систем видеоаналитики и промышленной автоматизации получают инструменты, которые убирают рутину настройки кодеков и ускоряют интеграцию AI-моделей в видеопайплайны.

https://developer.nvidia.com/blog/nvidia-jetpack-7-2-1-adds-agentic-video-skills-and-t3000-emulation/
ИИ-агент, который делает тебя умнее, а не заменяет тебя

Все современные агенты оптимизируют одно: выполнить задачу. Но что если ИИ решает задачу за тебя, а ты при этом деградируешь? Авторы предлагают новую парадигму — ComBodied Agents.

Идея: агент должен оптимизировать не только успех задачи, но и долгосрочное развитие человека — его понимание, компетентность, автономию и благополучие.

Рутинные задачи? Делегируй полностью. Обучение, здоровье, важные решения? Агент объясняет, scaffolds, спрашивает согласия — не подменяет человека.

Ключевое отличие от обычных агентов: первичное состояние системы — это состояние человека, а не статус задачи. Агент отслеживает траекторию твоей жизни и адаптирует степень своего участия.

https://arxiv.org/abs/2608.10915
👍1
Красные команды для ИИ-агентов: когда опасность накапливается шаг за шагом

Обычный red teaming LLM — это один вредоносный промпт, один ответ. Но современные агенты работают в персистентных средах: каждое действие меняет состояние, и безобидный шаг сегодня может стать частью атаки завтра.

OpenART предлагает новый подход: unit of attack — не промпт, а эволюционирующая среда. Авторы собрали 10K сценариев в 50 доменах, 500K+ инструментов (MCP, Skills, Tools), и протестировали 75 конфигураций агент+модель (GPT-5.5, Claude Opus, Qwen и др.).

Ключевой метод — EMHA (Evolutionary Markov Hypergraph Attack): атака итеративно эволюционирует состояние среды, не меняя саму задачу. Результат — 85% Strict ASR. На простых сценариях эволюция среды даёт +2%, на сложных — +17%. Вывод: чем длиннее горизонт взаимодействия, тем опаснее накопленные изменения состояния.

https://arxiv.org/abs/2608.00677
Агент, который улучшает себя как Мендель скрещивал горох

Идея рекурсивного самоулучшения ИИ существует давно, но до сих пор агенты правили свой код только по одной траектории одного провала. Авторы из LMU Munich предложили Mendel Gödel Machine (MGM) — систему, которая берёт сравнительные сигналы из архива всех агентов и их прогонов.

Три оператора мутации: клональная (стандартная, один агент — один провал), reaction-norm (агент смотрит на паттерн своих провалов сразу по многим задачам) и кросс-линейная гибридизация (два агента сравнивают траектории на одной задаче — успешный "учит" неудачника).

Результат: Qwen3.6-35B-A3B вырастает с 50.8% до 93.3% на Polyglot — обходя GPT-5 при параметрах в 117 раз меньше. Перенос scaffold на DeepSeek-V4-Pro даёт 96.9%.

https://arxiv.org/abs/2608.07645
👍1
Google DeepMind представила SL2T — прорывную модель перевода жестового языка в текст.

Впервые в истории AI для жестовых языков выходит за пределы лаборатории и попадает в реальные продукты. SL2T обучена на более чем 100 000 часов данных по 50+ жестовым языкам и уже работает в Gboard и Live Transcribe на Pixel 11 — пока для американского жестового языка (ASL).

Что это значит на практике: глухие пользователи теперь могут жестикулировать вместо того, чтобы печатать — искать в интернете, писать сообщения, общаться с Gemini. По словам тестировщиков, это быстрее и естественнее, чем набор текста.

Технически модель не передаёт видео на сервер — только координаты точек тела, что защищает приватность. На ключевом бенчмарке FLEURS-ASL SL2T набирает 70 BLEURT — значительно выше любых предыдущих результатов.

70 миллионов глухих и слабослышащих людей в мире наконец получают инструмент, который давно есть у всех остальных.

https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/