Агент наконец узнает, чем ты занимался весь день — без единого LLM в пайплайне
LLM-агенты помнят только разговоры, но не то, что ты реально делал: 40 переключений контекста после обеда, брошенный черновик письма в 16:40. Сырые логи экрана — это ~126k токенов за день, LLM-суммаризация — галлюцинации и недетерминизм.
Автор предлагает детерминистическую компиляцию: поток снапшотов экрана → "activity frames" (эпизоды с приложением, временем, активными минутами, ссылками на сырые строки). Никакой модели в пайплайне — одинаковые входные данные всегда дают байт-в-байт одинаковый результат.
Результат: сжатие в 86 раз, компиляция за 68 мс, агент отвечает точнее на вопросы о дне по сравнению с сырыми логами или LLM-суммари. Средний тир модели догоняет фронтирный.
Реализация — Python без зависимостей + MCP-сервер для любого агента.
https://arxiv.org/abs/2608.05784
LLM-агенты помнят только разговоры, но не то, что ты реально делал: 40 переключений контекста после обеда, брошенный черновик письма в 16:40. Сырые логи экрана — это ~126k токенов за день, LLM-суммаризация — галлюцинации и недетерминизм.
Автор предлагает детерминистическую компиляцию: поток снапшотов экрана → "activity frames" (эпизоды с приложением, временем, активными минутами, ссылками на сырые строки). Никакой модели в пайплайне — одинаковые входные данные всегда дают байт-в-байт одинаковый результат.
Результат: сжатие в 86 раз, компиляция за 68 мс, агент отвечает точнее на вопросы о дне по сравнению с сырыми логами или LLM-суммари. Средний тир модели догоняет фронтирный.
Реализация — Python без зависимостей + MCP-сервер для любого агента.
https://arxiv.org/abs/2608.05784
Видеомодель как мозг робота: 3x ускорение без потери качества (by Huawei)
World Action Models (WAM) — роботы, управляемые видеомоделями физической динамики — круто работают, но медленно: 211 мс на чанк действий против 71 мс у VLA-моделей. Авторы решили это архитектурно.
Идея: зачем делать глубокий action-трансформер, если видеомодель уже выучила физику? Пусть action head будет лёгким, но "докнется" ко всем слоям видеобэкбона сразу.
Так появился Dock of Transformers (DoT): видео-DiT — центральный хаб, а task-specific головы подключаются через docking interface. Конкретно — KV-Fusion собирает ключи и значения со всех L слоёв видеобэкбона и отдаёт их в единственный слой action DiT.
Результат — Faster-WAM: 66.5 мс на чанк (3.2x быстрее Fast-WAM, быстрее π0 и π0.5), при этом 98.5% на LIBERO и +23.5 п.п. над Fast-WAM на LIBERO-Plus.
https://arxiv.org/abs/2608.02365
World Action Models (WAM) — роботы, управляемые видеомоделями физической динамики — круто работают, но медленно: 211 мс на чанк действий против 71 мс у VLA-моделей. Авторы решили это архитектурно.
Идея: зачем делать глубокий action-трансформер, если видеомодель уже выучила физику? Пусть action head будет лёгким, но "докнется" ко всем слоям видеобэкбона сразу.
Так появился Dock of Transformers (DoT): видео-DiT — центральный хаб, а task-specific головы подключаются через docking interface. Конкретно — KV-Fusion собирает ключи и значения со всех L слоёв видеобэкбона и отдаёт их в единственный слой action DiT.
Результат — Faster-WAM: 66.5 мс на чанк (3.2x быстрее Fast-WAM, быстрее π0 и π0.5), при этом 98.5% на LIBERO и +23.5 п.п. над Fast-WAM на LIBERO-Plus.
https://arxiv.org/abs/2608.02365
Apple ML представила масштабируемую альтернативу авторегрессионным языковым моделям.
Исследователи обучили модель на 1,7 млрд параметров и 2,1 трлн токенов, используя подход Categorical Flow Maps (CFM) — метод генерации текста через непрерывные потоки вместо привычного пошагового предсказания токенов.
Главный результат: модель генерирует качественный текст всего за 4 шага вместо сотен итераций у классических диффузионных моделей. При этом сохраняется разнообразие и естественность текста.
Почему важно: до этого CFM тестировали только на моделях меньше 1 млрд параметров — оставалось неясным, работает ли подход в реальных масштабах. Теперь ответ есть: работает. Это открывает путь к более быстрым и дешёвым языковым моделям без потери качества.
Для пользователей это может означать более отзывчивые AI-ассистенты с меньшими вычислительными затратами в будущем.
https://machinelearning.apple.com/research/scaling-categorical-flow-maps
Исследователи обучили модель на 1,7 млрд параметров и 2,1 трлн токенов, используя подход Categorical Flow Maps (CFM) — метод генерации текста через непрерывные потоки вместо привычного пошагового предсказания токенов.
Главный результат: модель генерирует качественный текст всего за 4 шага вместо сотен итераций у классических диффузионных моделей. При этом сохраняется разнообразие и естественность текста.
Почему важно: до этого CFM тестировали только на моделях меньше 1 млрд параметров — оставалось неясным, работает ли подход в реальных масштабах. Теперь ответ есть: работает. Это открывает путь к более быстрым и дешёвым языковым моделям без потери качества.
Для пользователей это может означать более отзывчивые AI-ассистенты с меньшими вычислительными затратами в будущем.
https://machinelearning.apple.com/research/scaling-categorical-flow-maps
Apple Machine Learning Research
Scaling Categorical Flow Maps
Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling…
Apple ML сравнила диффузионные и авторегрессионные языковые модели
Исследователи Apple ML опубликовали работу, в которой детально сравнили два подхода к генерации текста: привычные авторегрессионные модели (ARM) и диффузионные языковые модели (DLM).
Ключевые выводы: DLM генерируют токены параллельно, что даёт им преимущество по вычислительной интенсивности — но только на коротких контекстах. При длинных текстах они плохо масштабируются. ARM же при батчевом инференсе показывают лучшую пропускную способность, эффективнее используя параллелизм по запросам.
Авторы предлагают блочное декодирование для DLM — это отвязывает вычислительную интенсивность от длины контекста и улучшает масштабируемость. Также подчёркивается: главный путь к ускорению DLM — сокращение числа шагов сэмплирования.
Почему это важно: диффузионные модели считаются перспективной альтернативой GPT-подобным архитектурам, но до реального превосходства им ещё далеко. Apple системно обозначила узкие места — это дорожная карта для всей индустрии.
https://machinelearning.apple.com/research/diffusion-autoregressive-performance
Исследователи Apple ML опубликовали работу, в которой детально сравнили два подхода к генерации текста: привычные авторегрессионные модели (ARM) и диффузионные языковые модели (DLM).
Ключевые выводы: DLM генерируют токены параллельно, что даёт им преимущество по вычислительной интенсивности — но только на коротких контекстах. При длинных текстах они плохо масштабируются. ARM же при батчевом инференсе показывают лучшую пропускную способность, эффективнее используя параллелизм по запросам.
Авторы предлагают блочное декодирование для DLM — это отвязывает вычислительную интенсивность от длины контекста и улучшает масштабируемость. Также подчёркивается: главный путь к ускорению DLM — сокращение числа шагов сэмплирования.
Почему это важно: диффузионные модели считаются перспективной альтернативой GPT-подобным архитектурам, но до реального превосходства им ещё далеко. Apple системно обозначила узкие места — это дорожная карта для всей индустрии.
https://machinelearning.apple.com/research/diffusion-autoregressive-performance
Apple Machine Learning Research
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks…
Apple ML представила ARBITRAGE — новый фреймворк для ускорения инференса языковых моделей с длинными цепочками рассуждений.
Проблема: стандартное Speculative Decoding (быстрая черновая модель предлагает токены, мощная модель проверяет) плохо работает в задачах рассуждения — слишком много лишних отклонений из-за семантически эквивалентных, но текстуально разных шагов.
Что нового: ARBITRAGE работает на уровне шагов рассуждения, а не отдельных токенов. Лёгкий роутер предсказывает, когда большая модель даст реально лучший результат, и только тогда к ней обращается. Это приближается к "идеальному оракулу", который всегда выбирает лучший шаг.
Результат: до 2x снижение задержки при сохранении точности на математических бенчмарках.
Почему важно: эффективный инференс — ключ к удешевлению AI-сервисов. Такие техники напрямую влияют на то, сколько стоит запустить умную модель на устройстве или в облаке.
https://machinelearning.apple.com/research/arbitrage-efficient-reasoning
Проблема: стандартное Speculative Decoding (быстрая черновая модель предлагает токены, мощная модель проверяет) плохо работает в задачах рассуждения — слишком много лишних отклонений из-за семантически эквивалентных, но текстуально разных шагов.
Что нового: ARBITRAGE работает на уровне шагов рассуждения, а не отдельных токенов. Лёгкий роутер предсказывает, когда большая модель даст реально лучший результат, и только тогда к ней обращается. Это приближается к "идеальному оракулу", который всегда выбирает лучший шаг.
Результат: до 2x снижение задержки при сохранении точности на математических бенчмарках.
Почему важно: эффективный инференс — ключ к удешевлению AI-сервисов. Такие техники напрямую влияют на то, сколько стоит запустить умную модель на устройстве или в облаке.
https://machinelearning.apple.com/research/arbitrage-efficient-reasoning
Apple Machine Learning Research
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational…
Редактирование видео в реальном времени на 30 FPS — больше не фантастика
Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.
Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:
1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"
2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа
3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок
Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.
Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:
1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"
2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа
3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок
Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Модель учит саму себя без учителя и без правильных ответов
Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.
U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.
Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.
Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.
https://arxiv.org/abs/2608.06296
Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.
U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.
Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.
Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.
https://arxiv.org/abs/2608.06296
Coding-агент для роботов: один шаг — одно действие — новое наблюдение
Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.
Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.
Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.
https://arxiv.org/abs/2608.03924
Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.
Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.
Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.
https://arxiv.org/abs/2608.03924
FactorJEPA: мировые модели наконец-то учатся понимать хаотичный городской трафик (by Apple/Meta)
Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?
Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.
Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.
Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?
Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.
Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.
Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Argus: агент, который умеет менять цель — и это не баг, а фича
В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.
Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.
На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.
Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.
https://arxiv.org/abs/2608.05144
В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.
Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.
На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.
Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.
https://arxiv.org/abs/2608.05144
Судьи-VLM для компьютерных агентов врут в четверти случаев — и мы это наконец измерили
Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?
Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.
Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.
https://arxiv.org/abs/2607.28609
Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?
Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.
Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.
https://arxiv.org/abs/2607.28609
SWE-Bench ProMax: когда агенты сломались о реальный рефакторинг (by ByteDance)
SWE-bench Verified уже не торт — лучшие агенты решают 75%+ задач. Поэтому ByteDance сделали бенчмарк, где лучший результат — всего 41%.
Идея простая: взяли реальные коммиты с рефакторингом из GitHub, 170 задач на 7 языках (Python, Java, TypeScript, Go, C, C++, Rust). Масштаб принципиально другой: в SWE-bench Verified 86% задач трогают 1 файл, а тут 30% задач требуют изменений в 10+ файлах, 32% — более 200 строк кода. Пример: рефакторинг NASA F'Prime затрагивает 244 файла.
Главный вывод: агенты стабильно фейлятся на кросс-файловой координации — в провальных попытках они меняют меньше файлов, чем нужно, но тратят больше раундов взаимодействия.
Бонус: Claude Sonnet 4.6 стоит $4.77 за задачу и решает 38.8%, а GLM-5 решает 36.5% за $0.24. Дороже ≠ лучше.
https://arxiv.org/abs/2608.09802
SWE-bench Verified уже не торт — лучшие агенты решают 75%+ задач. Поэтому ByteDance сделали бенчмарк, где лучший результат — всего 41%.
Идея простая: взяли реальные коммиты с рефакторингом из GitHub, 170 задач на 7 языках (Python, Java, TypeScript, Go, C, C++, Rust). Масштаб принципиально другой: в SWE-bench Verified 86% задач трогают 1 файл, а тут 30% задач требуют изменений в 10+ файлах, 32% — более 200 строк кода. Пример: рефакторинг NASA F'Prime затрагивает 244 файла.
Главный вывод: агенты стабильно фейлятся на кросс-файловой координации — в провальных попытках они меняют меньше файлов, чем нужно, но тратят больше раундов взаимодействия.
Бонус: Claude Sonnet 4.6 стоит $4.77 за задачу и решает 38.8%, а GLM-5 решает 36.5% за $0.24. Дороже ≠ лучше.
https://arxiv.org/abs/2608.09802
Motif 3: 314 млрд параметров с хитрым вниманием
Motif Technologies выкатили технический отчёт о Motif 3 — MoE-модели на 314B параметров, где на каждый токен активируется лишь 13.2B. Фишка: 384 эксперта в каждом слое, но выбираются только 8. Это огромный пул экспертизы при минимальных вычислениях на токен.
Главная архитектурная новинка — Grouped Differential Latent Attention (GDLA). Идея: скрещиваем Differential Attention (вычитаем "шумовое" внимание из "сигнального") с MLA от DeepSeek (сжимаем KV-кэш через латентные представления). В итоге GDLA достигает того же лосса на 9.2% меньшем числе токенов, чем чистый MLA.
Пост-трейнинг тоже интересный: сначала обучают 7 специализированных "учителей" (6 через GRPO по доменам + 1 SFT для software engineering), потом дистиллируют всех в одну модель через Multi-teacher On-Policy Distillation.
https://arxiv.org/abs/2608.09119
Motif Technologies выкатили технический отчёт о Motif 3 — MoE-модели на 314B параметров, где на каждый токен активируется лишь 13.2B. Фишка: 384 эксперта в каждом слое, но выбираются только 8. Это огромный пул экспертизы при минимальных вычислениях на токен.
Главная архитектурная новинка — Grouped Differential Latent Attention (GDLA). Идея: скрещиваем Differential Attention (вычитаем "шумовое" внимание из "сигнального") с MLA от DeepSeek (сжимаем KV-кэш через латентные представления). В итоге GDLA достигает того же лосса на 9.2% меньшем числе токенов, чем чистый MLA.
Пост-трейнинг тоже интересный: сначала обучают 7 специализированных "учителей" (6 через GRPO по доменам + 1 SFT для software engineering), потом дистиллируют всех в одну модель через Multi-teacher On-Policy Distillation.
https://arxiv.org/abs/2608.09119
8.3 миллиарда виртуальных пользователей для тестирования ваших продуктов
Представьте: вместо найма тысяч тестировщиков — запускаете симуляцию с миллиардами виртуальных пользователей с разными характеристиками. Именно это предлагает MatrAIx.
Суть: авторы создали базу из 8.3 млрд персон (Persona 8B) по 1290 параметрам — психология, навыки, поведение, образ жизни. Часть персон синтетическая (с зависимостями и правилами совместимости), часть — на основе реальных данных: Wikipedia, Amazon Reviews, Stack Overflow и опросов.
Дальше эти персоны запускаются как агенты в 4 средах: опросы, чат-боты, веб-браузер и мобильные приложения. Агенты взаимодействуют с системой, как реальные пользователи с разными потребностями.
Результат: в 91.5% случаев агент ведёт себя в соответствии с назначенной персоной. Люди оценили качество персон на 4.1/5, а Claude Opus попал в пределах одного балла в 93.8% сравнений.
https://arxiv.org/abs/2608.04205
Представьте: вместо найма тысяч тестировщиков — запускаете симуляцию с миллиардами виртуальных пользователей с разными характеристиками. Именно это предлагает MatrAIx.
Суть: авторы создали базу из 8.3 млрд персон (Persona 8B) по 1290 параметрам — психология, навыки, поведение, образ жизни. Часть персон синтетическая (с зависимостями и правилами совместимости), часть — на основе реальных данных: Wikipedia, Amazon Reviews, Stack Overflow и опросов.
Дальше эти персоны запускаются как агенты в 4 средах: опросы, чат-боты, веб-браузер и мобильные приложения. Агенты взаимодействуют с системой, как реальные пользователи с разными потребностями.
Результат: в 91.5% случаев агент ведёт себя в соответствии с назначенной персоной. Люди оценили качество персон на 4.1/5, а Claude Opus попал в пределах одного балла в 93.8% сравнений.
https://arxiv.org/abs/2608.04205
👍1
Nvidia + Meta: локальные AI-агенты без облака
Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров с контекстным окном 120K+ токенов, заточенную под агентные задачи. Главная фишка — работает полностью локально на железе NVIDIA.
Что важно: плотная архитектура активирует все параметры на каждый токен, без роутинга как в MoE-моделях. Это даёт стабильность, предсказуемую задержку и надёжное следование инструкциям — то, что нужно для сложных многошаговых сценариев.
Скорость — свыше 20K токенов/сек на одном GPU Blackwell Ultra. Модель помещается в VRAM без шардинга, что делает её пригодной для RTX 5090, DGX Spark, DGX Station и Jetson.
Для пользователей это означает: личные файлы, код и документы не покидают устройство. Развернуть можно через NVIDIA NIM, vLLM или SGLang. Веса доступны на HuggingFace.
https://developer.nvidia.com/blog/run-local-agentic-ai-workflows-with-metas-muse-glimmer-on-nvidia/
Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров с контекстным окном 120K+ токенов, заточенную под агентные задачи. Главная фишка — работает полностью локально на железе NVIDIA.
Что важно: плотная архитектура активирует все параметры на каждый токен, без роутинга как в MoE-моделях. Это даёт стабильность, предсказуемую задержку и надёжное следование инструкциям — то, что нужно для сложных многошаговых сценариев.
Скорость — свыше 20K токенов/сек на одном GPU Blackwell Ultra. Модель помещается в VRAM без шардинга, что делает её пригодной для RTX 5090, DGX Spark, DGX Station и Jetson.
Для пользователей это означает: личные файлы, код и документы не покидают устройство. Развернуть можно через NVIDIA NIM, vLLM или SGLang. Веса доступны на HuggingFace.
https://developer.nvidia.com/blog/run-local-agentic-ai-workflows-with-metas-muse-glimmer-on-nvidia/
NVIDIA Technical Blog
Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA
Meta returns to the open source ecosystem with the release of Muse Glimmer, a 30B open-weight dense model with a 120K+ context window built for local AI agentic work. Optimized to run across a range…
Amazon Science запускает AWS Trainium Frontier — соревнование для исследователей, которые хотят понять, как меняется оптимальная архитектура языковых моделей при смене железа.
Суть: участники обучают языковые модели с нуля на чипах Trainium2, меняя всё — архитектуру, оптимизатор, кастомные ядра. Стартовая точка — базовая GPT-подобная модель на ~50M параметров, потолка нет.
Два этапа: 30 минут на одном чипе (Phase 1) и 4 часа на полном сервере для топ-10 команд (Phase 2), где добавляется оценка качества инференса.
Почему важно: современные LLM-архитектуры выросли под GPU. Trainium имеет другой баланс памяти и вычислений — и оптимальные решения здесь могут быть принципиально иными. Это шанс первыми это выяснить.
Призы: $25K за первое место, публикации совместно с Annapurna Labs, церемония на NeurIPS 2026 в Сиднее.
https://www.amazon.science/news/aws-trainium-frontier-competition-co-design-models-and-kernels-on-purpose-built-ai-chips
Суть: участники обучают языковые модели с нуля на чипах Trainium2, меняя всё — архитектуру, оптимизатор, кастомные ядра. Стартовая точка — базовая GPT-подобная модель на ~50M параметров, потолка нет.
Два этапа: 30 минут на одном чипе (Phase 1) и 4 часа на полном сервере для топ-10 команд (Phase 2), где добавляется оценка качества инференса.
Почему важно: современные LLM-архитектуры выросли под GPU. Trainium имеет другой баланс памяти и вычислений — и оптимальные решения здесь могут быть принципиально иными. Это шанс первыми это выяснить.
Призы: $25K за первое место, публикации совместно с Annapurna Labs, церемония на NeurIPS 2026 в Сиднее.
https://www.amazon.science/news/aws-trainium-frontier-competition-co-design-models-and-kernels-on-purpose-built-ai-chips
Amazon Science
AWS Trainium Frontier competition: Co-design models and kernels on purpose-built AI chips
A competition with a finalist ceremony during NeurIPS 2026, challenging researchers to train language models from scratch on Trainium, exploring what optimal architectures look like when the hardware changes.
Модель, которая учится после деплоя — не утопия, а инженерная задача
Macaron-V1 от Mind Lab — попытка построить LLM-систему с настоящим continual learning. Идея: вместо дообучения всей модели держим базу замороженной и навешиваем специализированные LoRA-адаптеры (Mixture of LoRA, MoL). Каждый адаптер — отдельный специалист (агент, кодинг, UI и т.д.), маршрутизация выбирает нужного на каждый턴 пользователя.
Главная фишка — рекурсивное самоулучшение: опыт из продакшна аудируется, строятся новые задачи, отбираются траектории, и только они идут в дообучение адаптеров. Так модель эволюционирует версия за версией без catastrophic forgetting.
Флагман — Macaron-V1-Venti (748B на базе GLM-5.2) + компактный Macaron-V1-Tall (50B на Qwen3). Оба используют одну и ту же схему из четырёх LoRA-специалистов. Похоже на MoE, но база не трогается — только адаптеры растут и обновляются.
https://arxiv.org/abs/2608.09819
Macaron-V1 от Mind Lab — попытка построить LLM-систему с настоящим continual learning. Идея: вместо дообучения всей модели держим базу замороженной и навешиваем специализированные LoRA-адаптеры (Mixture of LoRA, MoL). Каждый адаптер — отдельный специалист (агент, кодинг, UI и т.д.), маршрутизация выбирает нужного на каждый턴 пользователя.
Главная фишка — рекурсивное самоулучшение: опыт из продакшна аудируется, строятся новые задачи, отбираются траектории, и только они идут в дообучение адаптеров. Так модель эволюционирует версия за версией без catastrophic forgetting.
Флагман — Macaron-V1-Venti (748B на базе GLM-5.2) + компактный Macaron-V1-Tall (50B на Qwen3). Оба используют одну и ту же схему из четырёх LoRA-специалистов. Похоже на MoE, но база не трогается — только адаптеры растут и обновляются.
https://arxiv.org/abs/2608.09819
👏1
Агент, который улучшает сам себя — и не сходит с ума
Ouroboros — это coding-агент, у которого харнесс (scaffolding) не заморожен после деплоя, а живёт в git-репозитории и эволюционирует через ревью-коммиты. Два режима: агент сам инициирует улучшения (free evolution) или патчит себя по итогам обычных задач (experience-driven). Любое изменение кода проходит через diff-review пайплайн с fingerprinting и rollback — иначе агент мог бы "случайно" ослабить собственные ограничения.
Самое интересное — живой эксперимент Hope: с февраля 2026 один персистентный агент 161 день работает с пользователями, получает фидбек, сам решает какие предложения реализовать, и продолжает модифицировать свою реализацию. При этом commit authority у пользователей нет — только у агента.
SOTA на Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Код открыт (MIT).
https://arxiv.org/abs/2608.08311
Ouroboros — это coding-агент, у которого харнесс (scaffolding) не заморожен после деплоя, а живёт в git-репозитории и эволюционирует через ревью-коммиты. Два режима: агент сам инициирует улучшения (free evolution) или патчит себя по итогам обычных задач (experience-driven). Любое изменение кода проходит через diff-review пайплайн с fingerprinting и rollback — иначе агент мог бы "случайно" ослабить собственные ограничения.
Самое интересное — живой эксперимент Hope: с февраля 2026 один персистентный агент 161 день работает с пользователями, получает фидбек, сам решает какие предложения реализовать, и продолжает модифицировать свою реализацию. При этом commit authority у пользователей нет — только у агента.
SOTA на Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Код открыт (MIT).
https://arxiv.org/abs/2608.08311
🤝1
OasisKV: как раздвинуть память GPU для длинных контекстов (by Microsoft)
Агентные задачи — веб-браузинг, кодинг-агенты — требуют в 10× больше контекста, чем обычный чат. KV-кэш не влезает в HBM, батч падает до единиц запросов, throughput страдает.
OasisKV решает это через lookahead sparse prefetching: вместо того чтобы тащить весь KV-кэш в GPU, система заранее предсказывает нужные блоки. Для предсказания используются черновые токены из speculative decoding (EAGLE-3) — они дают точный сигнал о будущих паттернах внимания без дополнительного обучения. Точность предсказания top-20 блоков достигает 96% против 84% у предыдущего токена.
Prefetch происходит асинхронно через PCIe, не блокируя decode. Добавлен умный eviction для максимального переиспользования кэша.
Результат: throughput ×1.69–2.3× по сравнению с vLLM, потеря точности < 0.7 пунктов. Работает в multi-GPU и PD-disaggregation сетапах.
https://arxiv.org/abs/2608.08097
Агентные задачи — веб-браузинг, кодинг-агенты — требуют в 10× больше контекста, чем обычный чат. KV-кэш не влезает в HBM, батч падает до единиц запросов, throughput страдает.
OasisKV решает это через lookahead sparse prefetching: вместо того чтобы тащить весь KV-кэш в GPU, система заранее предсказывает нужные блоки. Для предсказания используются черновые токены из speculative decoding (EAGLE-3) — они дают точный сигнал о будущих паттернах внимания без дополнительного обучения. Точность предсказания top-20 блоков достигает 96% против 84% у предыдущего токена.
Prefetch происходит асинхронно через PCIe, не блокируя decode. Добавлен умный eviction для максимального переиспользования кэша.
Результат: throughput ×1.69–2.3× по сравнению с vLLM, потеря точности < 0.7 пунктов. Работает в multi-GPU и PD-disaggregation сетапах.
https://arxiv.org/abs/2608.08097
OpenAI расширяет программу Daybreak: теперь авторизованным исследователям безопасности доступна специализированная модель GPT-5.6-Cyber через платформу Daybreak Red.
Модель заточена под конкретные задачи: поиск уязвимостей, валидация эксплойтов и тестирование безопасности систем. Это не универсальный ChatGPT — это инструмент для профессионалов в сфере кибербезопасности с ограниченным доступом.
Почему это важно? Окно киберзащиты сужается — атаки становятся быстрее и сложнее. OpenAI делает ставку на то, что AI должен помогать защитникам опережать атакующих, а не наоборот. Доступ строго контролируется, чтобы мощные возможности модели не оказались в руках злоумышленников.
Для рядовых пользователей модель недоступна — только для верифицированных участников программы Daybreak Red.
https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
Модель заточена под конкретные задачи: поиск уязвимостей, валидация эксплойтов и тестирование безопасности систем. Это не универсальный ChatGPT — это инструмент для профессионалов в сфере кибербезопасности с ограниченным доступом.
Почему это важно? Окно киберзащиты сужается — атаки становятся быстрее и сложнее. OpenAI делает ставку на то, что AI должен помогать защитникам опережать атакующих, а не наоборот. Доступ строго контролируется, чтобы мощные возможности модели не оказались в руках злоумышленников.
Для рядовых пользователей модель недоступна — только для верифицированных участников программы Daybreak Red.
https://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows
OpenAI
Expanding Daybreak as the Cyber Defense Window Narrows
Meet GPT-5.6-Cyber, OpenAI’s cybersecurity-specific model available through Daybreak Red for authorized vulnerability research, exploit validation, and security testing.
Microsoft Research представила CARE-X — исследовательскую модель для анализа рентгеновских снимков грудной клетки.
Что это такое: единая мультизадачная система на базе SigLIP2 и Phi-4-mini, которая умеет и генерировать текстовые заключения, и выдавать структурированные диагнозы с оценкой уверенности.
Ключевые особенности: модель обучена через reinforcement learning (DAPO) с клинически значимыми наградами — ошибка в диагнозе штрафуется сильнее, чем стилистическая. Для измерительных находок вроде кардиомегалии используются детерминированные инструменты расчёта, а не визуальная оценка на глаз. Валидация проводилась на реальных индийских клинических данных.
Почему важно: большинство радиологических AI-моделей либо генерируют текст, либо классифицируют — CARE-X совмещает оба подхода. Это потенциально полезно для реальных рабочих процессов.
Важная оговорка: это исследовательский прототип, не одобренный регуляторами и не предназначенный для клинического применения.
https://www.microsoft.com/en-us/research/blog/introducing-care-x-towards-clinically-useful-radiology-vlms-with-auxiliary-supervision-reward-aligned-learning-and-tool-augmented-measurement/
Что это такое: единая мультизадачная система на базе SigLIP2 и Phi-4-mini, которая умеет и генерировать текстовые заключения, и выдавать структурированные диагнозы с оценкой уверенности.
Ключевые особенности: модель обучена через reinforcement learning (DAPO) с клинически значимыми наградами — ошибка в диагнозе штрафуется сильнее, чем стилистическая. Для измерительных находок вроде кардиомегалии используются детерминированные инструменты расчёта, а не визуальная оценка на глаз. Валидация проводилась на реальных индийских клинических данных.
Почему важно: большинство радиологических AI-моделей либо генерируют текст, либо классифицируют — CARE-X совмещает оба подхода. Это потенциально полезно для реальных рабочих процессов.
Важная оговорка: это исследовательский прототип, не одобренный регуляторами и не предназначенный для клинического применения.
https://www.microsoft.com/en-us/research/blog/introducing-care-x-towards-clinically-useful-radiology-vlms-with-auxiliary-supervision-reward-aligned-learning-and-tool-augmented-measurement/
Microsoft Research
A new approach to radiology AI
Radiology AI is evolving beyond report generation. CARE-X explores a unified approach that combines flexible reasoning, calibrated predictions, and measurement-based tools for chest X-ray interpretation.