Apple ML представила метод защиты весов языковых моделей от несанкционированной дообучки.
Исследователи предложили DLR-Lock — способ «заблокировать» открытые веса модели от нежелательного файн-тюнинга. Идея в том, чтобы заменить каждый MLP-блок в модели на глубокую низкоранговую остаточную сеть (DLR-Net). Это создаёт асимметрию между прямым и обратным проходом: инференс работает нормально, а backpropagation требует памяти, которая растёт линейно с глубиной сети — файн-тюнинг становится непрактично дорогим.
Почему важно: открытые модели легко адаптировать под запрещённые сценарии. DLR-Lock усложняет это даже для атакующего, который знает архитектуру и стратегию защиты. При этом качество оригинальной модели сохраняется.
Для рядовых пользователей ничего не меняется — модель работает как обычно. Но для тех, кто хочет её «перекрутить», жизнь станет заметно сложнее.
https://machinelearning.apple.com/research/locking-pretrained-weights
Исследователи предложили DLR-Lock — способ «заблокировать» открытые веса модели от нежелательного файн-тюнинга. Идея в том, чтобы заменить каждый MLP-блок в модели на глубокую низкоранговую остаточную сеть (DLR-Net). Это создаёт асимметрию между прямым и обратным проходом: инференс работает нормально, а backpropagation требует памяти, которая растёт линейно с глубиной сети — файн-тюнинг становится непрактично дорогим.
Почему важно: открытые модели легко адаптировать под запрещённые сценарии. DLR-Lock усложняет это даже для атакующего, который знает архитектуру и стратегию защиты. При этом качество оригинальной модели сохраняется.
Для рядовых пользователей ничего не меняется — модель работает как обычно. Но для тех, кто хочет её «перекрутить», жизнь станет заметно сложнее.
https://machinelearning.apple.com/research/locking-pretrained-weights
Apple Machine Learning Research
Locking Pretrained Weights via Deep Low-Rank Residual Distillation
The quality of open-weight language models has dramatically improved in recent years. Sharing weights greatly facilitates model adoption by…
Apple ML выпустила новый бенчмарк DeepAmbigQA для оценки полноты ответов языковых моделей.
Исследователи создали датасет из 3600 вопросов, требующих многошагового рассуждения и разрешения неоднозначности имён — например, "Какой актёр из фильма «Жара» получил Оскар?", где существует несколько фильмов с одинаковым названием.
Главная находка: даже GPT-5 справляется плохо — всего 0.13 точных совпадений на неоднозначных вопросах и 0.21 на обычных. Это показывает, что современные модели с поиском умеют находить ответы, но часто дают неполные или однобокие результаты.
Для генерации данных создан автоматический пайплайн DeepAmbigQAGen, который строит вопросы на основе текстовых корпусов и графов знаний.
Практический вывод: AI-ассистенты пока ненадёжны в задачах, где важна полнота ответа, а не просто его наличие.
https://machinelearning.apple.com/research/deepambigqa-multihop-questions
Исследователи создали датасет из 3600 вопросов, требующих многошагового рассуждения и разрешения неоднозначности имён — например, "Какой актёр из фильма «Жара» получил Оскар?", где существует несколько фильмов с одинаковым названием.
Главная находка: даже GPT-5 справляется плохо — всего 0.13 точных совпадений на неоднозначных вопросах и 0.21 на обычных. Это показывает, что современные модели с поиском умеют находить ответы, но часто дают неполные или однобокие результаты.
Для генерации данных создан автоматический пайплайн DeepAmbigQAGen, который строит вопросы на основе текстовых корпусов и графов знаний.
Практический вывод: AI-ассистенты пока ненадёжны в задачах, где важна полнота ответа, а не просто его наличие.
https://machinelearning.apple.com/research/deepambigqa-multihop-questions
Apple Machine Learning Research
DeepAmbigQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
Large language models (LLMs) with integrated search tools show strong promise in open-domain question answering (QA), yet they often…
Как научить агента понимать, какой именно шаг в многоходовой задаче был решающим?
Классическая проблема RL для агентов: получил награду в конце, но какой из 20 ходов реально помог? GRPO просто раздаёт одинаковый сигнал всем токенам траектории.
AgentOPSD решает это байесовски. Идея: запускаем два форварда — обычный и с "подсказкой успеха" (skill prompt). Разница в log-вероятностях на каждом шаге — это и есть байесовское свидетельство того, насколько этот ход приближал к успеху. Накапливаем это свидетельство рекурсивно через траекторию, обновляя байесовское убеждение о вероятности успеха.
Итог: каждый ход получает свой вес advantage — не одинаковый для всей траектории, а пропорциональный реальному вкладу. При этом знак advantage сохраняется (плохая траектория не станет хорошей), а overhead — всего один дополнительный форвард на траекторию.
На ALFWorld, WebShop и Search-QA агент из Tsinghua бьёт GRPO и все аналоги (RLSD, SDAR, StepOPSD).
https://arxiv.org/abs/2608.05987
Классическая проблема RL для агентов: получил награду в конце, но какой из 20 ходов реально помог? GRPO просто раздаёт одинаковый сигнал всем токенам траектории.
AgentOPSD решает это байесовски. Идея: запускаем два форварда — обычный и с "подсказкой успеха" (skill prompt). Разница в log-вероятностях на каждом шаге — это и есть байесовское свидетельство того, насколько этот ход приближал к успеху. Накапливаем это свидетельство рекурсивно через траекторию, обновляя байесовское убеждение о вероятности успеха.
Итог: каждый ход получает свой вес advantage — не одинаковый для всей траектории, а пропорциональный реальному вкладу. При этом знак advantage сохраняется (плохая траектория не станет хорошей), а overhead — всего один дополнительный форвард на траекторию.
На ALFWorld, WebShop и Search-QA агент из Tsinghua бьёт GRPO и все аналоги (RLSD, SDAR, StepOPSD).
https://arxiv.org/abs/2608.05987
Агент наконец узнает, чем ты занимался весь день — без единого LLM в пайплайне
LLM-агенты помнят только разговоры, но не то, что ты реально делал: 40 переключений контекста после обеда, брошенный черновик письма в 16:40. Сырые логи экрана — это ~126k токенов за день, LLM-суммаризация — галлюцинации и недетерминизм.
Автор предлагает детерминистическую компиляцию: поток снапшотов экрана → "activity frames" (эпизоды с приложением, временем, активными минутами, ссылками на сырые строки). Никакой модели в пайплайне — одинаковые входные данные всегда дают байт-в-байт одинаковый результат.
Результат: сжатие в 86 раз, компиляция за 68 мс, агент отвечает точнее на вопросы о дне по сравнению с сырыми логами или LLM-суммари. Средний тир модели догоняет фронтирный.
Реализация — Python без зависимостей + MCP-сервер для любого агента.
https://arxiv.org/abs/2608.05784
LLM-агенты помнят только разговоры, но не то, что ты реально делал: 40 переключений контекста после обеда, брошенный черновик письма в 16:40. Сырые логи экрана — это ~126k токенов за день, LLM-суммаризация — галлюцинации и недетерминизм.
Автор предлагает детерминистическую компиляцию: поток снапшотов экрана → "activity frames" (эпизоды с приложением, временем, активными минутами, ссылками на сырые строки). Никакой модели в пайплайне — одинаковые входные данные всегда дают байт-в-байт одинаковый результат.
Результат: сжатие в 86 раз, компиляция за 68 мс, агент отвечает точнее на вопросы о дне по сравнению с сырыми логами или LLM-суммари. Средний тир модели догоняет фронтирный.
Реализация — Python без зависимостей + MCP-сервер для любого агента.
https://arxiv.org/abs/2608.05784
Видеомодель как мозг робота: 3x ускорение без потери качества (by Huawei)
World Action Models (WAM) — роботы, управляемые видеомоделями физической динамики — круто работают, но медленно: 211 мс на чанк действий против 71 мс у VLA-моделей. Авторы решили это архитектурно.
Идея: зачем делать глубокий action-трансформер, если видеомодель уже выучила физику? Пусть action head будет лёгким, но "докнется" ко всем слоям видеобэкбона сразу.
Так появился Dock of Transformers (DoT): видео-DiT — центральный хаб, а task-specific головы подключаются через docking interface. Конкретно — KV-Fusion собирает ключи и значения со всех L слоёв видеобэкбона и отдаёт их в единственный слой action DiT.
Результат — Faster-WAM: 66.5 мс на чанк (3.2x быстрее Fast-WAM, быстрее π0 и π0.5), при этом 98.5% на LIBERO и +23.5 п.п. над Fast-WAM на LIBERO-Plus.
https://arxiv.org/abs/2608.02365
World Action Models (WAM) — роботы, управляемые видеомоделями физической динамики — круто работают, но медленно: 211 мс на чанк действий против 71 мс у VLA-моделей. Авторы решили это архитектурно.
Идея: зачем делать глубокий action-трансформер, если видеомодель уже выучила физику? Пусть action head будет лёгким, но "докнется" ко всем слоям видеобэкбона сразу.
Так появился Dock of Transformers (DoT): видео-DiT — центральный хаб, а task-specific головы подключаются через docking interface. Конкретно — KV-Fusion собирает ключи и значения со всех L слоёв видеобэкбона и отдаёт их в единственный слой action DiT.
Результат — Faster-WAM: 66.5 мс на чанк (3.2x быстрее Fast-WAM, быстрее π0 и π0.5), при этом 98.5% на LIBERO и +23.5 п.п. над Fast-WAM на LIBERO-Plus.
https://arxiv.org/abs/2608.02365
Apple ML представила масштабируемую альтернативу авторегрессионным языковым моделям.
Исследователи обучили модель на 1,7 млрд параметров и 2,1 трлн токенов, используя подход Categorical Flow Maps (CFM) — метод генерации текста через непрерывные потоки вместо привычного пошагового предсказания токенов.
Главный результат: модель генерирует качественный текст всего за 4 шага вместо сотен итераций у классических диффузионных моделей. При этом сохраняется разнообразие и естественность текста.
Почему важно: до этого CFM тестировали только на моделях меньше 1 млрд параметров — оставалось неясным, работает ли подход в реальных масштабах. Теперь ответ есть: работает. Это открывает путь к более быстрым и дешёвым языковым моделям без потери качества.
Для пользователей это может означать более отзывчивые AI-ассистенты с меньшими вычислительными затратами в будущем.
https://machinelearning.apple.com/research/scaling-categorical-flow-maps
Исследователи обучили модель на 1,7 млрд параметров и 2,1 трлн токенов, используя подход Categorical Flow Maps (CFM) — метод генерации текста через непрерывные потоки вместо привычного пошагового предсказания токенов.
Главный результат: модель генерирует качественный текст всего за 4 шага вместо сотен итераций у классических диффузионных моделей. При этом сохраняется разнообразие и естественность текста.
Почему важно: до этого CFM тестировали только на моделях меньше 1 млрд параметров — оставалось неясным, работает ли подход в реальных масштабах. Теперь ответ есть: работает. Это открывает путь к более быстрым и дешёвым языковым моделям без потери качества.
Для пользователей это может означать более отзывчивые AI-ассистенты с меньшими вычислительными затратами в будущем.
https://machinelearning.apple.com/research/scaling-categorical-flow-maps
Apple Machine Learning Research
Scaling Categorical Flow Maps
Continuous diffusion and flow matching models could represent a powerful alternative to autoregressive approaches for language modelling…
Apple ML сравнила диффузионные и авторегрессионные языковые модели
Исследователи Apple ML опубликовали работу, в которой детально сравнили два подхода к генерации текста: привычные авторегрессионные модели (ARM) и диффузионные языковые модели (DLM).
Ключевые выводы: DLM генерируют токены параллельно, что даёт им преимущество по вычислительной интенсивности — но только на коротких контекстах. При длинных текстах они плохо масштабируются. ARM же при батчевом инференсе показывают лучшую пропускную способность, эффективнее используя параллелизм по запросам.
Авторы предлагают блочное декодирование для DLM — это отвязывает вычислительную интенсивность от длины контекста и улучшает масштабируемость. Также подчёркивается: главный путь к ускорению DLM — сокращение числа шагов сэмплирования.
Почему это важно: диффузионные модели считаются перспективной альтернативой GPT-подобным архитектурам, но до реального превосходства им ещё далеко. Apple системно обозначила узкие места — это дорожная карта для всей индустрии.
https://machinelearning.apple.com/research/diffusion-autoregressive-performance
Исследователи Apple ML опубликовали работу, в которой детально сравнили два подхода к генерации текста: привычные авторегрессионные модели (ARM) и диффузионные языковые модели (DLM).
Ключевые выводы: DLM генерируют токены параллельно, что даёт им преимущество по вычислительной интенсивности — но только на коротких контекстах. При длинных текстах они плохо масштабируются. ARM же при батчевом инференсе показывают лучшую пропускную способность, эффективнее используя параллелизм по запросам.
Авторы предлагают блочное декодирование для DLM — это отвязывает вычислительную интенсивность от длины контекста и улучшает масштабируемость. Также подчёркивается: главный путь к ускорению DLM — сокращение числа шагов сэмплирования.
Почему это важно: диффузионные модели считаются перспективной альтернативой GPT-подобным архитектурам, но до реального превосходства им ещё далеко. Apple системно обозначила узкие места — это дорожная карта для всей индустрии.
https://machinelearning.apple.com/research/diffusion-autoregressive-performance
Apple Machine Learning Research
Beyond Next-Token Prediction: A Performance Characterization of Diffusion versus Autoregressive Language Models
Large Language Models (LLMs) have achieved state-of-the-art performance on a broad range of Natural Language Processing (NLP) tasks…
Apple ML представила ARBITRAGE — новый фреймворк для ускорения инференса языковых моделей с длинными цепочками рассуждений.
Проблема: стандартное Speculative Decoding (быстрая черновая модель предлагает токены, мощная модель проверяет) плохо работает в задачах рассуждения — слишком много лишних отклонений из-за семантически эквивалентных, но текстуально разных шагов.
Что нового: ARBITRAGE работает на уровне шагов рассуждения, а не отдельных токенов. Лёгкий роутер предсказывает, когда большая модель даст реально лучший результат, и только тогда к ней обращается. Это приближается к "идеальному оракулу", который всегда выбирает лучший шаг.
Результат: до 2x снижение задержки при сохранении точности на математических бенчмарках.
Почему важно: эффективный инференс — ключ к удешевлению AI-сервисов. Такие техники напрямую влияют на то, сколько стоит запустить умную модель на устройстве или в облаке.
https://machinelearning.apple.com/research/arbitrage-efficient-reasoning
Проблема: стандартное Speculative Decoding (быстрая черновая модель предлагает токены, мощная модель проверяет) плохо работает в задачах рассуждения — слишком много лишних отклонений из-за семантически эквивалентных, но текстуально разных шагов.
Что нового: ARBITRAGE работает на уровне шагов рассуждения, а не отдельных токенов. Лёгкий роутер предсказывает, когда большая модель даст реально лучший результат, и только тогда к ней обращается. Это приближается к "идеальному оракулу", который всегда выбирает лучший шаг.
Результат: до 2x снижение задержки при сохранении точности на математических бенчмарках.
Почему важно: эффективный инференс — ключ к удешевлению AI-сервисов. Такие техники напрямую влияют на то, сколько стоит запустить умную модель на устройстве или в облаке.
https://machinelearning.apple.com/research/arbitrage-efficient-reasoning
Apple Machine Learning Research
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
Modern Large Language Models achieve impressive reasoning capabilities with long Chain of Thoughts, but they incur substantial computational…
Редактирование видео в реальном времени на 30 FPS — больше не фантастика
Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.
Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:
1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"
2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа
3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок
Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Представьте: вы стримите видео, а оно редактируется прямо на лету — меняется стиль, добавляются объекты, заменяется фон. Именно это делает JoyAI-Video-Edit — 16B-параметровая модель для потокового редактирования видео в реальном времени.
Главные проблемы стримингового редактирования: ошибки накапливаются со временем (дрейф), нельзя смотреть в будущее, нужна постоянная память. Авторы решают это тремя способами:
1. Chunk-wise causal attention — обрабатывает видео кусками, кешируя только последние N чанков + первый как "глобальный якорь"
2. SA-DMD (Source-Anchored Distribution Matching Distillation) — ускоряет диффузию до 2 шагов, используя исходный кадр как якорь против дрейфа
3. Long-Horizon Autoregressive Distillation — явно оптимизирует длинные роллауты против накопленных ошибок
Результат: 720p редактирование на одном Nvidia B200 при ~30 FPS. Также представлен новый бенчмарк LongV2VBench для оценки длинных потоков.
Модель учит саму себя без учителя и без правильных ответов
Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.
U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.
Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.
Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.
https://arxiv.org/abs/2608.06296
Стандартный on-policy self-distillation работает так: одна копия модели видит задачу + правильный ответ (учитель), другая — только задачу (ученик). Проблема: правильные ответы нужны извне, что дорого и не всегда доступно.
U-OPSD убирает эту зависимость полностью. Идея: сэмплируем G независимых решений от самой модели, берём majority vote как псевдо-ответ. Rollouts, согласные с большинством — это "учитель". Несогласные — "ученик". Дальше классическая дистилляция: KL-дивергенция между распределением учителя (с псевдо-решением в контексте) и ученика (без него) по токенам несогласных rollouts.
Никаких внешних меток, никакого отдельного большого учителя — только консенсус собственных генераций как сигнал.
Результат на Qwen3: +8.5–10.7 пунктов в non-thinking режиме, и при этом U-OPSD без единой метки бьёт supervised SFT и GRPO с правильными ответами.
https://arxiv.org/abs/2608.06296
Coding-агент для роботов: один шаг — одно действие — новое наблюдение
Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.
Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.
Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.
https://arxiv.org/abs/2608.03924
Большинство роботов сегодня управляются end-to-end моделями (VLA), которые сложно контролировать на длинных задачах. Авторы из USTC предлагают другой подход — Embodied Task Agent (ETA) и его open-source реализацию OpenETA.
Идея простая: над всеми инструментами и моделями стоит Planner (LLM). Он делает ровно один вызов инструмента, получает свежее наблюдение из реального мира, и только потом принимает следующее решение. Никаких длинных программ наперёд — каждый физический шаг верифицируется.
Результат на бенчмарке LIBERO: gpt-5.6-Sol решает 117/130 задач (90%) при PASS@5, без использования VLA вообще. Система также задеплоена на реальном роботе UR5e.
https://arxiv.org/abs/2608.03924
FactorJEPA: мировые модели наконец-то учатся понимать хаотичный городской трафик (by Apple/Meta)
Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?
Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.
Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.
Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Все датасеты для автономного вождения — это аккуратные американские и европейские дороги. А что насчёт Индии, где на одной полосе уживаются рикши, коровы, мотоциклы и пешеходы одновременно?
Авторы собрали DENSEWORLD — 1000 часов видео из 22 городов Индии (рынки, перекрёстки, набережные). Плотность агентов и окклюзия там принципиально выше, чем в BDD100K и nuScenes.
Проблема стандартных JEPA: предсказывают будущее одним монолитным латентным вектором. В хаотичных сценах модель учится срезать углы — использует текстуру толпы вместо реальных взаимодействий.
Решение — FactorJEPA: будущее разбивается на три явных канала: layout (разметка), agents (отдельные агенты), interactions (взаимодействия между ними). Добавлен visibility gate, чтобы не терять частично перекрытых агентов.
Argus: агент, который умеет менять цель — и это не баг, а фича
В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.
Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.
На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.
Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.
https://arxiv.org/abs/2608.05144
В долгосрочных исследовательских задачах цель часто меняется по ходу работы. Но как отличить осознанный «пивот» от банального провала? Авторы Argus предлагают ответ: верификация.
Argus — мультиагентный рантайм с четырьмя ролями: Manager (держит цель), Planner (планирует шаги), Engineer (реализует), Reviewer (независимо проверяет результат). Ключевая идея: любое изменение операционной цели должно быть подкреплено доказательствами, авторизовано нужной ролью и залогировано. Это делает пивот отличимым от дрейфа цели.
На 731 задаче SWE-Bench Pro: 466 задач прошли через независимый Reviewer, 35 были честно заблокированы (не объявлены решёнными). На зрелых этапах система тратит на 21% меньше токенов и на 15% меньше времени на задачу.
Шесть автономных научных статей — 254 миссии, 16 откатов стадий, и все дошли до сабмишна.
https://arxiv.org/abs/2608.05144
Судьи-VLM для компьютерных агентов врут в четверти случаев — и мы это наконец измерили
Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?
Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.
Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.
https://arxiv.org/abs/2607.28609
Агенты, управляющие браузером, мобилкой и десктопом, становятся мейнстримом. Чтобы их обучать и оценивать, нужен надёжный "судья" — модель, которая смотрит на траекторию агента и говорит: задача выполнена или нет. Но насколько этим судьям можно доверять?
Авторы из HKU построили OSReward — бенчмарк из 1019 человеко-размеченных траекторий на 4 платформах (web, mobile, Ubuntu, Windows). Главный вывод: даже лучшие VLM-судьи на сложных кейсах падают ниже 70%, а средний — до 52% (уровень монетки). Ключевой баг: модели верят агенту на слово — если тот заявляет "задача выполнена", судья соглашается, не глядя на экран.
Надёжные судьи (Claude Opus, GPT-5.5) стоят слишком дорого для миллионов оценок. Авторы обучили OS-Shepherd-9B/35B на 100K размеченных траекторий — точность близка к топовым моделям, но в 30-60 раз дешевле.
https://arxiv.org/abs/2607.28609
SWE-Bench ProMax: когда агенты сломались о реальный рефакторинг (by ByteDance)
SWE-bench Verified уже не торт — лучшие агенты решают 75%+ задач. Поэтому ByteDance сделали бенчмарк, где лучший результат — всего 41%.
Идея простая: взяли реальные коммиты с рефакторингом из GitHub, 170 задач на 7 языках (Python, Java, TypeScript, Go, C, C++, Rust). Масштаб принципиально другой: в SWE-bench Verified 86% задач трогают 1 файл, а тут 30% задач требуют изменений в 10+ файлах, 32% — более 200 строк кода. Пример: рефакторинг NASA F'Prime затрагивает 244 файла.
Главный вывод: агенты стабильно фейлятся на кросс-файловой координации — в провальных попытках они меняют меньше файлов, чем нужно, но тратят больше раундов взаимодействия.
Бонус: Claude Sonnet 4.6 стоит $4.77 за задачу и решает 38.8%, а GLM-5 решает 36.5% за $0.24. Дороже ≠ лучше.
https://arxiv.org/abs/2608.09802
SWE-bench Verified уже не торт — лучшие агенты решают 75%+ задач. Поэтому ByteDance сделали бенчмарк, где лучший результат — всего 41%.
Идея простая: взяли реальные коммиты с рефакторингом из GitHub, 170 задач на 7 языках (Python, Java, TypeScript, Go, C, C++, Rust). Масштаб принципиально другой: в SWE-bench Verified 86% задач трогают 1 файл, а тут 30% задач требуют изменений в 10+ файлах, 32% — более 200 строк кода. Пример: рефакторинг NASA F'Prime затрагивает 244 файла.
Главный вывод: агенты стабильно фейлятся на кросс-файловой координации — в провальных попытках они меняют меньше файлов, чем нужно, но тратят больше раундов взаимодействия.
Бонус: Claude Sonnet 4.6 стоит $4.77 за задачу и решает 38.8%, а GLM-5 решает 36.5% за $0.24. Дороже ≠ лучше.
https://arxiv.org/abs/2608.09802
Motif 3: 314 млрд параметров с хитрым вниманием
Motif Technologies выкатили технический отчёт о Motif 3 — MoE-модели на 314B параметров, где на каждый токен активируется лишь 13.2B. Фишка: 384 эксперта в каждом слое, но выбираются только 8. Это огромный пул экспертизы при минимальных вычислениях на токен.
Главная архитектурная новинка — Grouped Differential Latent Attention (GDLA). Идея: скрещиваем Differential Attention (вычитаем "шумовое" внимание из "сигнального") с MLA от DeepSeek (сжимаем KV-кэш через латентные представления). В итоге GDLA достигает того же лосса на 9.2% меньшем числе токенов, чем чистый MLA.
Пост-трейнинг тоже интересный: сначала обучают 7 специализированных "учителей" (6 через GRPO по доменам + 1 SFT для software engineering), потом дистиллируют всех в одну модель через Multi-teacher On-Policy Distillation.
https://arxiv.org/abs/2608.09119
Motif Technologies выкатили технический отчёт о Motif 3 — MoE-модели на 314B параметров, где на каждый токен активируется лишь 13.2B. Фишка: 384 эксперта в каждом слое, но выбираются только 8. Это огромный пул экспертизы при минимальных вычислениях на токен.
Главная архитектурная новинка — Grouped Differential Latent Attention (GDLA). Идея: скрещиваем Differential Attention (вычитаем "шумовое" внимание из "сигнального") с MLA от DeepSeek (сжимаем KV-кэш через латентные представления). В итоге GDLA достигает того же лосса на 9.2% меньшем числе токенов, чем чистый MLA.
Пост-трейнинг тоже интересный: сначала обучают 7 специализированных "учителей" (6 через GRPO по доменам + 1 SFT для software engineering), потом дистиллируют всех в одну модель через Multi-teacher On-Policy Distillation.
https://arxiv.org/abs/2608.09119
8.3 миллиарда виртуальных пользователей для тестирования ваших продуктов
Представьте: вместо найма тысяч тестировщиков — запускаете симуляцию с миллиардами виртуальных пользователей с разными характеристиками. Именно это предлагает MatrAIx.
Суть: авторы создали базу из 8.3 млрд персон (Persona 8B) по 1290 параметрам — психология, навыки, поведение, образ жизни. Часть персон синтетическая (с зависимостями и правилами совместимости), часть — на основе реальных данных: Wikipedia, Amazon Reviews, Stack Overflow и опросов.
Дальше эти персоны запускаются как агенты в 4 средах: опросы, чат-боты, веб-браузер и мобильные приложения. Агенты взаимодействуют с системой, как реальные пользователи с разными потребностями.
Результат: в 91.5% случаев агент ведёт себя в соответствии с назначенной персоной. Люди оценили качество персон на 4.1/5, а Claude Opus попал в пределах одного балла в 93.8% сравнений.
https://arxiv.org/abs/2608.04205
Представьте: вместо найма тысяч тестировщиков — запускаете симуляцию с миллиардами виртуальных пользователей с разными характеристиками. Именно это предлагает MatrAIx.
Суть: авторы создали базу из 8.3 млрд персон (Persona 8B) по 1290 параметрам — психология, навыки, поведение, образ жизни. Часть персон синтетическая (с зависимостями и правилами совместимости), часть — на основе реальных данных: Wikipedia, Amazon Reviews, Stack Overflow и опросов.
Дальше эти персоны запускаются как агенты в 4 средах: опросы, чат-боты, веб-браузер и мобильные приложения. Агенты взаимодействуют с системой, как реальные пользователи с разными потребностями.
Результат: в 91.5% случаев агент ведёт себя в соответствии с назначенной персоной. Люди оценили качество персон на 4.1/5, а Claude Opus попал в пределах одного балла в 93.8% сравнений.
https://arxiv.org/abs/2608.04205
👍1
Nvidia + Meta: локальные AI-агенты без облака
Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров с контекстным окном 120K+ токенов, заточенную под агентные задачи. Главная фишка — работает полностью локально на железе NVIDIA.
Что важно: плотная архитектура активирует все параметры на каждый токен, без роутинга как в MoE-моделях. Это даёт стабильность, предсказуемую задержку и надёжное следование инструкциям — то, что нужно для сложных многошаговых сценариев.
Скорость — свыше 20K токенов/сек на одном GPU Blackwell Ultra. Модель помещается в VRAM без шардинга, что делает её пригодной для RTX 5090, DGX Spark, DGX Station и Jetson.
Для пользователей это означает: личные файлы, код и документы не покидают устройство. Развернуть можно через NVIDIA NIM, vLLM или SGLang. Веса доступны на HuggingFace.
https://developer.nvidia.com/blog/run-local-agentic-ai-workflows-with-metas-muse-glimmer-on-nvidia/
Meta выпустила Muse Glimmer — открытую модель на 30 млрд параметров с контекстным окном 120K+ токенов, заточенную под агентные задачи. Главная фишка — работает полностью локально на железе NVIDIA.
Что важно: плотная архитектура активирует все параметры на каждый токен, без роутинга как в MoE-моделях. Это даёт стабильность, предсказуемую задержку и надёжное следование инструкциям — то, что нужно для сложных многошаговых сценариев.
Скорость — свыше 20K токенов/сек на одном GPU Blackwell Ultra. Модель помещается в VRAM без шардинга, что делает её пригодной для RTX 5090, DGX Spark, DGX Station и Jetson.
Для пользователей это означает: личные файлы, код и документы не покидают устройство. Развернуть можно через NVIDIA NIM, vLLM или SGLang. Веса доступны на HuggingFace.
https://developer.nvidia.com/blog/run-local-agentic-ai-workflows-with-metas-muse-glimmer-on-nvidia/
NVIDIA Technical Blog
Run Local Agentic AI Workflows with Meta’s Muse Glimmer on NVIDIA
Meta returns to the open source ecosystem with the release of Muse Glimmer, a 30B open-weight dense model with a 120K+ context window built for local AI agentic work. Optimized to run across a range…
Amazon Science запускает AWS Trainium Frontier — соревнование для исследователей, которые хотят понять, как меняется оптимальная архитектура языковых моделей при смене железа.
Суть: участники обучают языковые модели с нуля на чипах Trainium2, меняя всё — архитектуру, оптимизатор, кастомные ядра. Стартовая точка — базовая GPT-подобная модель на ~50M параметров, потолка нет.
Два этапа: 30 минут на одном чипе (Phase 1) и 4 часа на полном сервере для топ-10 команд (Phase 2), где добавляется оценка качества инференса.
Почему важно: современные LLM-архитектуры выросли под GPU. Trainium имеет другой баланс памяти и вычислений — и оптимальные решения здесь могут быть принципиально иными. Это шанс первыми это выяснить.
Призы: $25K за первое место, публикации совместно с Annapurna Labs, церемония на NeurIPS 2026 в Сиднее.
https://www.amazon.science/news/aws-trainium-frontier-competition-co-design-models-and-kernels-on-purpose-built-ai-chips
Суть: участники обучают языковые модели с нуля на чипах Trainium2, меняя всё — архитектуру, оптимизатор, кастомные ядра. Стартовая точка — базовая GPT-подобная модель на ~50M параметров, потолка нет.
Два этапа: 30 минут на одном чипе (Phase 1) и 4 часа на полном сервере для топ-10 команд (Phase 2), где добавляется оценка качества инференса.
Почему важно: современные LLM-архитектуры выросли под GPU. Trainium имеет другой баланс памяти и вычислений — и оптимальные решения здесь могут быть принципиально иными. Это шанс первыми это выяснить.
Призы: $25K за первое место, публикации совместно с Annapurna Labs, церемония на NeurIPS 2026 в Сиднее.
https://www.amazon.science/news/aws-trainium-frontier-competition-co-design-models-and-kernels-on-purpose-built-ai-chips
Amazon Science
AWS Trainium Frontier competition: Co-design models and kernels on purpose-built AI chips
A competition with a finalist ceremony during NeurIPS 2026, challenging researchers to train language models from scratch on Trainium, exploring what optimal architectures look like when the hardware changes.
Модель, которая учится после деплоя — не утопия, а инженерная задача
Macaron-V1 от Mind Lab — попытка построить LLM-систему с настоящим continual learning. Идея: вместо дообучения всей модели держим базу замороженной и навешиваем специализированные LoRA-адаптеры (Mixture of LoRA, MoL). Каждый адаптер — отдельный специалист (агент, кодинг, UI и т.д.), маршрутизация выбирает нужного на каждый턴 пользователя.
Главная фишка — рекурсивное самоулучшение: опыт из продакшна аудируется, строятся новые задачи, отбираются траектории, и только они идут в дообучение адаптеров. Так модель эволюционирует версия за версией без catastrophic forgetting.
Флагман — Macaron-V1-Venti (748B на базе GLM-5.2) + компактный Macaron-V1-Tall (50B на Qwen3). Оба используют одну и ту же схему из четырёх LoRA-специалистов. Похоже на MoE, но база не трогается — только адаптеры растут и обновляются.
https://arxiv.org/abs/2608.09819
Macaron-V1 от Mind Lab — попытка построить LLM-систему с настоящим continual learning. Идея: вместо дообучения всей модели держим базу замороженной и навешиваем специализированные LoRA-адаптеры (Mixture of LoRA, MoL). Каждый адаптер — отдельный специалист (агент, кодинг, UI и т.д.), маршрутизация выбирает нужного на каждый턴 пользователя.
Главная фишка — рекурсивное самоулучшение: опыт из продакшна аудируется, строятся новые задачи, отбираются траектории, и только они идут в дообучение адаптеров. Так модель эволюционирует версия за версией без catastrophic forgetting.
Флагман — Macaron-V1-Venti (748B на базе GLM-5.2) + компактный Macaron-V1-Tall (50B на Qwen3). Оба используют одну и ту же схему из четырёх LoRA-специалистов. Похоже на MoE, но база не трогается — только адаптеры растут и обновляются.
https://arxiv.org/abs/2608.09819
👏1
Агент, который улучшает сам себя — и не сходит с ума
Ouroboros — это coding-агент, у которого харнесс (scaffolding) не заморожен после деплоя, а живёт в git-репозитории и эволюционирует через ревью-коммиты. Два режима: агент сам инициирует улучшения (free evolution) или патчит себя по итогам обычных задач (experience-driven). Любое изменение кода проходит через diff-review пайплайн с fingerprinting и rollback — иначе агент мог бы "случайно" ослабить собственные ограничения.
Самое интересное — живой эксперимент Hope: с февраля 2026 один персистентный агент 161 день работает с пользователями, получает фидбек, сам решает какие предложения реализовать, и продолжает модифицировать свою реализацию. При этом commit authority у пользователей нет — только у агента.
SOTA на Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Код открыт (MIT).
https://arxiv.org/abs/2608.08311
Ouroboros — это coding-агент, у которого харнесс (scaffolding) не заморожен после деплоя, а живёт в git-репозитории и эволюционирует через ревью-коммиты. Два режима: агент сам инициирует улучшения (free evolution) или патчит себя по итогам обычных задач (experience-driven). Любое изменение кода проходит через diff-review пайплайн с fingerprinting и rollback — иначе агент мог бы "случайно" ослабить собственные ограничения.
Самое интересное — живой эксперимент Hope: с февраля 2026 один персистентный агент 161 день работает с пользователями, получает фидбек, сам решает какие предложения реализовать, и продолжает модифицировать свою реализацию. При этом commit authority у пользователей нет — только у агента.
SOTA на Terminal-Bench 2.1, OSWorld-Verified и CL-Bench. Код открыт (MIT).
https://arxiv.org/abs/2608.08311
🤝1