Душный NLP
6.56K subscribers
273 photos
2 videos
1 file
145 links
Разборы свежих статей от NLP-специалистов Яндекса. Подробно, полезно, с душ(нот)ой.

Вопросы и предложения > @yandex_ml_brand
Download Telegram
TG-RAG: A Retrieval-Augmented Framework for Reasoning Guidance in Specialized Domains

Продолжаем рассказывать об интересных работах с ICML 2026. Сегодня наш коллега, Сергей Юдин, разберёт статью об идее, как можно справляться с когнитивным дрейфом больших моделей в узких областях: таких как финансы, медицина и юриспруденция. Этот подход может быть релевантен Нейроюристу.

Большие рассуждающие модели (Deepseek-R1, Qwen3) хорошо думают «в общем», но буксуют в областях, где нужно строго следовать регламенту или стандартной операционной процедуре (SOP). Проблема в том, что на длинных цепочках рассуждений модель «сползает»: пропускает шаги, придумывает свои, отвлекается. Авторы называют это Cognitive Drift («когнитивный дрейф»).

Обычные способы лечить этот дрейф работают плохо. Если запихнуть инструкцию в промпт, то модель следует ей только на первых шагах, но по ходу длинного рассуждения эффект уменьшается. Дообучать модель дорого и негибко, а знания быстро устаревают. Даже классический RAG подкидывает регламент как «справочный текст рядом» — то есть, как совет, который модель вольна проигнорировать.

Идея авторов TG-RAG (Thought Guidance-Retrieval Augmented Generation) — не советовать что-то модели, а встраивать нужный шаг прямо в поток рассуждения в момент, когда это нужно.

Работает на двух компонентах:

1. EPG (Expert Procedure Graph). Регламент формализуют в граф с топологией Chain-of-Trees (цепочка стадий + деревья решений на развилках). В каждом узле разделены директива (что делать) и знание (чем подкрепить) — это изолирует ошибки и позволяет обновлять факты, не трогая логику. Строится полуавтоматом: модель парсит документы, эксперт лишь проверяет ветки (около 30 минут на домен).

2. Механизм IRG (Interrupt-Retrieve-Generate). Генерацию прерывают на границе шага → модель по своему же анализу выбирает следующую ветку графа → директиву впрыскивают в поток рассуждения, а факты — в контекст. И так до конца задачи. Директива становится более жёстким ограничением, от которого модели трудно отклониться.


#YaICML2026

Душный NLP
109🔥6
На ICML 2026 только и разговоров, что о GRPO

Что ещё привезли на конференцию авторы постерных докладов, рассказываем в новом обзоре!

Multi-Agent Teams Hold Experts Back

Забавная статья: авторы утверждают, что мультиагентная команда может портить результаты одного эксперта. Агенты скорее ищут компромисс, а не лучший ответ, и не слушаются эксперта, даже если обозначить его в промпте. Люди тоже склонны к такому поведению, но не так сильно, как LLM.

AgentSuite: Toward More Reliable Agent Evaluation with a Component-Based Benchmark Auditing Pipeline

Пайплайн для очистки и правки агентских бенчей. Сделали хорошую таксономию ошибок, подобрали judge'eй для поиска и исправления. Хорошо согласовано с людьми, находило много ошибок в первых версиях τ-бенча. Подходит для проверки запуска агентских бенчей и фильтрации траекторий.

FormulaCode: Evaluating Agentic Optimization on Large Codebases

Намайнили 900 задач на оптимизацию скорости из 245K пул-реквестов в 70+ научных Python-репозиториях. Фильтровали эвристиками, LLM, а потом и людьми.

Для каждой задачи сделали снэпшот репозитория, экспертный патч и кучу нагрузочных ворклоадов. Модель должна ускорять код, не сломав корректность (по юниттестам). Условно, ей задают какие из 50+ метрик можно замерять или ускорять, а она должна решить, что оптимизирует.

Скор — Δ% против человеческого патча, то есть, многокритерийные градации вместо бинарного вердикта. Даже топовым моделям тяжеловато его проходить.

Scaling Long-Horizon LLM Agent via Context-Folding

Ресёрчеры из ByteDance и Стэнфорда решают проблему контекста в задачах deepsearch.

Предлагают сделать что-то вроде селф-субагента, который называют Context Folding. Модели для этого дают два тула: Branch и return. Модель может уйти в ветку, дёргать тулы, потом вернуться из бранча и сбросить сделанный там контекст. Это позволяет неявно хендлить модели миллионы токенов и не переполняться. Все бенчи растут, +8 на BrowseCompPlus. При этом решение имплементируется гораздо легче, чем субагенты.

Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning

Авторы снижают затраты на инференс ризонящих моделей за счёт периодической суммаризации рассуждений. Модель генерирует кусок ризонинга в обычном режиме, пишет к нему короткое саммари с выводами, затем исходный ризонинг выкидывается, и дальше модель ризонит, опираясь только на саммари.

Замерялись на математических бенчах, так как в таких задачах ризонинг хорошо разбивается на отдельные логические блоки.

Для сбора SFT-датасета брали OpenR1-Math-220k и переписывали рассуждения DeepSeek так, чтобы они были разбиты на блоки с саммари.

Репортят ускорение в 3–4 раза относительно аналогичной модели с unfold-ризонингом без просадки pass@1.

Передали фото и впечатления Иван Дёгтев, Ирина Барская, Тимофей Смирнов, Михаил Коновалов

#YaICML2026

Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11👍95🤩2😐1
Оптимизируют MoE, стабилизируют RLVR, колдуют над кэшем и очень активно обсуждают GRPO: продолжаем рассказывать, что в тренде ICML 2026

Но обо всём по порядку. Читайте TL;DR от наших коллег и листайте фото с постерами!

Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs

Классная статья про стабилизацию RLVR. Авторы предлагают метрику, которая лучше всех предыдущих детектит потенциальный взрыв — effective sample size. По сути, это нормированная сумма important weight между движками актора и роллаута. Мы в Яндексе тоже её используем — работает!

Дальше авторы рассматривают два пути решения. Первый — простой (мы тоже его пробуем). Если метрика начинает стрелять, надо понижать лёрнинг рейт адаптивно.

Второй путь — умный потокенный решейпинг — чинит все проблемы сразу. RL учится 1000 степов и не разваливается, даже на специально усложнённом сетапе со staleness 12. Имплементировать, судя по описанию, должно быть легко.

TVCACHE: A Tool-Value Cache for Post-Training LLM Agents

В этой работе кэшируют последовательные цепочки туллколов в агентских роллаутах. Получается приличный кэшхит в десятки процентов. Применяют хаки типа прогрева кэша перед роллаутом. Кэш шарят по всему по времени обучения, поэтому кэшхит к концу может расти.

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

Говорят, что научились заставлять GRPO растить reward, не удлиняясь относительно инита. В GRPO вместо reward'а на R делают R • s, где s — нормализующий коэффициент, функция от относительной длины ответов в группе.

Spurious Rewards: Rethinking Training Signals in RLVR

Обучают GRPO на шумные сигналы, доходя до обучения на случайный шум. Обнаружили парадокс: в некоторых моделях Qwen обучение даже на такой «сигнал» даёт профит. Объясняют тем, что виноват клиппинг в GRPO — он чаще срабатывает на маловероятных траекториях, вероятности высоковероятных, наоборот, растут. Проверяют это, отключив клиппинг: действительно, модель перестает учиться на «испорченные» сигналы.

Revisiting Efficiency–Accuracy Scaling in Mixture-of-Experts Architectures

NVIDIA оптимизируют MoE. Обычно инференс таких архитектур упирается в пропускную способность памяти: либо перекачиваем туда-обратно экспертов на каждом токене, либо при большом батче упираемся в all-to-all.

Авторы сделали архитектуру LatentMoE — временно проецируют представления токенов в низкоразмерное латентное пространство перед маршрутизацией. Весь тяжелый сетевой трафик all-to-all и чтение экспертов из памяти происходят в сжатом формате. А на выходе из MoE-слоя данные возвращаются к исходному размеру.

Экономию при зеродифф-костах реинвестируют в увеличение числа экспертов и количество активируемых. Качество растёт — говорят, что уже используют это в Nemotron.

Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO

В GRPO при обучении ризонинг-модели на reward-сигнал генерации итогового ответа могут отличаться друг от друга, получая разную награду. В работе показывают, что часть бюджета выгодно потратить на генерации нескольких ответов при фиксированном CoT, чтобы разделить награду конкретного ответа от ожидаемой награды для цепочки (T4A4 > T16A1). На практике при правильном использовании это также экономит компьют, так как ризонинг цепочки обычно занимают бóльшую часть генерации.

Поделились впечатлениями Даниил Кириллов, Тимофей Смирнов, Даниил Гусев, Дмитрий Калашников, Алексей Зотов

#YaICML2026

Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7❤‍🔥53👍2
ICML 2026: как агенты справляются с контекстом

Об агентах и агентских системах в этом году говорили примерно все — тема стала одним из фокусов конференции. Главные тренды и новости собрала наша коллега Кристина Гуртова.

Было много работ о бенчмарках и диагностике агентов — пожалуй, самый крупный кластер. Пользовались популярностью мультиагентные системы и их обучение, agentic RL и tool use. Отдельное активное направление — safety. Общий тренд: рассматривать агента как инженерную систему, где каждый компонент (среда, обучение, оценка или память) становится отдельным объектом оптимизации.

А я углублюсь в актуальную проблему агентов: как не захлебнуться в собственном контексте. Сжимать его, сворачивать или выносить во вне?

Путь 1. Агент сам решает, что исключить из истории

Раньше агент линейно накапливал всю историю в один растущий контекст. Теперь — он ей управляет.

В Context-Folding (CMU, Stanford, ByteDance) агент разветвляет подзадачи с помощью двух тулколов: branch() создаёт подзадачу, return() возвращает итог этой подзадачи. Промежуточные шаги не попадают в основной контекст.

В Agent-Omit (HKUST) авторы посчитали, что размышления съедают около 45% токенов, наблюдения — 52%, а действия — всего 3%, поэтому их статья сфокусирована на сокращении ризонинга. Агент выборочно опускает свои мысли и наблюдения.

Conversational Inertia (ZJU, Ant) описывает отдельный побочный эффект длинной истории — «инерцию». Агент начинает имитировать собственные прошлые ответы как few-shot и перестаёт исследовать. Проблема лечится периодической очисткой истории.

Путь 2. Сжатие контекста — оптимизируемый навык, а не фиксированное правило

ACON (KAIST, Microsoft) оптимизирует не веса, а промпт для сжатия. Авторы собирают трейсы с полной и сжатой историей, сравнивают их с помощью LLM-критика и дополняют этим промпт. Затем дистиллирует такой навык компрессии в маленькую модель и используют его.

Путь 3. Внешняя память и переиспользование опыта

Ещё один вариант — не выбрасывать, а сохранять надолго.

EAM держит память как граф знаний, где узлы — это состояния системы, а рёбра — действия для перехода между ними.

Darwinian Memory — training-free память, где записи конкурируют за «выживание». Полезные переиспользуются, устаревшие и ненадёжные удаляются.

SE-GA хранит три вида памяти: эпизодическую, семантическую и экспериенциальную. Агент достаёт малую часть из каждой из них, добавляя к себе в контекст.

UMEM (Xiamen, Alibaba) обучают внешнюю модель работать с банком памяти. Для этого они замораживают модель-агента и обучают отдельный оптимизатор, что записать, обновить и удалить.

Отдельно — как это честно мерить. AMA-Bench проверяет память в реальных агентных траекториях, а не на сырых диалогах, и дополнительно показывает, что многие memory-системы пока проигрывают простому long-context.


#YaICML2026

Душный NLP
❤‍🔥1343👍3🔥1
LLMs Develop Novel Social Biases Through Adaptive Exploration

Даже если полностью вычистить bias'ы из данных, модель в агентском цикле решение → фидбек вырастит новые с нуля. Даже о группах, которых не существует — из случайного шума. Чем новее модель, тем сильнее эффект, а промптом это не лечится, нужно менять целевую функцию.

Ребята из Принстонского университета привезли на ICML 2026 доклад, в котором утверждают, что вычищать существующие стереотипы из LLM недостаточно — модель успешно вырабатывает новые сама, в рантайме.

В подробностях разобрался наш коллега Александр Краснов.

Сетап эксперимента из психологии: модель играет роль рекрутера и 40 раундов распределяет кандидатов из четырёх выдуманных этносов (Tufa, Aima, Reku, Weki) по профессиям. После каждого найма выносит вердикт: успех или провал.

Хитрость в том, что вероятность успеха у всех одинаковая — группы идентичны, и любые различия между ними модель может только выдумать. По сути, contextual bandit с шумным фидбеком.

Модель слишком мало исследует варианты и ранний случайный исход (например, «представитель Aima провалился на профессии учителя») закрепляется как впечатление обо всей группе, и к концу игры этносы разложены по своим профессиям. Вся история при этом есть в контексте, т.е. модель декларативно знает, что n=1 — не выборка, но действует при этом жадно.

По итогу эксперимента (стратификацию меряют через Stratification Index, т.е. насколько каждая группа загнана в узкий набор профессий):

• Все frontier-модели стратифицируют сильнее людей из оригинального эксперимента. У людей SI=0,84, у моделей в среднем 1,39, у o3 и Claude Sonnet — под 1,8.

• Чем новее модель, тем хуже дела: скор на классическом bias-бенчмарке BBQ обратно коррелирует с сегрегацией в итеративной игре. Сильный in-context learner увереннее делает вывод из трёх наблюдений, и эта уверенность подавляет исследование.

• В каждом прогоне bias'ы разные: паттерн рождается из шума внутри запуска, а не из претрейна. Single-turn-бенчмарки такое не ловят в принципе.

Промпт «будь справедливым» ничего не меняет. Работает только изменение самой цели. К успеху найма добавляют измеримый бонус за разнообразие, и стратификация падает ниже уровня людей и даже случайного распределения.

Хорошо, но как эта информация поможет обычному пользователю LLM?

На самом деле это касается не только «социальных» задач. Механизм срабатывает в любой длинной сессии, где модель принимает серию решений и видит исходы. Группой может быть что угодно. Агент один раз обжёгся на гипотезе «проблема в конфиге» и потом перестаёт рассматривать конфиг как класс причин. Вызов либы падает по случайной сетевой причине «библиотека не работает», дальше — костыли до конца сессии. И чем умнее модель, тем увереннее фиксация.

На практике абстрактное «будь объективным» не поможет, а сработает конкретика, встроенная в критерий успеха агента: «рассмотри минимум три гипотезы», «не отбрасывай вариант после одного провала», гейт в хуке, который не пропускает вывод без перепроверки альтернатив. По сути, мы вручную делаем исследование вариантов условием выигрыша (сам по себе агент не мотивирован). И если сессия накопила уверенные выводы из пары наблюдений, дешевле открыть свежий контекст, чем переубеждать залипшую модель.

Итого: bias — свойство не только данных, но и самого процесса принятия решений. Защищаться нужно на уровне целевой функции агента, а не датасета.



#YaICML2026

Душный NLP
18👍8🔥4🥱2
Ещё больше классных постеров из Сеула — по следам ICML 2026

RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents

Сейчас очень много агентов работает в ReAct парадигме (последовательные reasoning + acting). Авторы считают, что такой подход с длинными линейными цепочками плохо подходит для сложных задач, потому что deep search больше похож на дерево гипотез: модель может наметить несколько веток, но потом забыть часть из них, застрять в локальном направлении или зациклиться.

Re-Trac отличается от ReAct: после каждой траектории собирают compressed_state, в котором хранят лучший ответ на текущий момент, список проверенных фактов, логические выводы и список того, что осталось неизвестным. На следующих траекториях авторы стартуют с этого состояния. Благодаря этому авторы получили 53 пункта на BrowseComp с 8 rollout’ами.

Прочитав статью, я нашёл подвох: init для sft — это Tongyi-DeepResearch 3A30B, у которого и так 43 пункта на BrowseComp, а замера pass@8 — бейзлайна за схожий compute — для него нет. То есть идея интересная, но реальный эффект Re-Trac для лучшей модели из статьи не указан.

Training-Trajectory-Aware Token Selection

Исследователи изучают дистилляцию ризонящих моделей. Обычно SFT или дистилляция на reasoning-траекториях не улучшает модель, а иногда даже ухудшает её. Во время обучения loss монотонно падает, а реальные метрики сначала резко проседают (Imitation Shock), но затем постепенно восстанавливаются, при этом не всегда до конца. Авторы заметили расслоение токенов во время обучения на две группы, «полезные» и «вредные», причем одни подавляются другими. Поэтому стандартная дистилляция тратит ранние градиенты на токены, которые мешают обучению более полезных токенов.

Как решили проблему: замаскировали «вредные» токены и не добавляют их в loss. Чтобы понять, какие токены маскировать, придумали алгоритм T3S — Training-Trajectory-Aware Token Selection. Сначала модель проходит короткую фазу дистилляции, по ней находят Imitation Shock и затем сравнивают влияние токенов между началом и на чекпоинте, где всё взорвалось.

Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts

В MoE-модели каждый токен не проходит через весь FFN-блок, вместо этого роутер выбирает для него несколько экспертов. В Expert Parallelism эксперты распределены по GPU: условно, GPU-0 хранит экспертов 0–3, GPU-1 хранит 4–7 и так далее. Проблема возникает, когда роутер выбирает экспертов неравномерно. Например, на math/code данных один эксперт может стать очень популярным, потому что он специализировался на таких токенах. Тогда GPU, на которой лежит этот эксперт, получает слишком много токенов, считает дольше всех и определяет latency всего MoE-слоя.

LLEP решает это не изменением роутера, а изменением исполнения. Перед MoE-слоем система смотрит, сколько токенов попало в каждого эксперта и насколько загружена каждая GPU. Если дисбаланс маленький, используется обычный Expert Parallelism. Если дисбаланс большой, LLEP выбирает наименее загруженные GPU и отправляет туда не только токены, как в EP, но и веса перегруженного эксперта.

Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

Авторы говорят, что GRPO живёт за счёт разнообразных rollout’ов, но по ходу обучения они становятся однородными, advantage-сигнал слабеет, а прогресс встаёт. Вывели инсайт: GRPO нужно policy-level diversity — когда целые траектории структурно разные, но при этом логически связаны.

Обнаружили, что меньшие модели из этого же семейства дают гораздо больше policy-level разнообразия и предложили на ранней стадии обучения часть rollout’ов для большой модели генерировать маленькой замороженной моделью — так можно получить структурно разнообразные траектории на старте. Затем долю маленькой модели постепенно снижали, плавно возвращаясь к стабильному on-policy режиму большой модели. Результаты: на AIME24/25 получили выигрыш 23.8/22.5 против GRPO-базы 15.0/12.1.

Увидели и записали полезное для вас Даниил Кириллов, Иван Сапожков, Аркадий Альшан и Кристина Гуртова

#YaICML2026

Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
13🔥5👍4🤩2👀1