BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution
Сделать хороший Code Side-by-Side силами краудсорсинга довольно сложно: сессия оценивается не целиком, вместо полного кода — ошмётки, иногда из совершенно незнакомой оценивающим области. Сегодня разберём статью о новой платформе, которая должна решить эту проблему.
В отличие от популярной Chatbot Arena, BigCodeArena позволяет исполнять код, сгенерированный LLM, и взаимодействовать с ним и его результатами. Авторы отмечают: зачастую системы оценки слишком сосредоточены на том, чтобы код был корректным, но закрывают глаза на другие его аспекты. Например, во многих областях код рисует визуал, и этот визуал должен быть приятным.
Для этого:
• Оценивают сессию целиком с самой первой реплики — весь диалог с LLM часто бывает похож на вайб-кодинг.
• Самое главное — настроили execution sandbox, чтобы оценивающие могли увидеть результаты выполнения кода.
• Добавили возможность редактировать и запускать оцениваемый код, чтобы тестить его устойчивость.
За полгода на BigCodeArena разметили 14 тысяч сырых диалогов с LLM. 4,7 тысячи диалогов, где было больше одной реплики и происходило исполнение кода, собрали в отдельный датасет. Там всё по-честному: кроме выбора, кто лучше ответил, авторы попросили пользователей платформы оценивать корректность, эффективность, читаемость, удобство поддержки и UI/UX-кода. Собранные диалоги помогли объективно оценить, какие из моделей лучше работает ассистентами в разных областях и отдельно сравнить их как оценщиков кода.
Оценщиков кода в дальнейшем используют для того, чтобы масштабировать ту самую тяжёлую краудсорсинговую разметку. Из исследования видно, что добавление исполнения кода в контекст позволяет оценщикам точнее сравнивать два диалога-сессии.
В рейтинге моделей, лучше всего справляющихся с оценкой кода, нет ничего неожиданного: победили сильнейшие. Их никак не файнтьюнили, всё работает на обычных промптах.
Платформа BigCodeArena доступна на GitHub, датасет — на HuggingFace.
Разбор подготовил❣ Иван Каргапольцев
Душный NLP
Сделать хороший Code Side-by-Side силами краудсорсинга довольно сложно: сессия оценивается не целиком, вместо полного кода — ошмётки, иногда из совершенно незнакомой оценивающим области. Сегодня разберём статью о новой платформе, которая должна решить эту проблему.
В отличие от популярной Chatbot Arena, BigCodeArena позволяет исполнять код, сгенерированный LLM, и взаимодействовать с ним и его результатами. Авторы отмечают: зачастую системы оценки слишком сосредоточены на том, чтобы код был корректным, но закрывают глаза на другие его аспекты. Например, во многих областях код рисует визуал, и этот визуал должен быть приятным.
Для этого:
• Оценивают сессию целиком с самой первой реплики — весь диалог с LLM часто бывает похож на вайб-кодинг.
• Самое главное — настроили execution sandbox, чтобы оценивающие могли увидеть результаты выполнения кода.
• Добавили возможность редактировать и запускать оцениваемый код, чтобы тестить его устойчивость.
За полгода на BigCodeArena разметили 14 тысяч сырых диалогов с LLM. 4,7 тысячи диалогов, где было больше одной реплики и происходило исполнение кода, собрали в отдельный датасет. Там всё по-честному: кроме выбора, кто лучше ответил, авторы попросили пользователей платформы оценивать корректность, эффективность, читаемость, удобство поддержки и UI/UX-кода. Собранные диалоги помогли объективно оценить, какие из моделей лучше работает ассистентами в разных областях и отдельно сравнить их как оценщиков кода.
Оценщиков кода в дальнейшем используют для того, чтобы масштабировать ту самую тяжёлую краудсорсинговую разметку. Из исследования видно, что добавление исполнения кода в контекст позволяет оценщикам точнее сравнивать два диалога-сессии.
В рейтинге моделей, лучше всего справляющихся с оценкой кода, нет ничего неожиданного: победили сильнейшие. Их никак не файнтьюнили, всё работает на обычных промптах.
Платформа BigCodeArena доступна на GitHub, датасет — на HuggingFace.
Разбор подготовил
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9🔥6👍5
Технический отчёт Step 3.5 Flash — часть 2/2
Продолжаем разбирать техрепорт Step 3.5 Flash. В прошлый раз говорили об архитектуре, в этот — об обучении.
Предварительное обучение состояло из нескольких этапов: pretrain на базовые способности (14,6T токенов, 4K контекст). Сведение (annealing) для усиления рассуждений, кодовых и научных знаний (3T токенов, расширение конекста с 4K до 32K). Первая стадия мидтрейна для навыков SWE и использования тулов (386B токенов, 21% pretrain tokens replay, 32k контекст) и вторая стадия мидтрейна для обучения работе с длинным контекстом и агентскими сценариями (364B токенов, 128K контекст).
Для посттрейна готовят SFT-базу для экспертов в два этапа. Первый — стандартный; включает общие знания, следование инструкциям, математику, код, использование инструментов и так далее. Второй — настройка на узкие темы: экспертная химия и синтетическая арифметика. Финальный датасет состоит из 7,23B токенов, из которых 38,8% — это код. С помощью экспертов генерируют решения на промпты из SFT и заново обучают SFT, но с генерациями экспертов.
После дистилляции экспертов в SFT идёт RL. Авторы долго стремились стабилизировать обучение. Среди причин нестабильности — длинные цепочки ризонинг-генераций с отложенной наградой, возможные «скачки» градиентов при ошибке даже в одном токене и шум, возникающий, если на генерации и обучении вероятности токенов считаются по-разному.
Для стабилизации применяют Metropolized Independent Sampling — выбрасывают из обучения токены со слишком высокой или низкой активностью, а также траектории с геометрическим средним активаций выше или ниже порога. Для обрезанных по длине генераций вместо нулевого реворда берут выход value-модели как оценку возможной награды незавершённых рассуждений. Так даже при 20% оборванных генераций стабильность обучения сохраняется.
Награда считается отдельно для RLVR и RLHF. В первом случае есть две части: rule-based (для каждого среза подобран отдельный verifier) и model-based для STEM-дисциплин на основе OSS-120B со сложным промптом. В RLHF применяется генеративная награда в режиме pairwise, генерации сравниваются с использованием критерия Бредли-Терри, что позволяет уйти от абсолютных значений наград и оптимизироваться на ранжирование ответов модели.
В качестве эталона предположительно используется Replay Buffer. Для улучшения стабильности генерациям с лишним переключением языков, чрезмерной уверенностью и выдуманными цитатами присваивается награда 0. Используется мета-ревард-модель (MetaRM), которая даёт прирост на бенчмарках 0,5–3%. Для обучения реворд-модели используется дополнительный этап SFT, RL не раскрывается. Награда для агентных задач — rubric-based LLM с тернарными суждениями. Выходы ассиметрично проецируются в бинарную награду.
Данные для обучения использованию инструментов не синтезированы внешней LLM. Авторы строят жёсткий граф логики вызова инструментов: например, позволяют редактировать файл только после его открытия. Дальше генерируют данные в цикле Sample-Execute-Verify: модель вызывает инструмент, работает с ним, результаты оцениваются, фильтруются траектории с ошибками. Получается около 100K сценариев на миллиарды токенов с вызовом инструментов и без ошибок.
Для кодовых агентов модель учат генерировать среды в собственном пайплайне на основе SWE-factory. Получают 50 тысяч сред на 20 языках. Также добавляют опенсорные среды вроде SWE-smith и R2E-Gym. Что касается ресёрча и поисковых агентских сценариев, тут интересен метод отбора данных. Step 3.5 обучали только на задачах, которые DeepSeek-R1 не может решить без инструментов. Процесс гарантирует, что для решения задачи необходимо использование поиска.
Модель показывает хорошие результаты в математических бенчах. В других доменах есть просадки,но стоит помнить, что Step 3.5 Flash — значительно меньше многих конкурентов, с которыми сравнивается. В конце мая StepFun выпустила Step 3.7 Flash. Она превосходит версию 3.5 во всех бенчмарках, а в SimpleVQA обходит даже GPT-5.5.
Разбор подготовил❣ Антон Селиванов
Душный NLP
Продолжаем разбирать техрепорт Step 3.5 Flash. В прошлый раз говорили об архитектуре, в этот — об обучении.
Предварительное обучение состояло из нескольких этапов: pretrain на базовые способности (14,6T токенов, 4K контекст). Сведение (annealing) для усиления рассуждений, кодовых и научных знаний (3T токенов, расширение конекста с 4K до 32K). Первая стадия мидтрейна для навыков SWE и использования тулов (386B токенов, 21% pretrain tokens replay, 32k контекст) и вторая стадия мидтрейна для обучения работе с длинным контекстом и агентскими сценариями (364B токенов, 128K контекст).
Для посттрейна готовят SFT-базу для экспертов в два этапа. Первый — стандартный; включает общие знания, следование инструкциям, математику, код, использование инструментов и так далее. Второй — настройка на узкие темы: экспертная химия и синтетическая арифметика. Финальный датасет состоит из 7,23B токенов, из которых 38,8% — это код. С помощью экспертов генерируют решения на промпты из SFT и заново обучают SFT, но с генерациями экспертов.
После дистилляции экспертов в SFT идёт RL. Авторы долго стремились стабилизировать обучение. Среди причин нестабильности — длинные цепочки ризонинг-генераций с отложенной наградой, возможные «скачки» градиентов при ошибке даже в одном токене и шум, возникающий, если на генерации и обучении вероятности токенов считаются по-разному.
Для стабилизации применяют Metropolized Independent Sampling — выбрасывают из обучения токены со слишком высокой или низкой активностью, а также траектории с геометрическим средним активаций выше или ниже порога. Для обрезанных по длине генераций вместо нулевого реворда берут выход value-модели как оценку возможной награды незавершённых рассуждений. Так даже при 20% оборванных генераций стабильность обучения сохраняется.
Награда считается отдельно для RLVR и RLHF. В первом случае есть две части: rule-based (для каждого среза подобран отдельный verifier) и model-based для STEM-дисциплин на основе OSS-120B со сложным промптом. В RLHF применяется генеративная награда в режиме pairwise, генерации сравниваются с использованием критерия Бредли-Терри, что позволяет уйти от абсолютных значений наград и оптимизироваться на ранжирование ответов модели.
В качестве эталона предположительно используется Replay Buffer. Для улучшения стабильности генерациям с лишним переключением языков, чрезмерной уверенностью и выдуманными цитатами присваивается награда 0. Используется мета-ревард-модель (MetaRM), которая даёт прирост на бенчмарках 0,5–3%. Для обучения реворд-модели используется дополнительный этап SFT, RL не раскрывается. Награда для агентных задач — rubric-based LLM с тернарными суждениями. Выходы ассиметрично проецируются в бинарную награду.
Данные для обучения использованию инструментов не синтезированы внешней LLM. Авторы строят жёсткий граф логики вызова инструментов: например, позволяют редактировать файл только после его открытия. Дальше генерируют данные в цикле Sample-Execute-Verify: модель вызывает инструмент, работает с ним, результаты оцениваются, фильтруются траектории с ошибками. Получается около 100K сценариев на миллиарды токенов с вызовом инструментов и без ошибок.
Для кодовых агентов модель учат генерировать среды в собственном пайплайне на основе SWE-factory. Получают 50 тысяч сред на 20 языках. Также добавляют опенсорные среды вроде SWE-smith и R2E-Gym. Что касается ресёрча и поисковых агентских сценариев, тут интересен метод отбора данных. Step 3.5 обучали только на задачах, которые DeepSeek-R1 не может решить без инструментов. Процесс гарантирует, что для решения задачи необходимо использование поиска.
Модель показывает хорошие результаты в математических бенчах. В других доменах есть просадки,но стоит помнить, что Step 3.5 Flash — значительно меньше многих конкурентов, с которыми сравнивается. В конце мая StepFun выпустила Step 3.7 Flash. Она превосходит версию 3.5 во всех бенчмарках, а в SimpleVQA обходит даже GPT-5.5.
Разбор подготовил
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10🔥6👍3👎1
Задача credit assignment и подходы к её решению
Когда модель успешно выполняет задачу, неплохо бы понимать, какие именно действия привели к положительному результату. Выяснить это — задача credit assignment, о чём существует немало статей. Есть несколько основных подходов к проблеме:
• Temporal-difference (TD) — вклад текущего шага оценивается как разница оценки награды на текущем шаге и дисконтированной оценки на следующем.
• Beginning/tail — предполагает апдейт только токенов в начале и конце роллаутов.
• Энтропийный — предполагает использование в RL токенов с высокой энтропией и низкой вероятностью.
Это не все подходы, но сегодня кратко поговорим о них и статьях, в которых они реализуются.
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
В статье предложили temporal-difference-метод TEMPO. Для группы роллаутов строится префиксное дерево, в котором для каждого префикса оценивается средняя награда V(s). Авторы модифицируют GRPO-advantage, добавляя TD=V(s+1)-V(s). TD отлична от нуля только в точках ветвления, которые составляют незначительную часть токенов. Улучшение на математических бенчмарках составляет от 2 до 7 пп.
Token-Efficient RL for LLM Reasoning
В статье реализуется аналогичный подход с TD. Авторы предлагают два метода. Первый — S-GRPO, в рамках которого обновляются только префиксы роллаутов и семплируются K токенов из продолжения, но последнее можно рассматривать как регуляризацию. Второй метод из статьи — T-SPMO. Он аналогичен TEMPO, но апдейт делается только в точках ветвления префиксного дерева.
Подходы показывают хорошие приросты качества на бенчмарках с умножением трёхзначных чисел и задачах вербальной арифметики.
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
Авторы отмечают, что старт генерации определяет итоговое качество. Поэтому предлагают оптимизировать только префикс, постепенно увеличивая его длину. Для снижения дисперсии для каждого префикса семплируют несколько продолжений, а затем усредняют по ним награду.
Подход выигрывает у обычного GRPO на AIME на 8–16% в зависимости от модели. Эксперименты проводили на разных версиях Qwen3.
GRPO-λ: Credit Assignment improves LLM Reasoning
Предлагают умножать advantage на вес, зависящий от позиции в тексте. В статье рассматривают два варианта веса: both, при котором обновляются и начало, и конец роллаута; и recent, где с экспоненциальным затуханием обновляется только конец. Подход позволяет получить прибавку 3–4 пп по сравнению с обычным GRPO.
Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs
Авторы делят роллауты на сегменты трёх типов: токены с высокой энтропией, короткие сегменты с низкой и длинные с низкой. Показана польза от оптимизации не только высокоэнтропийных токенов, но и низкоэнтропийных сегментов, стабильно встречающихся в положительных роллаутах. Метод даёт значительный прирост поверх GRPO на трёх математических бенчмарках.
Разбор подготовил❣ Георгий Иванов
Душный NLP
Когда модель успешно выполняет задачу, неплохо бы понимать, какие именно действия привели к положительному результату. Выяснить это — задача credit assignment, о чём существует немало статей. Есть несколько основных подходов к проблеме:
• Temporal-difference (TD) — вклад текущего шага оценивается как разница оценки награды на текущем шаге и дисконтированной оценки на следующем.
• Beginning/tail — предполагает апдейт только токенов в начале и конце роллаутов.
• Энтропийный — предполагает использование в RL токенов с высокой энтропией и низкой вероятностью.
Это не все подходы, но сегодня кратко поговорим о них и статьях, в которых они реализуются.
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
В статье предложили temporal-difference-метод TEMPO. Для группы роллаутов строится префиксное дерево, в котором для каждого префикса оценивается средняя награда V(s). Авторы модифицируют GRPO-advantage, добавляя TD=V(s+1)-V(s). TD отлична от нуля только в точках ветвления, которые составляют незначительную часть токенов. Улучшение на математических бенчмарках составляет от 2 до 7 пп.
Token-Efficient RL for LLM Reasoning
В статье реализуется аналогичный подход с TD. Авторы предлагают два метода. Первый — S-GRPO, в рамках которого обновляются только префиксы роллаутов и семплируются K токенов из продолжения, но последнее можно рассматривать как регуляризацию. Второй метод из статьи — T-SPMO. Он аналогичен TEMPO, но апдейт делается только в точках ветвления префиксного дерева.
Подходы показывают хорошие приросты качества на бенчмарках с умножением трёхзначных чисел и задачах вербальной арифметики.
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
Авторы отмечают, что старт генерации определяет итоговое качество. Поэтому предлагают оптимизировать только префикс, постепенно увеличивая его длину. Для снижения дисперсии для каждого префикса семплируют несколько продолжений, а затем усредняют по ним награду.
Подход выигрывает у обычного GRPO на AIME на 8–16% в зависимости от модели. Эксперименты проводили на разных версиях Qwen3.
GRPO-λ: Credit Assignment improves LLM Reasoning
Предлагают умножать advantage на вес, зависящий от позиции в тексте. В статье рассматривают два варианта веса: both, при котором обновляются и начало, и конец роллаута; и recent, где с экспоненциальным затуханием обновляется только конец. Подход позволяет получить прибавку 3–4 пп по сравнению с обычным GRPO.
Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs
Авторы делят роллауты на сегменты трёх типов: токены с высокой энтропией, короткие сегменты с низкой и длинные с низкой. Показана польза от оптимизации не только высокоэнтропийных токенов, но и низкоэнтропийных сегментов, стабильно встречающихся в положительных роллаутах. Метод даёт значительный прирост поверх GRPO на трёх математических бенчмарках.
Разбор подготовил
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15❤9❤🔥5🤩1
Ускорение генерации роллаутов с помощью спекулятивного декодинга
Самая времязатратная часть в GRPO — это генерация траекторий модели, на которую приходится около 72% всего процесса. Поэтому хочется ускорить генерацию роллаутов — и в сегодняшней статье NVIDIA рассказано, как это можно сделать.
По большому счёту, генерация роллаутов — это обычный инференс модели. При наивном инференсе видеокарты используются не на полную. Помочь решить эту проблему способен спекулятивный декодинг. Его суть заключается в том, что маленькая драфт-модель, учится предсказывать, какие токены сгенерирует основная модель. Последней остаётся лишь верифицировать, правильную ли гипотезу выдала драфт-модель. В режиме спекулятивного декодинга разрыв между компьютом и трансфером памяти сокращается.
Авторы проверяли свою гипотезу на небольшой модели — Qwen3-8B. Обучали её на математическом датасете DAPO-Math-17K, а валидировали — на AIME-2024. При этом других наборов данных не использовали, что немного подозрительно. Возможно, именно из-за такого выбора сетапа получились хорошие результаты. Кроме того, замеры проводили на Qwen3-235B, но в симуляции, из-за чего полученные результаты могут отличаться от реальных.
Модель обучали в двух режимах. Первый, RL-Think, предполагает простое обучение после SFT (или продолжение RL-стадии поверх уже ризонящей модели), а второй, RL-Zero, — RL сразу поверх претрейн-модели. Во втором случае спекулятивные модели вроде EAGLE дают лучший acceptance.
Касательно самого предсказания: авторы пришли к выводу, что наибольшее ускорение получается при трёх спекулируемых токенах. Интересно, что при предсказании уже пяти токенов генерация, напротив, замедляется.
В RL-Zero ускорение генерации — 1,77x против 1,54x в RL-Think: драфтеру проще предсказывать распределение менее обученной политики. На общем времени GRPO-шага разрыв уменьшается, потому что спекулятивный декодинг ускоряет только генерацию, а пересчёт log-prob и шаг оптимизатора занимают примерно то же время, что и без него. В симуляции с Qwen3-235B ускорение составило 2,5х. Но, опять же, в реальных рабочих сценариях прирост может быть скромнее.
В дополнение авторы предлагают доучивать драфт-модель во время GRPO, чтобы она не отставала от меняющейся политики основной модели. Делается это так: берутся скрытые представления основной модели, на них навешивается
Разбор подготовил❣ Павел Васильев
Душный NLP
Самая времязатратная часть в GRPO — это генерация траекторий модели, на которую приходится около 72% всего процесса. Поэтому хочется ускорить генерацию роллаутов — и в сегодняшней статье NVIDIA рассказано, как это можно сделать.
По большому счёту, генерация роллаутов — это обычный инференс модели. При наивном инференсе видеокарты используются не на полную. Помочь решить эту проблему способен спекулятивный декодинг. Его суть заключается в том, что маленькая драфт-модель, учится предсказывать, какие токены сгенерирует основная модель. Последней остаётся лишь верифицировать, правильную ли гипотезу выдала драфт-модель. В режиме спекулятивного декодинга разрыв между компьютом и трансфером памяти сокращается.
Авторы проверяли свою гипотезу на небольшой модели — Qwen3-8B. Обучали её на математическом датасете DAPO-Math-17K, а валидировали — на AIME-2024. При этом других наборов данных не использовали, что немного подозрительно. Возможно, именно из-за такого выбора сетапа получились хорошие результаты. Кроме того, замеры проводили на Qwen3-235B, но в симуляции, из-за чего полученные результаты могут отличаться от реальных.
Модель обучали в двух режимах. Первый, RL-Think, предполагает простое обучение после SFT (или продолжение RL-стадии поверх уже ризонящей модели), а второй, RL-Zero, — RL сразу поверх претрейн-модели. Во втором случае спекулятивные модели вроде EAGLE дают лучший acceptance.
Касательно самого предсказания: авторы пришли к выводу, что наибольшее ускорение получается при трёх спекулируемых токенах. Интересно, что при предсказании уже пяти токенов генерация, напротив, замедляется.
В RL-Zero ускорение генерации — 1,77x против 1,54x в RL-Think: драфтеру проще предсказывать распределение менее обученной политики. На общем времени GRPO-шага разрыв уменьшается, потому что спекулятивный декодинг ускоряет только генерацию, а пересчёт log-prob и шаг оптимизатора занимают примерно то же время, что и без него. В симуляции с Qwen3-235B ускорение составило 2,5х. Но, опять же, в реальных рабочих сценариях прирост может быть скромнее.
В дополнение авторы предлагают доучивать драфт-модель во время GRPO, чтобы она не отставала от меняющейся политики основной модели. Делается это так: берутся скрытые представления основной модели, на них навешивается
.detach() , после чего они отправляются в драфтер. Такая система позволяет обучать драфтера вместе с основной моделью, не оказывая на неё влияния (схема на приложенном изображении). Разбор подготовил
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥16❤13🥰9🔥2
ICML 2026: что обсуждают в Сеуле
В этом году крупнейшая конференция о машинном обучении проходит в Южной Корее. По традиции будем рассказывать о самом интересном — открываем серию обзоров от инженеров и исследователей Яндекса.
Немного инсайтов о Xiaomi
Ребята тоже используют On-policy Distillation для мержа своих экспертных моделей. Вайб доклада: как мы сделали топ-1-опенсорс-модель по ИИ-индексу, с миллионным контекстом и 1000 токенов в секундубез регистрации и СМС супердёшево.
Public report'а нет, про обучение не рассказали, но в докладе можно было подсмотреть трюки по оптимизации. Например, гибридные SWA-слои, которые реюзают KV-кэш от полного аттеншна перед ними, помогают в 7 раз уменьшить объём кэша, не потеряв в качестве.
Xiaomi MiMo-V2.5-Pro
TL;DR: Context length и Inference speed. Новая опенсорсная модель на 1 триллион параметров может работать с контекстом объёмом до 1 миллиона токенов в 10 раз быстрее (до 1000 TPS).
Претрейн — sparse-аттеншн и shared KV-кэш. На основе HSWA авторы предложили гибридный HySparse, чтобы увеличить sparsity. Это позволило в 10 раз сэкономить на объёме кэша и получить почти линейный аттеншн.
MiMo-V2.5-Pro обучали в QAT-формате, MXFP4. Пост-трейн — Multi-Teacher On-Policy distillation с top-k, а не top-1. По метрикам MOPD показал себя значительно лучше и стабильнее остальных подходов, подобных Cascade RL.
MoE RL оказался нестабилен, так как выбирается только 10% экспертов. В качестве решения прибегли к R3: Rollout Routing Replay.
Инференс Mimo-V2.5 Pro UltraSpeed — это FP4 (mxfp4) + DFlash Speculative decoding + TileRT inference engine. Для ускорения делают бакетинг по задачам (например, чат/код).
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
IBM Research привезли инструмент, с помощью которого можно модифицировать логику в движке инференса vLLM и строить кастомные пайплайны.
Мотивация: несмотря на свою эффективность, движок vLLM не может похвастаться богатым функционалом. Авторы попробовали исправить это. Код — на GitHub.
Model Optimization Flywheel: Continuously Self-Improving LLMs in Production
Работа команды Shopify. Ребята отмечают важность голденсетов (ground truth set), потому что это потолок качества моделей, — и рассказывают, как собирают такие сеты.
Информацию получают от менеджеров. Если каппа Коэна низкая, то переписывают рубрику или инструкцию. Для подбора промпта judge пользуются GEPA и ACE. В датасет попадает и брак, и кейсы плохого срабатывания моделей. Некорректные ответы правят люди и judge.
Ещё больше о конференции читайте в канале ML Underhood: уже рассказали о работах основного трека, Spotlight-статье и первом дне. А если вы тоже на ICML, приходите пообщаться к любому из наших постеров.
Уже на конференции❣ Иван Дёгтев, Даниил Кириллов, Тимофей Смирнов, Артём Миронов, Федор Великонивцев
#YaICML2026
Душный NLP
В этом году крупнейшая конференция о машинном обучении проходит в Южной Корее. По традиции будем рассказывать о самом интересном — открываем серию обзоров от инженеров и исследователей Яндекса.
Немного инсайтов о Xiaomi
Ребята тоже используют On-policy Distillation для мержа своих экспертных моделей. Вайб доклада: как мы сделали топ-1-опенсорс-модель по ИИ-индексу, с миллионным контекстом и 1000 токенов в секунду
Public report'а нет, про обучение не рассказали, но в докладе можно было подсмотреть трюки по оптимизации. Например, гибридные SWA-слои, которые реюзают KV-кэш от полного аттеншна перед ними, помогают в 7 раз уменьшить объём кэша, не потеряв в качестве.
Xiaomi MiMo-V2.5-Pro
TL;DR: Context length и Inference speed. Новая опенсорсная модель на 1 триллион параметров может работать с контекстом объёмом до 1 миллиона токенов в 10 раз быстрее (до 1000 TPS).
Претрейн — sparse-аттеншн и shared KV-кэш. На основе HSWA авторы предложили гибридный HySparse, чтобы увеличить sparsity. Это позволило в 10 раз сэкономить на объёме кэша и получить почти линейный аттеншн.
MiMo-V2.5-Pro обучали в QAT-формате, MXFP4. Пост-трейн — Multi-Teacher On-Policy distillation с top-k, а не top-1. По метрикам MOPD показал себя значительно лучше и стабильнее остальных подходов, подобных Cascade RL.
MoE RL оказался нестабилен, так как выбирается только 10% экспертов. В качестве решения прибегли к R3: Rollout Routing Replay.
Инференс Mimo-V2.5 Pro UltraSpeed — это FP4 (mxfp4) + DFlash Speculative decoding + TileRT inference engine. Для ускорения делают бакетинг по задачам (например, чат/код).
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
IBM Research привезли инструмент, с помощью которого можно модифицировать логику в движке инференса vLLM и строить кастомные пайплайны.
Мотивация: несмотря на свою эффективность, движок vLLM не может похвастаться богатым функционалом. Авторы попробовали исправить это. Код — на GitHub.
Model Optimization Flywheel: Continuously Self-Improving LLMs in Production
Работа команды Shopify. Ребята отмечают важность голденсетов (ground truth set), потому что это потолок качества моделей, — и рассказывают, как собирают такие сеты.
Информацию получают от менеджеров. Если каппа Коэна низкая, то переписывают рубрику или инструкцию. Для подбора промпта judge пользуются GEPA и ACE. В датасет попадает и брак, и кейсы плохого срабатывания моделей. Некорректные ответы правят люди и judge.
Ещё больше о конференции читайте в канале ML Underhood: уже рассказали о работах основного трека, Spotlight-статье и первом дне. А если вы тоже на ICML, приходите пообщаться к любому из наших постеров.
Уже на конференции
#YaICML2026
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤15🔥8❤🔥4👍1🤡1
Агентские системы на ICML 2026 Oral Session
Benchmarking at the Edge of Comprehension
Авторы предложили процедуру бенчмаркинга с участием двух моделей: модель-бенчмаркер (Alice) и тестируемая модель (Bob). Alice генерирует вопрос q на заданную тему и ответ a_A, после чего сгенерированный пример проходит верификацию Bob'ом. Если вопрос после нескольких попыток генерации остаётся некорректным, процедура возвращает NULL.
Затем Bob генерирует ответ a_B, а Alice критикует его, указывая на конкретное место, где в рассуждении содержится ошибка (если она есть). Найденные «ошибки» эскалируются на моделей-судей, а при отсутствии единогласия — на асессоров-людей. Если ошибки действительно есть, процедура возвращает ALICE WINS. В противном случае — BOB WINS.
Исследователи утверждают, что с работой Alice-судьи справляются даже лёгкие модели вроде GPT 3.5: ответы всех моделей высоко коррелируют с людьми. Правда нас оставили без ответа насколько вопросы, сгенерированные GPT 3.5, являются сложными сами по себе.
Бенчмарк оказался довольно простым для фронтир-моделей: например, Bob на GPT 5.2 побеждает в 100% случаев против всех моделей за исключением одной. Из этого можно сделать вывод, что вопросы получились не очень сложными, и Alice как problem creator со своей работой не справилась. Также в работе не было оценки целых диалогов, что является немаловажным ограничением.
daVinci-Dev: Agent-native Mid-training for Software Engineering
Стандартный пайплайн обучения агентских моделей выглядит так: тушка -> SFT -> RL (например, GRPO). Авторы доклада о мид-трейнинге добавили дополнительный шаг перед SFT: они обучают модель на идеальных агентских трейсах на задачу Next Token Prediction и благодаря этому получают SOTA-результат среди открытых моделей на SWE-Bench Verified. Исследователи утверждают, что потратили существенно меньше компьюта, чем предыдущая SOTA, но получилось всё равно много: около 70b токенов на 32b/72b модели.
Strategic Navigation or Stochastic Search? How agents and humans reason over document collections
Исследователи разработали бенчмарк, который замеряет, насколько эффективно агенты решают задачу поиска по большой коллекции документов для ответа на вопросы. Неожиданно лучшая модель достигает всего 82% качества! При этом оказалось, что агентские пайплайны без ограничений тратят на порядки больше денег, чем пайплайны с разумными ограничениями ($850 против ~$40), и дают более слабый результат.
Ещё один любопытный факт: даже лучшие пайплайны тратят в 5 раз больше действий, чем человек, снабжённый теми же инструментами. Также авторы отмечают, что лучшие агентские пайплайны и люди дают примерно одинаковое качество ответов (~80%), но ошибаются по-разному: люди торопятся с неверными решениями, а модели, наоборот, «закапываются» там, где в этом нет необходимости.
Увидел интересное❣ Юрий Яровиков
#YaICML2026
Душный NLP
Benchmarking at the Edge of Comprehension
Авторы предложили процедуру бенчмаркинга с участием двух моделей: модель-бенчмаркер (Alice) и тестируемая модель (Bob). Alice генерирует вопрос q на заданную тему и ответ a_A, после чего сгенерированный пример проходит верификацию Bob'ом. Если вопрос после нескольких попыток генерации остаётся некорректным, процедура возвращает NULL.
Затем Bob генерирует ответ a_B, а Alice критикует его, указывая на конкретное место, где в рассуждении содержится ошибка (если она есть). Найденные «ошибки» эскалируются на моделей-судей, а при отсутствии единогласия — на асессоров-людей. Если ошибки действительно есть, процедура возвращает ALICE WINS. В противном случае — BOB WINS.
Исследователи утверждают, что с работой Alice-судьи справляются даже лёгкие модели вроде GPT 3.5: ответы всех моделей высоко коррелируют с людьми. Правда нас оставили без ответа насколько вопросы, сгенерированные GPT 3.5, являются сложными сами по себе.
Бенчмарк оказался довольно простым для фронтир-моделей: например, Bob на GPT 5.2 побеждает в 100% случаев против всех моделей за исключением одной. Из этого можно сделать вывод, что вопросы получились не очень сложными, и Alice как problem creator со своей работой не справилась. Также в работе не было оценки целых диалогов, что является немаловажным ограничением.
daVinci-Dev: Agent-native Mid-training for Software Engineering
Стандартный пайплайн обучения агентских моделей выглядит так: тушка -> SFT -> RL (например, GRPO). Авторы доклада о мид-трейнинге добавили дополнительный шаг перед SFT: они обучают модель на идеальных агентских трейсах на задачу Next Token Prediction и благодаря этому получают SOTA-результат среди открытых моделей на SWE-Bench Verified. Исследователи утверждают, что потратили существенно меньше компьюта, чем предыдущая SOTA, но получилось всё равно много: около 70b токенов на 32b/72b модели.
Strategic Navigation or Stochastic Search? How agents and humans reason over document collections
Исследователи разработали бенчмарк, который замеряет, насколько эффективно агенты решают задачу поиска по большой коллекции документов для ответа на вопросы. Неожиданно лучшая модель достигает всего 82% качества! При этом оказалось, что агентские пайплайны без ограничений тратят на порядки больше денег, чем пайплайны с разумными ограничениями ($850 против ~$40), и дают более слабый результат.
Ещё один любопытный факт: даже лучшие пайплайны тратят в 5 раз больше действий, чем человек, снабжённый теми же инструментами. Также авторы отмечают, что лучшие агентские пайплайны и люди дают примерно одинаковое качество ответов (~80%), но ошибаются по-разному: люди торопятся с неверными решениями, а модели, наоборот, «закапываются» там, где в этом нет необходимости.
Увидел интересное
#YaICML2026
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥17❤9🔥5👍1
Diffusion Language Models на ICML 2026
Собрали несколько работ о дифффузионных моделях и побеседовали с их авторами.
Residual Context Diffusion Language Models
Известная статья на тему masked diffusion. Суть в том, чтобы уменьшить потерю подсчитанной информации, которая обычно выбрасывается при низких вероятностях демаскируемых токенов.
Как работает masked diffusion. На каждом шаге генерации выделяется фрагмент последовательности (блок), который будет демаскироваться одновременно (что и должно приводить к ускорению). Но если сразу размаскировать все токены, качество будет плохим. Поэтому размаскируем только те из них внутри блока, предсказанные вероятности которых высоки. Вероятности других — низкие —выбрасываем и перегенерируем их заново, обуславливаясь на все размаскированные до текущего шага токены.
Для решения проблемы отброшенных вычислений вероятности непринятых токенов подают на следующий слой через дополнительный residual-вход. Чтобы дообучить модель работать с новым входом, предлагают использовать простую замороженную модель, которая предоставит не очень качественные вероятности.
Часть о том, что надо обучаться с dummy-моделью, а инфериться на хорошей, — ограничение метода. Автор считает, что его можно минимизировать рекурсивным дообучением, но сдвиг между распределениями никогда не будет нулевым. В целом необходимость делать такие трюки кажется ему фундаментальным ограничением дискретной диффузии, и он верит в скейлинг непрерывных подходов для генерации текстов.
Breaking the Factorization Barrier in Diffusion Language Models
Работа об увеличении репрезентативности masked diffusion. Проблема в том, что помимо самих текстовых знаний модель должна выучить ещё и все возможные комбинации паттернов размаскирования. Это непростая задача, хочется уменьшить комбинаторную сложность в ней.
Предлагается учить peft-like-добавку определённой структуры, специально направленную на понимание паттернов семплирования. На инференсе будем параллельно вычислять эту добавку и основные веса для получения вероятности размаскирования токенов.
Использовать метод можно для двух целей. Основная, которую показывают в статье, — увеличение качества при фиксированной скорости. Дополнительная — увеличение скорости (количество размаскируемых токенов за форвард) при сохранении качества.
Метод поскейлили до LLaDA 8B и показали буст качества относительно LoRA-добавок — правда, померить на этом скейле смогли только ген-перплексию.
Scaling Beyond Masked Diffusion Language Models
Есть несколько конкурирующих подходов к тому, как делать диффузию для текстов. Самый популярный — masked diffusion. Так получилось, потому что на низких масштабах компьюта и размеров моделей было показано, что у этого класса моделей теоретически лучший баланс эффективности и качества в терминах ген-перплексии (что не слишком надёжно).
Авторы делают честное сравнение разных диффузионных подходов (и авторегрессии как бейзлайна), но теперь скейлят модели до 2B параметров и показывают, что uniform state diffusion — на деле лучший подход.
На постере и в беседе автор тизерит свою следующую работу, в которой для uniform state diffusion сделали алайн и победили Nemotron 8B и Diffusion Gemma 26B по скорости и качеству на агентских бенчах.
Learning Unmasking Policies for Diffusion Language Models
Также удалось пообщаться с автором. Идея — в обучении небольшой полиси-головы поверх замороженной диффузионной тушки. Сама полиси-сетка очевидно выучивает статистики из домен-специфичных данных потому что, по словам автора, для хорошего качества им приходилось учить отдельные политики для кода и математики.
Также есть параллельная работа, в которой тушку размораживают и дообучают голову вместе с ней. Это дороже, но перспективнее в плане качества.
Фишка метода из статьи — из-за отдельного обучения головы можно смотреть, какие домен-специфичные паттерны выучиваются. Так, для математики политика выучивает больше всего токенов семплить на последних блоках, что не сработало бы для кода.
Увидел интересное❣ Сергей Кастрюлин
#YaICML2026
Душный NLP
Собрали несколько работ о дифффузионных моделях и побеседовали с их авторами.
Residual Context Diffusion Language Models
Известная статья на тему masked diffusion. Суть в том, чтобы уменьшить потерю подсчитанной информации, которая обычно выбрасывается при низких вероятностях демаскируемых токенов.
Как работает masked diffusion. На каждом шаге генерации выделяется фрагмент последовательности (блок), который будет демаскироваться одновременно (что и должно приводить к ускорению). Но если сразу размаскировать все токены, качество будет плохим. Поэтому размаскируем только те из них внутри блока, предсказанные вероятности которых высоки. Вероятности других — низкие —выбрасываем и перегенерируем их заново, обуславливаясь на все размаскированные до текущего шага токены.
Для решения проблемы отброшенных вычислений вероятности непринятых токенов подают на следующий слой через дополнительный residual-вход. Чтобы дообучить модель работать с новым входом, предлагают использовать простую замороженную модель, которая предоставит не очень качественные вероятности.
Часть о том, что надо обучаться с dummy-моделью, а инфериться на хорошей, — ограничение метода. Автор считает, что его можно минимизировать рекурсивным дообучением, но сдвиг между распределениями никогда не будет нулевым. В целом необходимость делать такие трюки кажется ему фундаментальным ограничением дискретной диффузии, и он верит в скейлинг непрерывных подходов для генерации текстов.
Breaking the Factorization Barrier in Diffusion Language Models
Работа об увеличении репрезентативности masked diffusion. Проблема в том, что помимо самих текстовых знаний модель должна выучить ещё и все возможные комбинации паттернов размаскирования. Это непростая задача, хочется уменьшить комбинаторную сложность в ней.
Предлагается учить peft-like-добавку определённой структуры, специально направленную на понимание паттернов семплирования. На инференсе будем параллельно вычислять эту добавку и основные веса для получения вероятности размаскирования токенов.
Использовать метод можно для двух целей. Основная, которую показывают в статье, — увеличение качества при фиксированной скорости. Дополнительная — увеличение скорости (количество размаскируемых токенов за форвард) при сохранении качества.
Метод поскейлили до LLaDA 8B и показали буст качества относительно LoRA-добавок — правда, померить на этом скейле смогли только ген-перплексию.
Scaling Beyond Masked Diffusion Language Models
Есть несколько конкурирующих подходов к тому, как делать диффузию для текстов. Самый популярный — masked diffusion. Так получилось, потому что на низких масштабах компьюта и размеров моделей было показано, что у этого класса моделей теоретически лучший баланс эффективности и качества в терминах ген-перплексии (что не слишком надёжно).
Авторы делают честное сравнение разных диффузионных подходов (и авторегрессии как бейзлайна), но теперь скейлят модели до 2B параметров и показывают, что uniform state diffusion — на деле лучший подход.
На постере и в беседе автор тизерит свою следующую работу, в которой для uniform state diffusion сделали алайн и победили Nemotron 8B и Diffusion Gemma 26B по скорости и качеству на агентских бенчах.
Learning Unmasking Policies for Diffusion Language Models
Также удалось пообщаться с автором. Идея — в обучении небольшой полиси-головы поверх замороженной диффузионной тушки. Сама полиси-сетка очевидно выучивает статистики из домен-специфичных данных потому что, по словам автора, для хорошего качества им приходилось учить отдельные политики для кода и математики.
Также есть параллельная работа, в которой тушку размораживают и дообучают голову вместе с ней. Это дороже, но перспективнее в плане качества.
Фишка метода из статьи — из-за отдельного обучения головы можно смотреть, какие домен-специфичные паттерны выучиваются. Так, для математики политика выучивает больше всего токенов семплить на последних блоках, что не сработало бы для кода.
Увидел интересное
#YaICML2026
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤17👍10🔥4❤🔥2
Как агенты и люди работают с документами, в которых нужно найти ответ на вопрос? Выясняют на ICML 2026
Продолжаем делиться работами с конференции. А о том, что мы сами привезли на ICML, читайте в канале ML Underhood.
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
Авторы задали людям и агентам 2250 вопросов, ответы на которые спрятаны внутри 800 разных PDF и документов. В ходе нового теста MADQA записывали не только финальный ответ, но и весь путь поиска.
В результате:
• Лучшие агенты уже догнали людей по точности (около 82%), но берут грубой силой, а не умом.
• Человек находит ответ с первой попытки в 50% случаев, лучший агент (Gemini 3 Pro) — только в 12%.
• Агенты не умеют останавливаться: если задача не по зубам, крутятся по кругу и жгут ресурсы.
• Увеличение объёма вычислений не спасает. Один агент потратил 270 млн токенов и 850 долларов, но проиграл более дешёвому и аккуратному.
• Около 20% вопросов не осилил никто: ни люди, ни агенты.
Новизна работы в том, что в обычных тестах оценивают только корректность ответа. Здесь впервые измеряли, насколько эффективно система к нему пришла, считая каждый шаг поиска.
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
В этой работе предлагают обучаться на верифицируемых средах, сложность которых растёт динамически.
Авторы собрали RLVE-Gym из 400 verifiable-задачек. Когда модель начинает хорошо справляться с текущими задачами, уровень их сложности растёт. Получается своего рода curriculum, который не только ускоряет сходимость, но и бустит общее качество.
Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy
Ресёрчеры из Университета Альберты неожиданно выдают базу в position-статье: оказывается, что если геймить среду, то агент будет плохо работать в онлайне 🤷♂️
Нашёл для вас эти статьи❣ Андрей Соколов
#YaICML2026
Душный NLP
Продолжаем делиться работами с конференции. А о том, что мы сами привезли на ICML, читайте в канале ML Underhood.
Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections
Авторы задали людям и агентам 2250 вопросов, ответы на которые спрятаны внутри 800 разных PDF и документов. В ходе нового теста MADQA записывали не только финальный ответ, но и весь путь поиска.
В результате:
• Лучшие агенты уже догнали людей по точности (около 82%), но берут грубой силой, а не умом.
• Человек находит ответ с первой попытки в 50% случаев, лучший агент (Gemini 3 Pro) — только в 12%.
• Агенты не умеют останавливаться: если задача не по зубам, крутятся по кругу и жгут ресурсы.
• Увеличение объёма вычислений не спасает. Один агент потратил 270 млн токенов и 850 долларов, но проиграл более дешёвому и аккуратному.
• Около 20% вопросов не осилил никто: ни люди, ни агенты.
Новизна работы в том, что в обычных тестах оценивают только корректность ответа. Здесь впервые измеряли, насколько эффективно система к нему пришла, считая каждый шаг поиска.
RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments
В этой работе предлагают обучаться на верифицируемых средах, сложность которых растёт динамически.
Авторы собрали RLVE-Gym из 400 verifiable-задачек. Когда модель начинает хорошо справляться с текущими задачами, уровень их сложности растёт. Получается своего рода curriculum, который не только ускоряет сходимость, но и бустит общее качество.
Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy
Ресёрчеры из Университета Альберты неожиданно выдают базу в position-статье: оказывается, что если геймить среду, то агент будет плохо работать в онлайне 🤷♂️
Нашёл для вас эти статьи
#YaICML2026
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10🔥5❤2💅1
Подборка методов улучшения LLM
На этот раз собрали несколько статей на тему обучения и инференса LLM. Ожидаемо, эта область на ICML 2026 — самая популярная и обсуждаемая.
Rethinking the Trust Region in LLM Reinforcement Learning
Сингапурские учёные рассматривают проблему нестабильности GRPO-like-алгоритмов. Авторы связывают её с асимметричностью применяемого клиппинга относительно абсолютного значения правдоподобия сгенерированной траектории. Разброс значений IS (очень шумной оценки trust region в PPO) снижается с ростом вероятности, вследствие чего клиппинг чаще срабатывает на высокоэнтропийных генерациях.
Эту проблему уже частично лечили в DAPO, повышая правую границу клиппинга. Здесь же предлагают перейти к более точным оценкам trust region: через KL-отклонение по полному словарю, по top-K или через альтернативную, но более подходящую односемпловую оценку.
В экспериментах показывают более стабильное обучение. Кроме того, в статье много аблейшнов и интересных выводов.
Don't Force the Fit: Bounded Log-Likelihood Loss for Enhanced Reasoning in Large Language Models
Очный доклад о модификации SFT-лосса для обучения на ризонинг-задачах. Предлагают перейти от классической кросс-энтропии L = - log p к ограниченной в нуле: L = log (2 - p). На высоковероятных токенах градиент нового лосса приближается к классическому CE, а вот на низковероятных — не улетает в бесконечность, а ограничен небольшим значением.
Мотивация такого подхода в том, что в ризонинг-цепочках есть множество высокоэнтропийных токенов, которые отвечают скорее за «стиль» рассуждения, но не влияют на его качество. При этом они отбирают значимую часть обучения, не давая как следует обучиться действительно важным токенам.
Приросты на графиках выглядят неправдоподобно большими.
Sparser Block-Sparse Attention via Token Permutation
Ресёрчеры решают проблему long-context-префилла: full attention дорогой, а обычный block-sparse attention не всегда хорошо работает, потому что важные key-токены размазаны по разным блокам.
Идея PBS-Attn: перед block-sparse attention переставить K/V-токены так, чтобы важные токены оказались рядом. Аттеншн не меняется при одинаковой перестановке K/V, зато sparse-блоки становятся более плотными и полезными.
Из-за каузальной маски нельзя перемешивать всё подряд, поэтому авторы делают перестановку внутри сегментов. Это сохраняет авторегрессивность, но всё ещё позволяет «дефрагментировать» матрицу аттеншна.
Плюс в том, что это не новая архитектура. Можно взять предобученную модель, добавить permutation и block-sparse-кернел и ускорить long-context-инференс.
На LongBench качество почти такое же, как у full attention, и лучше, чем у других бейзлайнов. По скорости заявляют до 2,75× ускорения на long-context-префилле.
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
Ещё один подход к тому, как делать критику в GRPO.
На сложных бенчах обучение в какой-то момент начинает стагнировать. Авторы предлагают добавить reward-модель, которая будет писать критику ответа актора. Затем эта критика подаётся модели вместе со старым ответом, и модель пишет ответ лучше. После этого даунсемплят такие аугментированные примеры и конкатят их с обычными.
На сете семплов с критикой модель учат сразу на улучшенный ответ — без промежуточной критики и первого ответа, как будто это изначально была такая генерация.
На математических и научных бенчах (AIME, MATH, GPQA) получают приросты от 7 до 12 пунктов.
Спросил автора, как бы он внедрял это в агентный RL. Он сказал, что, по его мнению, у модели должна быть тула «покритикуй мою текущую траекторию». Интересный подход.
Личное мнение: непонятно, насколько вообще критика в RL полезна. Как будто правильнее решать проблемы, которые она пытается закрыть, другими способами.
Увидели интересное❣ Алексей Зотов, Влад Тыцкий и Тимофей Смирнов
#YaICML2026
Душный NLP
На этот раз собрали несколько статей на тему обучения и инференса LLM. Ожидаемо, эта область на ICML 2026 — самая популярная и обсуждаемая.
Rethinking the Trust Region in LLM Reinforcement Learning
Сингапурские учёные рассматривают проблему нестабильности GRPO-like-алгоритмов. Авторы связывают её с асимметричностью применяемого клиппинга относительно абсолютного значения правдоподобия сгенерированной траектории. Разброс значений IS (очень шумной оценки trust region в PPO) снижается с ростом вероятности, вследствие чего клиппинг чаще срабатывает на высокоэнтропийных генерациях.
Эту проблему уже частично лечили в DAPO, повышая правую границу клиппинга. Здесь же предлагают перейти к более точным оценкам trust region: через KL-отклонение по полному словарю, по top-K или через альтернативную, но более подходящую односемпловую оценку.
В экспериментах показывают более стабильное обучение. Кроме того, в статье много аблейшнов и интересных выводов.
Don't Force the Fit: Bounded Log-Likelihood Loss for Enhanced Reasoning in Large Language Models
Очный доклад о модификации SFT-лосса для обучения на ризонинг-задачах. Предлагают перейти от классической кросс-энтропии L = - log p к ограниченной в нуле: L = log (2 - p). На высоковероятных токенах градиент нового лосса приближается к классическому CE, а вот на низковероятных — не улетает в бесконечность, а ограничен небольшим значением.
Мотивация такого подхода в том, что в ризонинг-цепочках есть множество высокоэнтропийных токенов, которые отвечают скорее за «стиль» рассуждения, но не влияют на его качество. При этом они отбирают значимую часть обучения, не давая как следует обучиться действительно важным токенам.
Приросты на графиках выглядят неправдоподобно большими.
Sparser Block-Sparse Attention via Token Permutation
Ресёрчеры решают проблему long-context-префилла: full attention дорогой, а обычный block-sparse attention не всегда хорошо работает, потому что важные key-токены размазаны по разным блокам.
Идея PBS-Attn: перед block-sparse attention переставить K/V-токены так, чтобы важные токены оказались рядом. Аттеншн не меняется при одинаковой перестановке K/V, зато sparse-блоки становятся более плотными и полезными.
Из-за каузальной маски нельзя перемешивать всё подряд, поэтому авторы делают перестановку внутри сегментов. Это сохраняет авторегрессивность, но всё ещё позволяет «дефрагментировать» матрицу аттеншна.
Плюс в том, что это не новая архитектура. Можно взять предобученную модель, добавить permutation и block-sparse-кернел и ускорить long-context-инференс.
На LongBench качество почти такое же, как у full attention, и лучше, чем у других бейзлайнов. По скорости заявляют до 2,75× ускорения на long-context-префилле.
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
Ещё один подход к тому, как делать критику в GRPO.
На сложных бенчах обучение в какой-то момент начинает стагнировать. Авторы предлагают добавить reward-модель, которая будет писать критику ответа актора. Затем эта критика подаётся модели вместе со старым ответом, и модель пишет ответ лучше. После этого даунсемплят такие аугментированные примеры и конкатят их с обычными.
На сете семплов с критикой модель учат сразу на улучшенный ответ — без промежуточной критики и первого ответа, как будто это изначально была такая генерация.
На математических и научных бенчах (AIME, MATH, GPQA) получают приросты от 7 до 12 пунктов.
Спросил автора, как бы он внедрял это в агентный RL. Он сказал, что, по его мнению, у модели должна быть тула «покритикуй мою текущую траекторию». Интересный подход.
Личное мнение: непонятно, насколько вообще критика в RL полезна. Как будто правильнее решать проблемы, которые она пытается закрыть, другими способами.
Увидели интересное
#YaICML2026
Душный NLP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤14👍9🔥6🤩1