Как дообучают без разметки и почему это важно для AI-инструментов
В свежей работе показали подход Cross-Model Entropy, или CME — схему награды для дообучения модели без ручной разметки. Идея простая: ответ одной модели оценивает другая, более «строгая» модель-верификатор. На выходе получается сигнал, который можно встроить в RL-посттренинг, не переписывая сам цикл обучения.
Авторы протестировали метод на задачах открытых инструкций и прогнали несколько семейств моделей: Qwen, Llama, Gemma и OLMo. На сравнении «один на один» против базовой версии выигрыш по tie-adjusted win rate оказался в диапазоне от 52,5% до 71,4%. Для области, где качество ответа часто измеряется не абсолютной метрикой, а предпочтением судьи, это заметный разрыв.
Почему это интересно не только ML-командам, но и тем, кто работает с no-code и MarTech-инструментами? Потому что такие схемы дообучения постепенно влияют на то, как ведут себя AI-ассистенты, поисковые ответы и встроенные помощники в продуктах. Один и тот же запрос в разных системах может давать разный результат не только из-за промпта, но и из-за того, как модель была посттренирована.
Для тех, кто строит процессы на базе AI-сервисов, это важный сигнал: качество ответа — это уже не просто вопрос интерфейса или промпт-шаблона. За ним всё чаще стоит архитектура дообучения, которая влияет на стабильность, полезность и предсказуемость результата.
В свежей работе показали подход Cross-Model Entropy, или CME — схему награды для дообучения модели без ручной разметки. Идея простая: ответ одной модели оценивает другая, более «строгая» модель-верификатор. На выходе получается сигнал, который можно встроить в RL-посттренинг, не переписывая сам цикл обучения.
Авторы протестировали метод на задачах открытых инструкций и прогнали несколько семейств моделей: Qwen, Llama, Gemma и OLMo. На сравнении «один на один» против базовой версии выигрыш по tie-adjusted win rate оказался в диапазоне от 52,5% до 71,4%. Для области, где качество ответа часто измеряется не абсолютной метрикой, а предпочтением судьи, это заметный разрыв.
Почему это интересно не только ML-командам, но и тем, кто работает с no-code и MarTech-инструментами? Потому что такие схемы дообучения постепенно влияют на то, как ведут себя AI-ассистенты, поисковые ответы и встроенные помощники в продуктах. Один и тот же запрос в разных системах может давать разный результат не только из-за промпта, но и из-за того, как модель была посттренирована.
Для тех, кто строит процессы на базе AI-сервисов, это важный сигнал: качество ответа — это уже не просто вопрос интерфейса или промпт-шаблона. За ним всё чаще стоит архитектура дообучения, которая влияет на стабильность, полезность и предсказуемость результата.
