Как дообучают без разметки и почему это важно для AI-инструментов
В свежей работе показали подход Cross-Model Entropy, или CME — схему награды для дообучения модели без ручной разметки. Идея простая: ответ одной модели оценивает другая, более «строгая» модель-верификатор. На выходе получается сигнал, который можно встроить в RL-посттренинг, не переписывая сам цикл обучения.
Авторы протестировали метод на задачах открытых инструкций и прогнали несколько семейств моделей: Qwen, Llama, Gemma и OLMo. На сравнении «один на один» против базовой версии выигрыш по tie-adjusted win rate оказался в диапазоне от 52,5% до 71,4%. Для области, где качество ответа часто измеряется не абсолютной метрикой, а предпочтением судьи, это заметный разрыв.
Почему это интересно не только ML-командам, но и тем, кто работает с no-code и MarTech-инструментами? Потому что такие схемы дообучения постепенно влияют на то, как ведут себя AI-ассистенты, поисковые ответы и встроенные помощники в продуктах. Один и тот же запрос в разных системах может давать разный результат не только из-за промпта, но и из-за того, как модель была посттренирована.
Для тех, кто строит процессы на базе AI-сервисов, это важный сигнал: качество ответа — это уже не просто вопрос интерфейса или промпт-шаблона. За ним всё чаще стоит архитектура дообучения, которая влияет на стабильность, полезность и предсказуемость результата.
В свежей работе показали подход Cross-Model Entropy, или CME — схему награды для дообучения модели без ручной разметки. Идея простая: ответ одной модели оценивает другая, более «строгая» модель-верификатор. На выходе получается сигнал, который можно встроить в RL-посттренинг, не переписывая сам цикл обучения.
Авторы протестировали метод на задачах открытых инструкций и прогнали несколько семейств моделей: Qwen, Llama, Gemma и OLMo. На сравнении «один на один» против базовой версии выигрыш по tie-adjusted win rate оказался в диапазоне от 52,5% до 71,4%. Для области, где качество ответа часто измеряется не абсолютной метрикой, а предпочтением судьи, это заметный разрыв.
Почему это интересно не только ML-командам, но и тем, кто работает с no-code и MarTech-инструментами? Потому что такие схемы дообучения постепенно влияют на то, как ведут себя AI-ассистенты, поисковые ответы и встроенные помощники в продуктах. Один и тот же запрос в разных системах может давать разный результат не только из-за промпта, но и из-за того, как модель была посттренирована.
Для тех, кто строит процессы на базе AI-сервисов, это важный сигнал: качество ответа — это уже не просто вопрос интерфейса или промпт-шаблона. За ним всё чаще стоит архитектура дообучения, которая влияет на стабильность, полезность и предсказуемость результата.
Как снижать «галлюцинации» в AI-генерации: не только промптом, но и проверкой фактов
В arXiv вышла работа про клиническое суммаризирование: Hallucination Detection-Guided Preference Optimization for Clinical Summarization. Суть не в медицине как таковой, а в подходе к качеству текста.
Авторы предложили два уровня контроля. Первый — во время генерации модель не просто пишет сводку, а получает сигнал от детектора фактических ошибок и по ходу правит проблемные места. Второй — такие цепочки правок превращают в пары предпочтений для дообучения, чтобы модель чаще выбирала более точные формулировки.
На тестах с Llama-3.1-8B-Instruct это дало заметный эффект: один вариант сократил галлюцинации на 24%, другой — на 48%. При этом текст не просел по читабельности, связности и релевантности, а качество подтверждали и эксперты, и LLM-Jury.
Почему это важно для no-code ops и маркетинга. Если вы собираете отчёты, карточки товаров, резюме встреч, CRM-заметки или черновики статей через AI, одного «хорошего промпта» уже мало. Нужна вторая линия защиты: проверка фактов, сравнение с источником, подсветка сомнительных фрагментов, ручное подтверждение критичных полей.
Особенно это полезно там, где ошибка стоит дорого: финансы, legal, медицина, B2B-аналитика, YMYL-контент, а также любые автоматизированные пайплайны, где текст потом уходит в публикацию или в CRM без редактора.
Практический вывод для no-code команд простой: качество AI-сценария растёт не от длины промпта, а от того, как вы встроили контроль фактов в сам процесс.
В arXiv вышла работа про клиническое суммаризирование: Hallucination Detection-Guided Preference Optimization for Clinical Summarization. Суть не в медицине как таковой, а в подходе к качеству текста.
Авторы предложили два уровня контроля. Первый — во время генерации модель не просто пишет сводку, а получает сигнал от детектора фактических ошибок и по ходу правит проблемные места. Второй — такие цепочки правок превращают в пары предпочтений для дообучения, чтобы модель чаще выбирала более точные формулировки.
На тестах с Llama-3.1-8B-Instruct это дало заметный эффект: один вариант сократил галлюцинации на 24%, другой — на 48%. При этом текст не просел по читабельности, связности и релевантности, а качество подтверждали и эксперты, и LLM-Jury.
Почему это важно для no-code ops и маркетинга. Если вы собираете отчёты, карточки товаров, резюме встреч, CRM-заметки или черновики статей через AI, одного «хорошего промпта» уже мало. Нужна вторая линия защиты: проверка фактов, сравнение с источником, подсветка сомнительных фрагментов, ручное подтверждение критичных полей.
Особенно это полезно там, где ошибка стоит дорого: финансы, legal, медицина, B2B-аналитика, YMYL-контент, а также любые автоматизированные пайплайны, где текст потом уходит в публикацию или в CRM без редактора.
Практический вывод для no-code команд простой: качество AI-сценария растёт не от длины промпта, а от того, как вы встроили контроль фактов в сам процесс.
