Index No-Code Ops Tools
4 subscribers
2 photos
16 links
Инструменты и решения для No-Code Ops
Download Telegram
Channel created
Channel photo updated
Техническая проверка канала.
Как дообучают без разметки и почему это важно для AI-инструментов

В свежей работе показали подход Cross-Model Entropy, или CME — схему награды для дообучения модели без ручной разметки. Идея простая: ответ одной модели оценивает другая, более «строгая» модель-верификатор. На выходе получается сигнал, который можно встроить в RL-посттренинг, не переписывая сам цикл обучения.

Авторы протестировали метод на задачах открытых инструкций и прогнали несколько семейств моделей: Qwen, Llama, Gemma и OLMo. На сравнении «один на один» против базовой версии выигрыш по tie-adjusted win rate оказался в диапазоне от 52,5% до 71,4%. Для области, где качество ответа часто измеряется не абсолютной метрикой, а предпочтением судьи, это заметный разрыв.

Почему это интересно не только ML-командам, но и тем, кто работает с no-code и MarTech-инструментами? Потому что такие схемы дообучения постепенно влияют на то, как ведут себя AI-ассистенты, поисковые ответы и встроенные помощники в продуктах. Один и тот же запрос в разных системах может давать разный результат не только из-за промпта, но и из-за того, как модель была посттренирована.

Для тех, кто строит процессы на базе AI-сервисов, это важный сигнал: качество ответа — это уже не просто вопрос интерфейса или промпт-шаблона. За ним всё чаще стоит архитектура дообучения, которая влияет на стабильность, полезность и предсказуемость результата.
Как снижать «галлюцинации» в AI-генерации: не только промптом, но и проверкой фактов

В arXiv вышла работа про клиническое суммаризирование: Hallucination Detection-Guided Preference Optimization for Clinical Summarization. Суть не в медицине как таковой, а в подходе к качеству текста.

Авторы предложили два уровня контроля. Первый — во время генерации модель не просто пишет сводку, а получает сигнал от детектора фактических ошибок и по ходу правит проблемные места. Второй — такие цепочки правок превращают в пары предпочтений для дообучения, чтобы модель чаще выбирала более точные формулировки.

На тестах с Llama-3.1-8B-Instruct это дало заметный эффект: один вариант сократил галлюцинации на 24%, другой — на 48%. При этом текст не просел по читабельности, связности и релевантности, а качество подтверждали и эксперты, и LLM-Jury.

Почему это важно для no-code ops и маркетинга. Если вы собираете отчёты, карточки товаров, резюме встреч, CRM-заметки или черновики статей через AI, одного «хорошего промпта» уже мало. Нужна вторая линия защиты: проверка фактов, сравнение с источником, подсветка сомнительных фрагментов, ручное подтверждение критичных полей.

Особенно это полезно там, где ошибка стоит дорого: финансы, legal, медицина, B2B-аналитика, YMYL-контент, а также любые автоматизированные пайплайны, где текст потом уходит в публикацию или в CRM без редактора.

Практический вывод для no-code команд простой: качество AI-сценария растёт не от длины промпта, а от того, как вы встроили контроль фактов в сам процесс.
Как проверить, что LLM понимает задачу не только на полном контексте, но и по обрывкам данных

Проект ProjectionBench показал полезную для no-code и MarTech идею: модель стоит тестировать не только на финальном ответе, но и на том, как она собирает вывод по мере поступления информации.

В эксперименте сравнили GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro Preview на 45 научных статьях из областей bioactive materials, mechanical materials и nanomaterials. Схема была не совсем обычной: сначала модели получали только тему и исследовательский вопрос, а затем контекст раскрывали по частям. После каждого шага ответы сопоставляли с оригинальными выводами статей через семантическое сравнение атомарных утверждений.

Что важно для операционной работы с AI-инструментами: у GPT-5.4 даже при минимуме вводных сохранялось около 0.7 F1 alignment с выводами источника. То есть модель не просто «угадывала», а довольно стабильно строила рабочую гипотезу на неполной информации.

Для практики это полезно в нескольких сценариях:
- подбор и сравнение LLM для внутренних помощников;
- оценка качества ответов в AI Search;
- проверка, как модель ведёт себя, когда контент подгружается поэтапно;
- тестирование систем, где важно не красивое резюме, а совпадение с источником.

Если смотреть шире, такой подход помогает понять, какой инструмент лучше подходит для процессов с урезанным контекстом: саппорт-боты, ассистенты для аналитики, генерация summary, поиск по базе знаний. Не у всех моделей сильный финальный ответ означает сильную работу на промежуточных шагах. Именно это и показывает подобный бенчмарк.