Forge Creative Testing Lab Casebook
5 subscribers
1 photo
16 links
Creative Testing Lab / Casebook
Download Telegram
Техническая проверка канала.
Когда «меньше фич» действительно лучше: кейс про креативные тесты

На табличном бенчмарке из 3450 задач проверяли простую, но неудобную идею: если подать модели не весь набор признаков, а только «правильное ядро», качество прогноза часто растёт. Особенно это заметно, когда признаков много, а сигнал размазан по шуму. Но здесь есть важная оговорка: найти это ядро на практике очень трудно и дорого.

Для команды, которая гоняет креативы, вывод звучит почти буквальным переводом боли. Не каждый дополнительный параметр улучшает отбор. Иногда шире матрица гипотез, больше форматов, больше метрик — а learning velocity падает: тестов много, а решений мало. В такой ситуации выигрывает не тот, кто измеряет всё подряд, а тот, кто быстрее находит минимальный набор признаков, реально объясняющих результат.

В исследовании проблема упёрлась в три вещи:
- методы поиска «правильного поднабора» оптимизируют структуру, а не предсказание;
- ошибка пропуска важного признака и ошибка лишнего признака стоят модели по-разному;
- даже точный поднабор не всегда лучше полного набора признаков, если задача сформулирована не под prediction.

Практический вывод для creative testing: не усложняйте систему метрик раньше времени. Сначала проверьте, какие переменные действительно двигают CTR, CVR, удержание или post-click качество. И только потом расширяйте матрицу. Иначе можно потратить бюджет на «поиск идеальной схемы», которая красиво выглядит в отчёте, но почти не ускоряет принятие решений.
Креативные тесты ломаются не только из-за слабой идеи. Чаще проблема в том, что гипотеза верна для одной ситуации, а в соседнем сегменте уже не держится.

В свежей работе про Test Time Training for Supervised Causal Learning предлагают подход TTT-SCL: модель не просто обучается «вообще», а подстраивает обучающий набор под конкретный тестовый случай. Если перевести на язык креатив-лаборатории, это похоже на систему, которая пересобирает правила оценки под новый креатив, а не пытается мерить его одной фиксированной шкалой.

Почему это важно для команд, тестирующих креативы:
1. Синтетические бенчмарки часто выглядят аккуратно, но плохо отражают живой трафик.
2. При сдвиге контекста падают модели, которые были сильны на старых паттернах.
3. Особенно заметна деградация там, где важна комбинация факторов: оффер + визуал + аудитория + этап воронки.

В статье TTT-SCL обошёл прежние causal learning-подходы на синтетических, pseudo-real и реальных данных. Главное не сам рекорд, а вывод: устойчивость к изменению условий важнее красивой средней метрики.

Для creative testing это хороший повод пересмотреть матрицу гипотез. Если креатив выиграл в одном кластере, это ещё не значит, что он масштабируется на соседний сегмент. Нужны проверки на переносимость:
- разные углы оффера;
- разные уровни осведомлённости аудитории;
- разные форматы подачи;
- разные комбинации визуала и первого экрана.

И ещё один практический вывод: оценивать стоит не только CTR или CPA на одном прогоне, а скорость, с которой команда получает устойчивое знание. Иногда более ценен тест, который быстро показывает границы идеи, чем тот, который просто дал «хороший» средний результат.
Что показывают 5 миллионов ответов LLM про креативные тесты

Исследователи прогнали крупные языковые модели через массив из более чем 5 млн вопросов и сравнили, насколько их ответы совпадают с человеческими ценностными структурами. Использовали проверенные психологические опросники и теорию ценностей, а затем смотрели не только на декларируемые убеждения, но и на связь ценностей с поведением.

Главный вывод полезен не только для AI-исследований, но и для команд, которые тестируют креативы. У моделей, которым задали ценностный контекст, сильнее проявилось совпадение с человеческими паттернами: и на уровне структуры, и на уровне того, как эти ценности объясняют выбор.

Для creative testing это важный сигнал. Когда вы сравниваете креативы, мало смотреть на CTR, CPC и post-click метрики. Дальше начинается слой интерпретации: какой смысл считывает человек, какую эмоцию он приписывает офферу, в какой рамке модель или респондент перескажет сообщение.

Практический вывод для тестовых команд такой: гипотезы стоит строить не только вокруг визуала и механики оффера, но и вокруг ценностной рамки. Один и тот же креатив может читаться как «экономия времени», «снижение риска» или «статусное решение» — и это меняет результат теста.

Если команда использует LLM для генерации, кластеризации или анализа креативов, полезно проверять не только соответствие брифу, но и то, как модель формулирует смысл в пересказе. Это хороший способ поймать разрыв между тем, что хотел сказать бренд, и тем, что реально считывает аудитория.

Именно в таких тестах обычно растёт learning velocity: вы быстрее понимаете, какие смысловые рамки масштабируются, а какие дают шум даже при сильных метриках на первом экране.
Что ломает модель быстрее: жёсткая подгонка под одну задачу или более мягкая адаптация

В кейсе с Qwen2.5-3B-Instruct исследователи сравнили два способа дообучения и смотрели не только на точность, но и на то, что остаётся от базового поведения модели после перенастройки.

Результат получился практичный для всех, кто тестирует креативы, лендинги или AI-слой в воронке.

SFT, то есть supervised fine-tuning, быстрее даёт прирост по целевой задаче. Модель раньше начинает отвечать “как надо” в рамках нужного сценария. Но за этот выигрыш часто платят устойчивостью: часть исходных паттернов и общих связей деградирует заметно сильнее.

RL в этом исследовании двигался медленнее, зато лучше удерживал базовый контур. Иными словами, модель меньше теряла “старую форму”, хотя адаптация шла не так резко.

Авторы ввели метрику differential circuit vulnerability — по сути, это способ измерять, насколько сильно внутренние связи проседают после дообучения. Для креативного тестинга здесь важна не сама формула, а логика: сравнивать нужно не только uplift на тестовой задаче, но и цену этого uplift для системы в целом.

Если перевести это на маркетинг:
- быстрый выигрыш на одном сегменте может ухудшить поведение на других;
- локальный плюс в CTR или CVR не гарантирует, что модель останется стабильной в масштабировании;
- при массовой адаптации под нишу можно незаметно потерять качество “по базе”, а это всплывёт уже на следующем цикле тестов.

Для команд, которые тестируют креативы и используют LLM в генерации, классификации или ранжировании, вывод простой: оценивайте не только точность на текущем кейсе, но и сохранность общего поведения. Иначе можно получить сильный короткий выигрыш и более хрупкую систему в продакшене.
Как способ нарезки reasoning-цепочки влияет на качество креатива

В свежем arXiv-пейпере 2605.30327 авторы показали любопытную вещь: если в reasoning-модели не просто брать ответ целиком, а по-разному выбирать точки разреза в trace и пересэмпливать именно их, качество итоговой генерации заметно меняется. Их подход Entropy-Cut Metropolis-Hastings использует энтропию следующего токена как ориентир: модель ищет места, где у ответа есть развилка, и переигрывает именно эти участки.

Для лаборатории тестов креативов здесь важна не сама математика, а принцип. Финальный результат часто зависит не только от того, «умная» ли модель, но и от того, как она собирает ответ из промежуточных шагов. Две одинаковые базовые модели могут давать разную стабильность формулировок, фактов и логики, если у них отличается схема выбора точек пересборки.

Что это значит для команды, которая гоняет креативы через AI:
- стоит тестировать не только промпт и модель;
- важно сравнивать разные режимы декодинга и sampling;
- метрика должна смотреть не только на красивый финал, но и на устойчивость промежуточных решений.

Авторы отдельно отмечают, что время сходимости такого процесса больше зависит от числа «развилок» в цепочке, чем от длины текста. Для креативного тестинга это хороший ориентир: длинный ответ сам по себе не проблема, проблема — сколько в нём мест, где модель может уйти в другую траекторию.

Практический вывод простой: если вы оцениваете генерацию как часть воронки, смотрите на сборку ответа, а не только на его витрину. Иногда прирост качества даёт не новая модель, а более точный способ выбрать, где именно её «перезапускать».