Creative Testing Lab Signal
3 subscribers
1 photo
15 links
Creative Testing Lab / How-to
Download Telegram
Как тестировать длинные видео для AI-креативов без потери контекста

Работа с длинными видео всегда была вызовом для команд, которые создают AI-креативы. Проблема в том, что типичные модели начинают “забывать” происходящее примерно на 40–60-й секунде: нейросети теряют связь между сценами, а персонажи перестают быть узнаваемыми.

Недавно в исследовании HD-EPIC-VQA показали, что проблему можно решать через двухуровневый подход. Первый уровень — семантический — строит общую структуру ролика, фиксируя ключевые события и логику сюжета. Второй — визуальный — отслеживает объекты, сцены и детали через bounding boxes и визуальные встраивания (embeddings). На этапе инференса модель получает именно те сегменты, которые нужны под конкретный запрос.

Для практики это значит: длинные UGC-креативы в формате TikTok или Reels можно не загружать целиком. Их удобно делить на смысловые и визуальные блоки, чтобы AI сохранял непрерывность персонажей и событий. Один и тот же герой может появляться через десяток сцен, при этом модель не “теряет нить” истории.

Для команд, которые тестируют креативы, это открывает новые возможности. Можно формировать матрицы гипотез и learning velocity на основе отдельных evidence-блоков, ускоряя проверку идей без жертв качества. В перспективе подобные подходы превратятся в полноценные инструменты контроля качества креативов, где баеры смогут видеть, как AI обрабатывает каждый сегмент видео.

Это не просто техническая новинка, а метод, который напрямую повышает стабильность и предсказуемость AI-креативов в длинных форматах.
Соберу самостоятельный пост под how-to: оставлю идею про end-to-end тестирование voice-агентов, но переупакую в методику для команд, которые проверяют креативы и воронки.Как провер

У voice-ботов часто ломается не «голос как таковой», а связка из трёх вещей: задача, диалог и устойчивость к шуму. Поэтому тест «поговорили две минуты — вроде нормально» почти ничего не показывает.

Полезнее смотреть на voice-testing как на обычный creative testing: сначала задаёте гипотезы, потом раскладываете их по матрице сценариев, а уже после считаете, где теряется качество.

Что стоит проверять отдельно:
- выполнение задачи: довёл ли агент до нужного результата;
- качество диалога: не сбивается ли на 3–5 реплике;
- устойчивость к реальным условиям: акцент, фон, паузы, перебивания;
- поведение на нестандартных ответах: уход с темы, уточняющие вопросы, сомнения.

На практике удобнее строить тест не вокруг одного «идеального» разговора, а вокруг набора сценариев. Например, одна ось — тип лида или клиента, вторая — сложность диалога, третья — качество связи. Тогда видно не просто среднюю оценку, а где именно проседает learning velocity: в каком сегменте модель быстро обучается, а где требует ручной донастройки.

Хороший ориентир для команды: считать отдельно две метрики — одну за выполнение задачи, вторую за качество общения. Если одна растёт, а вторая падает, значит решение ещё не готово к боевому запуску.

Для команд, которые тестируют креативы, AI SDR или voice-воронки, это полезный сдвиг мышления: не «нравится/не нравится», а «в каком сценарии гипотеза выдерживает реальный разговор».
Как языковые модели читают креативы: вывод для тестирования

Свежее исследование arXiv показало: большие языковые модели (LLM) не обрабатывают информацию последовательно, отслеживая состояния в каждом токене. Вместо этого они собирают релевантные признаки только в последнем токене, когда запрос становится полностью известен. Сложные цепочки условий, исключения и смена статусов модели «видят» как отдельные фрагменты, а не как единый сценарий.

Для команд, тестирующих креативы, это прямой сигнал: если в вашем креативе заложена динамика (например, изменение текста в зависимости от времени суток, последовательность шагов в видео, условные элементы в баннере), алгоритмы модерации или AI-анализ могут не понять логику. Они не «помнят», что было на втором кадре — они видят только то, что лежит рядом с ключевым запросом.

На практике это значит: тестируя креатив со сложным сценарием, обязательно проверяйте, как ключевые призна́ки (статус, условия, акценты) повторяются в каждой смысловой части. Если вы меняете сущность — например, продукт переходит из статуса «предзаказ» в «в продаже» — эту смену нужно дублировать в соседних блоках текста или визуала. Не рассчитывайте, что модель догадается по цепочке.

Простой чеклист для тестера:
- В каждом фрагменте креатива (кадр, абзац, кнопка) явно указаны текущие атрибуты продукта.
- Условные элементы (скидка только для первых 100, акция до даты) продублированы в ближайшем контексте.
- Избегайте конструкций, где вывод о состоянии зависит от предыдущего шага — модель может его пропустить.

Это не о SEO, а о том, как устроено восприятие текста современными алгоритмами. При тестировании креативов, особенно в соцсетях, учитывайте эту особенность. Простая структура с явными повторяющимися сигналами снижает риск, что сложная логика сломается в автоматическом анализе.
Как защитить watermarking от paraphrase: подход AliMark на уровне предложений

AliMark предлагает переосмыслить sentence-level watermarking как задачу синхронизации битовой последовательности с текстом по секретному ключу. Вместо простой маркировки отдельных токенов — сложное кодирование, где устойчивость достигается за счёт двухэтапной детекции и адаптивного выравнивания.

Сначала система генерирует несколько переписанных версий текста (paraphrase-кандидаты), затем выравнивает их битовые последовательности с эталонной. Такой multi-candidate alignment снижает шанс потери сигнала при операциях merge и split предложений — классической уязвимости prefix-based схем.

Эксперименты показали, что AliMark стабильно превосходит существующие state-of-the-art методы при атаках через перефразирование, особенно против DIPPER и GPT-3.5. При этом традиционные подходы, основанные на фиксированном префиксе, теряют целостность маркировки уже на слабых переформулировках.

Для SEO и AI Search это критично: если текст легко трансформируется и теряет структуру, любая поверхностная маркировка становится ненадёжной. Это повышает уровень шума при проверке происхождения контента и снижает доверие к меткам.

Что делать командам: не полагаться на единую схему watermarking, особенно если контент проходит через рерайт-цепочки. Вместо этого — строить многоуровневые проверки, включая семантическую целостность, retrieval-подтверждение и динамическое выравнивание. Только так можно повысить learning velocity в тестировании контентных защит.
CaC: точная детекция аномалий в видео

Модель CaC (Concentrate and Concentrate) использует coarse-to-fine подход на базе Vision-Language Models для поиска аномалий в видео. Авторы подготовили большой датасет с per-frame bounding boxes, временными окнами аномалий и тонкой разметкой причин. Обучение шло через двухэтапный GRPO после supervised fine-tuning. Результат: точность на fine-grained аномалиях выросла на 25.7%, а количество сгенерированных ошибок снизилось на 11.7%, при этом общее качество видео улучшилось. Для команд, работающих с AI-креативом и UGC, это значит, что теперь модели смогут точнее выявлять мелкие дефекты, артефакты и подмены лиц, а также оценивать контент по кадрам и времени. Итог: качество исходников и последующая оценка роликов алгоритмами заметно повышаются.
Устойчивость моделей в условиях смены интентов: зачем нужен TTT-SCL

Работа с AI в маркетинге и поиске часто упирается в одну проблему: модель отлично работает на обучающей выборке, но «плывет» при столкновении с реальными, смещенными запросами пользователей. Это особенно критично для арбитража трафика и SEO, где паттерны поведения аудитории меняются быстрее, чем обновляются датасеты.

Фреймворки типа TTT-SCL предлагают решение: динамическую подстройку под конкретный тестовый пример прямо в процессе вывода. Это позволяет модели не опираться на «застывшую» истину, а адаптироваться к контексту «на лету».

Что это значит для практики тестирования креативов и контента:

1. Анализируйте «длинный хвост». Ваши модели должны тестироваться не только на идеальных запросах из ТЗ, но и на максимально «грязных» данных — запросах с опечатками, смешанными интентами и нетипичной структурой.
2. Устойчивость важнее точности. В условиях нестабильной выдачи побеждает та модель (или тот подход к генерации), которая демонстрирует меньший разброс результатов при изменении входных условий.
3. Композиционное обобщение. Если вы используете AI для создания объявлений или лендингов, проверяйте, как он справляется с новыми комбинациями смыслов. Если модель выдает «галлюцинации» при малейшем отклонении от шаблона — значит, она жестко переобучена на старых паттернах.

В эпоху постоянного дрейфа данных выигрывают те, кто внедряет методы динамической адаптации, а не просто полагается на стандартные промпты.
Как строить контент под системы, которые ищут по сущностям

Поисковые системы постепенно уходят от модели, где важен только финальный ответ. Всё больше внимания получают промежуточные шаги: какие объекты были найдены, как они связаны между собой и какую роль сыграли в формировании результата.

Для команд, работающих с контентом и тестированием гипотез, это меняет подход к структуре материалов.

Первый принцип — описывать не отдельные ключевые слова, а сущности. Бренды, продукты, категории, технологии, люди и процессы становятся самостоятельными узлами информации.

Второй принцип — показывать связи между ними. Хороший материал не просто перечисляет факты, а объясняет, как один объект влияет на другой и почему эта связь имеет значение.

Третий принцип — делать путь к выводу прозрачным. Если статья приводит к какому-то заключению, читатель и поисковая система должны видеть логику переходов между тезисами.

Для тестирования контента это открывает новую матрицу гипотез. Можно проверять не только заголовки и форматы подачи, но и полноту покрытия сущностей внутри темы. Иногда рост качества материала связан не с добавлением текста, а с устранением пробелов в графе знаний, который этот текст формирует.

По мере развития агентных поисковых систем выигрывать будут материалы, где структура знаний продумана заранее. Чем понятнее карта сущностей и отношений внутри контента, тем выше вероятность, что система сможет использовать её как надёжную основу для ответа пользователю.
Адаптация контента под AI Search: ценностная логика вместо простого SEO

Исследования нейросетевых моделей показывают, что современные LLM научились имитировать человеческие ценностные установки. Это критический инсайт для тех, кто занимается SEO и контентным маркетингом: алгоритмы поиска теперь оценивают не только релевантность текста запросу, но и качество «человеческой логики» в ответе.

Как это влияет на стратегию создания контента?
Для AI-выдачи (AI Overviews) наиболее эффективны тексты, которые строятся вокруг принятия решений. Если ваш целевой запрос подразумевает выбор, сравнение или оценку, модель будет искать в тексте четкие критерии. Понимание ценностей аудитории — это новая база для написания текстов. Модель отдает предпочтение контенту, который предлагает структуру «проблема — критерии выбора — решение», так как это совпадает с паттерном человеческого мышления, на котором обучались модели.

Методические рекомендации для тестирования:
1. Анализ сценариев: при создании контента моделируйте ситуацию «почему пользователь должен выбрать это». Прописывайте логику приоритетов прямо в тексте.
2. Структура аргументации: используйте сравнительные таблицы и списки, которые помогают модели быстро считывать критерии выбора. Это упрощает AI задачу «выжимки» смысла и повышает шансы на попадание в блок прямого ответа.
3. Фокус на мотивации: в тех кластерах, где пользователь сомневается, выигрывают тексты, где есть понятная человеческая логика. Если модель понимает, «почему это важно», она охотнее подтягивает такой контент в свои ответы. Перестаньте оптимизировать только под роботов — начните оптимизировать под психологию выбора, которую теперь «понимает» и сам алгоритм.

Связанная тема раскрывается в @NativePushTrafficStack
Как оценивать шаги агентного поиска, а не только финальный ответ

В Agentic Search всё чаще становится важным не только то, что система ответила, но и как именно она дошла до ответа. В новой работе для этого предложили два слоя оценки: Graph-Distance Contribution Reward, который начисляет reward на уровне шага за новые сущности, найденные и процитированные в процессе поиска, и Step Advantage Policy Optimization, где учитываются и шаги, и итог траектории.

Для команд, которые тестируют поисковые и answer-driven сценарии, это полезный поворот. Если раньше качество часто сводили к финальному результату, то теперь видно, где именно агент теряет полезные сигналы: на сборе фактов, на связывании сущностей или на финальной сборке ответа. Это делает разбор провалов гораздо точнее.

Главный вывод для Creative Testing Lab в том, что тестировать нужно не только конечный output, но и промежуточные слои. Если контент должен хорошо распаковываться в сущности, цитаты и логические переходы, у него выше шанс встроиться в длинные цепочки поиска и ранжирования.

Для редакторов и стратегов это ещё один аргумент в пользу структурных текстов. Материалы, где есть чёткая иерархия смыслов, понятные связки и явные опорные элементы, лучше проходят через системы, которые оценивают не один ответ, а всю траекторию к нему.
Сокращение фич в табличных данных: когда марковская граница оправдана

Недавнее исследование на синтетическом бенчмарке SCM3K (3450 задач, 40–1000 признаков, 6 семейств SCM) проверило, помогает ли oracle Markov boundary в табличном предсказании. Результат: если ограничить регрессор истинной границей, качество часто заметно растёт — особенно на широких и разреженных наборах признаков.

Но есть нюанс: существующие оценщики границы обычно съедают так много вычислительных ресурсов, что не успевают выйти на режим реальной пользы. Даже когда выходят, они редко обгоняют модель на полном множестве фич. Авторы связывают провал с тем, что многие методы оптимизируют структурную корректность границы, а не предсказательную способность.

Практический вывод для команд, тестирующих модели конверсии: не измеряйте успех feature selection только метриками recovery. Если ваш пайплайн с большим числом признаков уже упирается в стоимость отбора признаков, а не в обучение — возможно, oracle-граница вам не нужна. Дешевле оставить все фичи и добавить регуляризацию. Для лёгких моделей (линейные, деревья) попробуйте простой отбор по важности, для тяжёлых — сначала оцените бюджет compute на поиск минимума.
Как адаптировать контент под ценностные паттерны LLM: пошаговая инструкция

Исследование на 5 млн вопросов показало: LLM отлично воспроизводят человеческие ценностные структуры. Если вы продвигаете контент в AI-выдачу, стоит пересмотреть не только семантику, но и то, как вы формулируете ценность продукта.

Шаг 1. Определите ценностные профили вашей аудитории. Используйте стандартные психологические опросники (Шварц, Рокич) или данные с CRM.

Шаг 2. Сопоставьте формулировки ваших креативов с этими профилями. Например, если аудитория ценит безопасность, делайте упор на гарантии и проверенные решения.

Шаг 3. Тестируйте несколько вариантов текста: с акцентом на разные ценности (достижение, универсализм, традиция). Замеряйте, какие варианты чаще попадают в AI-пересказы.

Шаг 4. Включайте в контент «поведенческие триггеры» — сравнения, логику выбора, социальное доказательство. LLM считывают эти паттерны как человеческие.

Шаг 5. Отслеживайте изменения в выдаче AI Search после внедрения. Если процент совпадений с summaries вырос — подход работает.

Важно: не имитируйте ценности искусственно, а опирайтесь на реальные данные об аудитории. Тогда LLM «узнает» ваш контент как релевантный.
Гранулярный контроль в AI-поиске: меняем подход к оценке действий агента

Разработка методов оценки Agentic Search смещается от анализа финального результата к детальному разбору каждого шага. Новый подход Graph-Distance Contribution Reward (GDCR) предлагает измерять пользу действий агента через расстояние до целевой сущности в графе знаний. Вместе с механизмом Step Advantage Policy Optimization (SAPO) это позволяет системе понимать не просто «что» стало ответом, а «какой именно» источник или переход привел к верному решению.

Для тех, кто выстраивает цепочки коммуникации с пользователем, это сигнал к смене парадигмы. Раньше мы оценивали эффективность связки по конечному конверсионному действию. Теперь, когда AI-агенты становятся инструментом доставки контента, критически важным становится качество «промежуточных сигналов». В условиях алгоритмического поиска выигрывают структуры, где связи между сущностями логичны, цитирование подтверждено, а порядок подачи информации обоснован графовой структурой данных. Чтобы оставаться релевантными в поисковой выдаче будущего, нужно фокусироваться не на длине цепочки, а на связности и доказательности каждого шага внутри вашего контента.
Почему в reasoning важнее точка развилки, а не длина ответа

Новая схема Entropy-Cut показывает важный для контентных пайплайнов принцип: качество ответа зависит не только от количества токенов, но и от того, где модель принимает решение. Алгоритм ищет ключевые decision points в reasoning trace по энтропии next-token и ресэмплит ответ именно с этих мест. То есть фокус смещается с «длиннее рассуждай» на «переиграй там, где модель сомневается».

Для команд, которые используют генерацию в SEO, GEO и AI Overviews, это практичный сигнал. Если вы строите пайплайн на reasoning-моделях, то шум на длинной цепочке можно уменьшать не бесконечным расширением промпта, а более умной механикой ресэмплинга и отбора. В исследованиях метод обгонял базовые подходы на MATH500, HumanEval, GPQA Diamond и AIME26, что подтверждает сам принцип.

Как применять в работе с креативами и текстами: отдельно тестировать не только финальный output, но и поведение модели в точках неопределённости. Если ответ стабилен после развилки — это хороший кандидат в продакшн. Если модель «плывёт» именно на решающем шаге, увеличение длины ответа не спасёт. Для тестовой команды это означает, что метрика качества должна учитывать не только результат, но и механизм его получения.

Для соседнего контекста загляни в @TiktokAdsOpinion4
Калибровка AI-прогнозов: залог доверия в интерфейсах

Foundation-модели для временных рядов показывают значительный прогресс в точности калибровки по сравнению с базовыми алгоритмами. Проблема «слишком уверенных ошибок» была ахиллесовой пятой глубокого обучения, но новые подходы к оценке вероятностей меняют правила игры. В контексте AI-выдачи и поисковых интерфейсов это критический фактор оценки качества. Когда модель адекватно оценивает степень своей уверенности, её прогнозы становятся более надежными для пользователя, что напрямую влияет на кликабельность и удержание. Для маркетологов, работающих с витринами товаров или финансовыми сервисами, где задействованы AI-рекомендации, это важный сигнал. Будущее конверсии в таких интерфейсах будет зависеть от того, насколько «честно» модель преподносит информацию. Там, где прогнозы выглядят излишне самоуверенно, пользователь интуитивно чувствует подвох. Модели, которые умеют подтверждать свои выводы или маркировать границы допустимого, получают больше доверия. При тестировании креативов и контентных связок обращайте внимание на то, как AI-инструменты подают данные: чем выше адекватность оценки модели, тем выше шанс, что пользователь воспримет рекомендацию как экспертную, а не как случайный набор предложений.
Когда категорию начинают размывать, метрики читаются хуже

В креативном тестировании есть знакомая ловушка: вы видите рост по верхнему уровню отчётности, но не понимаете, какой именно слой дал вклад. В таких ситуациях особенно важно не смешивать разные источники трафика, форматы и сценарии в одну корзину. Иначе learning velocity выглядит прилично, а реальные выводы расплываются.

Хороший ориентир — следить не только за итоговой выручкой или конверсией, но и за тем, как именно собирается категория. Если продуктовая линия объединяет разные механики под одной меткой, аналитика становится удобнее для отчёта и заметно хуже для тестов. Команде сложнее сравнивать гипотезы, потому что меняется не только креатив, но и контекст измерения.

Для лаборатории тестов отсюда простой вывод: при каждом новом запуске фиксируйте границы эксперимента. Что считается одним сегментом, что выносится отдельно, где проходит линия между «похожими» гипотезами и разными задачами. Чем аккуратнее структура измерения, тем меньше риск сделать ложный вывод из красивой общей цифры.

Связанная тема раскрывается в @ScoutMetaAds
GEO: меняем подход к оптимизации контента

Поисковая выдача трансформируется: значительная доля запросов сегодня закрывается без переходов на сайты, так как ответы агрегируются внутри поисковиков или AI-инструментов. Для команд, работающих с трафиком, это не означает смерть SEO, но требует пересмотра стратегии. Статистика показывает, что хотя доля прямого трафика из AI-инструментов остается невысокой, его качество зачастую выше: пользователи, приходящие по наводке ИИ, демонстрируют более высокий intent и конверсию. Это превращает Generative Engine Optimization (GEO) в отдельное направление, требующее настройки контента под специфику «интеллектуальных» ответов. Вместо погони только за позициями в выдаче, фокус смещается на то, как ваш бренд или оффер представлен в источниках, которые «скармливаются» языковым моделям. Ключевая сложность — атрибуция: пока данные размыты, а каналы нестабильны. Однако игнорировать этот слой уже нельзя. Рекомендую начать тесты с анализа того, насколько ваш контент структурирован для машинного чтения: есть ли в нем четкие ответы на конкретные вопросы, которые ИИ может подтянуть как релевантный контекст.
Как тестировать креативы в healthcare-маркетинге с учётом HIPAA

Healthcare-кампании требуют особого подхода к трекингу и атрибуции. Если вы используете MMP (например, Branch, AppsFlyer), важно понять, когда обычная аналитика становится обработкой PHI (protected health information). Вот пошаговая инструкция для команды тестирования креативов.

Шаг 1. Определите, является ли ваш трекинг HIPAA-подлежащим. Три условия: ваша организация — covered entity или business associate; вы обрабатываете PHI; PHI создаётся, принимается, хранится или передаётся в рамках программы. Если event связывается с device ID, IP или cookie и этот event относится к здоровью пользователя (например, просмотр рекламы лекарства), то эти технические идентификаторы становятся PHI.

Шаг 2. Разделите данные на три категории: fully identifiable PHI (содержит прямые идентификаторы), de-identified data (обезличенные, не подпадают под HIPAA) и limited data sets (ограниченные, без прямых идентификаторов, но с географией и датами). Для тестирования креативов старайтесь использовать de-identified data — это безопаснее и упрощает compliance.

Шаг 3. Настройте pipeline: убедитесь, что любой участник цепочки — analytics platform, attribution provider, маркетинговое агентство — подписал BAA (Business Associate Agreement). Если вы передаёте event-ы с health-related контекстом через postback, то ваш MMP становится business associate.

Шаг 4. Проверьте payload событий. Если в событии указан идентификатор, а контекст (URL кампании, категория товара) явно указывает на здоровье — это PHI. Для тестов используйте агрегированные данные без привязки к пользователю. Например, замеряйте CTR по креативу в разрезе гео, а не по конкретному device ID.

Шаг 5. Документируйте compliance. Ведите лог, какие данные собираются, кто их обрабатывает и какой статус (PHI/de-identified). Это поможет при аудите и при масштабировании на новые гео.

Итог: healthcare-трекинг можно вести, если сегментировать данные и подписывать BAA. Для тестов креативов используйте обезличенные данные — это снижает риски и ускоряет learning velocity.
Тестирование каузальных моделей: почему бенчмарки не гарантируют успех в продакшене

Методология TTT-SCL (Test-Time Training for Supervised Causal Learning) в очередной раз подсвечивает проблему разрыва между синтетическими тестами и реальностью. Многие модели, демонстрирующие отличные результаты на «стерильных» датасетах, начинают терять точность при столкновении с распределением живого трафика или смешанными интентами. Для команд, внедряющих AI-инструменты в ранжирование и аналитику намерений пользователей, это главный риск-фактор.

Чтобы модель оставалась стабильной, недостаточно ориентироваться на базовые метрики. Необходим регулярный стресс-тест на distribution shift — проверку того, как алгоритм справляется с изменением контекста и новыми паттернами пользовательского поведения. Внедряйте в свои рабочие процессы обязательный этап тестирования на «грязных» данных, имитирующих реальные запросы. Если модель не проходит проверку на смешанных интентах, она будет создавать просадки в конверсии, даже если формально она кажется высокоэффективной. Настоящая устойчивость системы проверяется не в демо-версии, а в условиях постоянного изменения входных данных.
Адаптация AI-пайплайнов под динамику спроса

В условиях, когда пользовательские формулировки меняются быстрее, чем обновляются модели, классические подходы к обучению начинают проигрывать. Фреймворк TTT-SCL (Test Time Training for Supervised Causal Learning) — это попытка уйти от статичных бенчмарков к гибкой настройке под конкретную задачу. Для систем, отвечающих за retrieval и понимание интента, это критически важный сдвиг.

Главная проблема существующих решений — хрупкость при столкновении с данными, которые не вписываются в привычную логику (distribution shift). Если ваш текущий AI-стек показывает отличные результаты на синтетических тестах, но «тормозит» на реальных пользовательских запросах, значит, модель не умеет адаптироваться к контексту «на лету».

Как использовать это в работе? При проектировании систем обработки запросов или скоринга связей сущностей, закладывайте возможность динамической перенастройки весов под текущий поток данных. Оценивайте эффективность не только по точности ответов, но и по стабильности работы на нестандартных, редких запросах. Устойчивость модели к сдвигам — это основной показатель её готовности к работе в реальном digital-продакшене.
How-to: Используйте человеческие паттерны выбора в контенте под AI Search

LLM всё точнее воспроизводят не только текст, но и структуру человеческих ценностей. Исследование на 5 млн вопросов показало: совпадение ценностных профилей моделей с людьми сильно по двум направлениям — по самим структурам ценностей и по связи ценностей с поведением. Это значит, что AI Search ранжирует контент, ориентируясь не на ключевые слова, а на то, насколько текст соответствует типичным для человека моделям аргументации и приоритизации.

Как это применить в тестировании креативов:

1. При подготовке контента под AI Overviews стройте текст не вокруг запроса, а вокруг логики выбора. Например, если пользователь ищет «лучший бюджетный ноутбук», модель ожидает сравнение по цене, надёжности, отзывам — именно в такой последовательности.
2. Используйте value-prompted подходы: вставьте в текст явные ценностные метки (надёжность, скорость, безопасность) в той же пропорции, что и у целевой аудитории.
3. Проверяйте контент на релевантность не только по TF-IDF, но и по семантической близости к типичным человеческим паттернам. Для этого подойдут модели sentence-transformers, обученные на ценностных структурах.

Сигнал для тест-команд: при оценке гипотез креативов замеряйте не только CTR, но и соответствие ценностному профилю аудитории. Чем ближе текст к человеческому, тем выше шанс, что AI Search выберет его в сниппет.