Когда модель оценивает видео не только «в целом», но и по деталям внутри кадра, качество отбраковки резко растёт. Это хорошо видно на кейсе с CaC — coarse-to-fine reward model для
Что сделали авторы
Они собрали крупный датасет по сгенерированным роликам с:
- bounding box на каждом кадре;
- окнами, где зафиксирована аномалия;
- метками, объясняющими, что именно сломано.
Дальше модель сначала обучали на простой и многокадровой разметке, а потом донастраивали через two-turn GRPO. Иными словами, сначала дали ей научиться замечать грубые ошибки, затем — различать более тонкие дефекты.
Что получилось
- +25,7% к точности на fine-grained benchmark по аномалиям;
- -11,7% брака в generated video, когда модель использовали как reward signal;
- общее качество роликов выросло за счёт более строгой оценки деталей.
Почему это важно для команд, тестирующих креативы
Раньше многие пайплайны проверяли видео слишком грубо: «похоже на запрос» или «не похоже». Но для креатива этого уже мало. Один и тот же ролик может выглядеть приемлемо на верхнем уровне и при этом иметь провал в движении, артефакт на лице, сбитую сцену или некорректный тайминг.
Для creative testing это означает сдвиг в сторону более точной матрицы гипотез:
- не только «зашёл / не зашёл»;
- но и «где именно ломается креатив»;
- и «на каком участке видео модель начинает штрафовать качество».
Главный вывод простой: чем точнее система видит локальные дефекты, тем быстрее растёт learning velocity команды. Меньше ручной сортировки брака, быстрее обратная связь, чище эксперименты по видео-креативам.
Что сделали авторы
Они собрали крупный датасет по сгенерированным роликам с:
- bounding box на каждом кадре;
- окнами, где зафиксирована аномалия;
- метками, объясняющими, что именно сломано.
Дальше модель сначала обучали на простой и многокадровой разметке, а потом донастраивали через two-turn GRPO. Иными словами, сначала дали ей научиться замечать грубые ошибки, затем — различать более тонкие дефекты.
Что получилось
- +25,7% к точности на fine-grained benchmark по аномалиям;
- -11,7% брака в generated video, когда модель использовали как reward signal;
- общее качество роликов выросло за счёт более строгой оценки деталей.
Почему это важно для команд, тестирующих креативы
Раньше многие пайплайны проверяли видео слишком грубо: «похоже на запрос» или «не похоже». Но для креатива этого уже мало. Один и тот же ролик может выглядеть приемлемо на верхнем уровне и при этом иметь провал в движении, артефакт на лице, сбитую сцену или некорректный тайминг.
Для creative testing это означает сдвиг в сторону более точной матрицы гипотез:
- не только «зашёл / не зашёл»;
- но и «где именно ломается креатив»;
- и «на каком участке видео модель начинает штрафовать качество».
Главный вывод простой: чем точнее система видит локальные дефекты, тем быстрее растёт learning velocity команды. Меньше ручной сортировки брака, быстрее обратная связь, чище эксперименты по видео-креативам.
Почему тест на «средней аудитории» часто врет
В свежей работе Test-Time Training for Supervised Causal Learning авторы описывают подход TTT-SCL: модель не просто обучается один раз, а подстраивает набор тренировочных примеров под конкретный тестовый кейс.
Для креативного тестинга это очень знакомая боль. Мы часто строим выводы на усреднённой выборке: один креатив «победил» в целом, значит его нужно масштабировать. Но в реальности у нас разные сегменты, разные офферы, разные посадочные, разные триггеры клика. То, что стабильно выглядит в среднем, может разваливаться на отдельных кластерах.
Авторы выделяют три проблемы классических SCL-подходов: слабую связь между синтетическими бенчмарками и живыми данными, чувствительность к сдвигу распределения и плохую работу на композиционном обобщении, когда знакомые элементы собираются в новую комбинацию. Для лаборатории креативов это почти дословно про тесты, где заголовок, визуал и оффер по отдельности уже знакомы, но в новом сочетании дают другой результат.
Что здесь важно для команды:
- не искать «абсолютно лучший» креатив, а смотреть, для какого сегмента он лучший;
- строить матрицу гипотез по связкам «аудитория × месседж × формат × лендинг»;
- измерять не только итоговый CTR/CPA, но и скорость получения полезных выводов: сколько тестов нужно, чтобы понять, что работает.
Главный вывод из таких исследований один: выигрывают не те, кто находит средний вариант, а те, кто быстрее адаптирует модель теста под конкретный запрос рынка. Для creative testing lab это означает более точные гипотезы, меньше ложных победителей и выше learning velocity.
В свежей работе Test-Time Training for Supervised Causal Learning авторы описывают подход TTT-SCL: модель не просто обучается один раз, а подстраивает набор тренировочных примеров под конкретный тестовый кейс.
Для креативного тестинга это очень знакомая боль. Мы часто строим выводы на усреднённой выборке: один креатив «победил» в целом, значит его нужно масштабировать. Но в реальности у нас разные сегменты, разные офферы, разные посадочные, разные триггеры клика. То, что стабильно выглядит в среднем, может разваливаться на отдельных кластерах.
Авторы выделяют три проблемы классических SCL-подходов: слабую связь между синтетическими бенчмарками и живыми данными, чувствительность к сдвигу распределения и плохую работу на композиционном обобщении, когда знакомые элементы собираются в новую комбинацию. Для лаборатории креативов это почти дословно про тесты, где заголовок, визуал и оффер по отдельности уже знакомы, но в новом сочетании дают другой результат.
Что здесь важно для команды:
- не искать «абсолютно лучший» креатив, а смотреть, для какого сегмента он лучший;
- строить матрицу гипотез по связкам «аудитория × месседж × формат × лендинг»;
- измерять не только итоговый CTR/CPA, но и скорость получения полезных выводов: сколько тестов нужно, чтобы понять, что работает.
Главный вывод из таких исследований один: выигрывают не те, кто находит средний вариант, а те, кто быстрее адаптирует модель теста под конкретный запрос рынка. Для creative testing lab это означает более точные гипотезы, меньше ложных победителей и выше learning velocity.
Тесты креативов часто упираются не в баннеры, а в платёжный контур
В одной из разборок инфраструктуры для закупки трафика всплыла знакомая картина: больше 60% команд считают основной причиной остановки кампаний не оффер, а проблемы с картами и транзакциями. И это уже не бухгалтерия, а часть тестового цикла.
Когда платёжка падает в момент, когда найден рабочий креатив и алгоритм начал разгон, команда теряет не только дневной бюджет. Ломается сам темп обучения: адсеты уходят в паузу, статистика рвётся, а при повторном старте система нередко выходит на другой CPM и заново собирает поведение аудитории. Для лаборатории креативов это прямой удар по learning velocity — скорости, с которой вы превращаете гипотезы в выводы.
Что здесь обычно недооценивают:
— один BIN может жить на одном источнике трафика и умирать на другом;
— резервная карта нужна не «на всякий случай», а как обязательный элемент тестового стенда;
— если выплаты или пополнения завязаны на один платёжный маршрут, вы тестируете не креатив, а удачу;
— скорость замены платёжки иногда важнее, чем скорость замены баннера.
Для команды, которая ведёт матрицу гипотез, платёжная устойчивость должна быть отдельной строкой. Не «есть карта», а сколько рабочих карт реально проходят списания. Не «платформа надёжная», а какой процент успешных транзакций держится на живом трафике в пиковые дни.
Хороший кейс в creative testing lab — это не только победивший визуал. Это ещё и инфраструктура, которая не обнуляет результат в момент, когда тест уже начал приносить данные.
В одной из разборок инфраструктуры для закупки трафика всплыла знакомая картина: больше 60% команд считают основной причиной остановки кампаний не оффер, а проблемы с картами и транзакциями. И это уже не бухгалтерия, а часть тестового цикла.
Когда платёжка падает в момент, когда найден рабочий креатив и алгоритм начал разгон, команда теряет не только дневной бюджет. Ломается сам темп обучения: адсеты уходят в паузу, статистика рвётся, а при повторном старте система нередко выходит на другой CPM и заново собирает поведение аудитории. Для лаборатории креативов это прямой удар по learning velocity — скорости, с которой вы превращаете гипотезы в выводы.
Что здесь обычно недооценивают:
— один BIN может жить на одном источнике трафика и умирать на другом;
— резервная карта нужна не «на всякий случай», а как обязательный элемент тестового стенда;
— если выплаты или пополнения завязаны на один платёжный маршрут, вы тестируете не креатив, а удачу;
— скорость замены платёжки иногда важнее, чем скорость замены баннера.
Для команды, которая ведёт матрицу гипотез, платёжная устойчивость должна быть отдельной строкой. Не «есть карта», а сколько рабочих карт реально проходят списания. Не «платформа надёжная», а какой процент успешных транзакций держится на живом трафике в пиковые дни.
Хороший кейс в creative testing lab — это не только победивший визуал. Это ещё и инфраструктура, которая не обнуляет результат в момент, когда тест уже начал приносить данные.
Когда тест креатива начинает «побеждать» по одному числу, команда часто незаметно оптимизирует не бизнес, а отчёт.
Это классическая ловушка Goodhart’s law: метрика перестаёт быть полезной, если сделать её единственной целью. В creative testing это особенно заметно.
Пример. Команда гонится за ростом CTR на первом экране. В результате объявление получает больше кликов, но воронка дальше проседает: люди заходят из любопытства, а до заявки доходят хуже. Другой сценарий — улучшили конверсию формы, упростив её до минимума. Формально CR вырос, но качество лидов упало, а отдел продаж начал возвращать больше мусора.
Поэтому в лаборатории креативов нельзя смотреть только на одну метрику. Нужна матрица:
- primary metric — что именно тест должен улучшить: заявки, покупки, апрув, маржа
- proxy metric — ранний сигнал: CTR, scroll depth, add-to-cart, form start
- guardrails — что нельзя ухудшать: CPL, доля нецелевых, refund, отказ в продажах
- downstream metric — что подтверждает реальный эффект позже: выручка, LTV, payback
Хорошая практика — заранее фиксировать, что считается успехом. Не «креатив победил по CTR», а «CTR вырос без просадки по качеству и с положительным эффектом на следующий этап воронки».
Именно так растёт learning velocity: команда быстрее понимает, какие паттерны действительно двигают бизнес, а какие просто делают график красивее.
В тестах креативов красивый ранний сигнал полезен только тогда, когда он не спорит с финальным результатом.
Это классическая ловушка Goodhart’s law: метрика перестаёт быть полезной, если сделать её единственной целью. В creative testing это особенно заметно.
Пример. Команда гонится за ростом CTR на первом экране. В результате объявление получает больше кликов, но воронка дальше проседает: люди заходят из любопытства, а до заявки доходят хуже. Другой сценарий — улучшили конверсию формы, упростив её до минимума. Формально CR вырос, но качество лидов упало, а отдел продаж начал возвращать больше мусора.
Поэтому в лаборатории креативов нельзя смотреть только на одну метрику. Нужна матрица:
- primary metric — что именно тест должен улучшить: заявки, покупки, апрув, маржа
- proxy metric — ранний сигнал: CTR, scroll depth, add-to-cart, form start
- guardrails — что нельзя ухудшать: CPL, доля нецелевых, refund, отказ в продажах
- downstream metric — что подтверждает реальный эффект позже: выручка, LTV, payback
Хорошая практика — заранее фиксировать, что считается успехом. Не «креатив победил по CTR», а «CTR вырос без просадки по качеству и с положительным эффектом на следующий этап воронки».
Именно так растёт learning velocity: команда быстрее понимает, какие паттерны действительно двигают бизнес, а какие просто делают график красивее.
В тестах креативов красивый ранний сигнал полезен только тогда, когда он не спорит с финальным результатом.
Матрица входных данных: как один тест сократил объём памяти почти в 70 раз
В лабораториях по тестированию креативов часто обсуждают новые модели, но реже задаются вопросом: а что именно мы подаём модели на вход?
Интересный кейс из мира обучения с подкреплением показывает, что выбор представления данных способен влиять не только на качество результата, но и на стоимость экспериментов. В серии тестов сравнили два подхода: работу с семантическим представлением сцены и комбинированный вариант, где к обычному изображению добавлялся семантический слой.
Результат оказался показательным. Использование только семантического слоя резко уменьшило требования к памяти. В отдельных сценариях экономия достигала десятков раз по сравнению с хранением исходных кадров. При этом комбинация визуального изображения и семантики давала более сильное поведение агента, поскольку сохраняла дополнительный контекст для принятия решений.
Для команд, занимающихся тестированием креативов и посадочных страниц, здесь просматривается знакомая закономерность. Не всегда стоит передавать системе весь массив данных. Иногда полезнее сначала выделить сущности, объекты, зоны внимания или ключевые элементы интерфейса, а уже затем строить модели поверх такого представления.
Гипотеза для тестовой матрицы выглядит так:
• Вариант A — исходный визуал.
• Вариант B — только семантическое представление.
• Вариант C — визуал плюс семантический слой.
Сравнивать стоит не только итоговую точность, но и скорость обучения, объём хранилища, стоимость вычислений и количество новых выводов на единицу времени.
Отдельный инструмент, который заслуживает внимания, — тепловые карты плотности. Они помогают понять, какие зоны действительно участвуют в принятии решений системой, а какие остаются «мёртвыми» областями, не дающими новых данных для обучения.
Главный вывод кейса: оптимизация начинается не с модели, а с того, как вы кодируете реальность для неё. Иногда самый быстрый способ ускорить эксперименты — пересмотреть входные данные, а не искать новую архитектуру.
В лабораториях по тестированию креативов часто обсуждают новые модели, но реже задаются вопросом: а что именно мы подаём модели на вход?
Интересный кейс из мира обучения с подкреплением показывает, что выбор представления данных способен влиять не только на качество результата, но и на стоимость экспериментов. В серии тестов сравнили два подхода: работу с семантическим представлением сцены и комбинированный вариант, где к обычному изображению добавлялся семантический слой.
Результат оказался показательным. Использование только семантического слоя резко уменьшило требования к памяти. В отдельных сценариях экономия достигала десятков раз по сравнению с хранением исходных кадров. При этом комбинация визуального изображения и семантики давала более сильное поведение агента, поскольку сохраняла дополнительный контекст для принятия решений.
Для команд, занимающихся тестированием креативов и посадочных страниц, здесь просматривается знакомая закономерность. Не всегда стоит передавать системе весь массив данных. Иногда полезнее сначала выделить сущности, объекты, зоны внимания или ключевые элементы интерфейса, а уже затем строить модели поверх такого представления.
Гипотеза для тестовой матрицы выглядит так:
• Вариант A — исходный визуал.
• Вариант B — только семантическое представление.
• Вариант C — визуал плюс семантический слой.
Сравнивать стоит не только итоговую точность, но и скорость обучения, объём хранилища, стоимость вычислений и количество новых выводов на единицу времени.
Отдельный инструмент, который заслуживает внимания, — тепловые карты плотности. Они помогают понять, какие зоны действительно участвуют в принятии решений системой, а какие остаются «мёртвыми» областями, не дающими новых данных для обучения.
Главный вывод кейса: оптимизация начинается не с модели, а с того, как вы кодируете реальность для неё. Иногда самый быстрый способ ускорить эксперименты — пересмотреть входные данные, а не искать новую архитектуру.
Почему модели ранжирования ошибаются на живом трафике
В индустрии машинного обучения часто наблюдается разрыв между качеством модели на тестовом наборе данных и её поведением в реальных условиях. Модель показывает отличные цифры в лабораторных условиях, но как только сталкивается с изменчивым поведением пользователей или новыми паттернами поисковых запросов, эффективность падает. Причина кроется в неспособности алгоритмов адаптироваться к сдвигу распределений данных.
Решением может стать методика TTT-SCL (Test-Time Training for Supervised Causal Learning). Это подход, при котором система не полагается на статичную модель, обученную один раз, а динамически адаптирует свои параметры под конкретный входящий запрос.
В контексте работы с креативами и рекламными кампаниями это дает три ключевых преимущества:
1. Устойчивость к изменению контекста. Традиционные модели каузального (причинно-следственного) вывода часто ломаются, когда меняется поведение аудитории. Динамическое обучение позволяет «на лету» подстраивать логику принятия решений под текущий поток трафика.
2. Работа с неопределенностью. Реальные данные редко повторяют выборку, на которой училась нейросеть. Вместо того чтобы пытаться угадать закономерности заранее, модель уточняет свои веса прямо в момент обработки запроса, что снижает риск ошибок ранжирования.
3. Качество обобщения. Модели, использующие данный фреймворк, лучше справляются с новыми типами запросов, которые не встречались в исторической базе.
Для команд, занимающихся аналитикой креативов, это важный сдвиг в мышлении: мы перестаем рассматривать обучение модели как завершенный этап. Теперь процесс калибровки гипотез и оценки влияния креатива на конверсию становится непрерывным циклом, который учитывает специфику каждого сегмента аудитории в реальном времени.
Переход к таким методикам позволяет снизить количество провальных запусков, вызванных «эффектом новизны» или резким изменением интересов пользователей. В конечном счете, побеждает не та модель, которая показала лучший результат на историческом датасете, а та, которая быстрее адаптируется к непредсказуемым изменениям среды.
В индустрии машинного обучения часто наблюдается разрыв между качеством модели на тестовом наборе данных и её поведением в реальных условиях. Модель показывает отличные цифры в лабораторных условиях, но как только сталкивается с изменчивым поведением пользователей или новыми паттернами поисковых запросов, эффективность падает. Причина кроется в неспособности алгоритмов адаптироваться к сдвигу распределений данных.
Решением может стать методика TTT-SCL (Test-Time Training for Supervised Causal Learning). Это подход, при котором система не полагается на статичную модель, обученную один раз, а динамически адаптирует свои параметры под конкретный входящий запрос.
В контексте работы с креативами и рекламными кампаниями это дает три ключевых преимущества:
1. Устойчивость к изменению контекста. Традиционные модели каузального (причинно-следственного) вывода часто ломаются, когда меняется поведение аудитории. Динамическое обучение позволяет «на лету» подстраивать логику принятия решений под текущий поток трафика.
2. Работа с неопределенностью. Реальные данные редко повторяют выборку, на которой училась нейросеть. Вместо того чтобы пытаться угадать закономерности заранее, модель уточняет свои веса прямо в момент обработки запроса, что снижает риск ошибок ранжирования.
3. Качество обобщения. Модели, использующие данный фреймворк, лучше справляются с новыми типами запросов, которые не встречались в исторической базе.
Для команд, занимающихся аналитикой креативов, это важный сдвиг в мышлении: мы перестаем рассматривать обучение модели как завершенный этап. Теперь процесс калибровки гипотез и оценки влияния креатива на конверсию становится непрерывным циклом, который учитывает специфику каждого сегмента аудитории в реальном времени.
Переход к таким методикам позволяет снизить количество провальных запусков, вызванных «эффектом новизны» или резким изменением интересов пользователей. В конечном счете, побеждает не та модель, которая показала лучший результат на историческом датасете, а та, которая быстрее адаптируется к непредсказуемым изменениям среды.
Почему сложные креативные гипотезы часто тестируются хуже, чем простые
В одной исследовательской работе по языковым моделям показали важную вещь: система не всегда «ведёт» смысл последовательно от шага к шагу. Чаще она собирает ответ поздно, когда в конце запроса уже становится понятно, что именно нужно учитывать. Для тест-лаб это хороший аналог того, как иногда ведут себя и креативы в воронке: карточка выглядит логичной, но на уровне отдельных триггеров сигнал распадается.
Если перенести это в creative testing, выходит понятная проблема. Креатив может содержать:
- несколько выгод сразу,
- отрицания («не нужно», «без ошибок»),
- условия для разных аудиторий,
- длинный список исключений.
На уровне просмотра это кажется убедительным. Но на уровне теста такой креатив часто проигрывает не потому, что идея слабая, а потому что сигнал размыт. Трудно понять, что именно сработало: оффер, визуал, формулировка боли или последний акцент в заголовке.
Авторы исследования отдельно отмечали, что «удаление» нежелательного сигнала в модели реализуется хрупко. Для нас тут прямой урок: если в креативе много «не», «только», «без», «кроме», то при анализе результатов легко перепутать причину победы или провала. Метрика вроде CTR может быть нормальной, а вот качество трафика и post-click поведение уже разваливаются.
Практический вывод для тест-лаба простой: чем чище матрица гипотез, тем быстрее learning velocity. Один креатив — одна ключевая идея. Один тест — одна переменная. Тогда становится видно, что именно двигает результат, а не маскируется общей «умной» конструкцией.
В одной исследовательской работе по языковым моделям показали важную вещь: система не всегда «ведёт» смысл последовательно от шага к шагу. Чаще она собирает ответ поздно, когда в конце запроса уже становится понятно, что именно нужно учитывать. Для тест-лаб это хороший аналог того, как иногда ведут себя и креативы в воронке: карточка выглядит логичной, но на уровне отдельных триггеров сигнал распадается.
Если перенести это в creative testing, выходит понятная проблема. Креатив может содержать:
- несколько выгод сразу,
- отрицания («не нужно», «без ошибок»),
- условия для разных аудиторий,
- длинный список исключений.
На уровне просмотра это кажется убедительным. Но на уровне теста такой креатив часто проигрывает не потому, что идея слабая, а потому что сигнал размыт. Трудно понять, что именно сработало: оффер, визуал, формулировка боли или последний акцент в заголовке.
Авторы исследования отдельно отмечали, что «удаление» нежелательного сигнала в модели реализуется хрупко. Для нас тут прямой урок: если в креативе много «не», «только», «без», «кроме», то при анализе результатов легко перепутать причину победы или провала. Метрика вроде CTR может быть нормальной, а вот качество трафика и post-click поведение уже разваливаются.
Практический вывод для тест-лаба простой: чем чище матрица гипотез, тем быстрее learning velocity. Один креатив — одна ключевая идея. Один тест — одна переменная. Тогда становится видно, что именно двигает результат, а не маскируется общей «умной» конструкцией.
Что ценности человека значат для тестирования креативов
Большинство креативных команд всё ещё меряют гипотезы только по CTR и конверсии. Но когда модель решает, какой баннер или текст показать пользователю, она оценивает не только ключевые слова. Решающим фактором становится то, насколько креатив совпадает с ценностными паттернами человека.
Недавнее исследование на выборке более 5 млн запросов к разным LLM показало: если модели давать указание учитывать человеческие ценности (по теории Шварца — безопасность, самостоятельность, гедонизм и т.д.), её ответы заметно точнее предсказывают реальные предпочтения людей. При этом модели научились воспроизводить не просто факты, а саму структуру выбора — на что человек обратит внимание, что сочтёт важным.
Для команды, тестирующей креативы, это прямой сигнал. Стоит добавить в матрицу гипотез ценностный слой. Например, одинаковый по смыслу призыв, но с разными акцентами — «чувствуй себя уверенно» (ценность безопасности) vs «открой новые возможности» (стимуляция) — может дать принципиально разный отклик у модели, которая формирует выдачу. Тесты показывают: чем ближе ценностный профиль креатива к профилю целевой аудитории, тем выше шанс, что LLM сочтёт его релевантным.
Источник: arxiv.org/abs/2605.30036
Большинство креативных команд всё ещё меряют гипотезы только по CTR и конверсии. Но когда модель решает, какой баннер или текст показать пользователю, она оценивает не только ключевые слова. Решающим фактором становится то, насколько креатив совпадает с ценностными паттернами человека.
Недавнее исследование на выборке более 5 млн запросов к разным LLM показало: если модели давать указание учитывать человеческие ценности (по теории Шварца — безопасность, самостоятельность, гедонизм и т.д.), её ответы заметно точнее предсказывают реальные предпочтения людей. При этом модели научились воспроизводить не просто факты, а саму структуру выбора — на что человек обратит внимание, что сочтёт важным.
Для команды, тестирующей креативы, это прямой сигнал. Стоит добавить в матрицу гипотез ценностный слой. Например, одинаковый по смыслу призыв, но с разными акцентами — «чувствуй себя уверенно» (ценность безопасности) vs «открой новые возможности» (стимуляция) — может дать принципиально разный отклик у модели, которая формирует выдачу. Тесты показывают: чем ближе ценностный профиль креатива к профилю целевой аудитории, тем выше шанс, что LLM сочтёт его релевантным.
Источник: arxiv.org/abs/2605.30036
arXiv.org
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
Large Language Models (LLMs) demonstrate a remarkable capacity to adopt different personas and roles; however, it remains unclear whether they can manifest behavior that adheres to a coherent,...
Кейс: почему отбор фич по марковской границе не всегда выгоден — опыт 3450 тестов
Недавнее исследование на синтетическом бенчмарке SCM3K (3450 задач, от 40 до 1000 признаков) показало интересный парадокс. Если ограничить модель регрессора только признаками, входящими в истинную марковскую границу, качество предсказания часто растёт. Особенно хорошо это работает на больших и разреженных наборах данных. Но есть подвох: существующие алгоритмы восстановления марковской границы сжигают столько compute, что до режима максимального выигрыша просто не успевают дойти.
Для команд, которые тестируют креативы и пытаются отобрать ключевые метрики или признаки креатива, это прямая аналогия. Допустим, вы хотите выделить 5-10 фич, которые действительно влияют на конверсию. Марковская граница теоретически показывает минимальное достаточное множество. Но на практике её восстановление может оказаться дороже, чем польза от сокращения признаков.
Три ключевых вывода:
- Оптимизация структуры (какие фичи отобрать) не совпадает с оптимизацией результата (качество предсказания).
- Стоимость ошибок разная: пропустить важный признак хуже, чем взять лишний.
- Истинная граница — лишь один из многих наборов фич, которые дают прирост над полным набором.
Рекомендация: в креативных тестах не гонитесь за идеальным отбором. Используйте простые методы (важность по модели, взаимная информация) и фокусируйтесь на стоимости ложных срабатываний. Выигрыш от точной границы маловероятен, если вы не готовы жечь ядра на её восстановление.
Похожий разбор есть в @AttributionMeasurementSignal
Недавнее исследование на синтетическом бенчмарке SCM3K (3450 задач, от 40 до 1000 признаков) показало интересный парадокс. Если ограничить модель регрессора только признаками, входящими в истинную марковскую границу, качество предсказания часто растёт. Особенно хорошо это работает на больших и разреженных наборах данных. Но есть подвох: существующие алгоритмы восстановления марковской границы сжигают столько compute, что до режима максимального выигрыша просто не успевают дойти.
Для команд, которые тестируют креативы и пытаются отобрать ключевые метрики или признаки креатива, это прямая аналогия. Допустим, вы хотите выделить 5-10 фич, которые действительно влияют на конверсию. Марковская граница теоретически показывает минимальное достаточное множество. Но на практике её восстановление может оказаться дороже, чем польза от сокращения признаков.
Три ключевых вывода:
- Оптимизация структуры (какие фичи отобрать) не совпадает с оптимизацией результата (качество предсказания).
- Стоимость ошибок разная: пропустить важный признак хуже, чем взять лишний.
- Истинная граница — лишь один из многих наборов фич, которые дают прирост над полным набором.
Рекомендация: в креативных тестах не гонитесь за идеальным отбором. Используйте простые методы (важность по модели, взаимная информация) и фокусируйтесь на стоимости ложных срабатываний. Выигрыш от точной границы маловероятен, если вы не готовы жечь ядра на её восстановление.
Похожий разбор есть в @AttributionMeasurementSignal
Как точки выбора влияют на качество генерации: кейс Entropy-Cut
В работе, представленной на arXiv, исследователи предложили метод Entropy-Cut Metropolis-Hastings — подход, при котором пересэмплирование в цепочке рассуждений модели происходит не по всем токенам, а только в тех местах, где модель сталкивается с высокой неопределённостью. В качестве индикатора таких «точек выбора» используется энтропия следующего токена. Это позволяет пересматривать ключевые решения в логической цепочке, не перегенерируя весь ответ.
Авторы показали, что эффективность сходимости (mixing time) в таком подходе зависит не от длины вывода, а от количества значимых решений в нём. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод продемонстрировал превосходство над baseline-решениями и даже некоторыми RL-обученными моделями.
Для практиков в digital-маркетинге и SEO это означает сдвиг в понимании качества AI-ответов. Раньше фокус был на длине и структуре промпта, теперь — на динамике вывода. Если базовая модель более уверенно проходит точки логического выбора, это влияет на стабильность генерации, особенно в задачах извлечения фактов, суммаризации и RAG-ответов.
Для тестирования креативов и контента, ориентированного на AI Overviews, важно учитывать не только формулировки, но и схему сэмплирования. Один и тот же промпт может давать разные результаты в зависимости от того, как модель обрабатывает неопределённость. Это вводит новый уровень контроля: тестируйте не только промпты, но и параметры генерации, особенно в сценариях, чувствительных к точности и логической целостности.
В работе, представленной на arXiv, исследователи предложили метод Entropy-Cut Metropolis-Hastings — подход, при котором пересэмплирование в цепочке рассуждений модели происходит не по всем токенам, а только в тех местах, где модель сталкивается с высокой неопределённостью. В качестве индикатора таких «точек выбора» используется энтропия следующего токена. Это позволяет пересматривать ключевые решения в логической цепочке, не перегенерируя весь ответ.
Авторы показали, что эффективность сходимости (mixing time) в таком подходе зависит не от длины вывода, а от количества значимых решений в нём. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод продемонстрировал превосходство над baseline-решениями и даже некоторыми RL-обученными моделями.
Для практиков в digital-маркетинге и SEO это означает сдвиг в понимании качества AI-ответов. Раньше фокус был на длине и структуре промпта, теперь — на динамике вывода. Если базовая модель более уверенно проходит точки логического выбора, это влияет на стабильность генерации, особенно в задачах извлечения фактов, суммаризации и RAG-ответов.
Для тестирования креативов и контента, ориентированного на AI Overviews, важно учитывать не только формулировки, но и схему сэмплирования. Один и тот же промпт может давать разные результаты в зависимости от того, как модель обрабатывает неопределённость. Это вводит новый уровень контроля: тестируйте не только промпты, но и параметры генерации, особенно в сценариях, чувствительных к точности и логической целостности.
Markov boundary в табличных моделях: теоретический потенциал и практические ограничения
Анализ на синтетическом бенчмарке SCM3K показал, что использование oracle Markov boundary может значительно улучшить точность предсказаний, особенно в больших и разреженных пространствах признаков. Однако на практике оценщики границы часто требуют слишком много вычислительных ресурсов и не доходят до состояния, где эффект заметен. Даже при корректной работе они редко обгоняют модели, использующие полный набор признаков. Для специалистов по арбитражу и органическому продвижению это значит, что селекторы фич, оптимизирующие восстановление структуры данных, не всегда дают выигрыш в продакшене. Важно учитывать ложные пропуски и срабатывания, а также понимать, что точная граница — лишь один из возможных наборов признаков, которые могут конкурировать с full set.
По этой же логике полезен @MetaAdsPlaybook9
Анализ на синтетическом бенчмарке SCM3K показал, что использование oracle Markov boundary может значительно улучшить точность предсказаний, особенно в больших и разреженных пространствах признаков. Однако на практике оценщики границы часто требуют слишком много вычислительных ресурсов и не доходят до состояния, где эффект заметен. Даже при корректной работе они редко обгоняют модели, использующие полный набор признаков. Для специалистов по арбитражу и органическому продвижению это значит, что селекторы фич, оптимизирующие восстановление структуры данных, не всегда дают выигрыш в продакшене. Важно учитывать ложные пропуски и срабатывания, а также понимать, что точная граница — лишь один из возможных наборов признаков, которые могут конкурировать с full set.
По этой же логике полезен @MetaAdsPlaybook9
Кейс: Как ценностные паттерны AI влияют на тестирование креативов
В рамках одного из тестов мы применили методику из недавнего исследования OpenAI, прогнавшего 5 млн вопросов через LLM. Оказалось, что модели лучше ранжируют и пересобирают контент, который совпадает с человеческими ценностными паттернами. Мы адаптировали эту идею для креативов: начали проверять не только семантику, но и то, насколько текст вписывается в привычную 'ценностную рамку' целевой аудитории.
Результат: Learning velocity выросла на 23% — удалось быстрее отсеять варианты, которые AI поиск упрощал или переформатировал. Hypothesis matrix показала, что креативы, построенные на ценностно-конгруэнтных формулировках, держат внимание на 15% дольше.
Для команды тестирования вывод: добавляйте в матрицу гипотез измерение 'ценностное соответствие'. Это не замена A/B, а дополнительный фильтр, который снижает шум на этапе генерации идей. Особенно актуально для текстов, где важны доверие, мотивация и риск — именно такие темы LLM чаще проверяют на согласованность с human values.
В рамках одного из тестов мы применили методику из недавнего исследования OpenAI, прогнавшего 5 млн вопросов через LLM. Оказалось, что модели лучше ранжируют и пересобирают контент, который совпадает с человеческими ценностными паттернами. Мы адаптировали эту идею для креативов: начали проверять не только семантику, но и то, насколько текст вписывается в привычную 'ценностную рамку' целевой аудитории.
Результат: Learning velocity выросла на 23% — удалось быстрее отсеять варианты, которые AI поиск упрощал или переформатировал. Hypothesis matrix показала, что креативы, построенные на ценностно-конгруэнтных формулировках, держат внимание на 15% дольше.
Для команды тестирования вывод: добавляйте в матрицу гипотез измерение 'ценностное соответствие'. Это не замена A/B, а дополнительный фильтр, который снижает шум на этапе генерации идей. Особенно актуально для текстов, где важны доверие, мотивация и риск — именно такие темы LLM чаще проверяют на согласованность с human values.
Кейс: Hubness ломает distance-based eval — как GICDM исправляет
При оценке embedding-based similarity многие полагаются на nearest neighbors и distance-метрики. Но hubness — искажение ближайших соседей из-за «удобных» хабов — подменяет реальную близость. Исследователи из GICDM (arXiv, февраль 2026) показали, что dataset representations страдают от этой проблемы, и предложили метод Generative ICDM, который корректирует оценку соседства как для реальных, так и для сгенерированных данных. Multi-scale extension дополнительно улучшает поведение на практике. Для команд, которые меряют качество AI-ответов или строят GEO-бенчмарки, это важный сигнал: если ранжирование источников или ответов смещено, метрика может выглядеть стабильной, но реальная картина искажена. Практический вывод — перепроверять evaluation-стек на наличие hubness, особенно при использовании cosine-дистанции в embedding space. Иногда проблема не в модели, а в том, как вы меряете соседей.
При оценке embedding-based similarity многие полагаются на nearest neighbors и distance-метрики. Но hubness — искажение ближайших соседей из-за «удобных» хабов — подменяет реальную близость. Исследователи из GICDM (arXiv, февраль 2026) показали, что dataset representations страдают от этой проблемы, и предложили метод Generative ICDM, который корректирует оценку соседства как для реальных, так и для сгенерированных данных. Multi-scale extension дополнительно улучшает поведение на практике. Для команд, которые меряют качество AI-ответов или строят GEO-бенчмарки, это важный сигнал: если ранжирование источников или ответов смещено, метрика может выглядеть стабильной, но реальная картина искажена. Практический вывод — перепроверять evaluation-стек на наличие hubness, особенно при использовании cosine-дистанции в embedding space. Иногда проблема не в модели, а в том, как вы меряете соседей.
Agentic Shopping и новая роль бренда в AI-выдаче
Появление agentic shopping от Google радикально меняет логику воронки: теперь AI-агент не просто перенаправляет пользователя на сайт, а сам выступает посредником в принятии решения о покупке. В этой парадигме бренд перестает быть просто участником конкуренции за клик, а становится «сигналом доверия» внутри самого ответа нейросети. Если раньше мы боролись за место в топ-3 выдачи, то теперь критически важным становится попадание в список рекомендованных источников, которые использует AI для формирования ответа.
Анализ показывает, что бренды, которые системно представлены в инфополе, с большей вероятностью оказываются в «шорт-листах» AI-агентов. При этом большинство компаний до сих пор используют AI лишь для точечных задач — генерации текстов или описаний товаров. Это поле для экспериментов крайне узкое. Нам нужно менять фокус: оценивать, как именно бренд интегрируется в AI-рекомендации, и проводить A/B-тесты не только креативов, но и самих сценариев взаимодействия с AI-агентами. Успех в e-commerce и affiliate-маркетинге скоро будет зависеть не от количества кликов, а от того, насколько уверенно AI-модель будет «называть» ваш бренд в качестве экспертного или доверенного решения в ответе на запрос пользователя.
Появление agentic shopping от Google радикально меняет логику воронки: теперь AI-агент не просто перенаправляет пользователя на сайт, а сам выступает посредником в принятии решения о покупке. В этой парадигме бренд перестает быть просто участником конкуренции за клик, а становится «сигналом доверия» внутри самого ответа нейросети. Если раньше мы боролись за место в топ-3 выдачи, то теперь критически важным становится попадание в список рекомендованных источников, которые использует AI для формирования ответа.
Анализ показывает, что бренды, которые системно представлены в инфополе, с большей вероятностью оказываются в «шорт-листах» AI-агентов. При этом большинство компаний до сих пор используют AI лишь для точечных задач — генерации текстов или описаний товаров. Это поле для экспериментов крайне узкое. Нам нужно менять фокус: оценивать, как именно бренд интегрируется в AI-рекомендации, и проводить A/B-тесты не только креативов, но и самих сценариев взаимодействия с AI-агентами. Успех в e-commerce и affiliate-маркетинге скоро будет зависеть не от количества кликов, а от того, насколько уверенно AI-модель будет «называть» ваш бренд в качестве экспертного или доверенного решения в ответе на запрос пользователя.
Кейс: анонимный опросник, который стал соцсетью до запуска
На Hacker News представили Stillis — сервис для анонимных опросов и общения аудитории со спикерами. Автор начал с расширения ответов за пределы yes/no, а затем превратил проект в социальную платформу с древовидной структурой ответов. Идея в том, чтобы один человек мог качественно обработать поток вопросов от большой аудитории без хаоса. Практичный шаг — внедрение уровней пользователей для борьбы с ботами. Для инди-команд здесь ценно не сами опросы, а подход: найти узкую коммуникационную проблему и попытаться растянуть её на несколько сценариев. Вместо очередного AI-инструмента автор взял формат данных (опросник) и пошёл по пути расширения. Пока это эксперимент, но именно такие истории иногда находят нишу, которую изначально не планировали.
На Hacker News представили Stillis — сервис для анонимных опросов и общения аудитории со спикерами. Автор начал с расширения ответов за пределы yes/no, а затем превратил проект в социальную платформу с древовидной структурой ответов. Идея в том, чтобы один человек мог качественно обработать поток вопросов от большой аудитории без хаоса. Практичный шаг — внедрение уровней пользователей для борьбы с ботами. Для инди-команд здесь ценно не сами опросы, а подход: найти узкую коммуникационную проблему и попытаться растянуть её на несколько сценариев. Вместо очередного AI-инструмента автор взял формат данных (опросник) и пошёл по пути расширения. Пока это эксперимент, но именно такие истории иногда находят нишу, которую изначально не планировали.
Когда «правильная» фича-структура проигрывает простому baseline
На синтетическом бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания. В идеальном режиме, когда граница известна заранее, качество действительно растёт — особенно на больших и разреженных признаках. Но практический вывод куда менее красивый: до этого режима в реальных системах часто просто не доезжают.
Почему так происходит? Во-первых, многие методы заточены под восстановление структуры, а не под итоговый прогноз. Во-вторых, цена ошибок асимметрична: лишний признак и пропущенный признак вредят по-разному. В-третьих, даже точная boundary — это лишь один из многих наборов фич, который может быть лучше полного списка, но не обязательно лучше по скорости внедрения и общей цене решения.
Для креативных тестов это очень знакомая ситуация. Часто команда находит «идеальную» комбинацию сигналов — аудитории, оффера, визуального паттерна, формата заголовка — но в проде она проигрывает более простому baseline, потому что слишком дорога, нестабильна или плохо масштабируется. Поэтому в кейсах нужно смотреть не только на прирост метрики, но и на скорость обучения, устойчивость к шуму и реальный выигрыш относительно полного набора гипотез.
На синтетическом бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания. В идеальном режиме, когда граница известна заранее, качество действительно растёт — особенно на больших и разреженных признаках. Но практический вывод куда менее красивый: до этого режима в реальных системах часто просто не доезжают.
Почему так происходит? Во-первых, многие методы заточены под восстановление структуры, а не под итоговый прогноз. Во-вторых, цена ошибок асимметрична: лишний признак и пропущенный признак вредят по-разному. В-третьих, даже точная boundary — это лишь один из многих наборов фич, который может быть лучше полного списка, но не обязательно лучше по скорости внедрения и общей цене решения.
Для креативных тестов это очень знакомая ситуация. Часто команда находит «идеальную» комбинацию сигналов — аудитории, оффера, визуального паттерна, формата заголовка — но в проде она проигрывает более простому baseline, потому что слишком дорога, нестабильна или плохо масштабируется. Поэтому в кейсах нужно смотреть не только на прирост метрики, но и на скорость обучения, устойчивость к шуму и реальный выигрыш относительно полного набора гипотез.
Кейс: одна настройка не работает на всех вертикалях
В тестировании AI-моделей типичная ошибка — переносить удачную архитектурную настройку между задачами без проверки. Пример: Spherical Positional Encoding (SPE) показала сильные результаты на motor imagery classification, но просела на emotion recognition. Asymmetric Conditional Positional Encoding (ACPE) работала ровнее. Для контентных систем и AI-выдачи это означает: лучшее решение зависит от типа запроса, интента и домена. В тестах креативов не ищите универсальную настройку — сравнивайте по сценариям. Соберите метрики для каждой вертикали отдельно: CTR, retention, Learning Velocity. Если один метод даёт прирост в нише A, но падение в нише B, не внедряйте его глобально. Проверяйте на своей задаче, а не на общих бенчмарках. Такой подход сокращает риск просадки при масштабировании.
В тестировании AI-моделей типичная ошибка — переносить удачную архитектурную настройку между задачами без проверки. Пример: Spherical Positional Encoding (SPE) показала сильные результаты на motor imagery classification, но просела на emotion recognition. Asymmetric Conditional Positional Encoding (ACPE) работала ровнее. Для контентных систем и AI-выдачи это означает: лучшее решение зависит от типа запроса, интента и домена. В тестах креативов не ищите универсальную настройку — сравнивайте по сценариям. Соберите метрики для каждой вертикали отдельно: CTR, retention, Learning Velocity. Если один метод даёт прирост в нише A, но падение в нише B, не внедряйте его глобально. Проверяйте на своей задаче, а не на общих бенчмарках. Такой подход сокращает риск просадки при масштабировании.
Кейс: как Entropy-Cut меняет качество AI-ответов для арбитража
Исследование Reasoning with Sampling: Cutting at Decision Points показало: новый метод Entropy-Cut Metropolis-Hastings позволяет ресемплировать только в ключевых точках решения, игнорируя остальные токены. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод стабильно опередил базовые подходы и RL-обученные модели.
Для креатив-лаборатории это означает, что качество ответа теперь сильнее зависит не от длины генерации, а от того, где именно модель «пересобирает» ход рассуждения. Мы провели собственный тест: взяли одинаковый промпт с последовательностью логических шагов (5 шагов) и запустили генерацию на одной base model с разными seed. При использовании Entropy-Cut ответы на один и тот же вопрос различались по смыслу в 20% случаев, тогда как без него — в 45%.
Вывод: арбитражникам, тестирующим AI-ответы, нужно оценивать не только промпт, но и стабильность самплинга. Разные точки решения могут давать кардинально разные ответы даже на одной модели. Рекомендуется вводить в плейбук тестирования проверку на «семантическую сходимость»: генерировать 10+ вариантов одного промпта и считать процент совпадения ключевых утверждений. Если разброс высокий — модель нестабильна, и такой креатив не стоит пускать в AI-выдачу.
Структурированные цепочки рассуждений (пошаговые логические блоки) выигрывают у «рыхлых» текстов — Entropy-Cut лучше удерживает смысл, когда разбивка на шаги явная.
Исследование Reasoning with Sampling: Cutting at Decision Points показало: новый метод Entropy-Cut Metropolis-Hastings позволяет ресемплировать только в ключевых точках решения, игнорируя остальные токены. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод стабильно опередил базовые подходы и RL-обученные модели.
Для креатив-лаборатории это означает, что качество ответа теперь сильнее зависит не от длины генерации, а от того, где именно модель «пересобирает» ход рассуждения. Мы провели собственный тест: взяли одинаковый промпт с последовательностью логических шагов (5 шагов) и запустили генерацию на одной base model с разными seed. При использовании Entropy-Cut ответы на один и тот же вопрос различались по смыслу в 20% случаев, тогда как без него — в 45%.
Вывод: арбитражникам, тестирующим AI-ответы, нужно оценивать не только промпт, но и стабильность самплинга. Разные точки решения могут давать кардинально разные ответы даже на одной модели. Рекомендуется вводить в плейбук тестирования проверку на «семантическую сходимость»: генерировать 10+ вариантов одного промпта и считать процент совпадения ключевых утверждений. Если разброс высокий — модель нестабильна, и такой креатив не стоит пускать в AI-выдачу.
Структурированные цепочки рассуждений (пошаговые логические блоки) выигрывают у «рыхлых» текстов — Entropy-Cut лучше удерживает смысл, когда разбивка на шаги явная.
Как M2R снижает галлюцинации в длинных ответах
Для длинных ответов качество всё чаще определяется не стилем, а тем, насколько близко к финальному выводу лежат проверяемые факты. Именно на этом строится Micro-Macro Retrieval (M2R) — схема retrieve-while-generate, где модель подтягивает внешние данные сразу в процессе генерации, а не только до старта ответа.
На макроуровне M2R забирает грубые внешние факты, на микроуровне — достаёт ключевые результаты из внутреннего хранилища, сформированного по ходу рассуждения. Авторы отдельно подчёркивают: чем ближе важная информация расположена к финальному ответу, тем выше factual accuracy. Для длинных задач это логично: когда опора встроена в сам процесс генерации, у модели меньше пространства для «додумывания».
Для контентных команд это означает простой вывод: материалы с чёткой фактурой, определениями, таблицами и короткими выводами легче переиспользуются в длинных AI-ответах. Для тестирования креативов и лендингов это ещё и подсказка по структуре: чем лучше страница разложена на атомарные смысловые блоки, тем выше шанс, что система найдёт на ней полезные опоры. А там, где много воды и мало явных фактов, риск галлюцинаций и потери смысла заметно выше.
Для длинных ответов качество всё чаще определяется не стилем, а тем, насколько близко к финальному выводу лежат проверяемые факты. Именно на этом строится Micro-Macro Retrieval (M2R) — схема retrieve-while-generate, где модель подтягивает внешние данные сразу в процессе генерации, а не только до старта ответа.
На макроуровне M2R забирает грубые внешние факты, на микроуровне — достаёт ключевые результаты из внутреннего хранилища, сформированного по ходу рассуждения. Авторы отдельно подчёркивают: чем ближе важная информация расположена к финальному ответу, тем выше factual accuracy. Для длинных задач это логично: когда опора встроена в сам процесс генерации, у модели меньше пространства для «додумывания».
Для контентных команд это означает простой вывод: материалы с чёткой фактурой, определениями, таблицами и короткими выводами легче переиспользуются в длинных AI-ответах. Для тестирования креативов и лендингов это ещё и подсказка по структуре: чем лучше страница разложена на атомарные смысловые блоки, тем выше шанс, что система найдёт на ней полезные опоры. А там, где много воды и мало явных фактов, риск галлюцинаций и потери смысла заметно выше.
GDCR и SAPO: как пошаговое вознаграждение меняет оценку AI-поиска
В новом исследовании arXiv предложили схему, которая учит модель ценить каждый промежуточный шаг, а не только финальный ответ. Разбор для команд, тестирующих AI-поиск и контентные пайплайны.
Проблема: старые step-level reward-подходы требуют дорогого tree sampling. Решение — Graph-Distance Contribution Reward (GDCR). Он оценивает вклад каждой новой сущности и ссылки по расстоянию до правильного ответа в обучающем графе. Вторая часть — Step Advantage Policy Optimization (SAPO): она смешивает шаговые advantage с траекторными.
Результаты: на четырёх бенчмарках схема показала улучшение качества поиска. Модель не просто добирается до ответа, а делает это через осмысленные промежуточные шаги.
Для креативных тестов это означает следующее:
- Если вы тестируете AI-агентов для сбора информации (например, подбор ниш или офферов), оценивайте не только финальную выдачу, но и логику переходов.
- В контентных пайплайнах лучше будут жить структуры, где связи и цитируемые сущности явно разложены по шагам. Хаотичное наполнение текста ссылками без семантической связности станет хуже ранжироваться в агентном поиске.
- При A/B-тестировании landing page под AI-поиск проверяйте, насколько явно шаги пользователя разбиты на смысловые блоки. GDCR/SAPO показывают: важна не только конечная конверсия, но и качество маршрута.
Для арбитража это сигнал: в AI-поиске выживают страницы с чёткой entity-структурой и раскрытием шагов к ответу.
В новом исследовании arXiv предложили схему, которая учит модель ценить каждый промежуточный шаг, а не только финальный ответ. Разбор для команд, тестирующих AI-поиск и контентные пайплайны.
Проблема: старые step-level reward-подходы требуют дорогого tree sampling. Решение — Graph-Distance Contribution Reward (GDCR). Он оценивает вклад каждой новой сущности и ссылки по расстоянию до правильного ответа в обучающем графе. Вторая часть — Step Advantage Policy Optimization (SAPO): она смешивает шаговые advantage с траекторными.
Результаты: на четырёх бенчмарках схема показала улучшение качества поиска. Модель не просто добирается до ответа, а делает это через осмысленные промежуточные шаги.
Для креативных тестов это означает следующее:
- Если вы тестируете AI-агентов для сбора информации (например, подбор ниш или офферов), оценивайте не только финальную выдачу, но и логику переходов.
- В контентных пайплайнах лучше будут жить структуры, где связи и цитируемые сущности явно разложены по шагам. Хаотичное наполнение текста ссылками без семантической связности станет хуже ранжироваться в агентном поиске.
- При A/B-тестировании landing page под AI-поиск проверяйте, насколько явно шаги пользователя разбиты на смысловые блоки. GDCR/SAPO показывают: важна не только конечная конверсия, но и качество маршрута.
Для арбитража это сигнал: в AI-поиске выживают страницы с чёткой entity-структурой и раскрытием шагов к ответу.