Когда “правильные” признаки всё равно проигрывают: урок из SCM3K
На бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания в табличных моделях. В выборке — 3 450 задач, от 40 до 1000 признаков и шесть семейств SCM. Результат получился не совсем комфортным для теории: если дать регрессору oracle-boundary, качество действительно заметно растёт, особенно на более разреженных и больших признаках. Но на практике оценщики boundary часто упираются в вычислительные ограничения раньше, чем достигают режимов, где эффект становится максимальным.
Есть и ещё одна важная деталь: даже когда boundary удаётся восстановить, полный набор признаков она обгоняет нечасто. Это хороший пример того, как “структурно правильное” решение не всегда выигрывает в боевых условиях. Слишком много зависит от цены ошибок, ограничений по времени и того, что именно оптимизирует алгоритм — восстановление структуры или прогноз.
Для Meta Ads этот вывод хорошо ложится на работу с креативами, аудиторией и сигналами конверсии. Упрощение модели отбора не гарантирует рост качества, если система начинает терять важные, но неочевидные факторы. В закупке, как и в ML, важен не только красивый набор признаков, но и то, как он ведёт себя в проде, где цена false negative и false positive различается.
На бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания в табличных моделях. В выборке — 3 450 задач, от 40 до 1000 признаков и шесть семейств SCM. Результат получился не совсем комфортным для теории: если дать регрессору oracle-boundary, качество действительно заметно растёт, особенно на более разреженных и больших признаках. Но на практике оценщики boundary часто упираются в вычислительные ограничения раньше, чем достигают режимов, где эффект становится максимальным.
Есть и ещё одна важная деталь: даже когда boundary удаётся восстановить, полный набор признаков она обгоняет нечасто. Это хороший пример того, как “структурно правильное” решение не всегда выигрывает в боевых условиях. Слишком много зависит от цены ошибок, ограничений по времени и того, что именно оптимизирует алгоритм — восстановление структуры или прогноз.
Для Meta Ads этот вывод хорошо ложится на работу с креативами, аудиторией и сигналами конверсии. Упрощение модели отбора не гарантирует рост качества, если система начинает терять важные, но неочевидные факторы. В закупке, как и в ML, важен не только красивый набор признаков, но и то, как он ведёт себя в проде, где цена false negative и false positive различается.
Почему «идеальная» оптимизация в Meta Ads часто не доезжает до продакшена
В исследовании на синтетическом бенчмарке SCM3K проверили довольно приземлённую для медиабайинга вещь: помогает ли сокращение набора признаков, если подбирать его не по красоте схемы, а по влиянию на прогноз. Модель сравнивали на 3 450 задачах, где было от 40 до 1000 фичей и несколько семейств структурных моделей.
Главный вывод полезен именно для performance-команд: если регрессор ограничить только «правильным» подмножеством признаков, качество предсказания часто растёт. Особенно заметно это в широких и разреженных пространствах, где полный набор фичей шумит и мешает находить сигнал.
Но есть проблема, знакомая любому, кто пытался собрать «идеальную» структуру кампаний, аудиторий и событий. Методы, которые восстанавливают boundary, обычно тратят слишком много вычислений ещё до того, как доходят до режима, где есть реальная польза. В итоге на практике они нередко проигрывают простому full feature set.
Авторы отдельно показывают, почему так происходит:
- алгоритмы часто оптимизируются под восстановление структуры, а не под качество прогноза;
- цена ошибки «не добрали важный сигнал» и «добавили лишний шум» может быть разной;
- и даже точная boundary не гарантирует победу над другими наборами признаков.
Для Meta Ads отсюда прямой рабочий вывод: не путать красивую схему с полезной. Урезать набор сигналов, событий или аудиторий имеет смысл только тогда, когда это даёт прирост на CPA, ROAS, CVR или стабильности обучения. Иначе «чище» не значит «лучше» — особенно в кампаниях, где модель и так живёт на грани данных и шума.
В исследовании на синтетическом бенчмарке SCM3K проверили довольно приземлённую для медиабайинга вещь: помогает ли сокращение набора признаков, если подбирать его не по красоте схемы, а по влиянию на прогноз. Модель сравнивали на 3 450 задачах, где было от 40 до 1000 фичей и несколько семейств структурных моделей.
Главный вывод полезен именно для performance-команд: если регрессор ограничить только «правильным» подмножеством признаков, качество предсказания часто растёт. Особенно заметно это в широких и разреженных пространствах, где полный набор фичей шумит и мешает находить сигнал.
Но есть проблема, знакомая любому, кто пытался собрать «идеальную» структуру кампаний, аудиторий и событий. Методы, которые восстанавливают boundary, обычно тратят слишком много вычислений ещё до того, как доходят до режима, где есть реальная польза. В итоге на практике они нередко проигрывают простому full feature set.
Авторы отдельно показывают, почему так происходит:
- алгоритмы часто оптимизируются под восстановление структуры, а не под качество прогноза;
- цена ошибки «не добрали важный сигнал» и «добавили лишний шум» может быть разной;
- и даже точная boundary не гарантирует победу над другими наборами признаков.
Для Meta Ads отсюда прямой рабочий вывод: не путать красивую схему с полезной. Урезать набор сигналов, событий или аудиторий имеет смысл только тогда, когда это даёт прирост на CPA, ROAS, CVR или стабильности обучения. Иначе «чище» не значит «лучше» — особенно в кампаниях, где модель и так живёт на грани данных и шума.
Micro-Macro Retrieval: как снизить галлюцинации AI в контентных воронках
Новый фреймворк M2R (Micro-Macro Retrieval) решает проблему галлюцинаций в длинных ответах. Он работает в режиме retrieve-while-generate: на макроуровне модель получает coarse-grained evidence из внешних источников, на микроуровне — извлекает ключевые результаты из внутреннего хранилища, накопленного в ходе рассуждения. Главный эффект: чем ближе ключевая информация к выходу модели, тем выше factual accuracy.
Для длинных текстов это критично — ошибка часто не в поиске, а в том, что нужный факт теряется по пути к генерации. M2R обучался через curriculum learning RL с rule-based rewards, что делает его устойчивым на длинной дистанции.
Для медиабайера Meta Ads это прямой урок: контентные воронки с длинными страницами (landing pages, статьи) должны иметь плотную опору на факты, расположенные как можно ближе к финальному выводу. Если ключевые преимущества или характеристики размазаны по тексту, AI при суммаризации или answer extraction будет их терять. Практический кейс: при создании страницы для сложного оффера размещайте самые важные факты в последних абзацах или в чётком итоговом блоке — это повысит точность AI-генерации ответов для пользователей.
Если интересна смежная механика — @VerticalWatchReview
Новый фреймворк M2R (Micro-Macro Retrieval) решает проблему галлюцинаций в длинных ответах. Он работает в режиме retrieve-while-generate: на макроуровне модель получает coarse-grained evidence из внешних источников, на микроуровне — извлекает ключевые результаты из внутреннего хранилища, накопленного в ходе рассуждения. Главный эффект: чем ближе ключевая информация к выходу модели, тем выше factual accuracy.
Для длинных текстов это критично — ошибка часто не в поиске, а в том, что нужный факт теряется по пути к генерации. M2R обучался через curriculum learning RL с rule-based rewards, что делает его устойчивым на длинной дистанции.
Для медиабайера Meta Ads это прямой урок: контентные воронки с длинными страницами (landing pages, статьи) должны иметь плотную опору на факты, расположенные как можно ближе к финальному выводу. Если ключевые преимущества или характеристики размазаны по тексту, AI при суммаризации или answer extraction будет их терять. Практический кейс: при создании страницы для сложного оффера размещайте самые важные факты в последних абзацах или в чётком итоговом блоке — это повысит точность AI-генерации ответов для пользователей.
Если интересна смежная механика — @VerticalWatchReview
Поиск на сайте в Meta Ads часто игнорируют, хотя это один из самых честных сигналов намерения. Если человек уже пользуется поиском, значит, креатив или первый экран не закрыли его
В кейсах по performance это удобно разбирать не как «конверсию», а как слой поведения до заявки. Например, в Microsoft Clarity у поисковых сессий есть два рабочих сценария:
— Автоматические события. Clarity умеет сам фиксировать часть кликов и интеракций, включая активность в поиске сайта. Такие действия попадают в Smart Events без ручной настройки.
— Событие на страницу результатов. Если поиск уводит на отдельный URL, можно вручную создать Smart Event по визиту на эту страницу. Это полезно, когда нужно выделить пользователей, которые не нашли нужное сразу и пошли через поиск.
Здесь есть важный нюанс: такие события не подтягивают историю задним числом. То есть если тест уже шёл, а событие вы создали позже, прошлые сессии с поиском в разметку не попадут.
Для медиабайера это значит простую вещь: если вы тестируете лендинг, категорию или оффер, метку на поисковое поведение лучше ставить до старта. Иначе в записях сессий и сегментах будет слепая зона — люди уже искали товар, но в аналитике это не зафиксировано.
Практическая польза тут не в «красивом отчёте», а в проверке гипотез:
— первый экран не отвечает на запрос;
— ассортимент или оффер спрятаны;
— поиск сам по себе стал маркером фрикции;
— пользователей с поиском можно выделить в отдельный сегмент и сравнить их поведение с остальными.
Для Meta Ads это хороший маркер качества трафика и посадочной: иногда проблема не в рекламе, а в том, что трафик приходит с намерением, которое страница не умеет быстро подхватить.
В кейсах по performance это удобно разбирать не как «конверсию», а как слой поведения до заявки. Например, в Microsoft Clarity у поисковых сессий есть два рабочих сценария:
— Автоматические события. Clarity умеет сам фиксировать часть кликов и интеракций, включая активность в поиске сайта. Такие действия попадают в Smart Events без ручной настройки.
— Событие на страницу результатов. Если поиск уводит на отдельный URL, можно вручную создать Smart Event по визиту на эту страницу. Это полезно, когда нужно выделить пользователей, которые не нашли нужное сразу и пошли через поиск.
Здесь есть важный нюанс: такие события не подтягивают историю задним числом. То есть если тест уже шёл, а событие вы создали позже, прошлые сессии с поиском в разметку не попадут.
Для медиабайера это значит простую вещь: если вы тестируете лендинг, категорию или оффер, метку на поисковое поведение лучше ставить до старта. Иначе в записях сессий и сегментах будет слепая зона — люди уже искали товар, но в аналитике это не зафиксировано.
Практическая польза тут не в «красивом отчёте», а в проверке гипотез:
— первый экран не отвечает на запрос;
— ассортимент или оффер спрятаны;
— поиск сам по себе стал маркером фрикции;
— пользователей с поиском можно выделить в отдельный сегмент и сравнить их поведение с остальными.
Для Meta Ads это хороший маркер качества трафика и посадочной: иногда проблема не в рекламе, а в том, что трафик приходит с намерением, которое страница не умеет быстро подхватить.
Как LLM обрабатывают изменения состояний — и почему это важно для контента
Исследование Do Language Models Track Entities Across State Changes? раскрывает важную особенность архитектуры языковых моделей: они не отслеживают изменения состояний объектов по ходу текста. Вместо последовательного обновления контекста модель агрегирует необходимую информацию только на финальном токене, когда запрос становится однозначным. Это означает, что в длинных цепочках логических или физических изменений (например, «добавить — изменить — удалить») модель может упустить промежуточные состояния.
Особенно интересно наблюдение за операцией REMOVE: модель реализует её через глобальный тег подавления, который легко сбивается шумом. Это объясняет, почему в AI-генерации часто возникают логические конфликты — например, удалённый объект продолжает участвовать в сцене. Авторы предлагают частичное решение — обнуление этого тега, что улучшает точность.
Для специалистов по контенту и SEO это критично: страницы с последовательной логикой (FAQ, гайды, сравнения) страдают от такой архитектуры. Чем сложнее цепочка «до/после», тем выше риск, что модель сгенерирует противоречивый ответ. Это бьёт по релевантности и удержанию.
Практический вывод: структурируйте контент так, чтобы ключевые изменения выделялись явно — через заголовки, списки, отдельные блоки. Избегайте плотных абзацев, где состояние обновляется неявно. Чем больше опорных точек вы даёте модели, тем выше шанс, что она правильно интерпретирует логику.
Для соседнего контекста загляни в @IgamingMarketWatchResearch4
Исследование Do Language Models Track Entities Across State Changes? раскрывает важную особенность архитектуры языковых моделей: они не отслеживают изменения состояний объектов по ходу текста. Вместо последовательного обновления контекста модель агрегирует необходимую информацию только на финальном токене, когда запрос становится однозначным. Это означает, что в длинных цепочках логических или физических изменений (например, «добавить — изменить — удалить») модель может упустить промежуточные состояния.
Особенно интересно наблюдение за операцией REMOVE: модель реализует её через глобальный тег подавления, который легко сбивается шумом. Это объясняет, почему в AI-генерации часто возникают логические конфликты — например, удалённый объект продолжает участвовать в сцене. Авторы предлагают частичное решение — обнуление этого тега, что улучшает точность.
Для специалистов по контенту и SEO это критично: страницы с последовательной логикой (FAQ, гайды, сравнения) страдают от такой архитектуры. Чем сложнее цепочка «до/после», тем выше риск, что модель сгенерирует противоречивый ответ. Это бьёт по релевантности и удержанию.
Практический вывод: структурируйте контент так, чтобы ключевые изменения выделялись явно — через заголовки, списки, отдельные блоки. Избегайте плотных абзацев, где состояние обновляется неявно. Чем больше опорных точек вы даёте модели, тем выше шанс, что она правильно интерпретирует логику.
Для соседнего контекста загляни в @IgamingMarketWatchResearch4
Почему Meta лучше читает креативы, где есть не только оффер, но и человеческая логика
В свежем исследовании на базе более чем 5 миллионов вопросов LLM сравнили с людьми не просто по ответам, а по тому, как у них связаны ценности и поведение. Модели проверяли через валидированные психологические опросники и сопоставляли с теорией человеческих ценностей. Итог любопытный: если LLM «подсказать» ценностный контекст, они начинают заметно ближе совпадать с людьми и по структуре ценностей, и по тому, как из этих ценностей вырастает действие.
Для медиабаинга это не академическая история, а прикладной сигнал. Meta все чаще живет не только на уровне прямого смысла объявления, но и на уровне того, насколько текст выглядит естественным для человека. Сухой набор выгод, цифр и CTA без мотивации пользователя может уступать креативу, где ясно показано: почему это важно, для кого это, что человек сделает дальше.
Практически это означает одно: в связке «проблема → ценность → действие» модель и аудитория считывают сообщение быстрее. Например, не просто «скидка 20%», а «если задача — снизить CAC и не сливать бюджет на холодный трафик, этот оффер закрывает тестовую гипотезу без лишнего риска». Такой текст лучше отражает логику принятия решения, а значит, чаще попадает в рабочие паттерны показа и отклика.
Для performance-команд вывод простой: креативы стоит оценивать не только по офферу, но и по тому, насколько в них встроен человеческий мотив. В Meta это часто решает больше, чем очередной список преимуществ.
В свежем исследовании на базе более чем 5 миллионов вопросов LLM сравнили с людьми не просто по ответам, а по тому, как у них связаны ценности и поведение. Модели проверяли через валидированные психологические опросники и сопоставляли с теорией человеческих ценностей. Итог любопытный: если LLM «подсказать» ценностный контекст, они начинают заметно ближе совпадать с людьми и по структуре ценностей, и по тому, как из этих ценностей вырастает действие.
Для медиабаинга это не академическая история, а прикладной сигнал. Meta все чаще живет не только на уровне прямого смысла объявления, но и на уровне того, насколько текст выглядит естественным для человека. Сухой набор выгод, цифр и CTA без мотивации пользователя может уступать креативу, где ясно показано: почему это важно, для кого это, что человек сделает дальше.
Практически это означает одно: в связке «проблема → ценность → действие» модель и аудитория считывают сообщение быстрее. Например, не просто «скидка 20%», а «если задача — снизить CAC и не сливать бюджет на холодный трафик, этот оффер закрывает тестовую гипотезу без лишнего риска». Такой текст лучше отражает логику принятия решения, а значит, чаще попадает в рабочие паттерны показа и отклика.
Для performance-команд вывод простой: креативы стоит оценивать не только по офферу, но и по тому, насколько в них встроен человеческий мотив. В Meta это часто решает больше, чем очередной список преимуществ.
Markov boundary в реальности: когда отбор признаков не оправдывает ожиданий
Идея Markov boundary — отобрать минимальный набор признаков, который полностью объясняет целевую переменную — звучит привлекательно. В теории это должно улучшить предсказание и снизить переобучение. Но исследование на синтетическом бенчмарке SCM3K, включающем 3 450 задач, показало: на практике выгода неочевидна.
Да, если ограничить регрессор oracle-версией Markov boundary, качество растёт — особенно в условиях большого и шумного пространства признаков. Но реальные оценщики boundary редко достигают такого уровня. Чаще они съедают вычислительный бюджет, не успевая дать прирост, или проигрывают даже полному набору фич.
Причины просты: алгоритмы discovery оптимизированы под восстановление структуры, а не под прогноз; ошибки (особенно false negative) сильно бьют по качеству; и, главное, exact boundary — не единственный способ обыграть полную модель. Иногда грубая, но быстрая фильтрация работает лучше.
Для медиабайеров и аналитиков — важный урок: слепая вера в «идеальный» отбор признаков может стоить эффективности. В операционной закупке, где важно быстро тестировать гипотезы, дорогие feature selection-процедуры часто не оправдывают себя.
Гораздо полезнее — простая модель на полном наборе с последующим A/B тестом по бизнес-метрике. Особенно если признаков много, а данные шумные. Иногда выигрыш не в точности отбора, а в скорости итераций.
Вывод: не гонитесь за теоретической оптимальностью. В реальных системах prediction важнее, чем структурная чистота.
Идея Markov boundary — отобрать минимальный набор признаков, который полностью объясняет целевую переменную — звучит привлекательно. В теории это должно улучшить предсказание и снизить переобучение. Но исследование на синтетическом бенчмарке SCM3K, включающем 3 450 задач, показало: на практике выгода неочевидна.
Да, если ограничить регрессор oracle-версией Markov boundary, качество растёт — особенно в условиях большого и шумного пространства признаков. Но реальные оценщики boundary редко достигают такого уровня. Чаще они съедают вычислительный бюджет, не успевая дать прирост, или проигрывают даже полному набору фич.
Причины просты: алгоритмы discovery оптимизированы под восстановление структуры, а не под прогноз; ошибки (особенно false negative) сильно бьют по качеству; и, главное, exact boundary — не единственный способ обыграть полную модель. Иногда грубая, но быстрая фильтрация работает лучше.
Для медиабайеров и аналитиков — важный урок: слепая вера в «идеальный» отбор признаков может стоить эффективности. В операционной закупке, где важно быстро тестировать гипотезы, дорогие feature selection-процедуры часто не оправдывают себя.
Гораздо полезнее — простая модель на полном наборе с последующим A/B тестом по бизнес-метрике. Особенно если признаков много, а данные шумные. Иногда выигрыш не в точности отбора, а в скорости итераций.
Вывод: не гонитесь за теоретической оптимальностью. В реальных системах prediction важнее, чем структурная чистота.
Когда отбор аудиторий не даёт прироста: разбор кейса
Разбираем ситуацию, когда feature selection (отбор признаков) в моделях предсказания поведения аудитории не оправдывает затрат. На синтетическом бенчмарке SCM3K исследователи показали, что сокращение признаков до «марковской границы» улучшает качество только при идеальных условиях. В реальности пайплайны Meta Ads часто тратят бюджет на чистку фич, а не на метрику прогноза.
У нас был кейс: в кампании по лидогенерации мы убрали «шумные» признаки (время суток, тип устройства, история кликов) в пользу «структурно правильного» набора. Качество предсказания конверсии не выросло, зато увеличилось время обучения модели и количество false negatives — модель перестала видеть редкие, но ценные паттерны.
Вывод для performance-маркетологов: отбор признаков должен проверяться не на «красоту набора», а на прирост ключевой метрики (ROAS, CPA, конверсия). Если после чистки метрика не изменилась, вы просто потратили ресурсы. Лучше оставить шум, который не мешает, чем терять сигнал ради порядка.
Если интересна смежная механика — @IndexVerticalWatchBrief
Разбираем ситуацию, когда feature selection (отбор признаков) в моделях предсказания поведения аудитории не оправдывает затрат. На синтетическом бенчмарке SCM3K исследователи показали, что сокращение признаков до «марковской границы» улучшает качество только при идеальных условиях. В реальности пайплайны Meta Ads часто тратят бюджет на чистку фич, а не на метрику прогноза.
У нас был кейс: в кампании по лидогенерации мы убрали «шумные» признаки (время суток, тип устройства, история кликов) в пользу «структурно правильного» набора. Качество предсказания конверсии не выросло, зато увеличилось время обучения модели и количество false negatives — модель перестала видеть редкие, но ценные паттерны.
Вывод для performance-маркетологов: отбор признаков должен проверяться не на «красоту набора», а на прирост ключевой метрики (ROAS, CPA, конверсия). Если после чистки метрика не изменилась, вы просто потратили ресурсы. Лучше оставить шум, который не мешает, чем терять сигнал ради порядка.
Если интересна смежная механика — @IndexVerticalWatchBrief
Почему «лучший набор сигналов» в Meta Ads часто не окупает сам себя
В одном исследовании на синтетическом бенчмарке с 3450 задачами проверяли идею Markov boundary — то есть попытку найти минимальный набор признаков, который почти полностью объясняет целевую переменную. На бумаге всё красиво: если отдать регрессору не всю табличку, а только действительно связанные поля, качество предсказания часто растёт. Особенно это заметно в больших и разреженных пространствах признаков.
Но есть важная оговорка: стоимость такой оптимизации быстро съедает выигрыш. Оценщики boundary нередко тратят слишком много вычислений, а на практике ещё и не всегда обгоняют обычную модель на полном наборе фич.
Для Meta Ads это очень узнаваемая история. У медиабаинга постоянно есть соблазн выкинуть «мусорные» поля из логов, оставить только самые «сильные» сигналы и построить из них более умную модель. Проблема в том, что на реальных данных идеальный отбор признаков часто сложнее, чем кажется: часть полезных сигналов теряется, часть ложных остаётся, а время команды уходит не на рост качества, а на бесконечную настройку отбора.
Вывод здесь практический: feature selection надо мерить не красотой выбранной структуры, а итоговым результатом на своих кампаниях. Если новый набор фич не даёт прироста в CPA, ROAS или стабильности прогнозов, значит он не работает — даже если выглядит математически изящно.
Три причины, почему такие подходы часто буксуют:
- модель оптимизирует структуру, а не прибыльный прогноз;
- ошибки пропуска важных сигналов и добавления лишних сигналов стоят по-разному;
- «минимально достаточный» набор признаков — не единственный, который может обойти полный датасет.
Для performance-команды это хороший тест на зрелость: не спрашивать, какие поля «правильные», а считать, сколько реально стоит их поиск и что они дают в проде.
В одном исследовании на синтетическом бенчмарке с 3450 задачами проверяли идею Markov boundary — то есть попытку найти минимальный набор признаков, который почти полностью объясняет целевую переменную. На бумаге всё красиво: если отдать регрессору не всю табличку, а только действительно связанные поля, качество предсказания часто растёт. Особенно это заметно в больших и разреженных пространствах признаков.
Но есть важная оговорка: стоимость такой оптимизации быстро съедает выигрыш. Оценщики boundary нередко тратят слишком много вычислений, а на практике ещё и не всегда обгоняют обычную модель на полном наборе фич.
Для Meta Ads это очень узнаваемая история. У медиабаинга постоянно есть соблазн выкинуть «мусорные» поля из логов, оставить только самые «сильные» сигналы и построить из них более умную модель. Проблема в том, что на реальных данных идеальный отбор признаков часто сложнее, чем кажется: часть полезных сигналов теряется, часть ложных остаётся, а время команды уходит не на рост качества, а на бесконечную настройку отбора.
Вывод здесь практический: feature selection надо мерить не красотой выбранной структуры, а итоговым результатом на своих кампаниях. Если новый набор фич не даёт прироста в CPA, ROAS или стабильности прогнозов, значит он не работает — даже если выглядит математически изящно.
Три причины, почему такие подходы часто буксуют:
- модель оптимизирует структуру, а не прибыльный прогноз;
- ошибки пропуска важных сигналов и добавления лишних сигналов стоят по-разному;
- «минимально достаточный» набор признаков — не единственный, который может обойти полный датасет.
Для performance-команды это хороший тест на зрелость: не спрашивать, какие поля «правильные», а считать, сколько реально стоит их поиск и что они дают в проде.
Пошаговая оценка релевантности: как графовые метрики меняют агентный поиск
Исследователи предложили GDCR (Graph-Distance Contribution Reward) — step-level награду, которая оценивает вклад каждого нового найденного и процитированного энтити по расстоянию до ответа в ER-графе. В паре с SAPO (Step Advantage Policy Optimization) это позволяет оптимизировать не конечный ответ, а каждый шаг агента. Кейс для Meta Ads: представьте, что ваш лендинг — это агент, который по шагам раскрывает информацию. Если первые же энтити (бренд, цена, оффер) сразу близки к целевому запросу пользователя, модель даёт высокую пошаговую оценку. Если же пользователь вынужден «переходить» через много лишних сущностей, релевантность снижается. Тест: возьмите одну из ваших страниц и выпишите последовательность ключевых сущностей в порядке их появления. Сравните с типичными поисковыми запросами по кампании. Если ответная сущность появляется только на 4-м шаге — перестройте структуру. В экспериментах на четырёх бенчмарках метод показал значительное превосходство. Для арбитража это сигнал: выигрывают материалы с «короткой дистанцией» от первого упоминания до целевого ответа.
По этой же логике полезен @FraudQualitySignalsDeep9
Исследователи предложили GDCR (Graph-Distance Contribution Reward) — step-level награду, которая оценивает вклад каждого нового найденного и процитированного энтити по расстоянию до ответа в ER-графе. В паре с SAPO (Step Advantage Policy Optimization) это позволяет оптимизировать не конечный ответ, а каждый шаг агента. Кейс для Meta Ads: представьте, что ваш лендинг — это агент, который по шагам раскрывает информацию. Если первые же энтити (бренд, цена, оффер) сразу близки к целевому запросу пользователя, модель даёт высокую пошаговую оценку. Если же пользователь вынужден «переходить» через много лишних сущностей, релевантность снижается. Тест: возьмите одну из ваших страниц и выпишите последовательность ключевых сущностей в порядке их появления. Сравните с типичными поисковыми запросами по кампании. Если ответная сущность появляется только на 4-м шаге — перестройте структуру. В экспериментах на четырёх бенчмарках метод показал значительное превосходство. Для арбитража это сигнал: выигрывают материалы с «короткой дистанцией» от первого упоминания до целевого ответа.
По этой же логике полезен @FraudQualitySignalsDeep9
Почему креатив, который «тащил» неделю назад, внезапно проседает
В AI Search уязвимость старых моделей показали на простом месте: они хорошо работают на ровных бенчмарках, но заметно хуже — когда меняется контекст запроса, смешиваются намерения и приезжают «грязные» данные из реального мира. Поэтому в новой схеме TTT-SCL модель не просто живёт на статичном train set, а подстраивает набор обучающих примеров под конкретный тестовый случай.
Для Meta Ads это очень знакомая проблема. У нас тоже есть «идеальный» мир:
- аккуратные аудитории;
- стабильные CPM;
- понятный плейсмент;
- ровный funnel.
А потом в проде всё смещается: выгорают связки, один и тот же оффер начинает собирать другой тип кликов, а в отчётах внезапно меняется структура конверсий. Если оценивать систему только на исторических данных, она выглядит сильнее, чем есть на самом деле.
Смысл подхода из исследования полезен и для байера: проверять не только среднюю эффективность, а устойчивость к сдвигу. То есть смотреть, как связка ведёт себя:
- на новых креативах с тем же оффером;
- в другом GEO;
- на аудитории с похожим, но не тем же интентом;
- после изменения окна атрибуции или источника трафика.
Главный вывод простой: в Meta побеждает не только тот, кто нашёл удачную связку, но и тот, у кого пайплайн нормально переживает смену условий. Кейс может выглядеть отлично на «чистых» данных и разваливаться на хвостах. А именно хвосты и показывают, насколько система реально управляема.
В AI Search уязвимость старых моделей показали на простом месте: они хорошо работают на ровных бенчмарках, но заметно хуже — когда меняется контекст запроса, смешиваются намерения и приезжают «грязные» данные из реального мира. Поэтому в новой схеме TTT-SCL модель не просто живёт на статичном train set, а подстраивает набор обучающих примеров под конкретный тестовый случай.
Для Meta Ads это очень знакомая проблема. У нас тоже есть «идеальный» мир:
- аккуратные аудитории;
- стабильные CPM;
- понятный плейсмент;
- ровный funnel.
А потом в проде всё смещается: выгорают связки, один и тот же оффер начинает собирать другой тип кликов, а в отчётах внезапно меняется структура конверсий. Если оценивать систему только на исторических данных, она выглядит сильнее, чем есть на самом деле.
Смысл подхода из исследования полезен и для байера: проверять не только среднюю эффективность, а устойчивость к сдвигу. То есть смотреть, как связка ведёт себя:
- на новых креативах с тем же оффером;
- в другом GEO;
- на аудитории с похожим, но не тем же интентом;
- после изменения окна атрибуции или источника трафика.
Главный вывод простой: в Meta побеждает не только тот, кто нашёл удачную связку, но и тот, у кого пайплайн нормально переживает смену условий. Кейс может выглядеть отлично на «чистых» данных и разваливаться на хвостах. А именно хвосты и показывают, насколько система реально управляема.
SCM3K: почему отбор признаков не всегда окупается в прогнозных моделях
Массовое тестирование на бенчмарке SCM3K — 3 450 задач, до 1 000 признаков, шесть типов структур — показало парадокс: хотя теоретически Markov boundary (минимальный набор релевантных признаков) улучшает качество предсказаний, на практике существующие методы её оценки редко дают прирост. Даже при идеальном восстановлении границы выигрыш по сравнению с полным набором признаков незначителен, а в большинстве случаев — отрицательный из-за вычислительных издержек.
Анализ выявил три системные проблемы. Первая — алгоритмы оптимизируют структурную точность, а не прогнозную силу. Вторая — ошибки в определении границы (особенно false negatives) сильно деградируют результат, в то время как избыток признаков влияет слабее. Третья — сама по себе exact boundary не гарантирует лучшее предсказание: существуют и другие комбинации фич, которые могут работать эффективнее.
Для маркетологов и аналитиков: в системах прогнозирования конверсий, CTR или LTV важно не просто отбирать «правильные» сигналы, но и учитывать стоимость и надёжность самого механизма отбора. Часто проще и эффективнее использовать все доступные данные, особенно если инструменты feature selection вносят шум или требуют высоких ресурсов. Это особенно актуально для табличных моделей в арбитраже и lookalike-генерации.
Если интересна смежная механика — @OfferIntelligenceSignal
Массовое тестирование на бенчмарке SCM3K — 3 450 задач, до 1 000 признаков, шесть типов структур — показало парадокс: хотя теоретически Markov boundary (минимальный набор релевантных признаков) улучшает качество предсказаний, на практике существующие методы её оценки редко дают прирост. Даже при идеальном восстановлении границы выигрыш по сравнению с полным набором признаков незначителен, а в большинстве случаев — отрицательный из-за вычислительных издержек.
Анализ выявил три системные проблемы. Первая — алгоритмы оптимизируют структурную точность, а не прогнозную силу. Вторая — ошибки в определении границы (особенно false negatives) сильно деградируют результат, в то время как избыток признаков влияет слабее. Третья — сама по себе exact boundary не гарантирует лучшее предсказание: существуют и другие комбинации фич, которые могут работать эффективнее.
Для маркетологов и аналитиков: в системах прогнозирования конверсий, CTR или LTV важно не просто отбирать «правильные» сигналы, но и учитывать стоимость и надёжность самого механизма отбора. Часто проще и эффективнее использовать все доступные данные, особенно если инструменты feature selection вносят шум или требуют высоких ресурсов. Это особенно актуально для табличных моделей в арбитраже и lookalike-генерации.
Если интересна смежная механика — @OfferIntelligenceSignal
