Meta Ads Stack
5 subscribers
14 links
Meta Ads / Кейсы
Download Telegram
Channel created
Channel photo updated
Техническая проверка канала.
Когда “правильные” признаки всё равно проигрывают: урок из SCM3K

На бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания в табличных моделях. В выборке — 3 450 задач, от 40 до 1000 признаков и шесть семейств SCM. Результат получился не совсем комфортным для теории: если дать регрессору oracle-boundary, качество действительно заметно растёт, особенно на более разреженных и больших признаках. Но на практике оценщики boundary часто упираются в вычислительные ограничения раньше, чем достигают режимов, где эффект становится максимальным.

Есть и ещё одна важная деталь: даже когда boundary удаётся восстановить, полный набор признаков она обгоняет нечасто. Это хороший пример того, как “структурно правильное” решение не всегда выигрывает в боевых условиях. Слишком много зависит от цены ошибок, ограничений по времени и того, что именно оптимизирует алгоритм — восстановление структуры или прогноз.

Для Meta Ads этот вывод хорошо ложится на работу с креативами, аудиторией и сигналами конверсии. Упрощение модели отбора не гарантирует рост качества, если система начинает терять важные, но неочевидные факторы. В закупке, как и в ML, важен не только красивый набор признаков, но и то, как он ведёт себя в проде, где цена false negative и false positive различается.
Почему «идеальная» оптимизация в Meta Ads часто не доезжает до продакшена

В исследовании на синтетическом бенчмарке SCM3K проверили довольно приземлённую для медиабайинга вещь: помогает ли сокращение набора признаков, если подбирать его не по красоте схемы, а по влиянию на прогноз. Модель сравнивали на 3 450 задачах, где было от 40 до 1000 фичей и несколько семейств структурных моделей.

Главный вывод полезен именно для performance-команд: если регрессор ограничить только «правильным» подмножеством признаков, качество предсказания часто растёт. Особенно заметно это в широких и разреженных пространствах, где полный набор фичей шумит и мешает находить сигнал.

Но есть проблема, знакомая любому, кто пытался собрать «идеальную» структуру кампаний, аудиторий и событий. Методы, которые восстанавливают boundary, обычно тратят слишком много вычислений ещё до того, как доходят до режима, где есть реальная польза. В итоге на практике они нередко проигрывают простому full feature set.

Авторы отдельно показывают, почему так происходит:
- алгоритмы часто оптимизируются под восстановление структуры, а не под качество прогноза;
- цена ошибки «не добрали важный сигнал» и «добавили лишний шум» может быть разной;
- и даже точная boundary не гарантирует победу над другими наборами признаков.

Для Meta Ads отсюда прямой рабочий вывод: не путать красивую схему с полезной. Урезать набор сигналов, событий или аудиторий имеет смысл только тогда, когда это даёт прирост на CPA, ROAS, CVR или стабильности обучения. Иначе «чище» не значит «лучше» — особенно в кампаниях, где модель и так живёт на грани данных и шума.
Micro-Macro Retrieval: как снизить галлюцинации AI в контентных воронках

Новый фреймворк M2R (Micro-Macro Retrieval) решает проблему галлюцинаций в длинных ответах. Он работает в режиме retrieve-while-generate: на макроуровне модель получает coarse-grained evidence из внешних источников, на микроуровне — извлекает ключевые результаты из внутреннего хранилища, накопленного в ходе рассуждения. Главный эффект: чем ближе ключевая информация к выходу модели, тем выше factual accuracy.

Для длинных текстов это критично — ошибка часто не в поиске, а в том, что нужный факт теряется по пути к генерации. M2R обучался через curriculum learning RL с rule-based rewards, что делает его устойчивым на длинной дистанции.

Для медиабайера Meta Ads это прямой урок: контентные воронки с длинными страницами (landing pages, статьи) должны иметь плотную опору на факты, расположенные как можно ближе к финальному выводу. Если ключевые преимущества или характеристики размазаны по тексту, AI при суммаризации или answer extraction будет их терять. Практический кейс: при создании страницы для сложного оффера размещайте самые важные факты в последних абзацах или в чётком итоговом блоке — это повысит точность AI-генерации ответов для пользователей.

Если интересна смежная механика — @VerticalWatchReview