Meta Ads Stack
5 subscribers
14 links
Meta Ads / Кейсы
Download Telegram
Channel created
Channel photo updated
Техническая проверка канала.
Когда “правильные” признаки всё равно проигрывают: урок из SCM3K

На бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания в табличных моделях. В выборке — 3 450 задач, от 40 до 1000 признаков и шесть семейств SCM. Результат получился не совсем комфортным для теории: если дать регрессору oracle-boundary, качество действительно заметно растёт, особенно на более разреженных и больших признаках. Но на практике оценщики boundary часто упираются в вычислительные ограничения раньше, чем достигают режимов, где эффект становится максимальным.

Есть и ещё одна важная деталь: даже когда boundary удаётся восстановить, полный набор признаков она обгоняет нечасто. Это хороший пример того, как “структурно правильное” решение не всегда выигрывает в боевых условиях. Слишком много зависит от цены ошибок, ограничений по времени и того, что именно оптимизирует алгоритм — восстановление структуры или прогноз.

Для Meta Ads этот вывод хорошо ложится на работу с креативами, аудиторией и сигналами конверсии. Упрощение модели отбора не гарантирует рост качества, если система начинает терять важные, но неочевидные факторы. В закупке, как и в ML, важен не только красивый набор признаков, но и то, как он ведёт себя в проде, где цена false negative и false positive различается.
Почему «идеальная» оптимизация в Meta Ads часто не доезжает до продакшена

В исследовании на синтетическом бенчмарке SCM3K проверили довольно приземлённую для медиабайинга вещь: помогает ли сокращение набора признаков, если подбирать его не по красоте схемы, а по влиянию на прогноз. Модель сравнивали на 3 450 задачах, где было от 40 до 1000 фичей и несколько семейств структурных моделей.

Главный вывод полезен именно для performance-команд: если регрессор ограничить только «правильным» подмножеством признаков, качество предсказания часто растёт. Особенно заметно это в широких и разреженных пространствах, где полный набор фичей шумит и мешает находить сигнал.

Но есть проблема, знакомая любому, кто пытался собрать «идеальную» структуру кампаний, аудиторий и событий. Методы, которые восстанавливают boundary, обычно тратят слишком много вычислений ещё до того, как доходят до режима, где есть реальная польза. В итоге на практике они нередко проигрывают простому full feature set.

Авторы отдельно показывают, почему так происходит:
- алгоритмы часто оптимизируются под восстановление структуры, а не под качество прогноза;
- цена ошибки «не добрали важный сигнал» и «добавили лишний шум» может быть разной;
- и даже точная boundary не гарантирует победу над другими наборами признаков.

Для Meta Ads отсюда прямой рабочий вывод: не путать красивую схему с полезной. Урезать набор сигналов, событий или аудиторий имеет смысл только тогда, когда это даёт прирост на CPA, ROAS, CVR или стабильности обучения. Иначе «чище» не значит «лучше» — особенно в кампаниях, где модель и так живёт на грани данных и шума.