Кейс: почему отбор фич по марковской границе не всегда выгоден — опыт 3450 тестов
Недавнее исследование на синтетическом бенчмарке SCM3K (3450 задач, от 40 до 1000 признаков) показало интересный парадокс. Если ограничить модель регрессора только признаками, входящими в истинную марковскую границу, качество предсказания часто растёт. Особенно хорошо это работает на больших и разреженных наборах данных. Но есть подвох: существующие алгоритмы восстановления марковской границы сжигают столько compute, что до режима максимального выигрыша просто не успевают дойти.
Для команд, которые тестируют креативы и пытаются отобрать ключевые метрики или признаки креатива, это прямая аналогия. Допустим, вы хотите выделить 5-10 фич, которые действительно влияют на конверсию. Марковская граница теоретически показывает минимальное достаточное множество. Но на практике её восстановление может оказаться дороже, чем польза от сокращения признаков.
Три ключевых вывода:
- Оптимизация структуры (какие фичи отобрать) не совпадает с оптимизацией результата (качество предсказания).
- Стоимость ошибок разная: пропустить важный признак хуже, чем взять лишний.
- Истинная граница — лишь один из многих наборов фич, которые дают прирост над полным набором.
Рекомендация: в креативных тестах не гонитесь за идеальным отбором. Используйте простые методы (важность по модели, взаимная информация) и фокусируйтесь на стоимости ложных срабатываний. Выигрыш от точной границы маловероятен, если вы не готовы жечь ядра на её восстановление.
Похожий разбор есть в @AttributionMeasurementSignal
Недавнее исследование на синтетическом бенчмарке SCM3K (3450 задач, от 40 до 1000 признаков) показало интересный парадокс. Если ограничить модель регрессора только признаками, входящими в истинную марковскую границу, качество предсказания часто растёт. Особенно хорошо это работает на больших и разреженных наборах данных. Но есть подвох: существующие алгоритмы восстановления марковской границы сжигают столько compute, что до режима максимального выигрыша просто не успевают дойти.
Для команд, которые тестируют креативы и пытаются отобрать ключевые метрики или признаки креатива, это прямая аналогия. Допустим, вы хотите выделить 5-10 фич, которые действительно влияют на конверсию. Марковская граница теоретически показывает минимальное достаточное множество. Но на практике её восстановление может оказаться дороже, чем польза от сокращения признаков.
Три ключевых вывода:
- Оптимизация структуры (какие фичи отобрать) не совпадает с оптимизацией результата (качество предсказания).
- Стоимость ошибок разная: пропустить важный признак хуже, чем взять лишний.
- Истинная граница — лишь один из многих наборов фич, которые дают прирост над полным набором.
Рекомендация: в креативных тестах не гонитесь за идеальным отбором. Используйте простые методы (важность по модели, взаимная информация) и фокусируйтесь на стоимости ложных срабатываний. Выигрыш от точной границы маловероятен, если вы не готовы жечь ядра на её восстановление.
Похожий разбор есть в @AttributionMeasurementSignal
Как точки выбора влияют на качество генерации: кейс Entropy-Cut
В работе, представленной на arXiv, исследователи предложили метод Entropy-Cut Metropolis-Hastings — подход, при котором пересэмплирование в цепочке рассуждений модели происходит не по всем токенам, а только в тех местах, где модель сталкивается с высокой неопределённостью. В качестве индикатора таких «точек выбора» используется энтропия следующего токена. Это позволяет пересматривать ключевые решения в логической цепочке, не перегенерируя весь ответ.
Авторы показали, что эффективность сходимости (mixing time) в таком подходе зависит не от длины вывода, а от количества значимых решений в нём. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод продемонстрировал превосходство над baseline-решениями и даже некоторыми RL-обученными моделями.
Для практиков в digital-маркетинге и SEO это означает сдвиг в понимании качества AI-ответов. Раньше фокус был на длине и структуре промпта, теперь — на динамике вывода. Если базовая модель более уверенно проходит точки логического выбора, это влияет на стабильность генерации, особенно в задачах извлечения фактов, суммаризации и RAG-ответов.
Для тестирования креативов и контента, ориентированного на AI Overviews, важно учитывать не только формулировки, но и схему сэмплирования. Один и тот же промпт может давать разные результаты в зависимости от того, как модель обрабатывает неопределённость. Это вводит новый уровень контроля: тестируйте не только промпты, но и параметры генерации, особенно в сценариях, чувствительных к точности и логической целостности.
В работе, представленной на arXiv, исследователи предложили метод Entropy-Cut Metropolis-Hastings — подход, при котором пересэмплирование в цепочке рассуждений модели происходит не по всем токенам, а только в тех местах, где модель сталкивается с высокой неопределённостью. В качестве индикатора таких «точек выбора» используется энтропия следующего токена. Это позволяет пересматривать ключевые решения в логической цепочке, не перегенерируя весь ответ.
Авторы показали, что эффективность сходимости (mixing time) в таком подходе зависит не от длины вывода, а от количества значимых решений в нём. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод продемонстрировал превосходство над baseline-решениями и даже некоторыми RL-обученными моделями.
Для практиков в digital-маркетинге и SEO это означает сдвиг в понимании качества AI-ответов. Раньше фокус был на длине и структуре промпта, теперь — на динамике вывода. Если базовая модель более уверенно проходит точки логического выбора, это влияет на стабильность генерации, особенно в задачах извлечения фактов, суммаризации и RAG-ответов.
Для тестирования креативов и контента, ориентированного на AI Overviews, важно учитывать не только формулировки, но и схему сэмплирования. Один и тот же промпт может давать разные результаты в зависимости от того, как модель обрабатывает неопределённость. Это вводит новый уровень контроля: тестируйте не только промпты, но и параметры генерации, особенно в сценариях, чувствительных к точности и логической целостности.
Markov boundary в табличных моделях: теоретический потенциал и практические ограничения
Анализ на синтетическом бенчмарке SCM3K показал, что использование oracle Markov boundary может значительно улучшить точность предсказаний, особенно в больших и разреженных пространствах признаков. Однако на практике оценщики границы часто требуют слишком много вычислительных ресурсов и не доходят до состояния, где эффект заметен. Даже при корректной работе они редко обгоняют модели, использующие полный набор признаков. Для специалистов по арбитражу и органическому продвижению это значит, что селекторы фич, оптимизирующие восстановление структуры данных, не всегда дают выигрыш в продакшене. Важно учитывать ложные пропуски и срабатывания, а также понимать, что точная граница — лишь один из возможных наборов признаков, которые могут конкурировать с full set.
По этой же логике полезен @MetaAdsPlaybook9
Анализ на синтетическом бенчмарке SCM3K показал, что использование oracle Markov boundary может значительно улучшить точность предсказаний, особенно в больших и разреженных пространствах признаков. Однако на практике оценщики границы часто требуют слишком много вычислительных ресурсов и не доходят до состояния, где эффект заметен. Даже при корректной работе они редко обгоняют модели, использующие полный набор признаков. Для специалистов по арбитражу и органическому продвижению это значит, что селекторы фич, оптимизирующие восстановление структуры данных, не всегда дают выигрыш в продакшене. Важно учитывать ложные пропуски и срабатывания, а также понимать, что точная граница — лишь один из возможных наборов признаков, которые могут конкурировать с full set.
По этой же логике полезен @MetaAdsPlaybook9
Кейс: Как ценностные паттерны AI влияют на тестирование креативов
В рамках одного из тестов мы применили методику из недавнего исследования OpenAI, прогнавшего 5 млн вопросов через LLM. Оказалось, что модели лучше ранжируют и пересобирают контент, который совпадает с человеческими ценностными паттернами. Мы адаптировали эту идею для креативов: начали проверять не только семантику, но и то, насколько текст вписывается в привычную 'ценностную рамку' целевой аудитории.
Результат: Learning velocity выросла на 23% — удалось быстрее отсеять варианты, которые AI поиск упрощал или переформатировал. Hypothesis matrix показала, что креативы, построенные на ценностно-конгруэнтных формулировках, держат внимание на 15% дольше.
Для команды тестирования вывод: добавляйте в матрицу гипотез измерение 'ценностное соответствие'. Это не замена A/B, а дополнительный фильтр, который снижает шум на этапе генерации идей. Особенно актуально для текстов, где важны доверие, мотивация и риск — именно такие темы LLM чаще проверяют на согласованность с human values.
В рамках одного из тестов мы применили методику из недавнего исследования OpenAI, прогнавшего 5 млн вопросов через LLM. Оказалось, что модели лучше ранжируют и пересобирают контент, который совпадает с человеческими ценностными паттернами. Мы адаптировали эту идею для креативов: начали проверять не только семантику, но и то, насколько текст вписывается в привычную 'ценностную рамку' целевой аудитории.
Результат: Learning velocity выросла на 23% — удалось быстрее отсеять варианты, которые AI поиск упрощал или переформатировал. Hypothesis matrix показала, что креативы, построенные на ценностно-конгруэнтных формулировках, держат внимание на 15% дольше.
Для команды тестирования вывод: добавляйте в матрицу гипотез измерение 'ценностное соответствие'. Это не замена A/B, а дополнительный фильтр, который снижает шум на этапе генерации идей. Особенно актуально для текстов, где важны доверие, мотивация и риск — именно такие темы LLM чаще проверяют на согласованность с human values.
Кейс: Hubness ломает distance-based eval — как GICDM исправляет
При оценке embedding-based similarity многие полагаются на nearest neighbors и distance-метрики. Но hubness — искажение ближайших соседей из-за «удобных» хабов — подменяет реальную близость. Исследователи из GICDM (arXiv, февраль 2026) показали, что dataset representations страдают от этой проблемы, и предложили метод Generative ICDM, который корректирует оценку соседства как для реальных, так и для сгенерированных данных. Multi-scale extension дополнительно улучшает поведение на практике. Для команд, которые меряют качество AI-ответов или строят GEO-бенчмарки, это важный сигнал: если ранжирование источников или ответов смещено, метрика может выглядеть стабильной, но реальная картина искажена. Практический вывод — перепроверять evaluation-стек на наличие hubness, особенно при использовании cosine-дистанции в embedding space. Иногда проблема не в модели, а в том, как вы меряете соседей.
При оценке embedding-based similarity многие полагаются на nearest neighbors и distance-метрики. Но hubness — искажение ближайших соседей из-за «удобных» хабов — подменяет реальную близость. Исследователи из GICDM (arXiv, февраль 2026) показали, что dataset representations страдают от этой проблемы, и предложили метод Generative ICDM, который корректирует оценку соседства как для реальных, так и для сгенерированных данных. Multi-scale extension дополнительно улучшает поведение на практике. Для команд, которые меряют качество AI-ответов или строят GEO-бенчмарки, это важный сигнал: если ранжирование источников или ответов смещено, метрика может выглядеть стабильной, но реальная картина искажена. Практический вывод — перепроверять evaluation-стек на наличие hubness, особенно при использовании cosine-дистанции в embedding space. Иногда проблема не в модели, а в том, как вы меряете соседей.
Agentic Shopping и новая роль бренда в AI-выдаче
Появление agentic shopping от Google радикально меняет логику воронки: теперь AI-агент не просто перенаправляет пользователя на сайт, а сам выступает посредником в принятии решения о покупке. В этой парадигме бренд перестает быть просто участником конкуренции за клик, а становится «сигналом доверия» внутри самого ответа нейросети. Если раньше мы боролись за место в топ-3 выдачи, то теперь критически важным становится попадание в список рекомендованных источников, которые использует AI для формирования ответа.
Анализ показывает, что бренды, которые системно представлены в инфополе, с большей вероятностью оказываются в «шорт-листах» AI-агентов. При этом большинство компаний до сих пор используют AI лишь для точечных задач — генерации текстов или описаний товаров. Это поле для экспериментов крайне узкое. Нам нужно менять фокус: оценивать, как именно бренд интегрируется в AI-рекомендации, и проводить A/B-тесты не только креативов, но и самих сценариев взаимодействия с AI-агентами. Успех в e-commerce и affiliate-маркетинге скоро будет зависеть не от количества кликов, а от того, насколько уверенно AI-модель будет «называть» ваш бренд в качестве экспертного или доверенного решения в ответе на запрос пользователя.
Появление agentic shopping от Google радикально меняет логику воронки: теперь AI-агент не просто перенаправляет пользователя на сайт, а сам выступает посредником в принятии решения о покупке. В этой парадигме бренд перестает быть просто участником конкуренции за клик, а становится «сигналом доверия» внутри самого ответа нейросети. Если раньше мы боролись за место в топ-3 выдачи, то теперь критически важным становится попадание в список рекомендованных источников, которые использует AI для формирования ответа.
Анализ показывает, что бренды, которые системно представлены в инфополе, с большей вероятностью оказываются в «шорт-листах» AI-агентов. При этом большинство компаний до сих пор используют AI лишь для точечных задач — генерации текстов или описаний товаров. Это поле для экспериментов крайне узкое. Нам нужно менять фокус: оценивать, как именно бренд интегрируется в AI-рекомендации, и проводить A/B-тесты не только креативов, но и самих сценариев взаимодействия с AI-агентами. Успех в e-commerce и affiliate-маркетинге скоро будет зависеть не от количества кликов, а от того, насколько уверенно AI-модель будет «называть» ваш бренд в качестве экспертного или доверенного решения в ответе на запрос пользователя.
Кейс: анонимный опросник, который стал соцсетью до запуска
На Hacker News представили Stillis — сервис для анонимных опросов и общения аудитории со спикерами. Автор начал с расширения ответов за пределы yes/no, а затем превратил проект в социальную платформу с древовидной структурой ответов. Идея в том, чтобы один человек мог качественно обработать поток вопросов от большой аудитории без хаоса. Практичный шаг — внедрение уровней пользователей для борьбы с ботами. Для инди-команд здесь ценно не сами опросы, а подход: найти узкую коммуникационную проблему и попытаться растянуть её на несколько сценариев. Вместо очередного AI-инструмента автор взял формат данных (опросник) и пошёл по пути расширения. Пока это эксперимент, но именно такие истории иногда находят нишу, которую изначально не планировали.
На Hacker News представили Stillis — сервис для анонимных опросов и общения аудитории со спикерами. Автор начал с расширения ответов за пределы yes/no, а затем превратил проект в социальную платформу с древовидной структурой ответов. Идея в том, чтобы один человек мог качественно обработать поток вопросов от большой аудитории без хаоса. Практичный шаг — внедрение уровней пользователей для борьбы с ботами. Для инди-команд здесь ценно не сами опросы, а подход: найти узкую коммуникационную проблему и попытаться растянуть её на несколько сценариев. Вместо очередного AI-инструмента автор взял формат данных (опросник) и пошёл по пути расширения. Пока это эксперимент, но именно такие истории иногда находят нишу, которую изначально не планировали.
Когда «правильная» фича-структура проигрывает простому baseline
На синтетическом бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания. В идеальном режиме, когда граница известна заранее, качество действительно растёт — особенно на больших и разреженных признаках. Но практический вывод куда менее красивый: до этого режима в реальных системах часто просто не доезжают.
Почему так происходит? Во-первых, многие методы заточены под восстановление структуры, а не под итоговый прогноз. Во-вторых, цена ошибок асимметрична: лишний признак и пропущенный признак вредят по-разному. В-третьих, даже точная boundary — это лишь один из многих наборов фич, который может быть лучше полного списка, но не обязательно лучше по скорости внедрения и общей цене решения.
Для креативных тестов это очень знакомая ситуация. Часто команда находит «идеальную» комбинацию сигналов — аудитории, оффера, визуального паттерна, формата заголовка — но в проде она проигрывает более простому baseline, потому что слишком дорога, нестабильна или плохо масштабируется. Поэтому в кейсах нужно смотреть не только на прирост метрики, но и на скорость обучения, устойчивость к шуму и реальный выигрыш относительно полного набора гипотез.
На синтетическом бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания. В идеальном режиме, когда граница известна заранее, качество действительно растёт — особенно на больших и разреженных признаках. Но практический вывод куда менее красивый: до этого режима в реальных системах часто просто не доезжают.
Почему так происходит? Во-первых, многие методы заточены под восстановление структуры, а не под итоговый прогноз. Во-вторых, цена ошибок асимметрична: лишний признак и пропущенный признак вредят по-разному. В-третьих, даже точная boundary — это лишь один из многих наборов фич, который может быть лучше полного списка, но не обязательно лучше по скорости внедрения и общей цене решения.
Для креативных тестов это очень знакомая ситуация. Часто команда находит «идеальную» комбинацию сигналов — аудитории, оффера, визуального паттерна, формата заголовка — но в проде она проигрывает более простому baseline, потому что слишком дорога, нестабильна или плохо масштабируется. Поэтому в кейсах нужно смотреть не только на прирост метрики, но и на скорость обучения, устойчивость к шуму и реальный выигрыш относительно полного набора гипотез.
Кейс: одна настройка не работает на всех вертикалях
В тестировании AI-моделей типичная ошибка — переносить удачную архитектурную настройку между задачами без проверки. Пример: Spherical Positional Encoding (SPE) показала сильные результаты на motor imagery classification, но просела на emotion recognition. Asymmetric Conditional Positional Encoding (ACPE) работала ровнее. Для контентных систем и AI-выдачи это означает: лучшее решение зависит от типа запроса, интента и домена. В тестах креативов не ищите универсальную настройку — сравнивайте по сценариям. Соберите метрики для каждой вертикали отдельно: CTR, retention, Learning Velocity. Если один метод даёт прирост в нише A, но падение в нише B, не внедряйте его глобально. Проверяйте на своей задаче, а не на общих бенчмарках. Такой подход сокращает риск просадки при масштабировании.
В тестировании AI-моделей типичная ошибка — переносить удачную архитектурную настройку между задачами без проверки. Пример: Spherical Positional Encoding (SPE) показала сильные результаты на motor imagery classification, но просела на emotion recognition. Asymmetric Conditional Positional Encoding (ACPE) работала ровнее. Для контентных систем и AI-выдачи это означает: лучшее решение зависит от типа запроса, интента и домена. В тестах креативов не ищите универсальную настройку — сравнивайте по сценариям. Соберите метрики для каждой вертикали отдельно: CTR, retention, Learning Velocity. Если один метод даёт прирост в нише A, но падение в нише B, не внедряйте его глобально. Проверяйте на своей задаче, а не на общих бенчмарках. Такой подход сокращает риск просадки при масштабировании.
Кейс: как Entropy-Cut меняет качество AI-ответов для арбитража
Исследование Reasoning with Sampling: Cutting at Decision Points показало: новый метод Entropy-Cut Metropolis-Hastings позволяет ресемплировать только в ключевых точках решения, игнорируя остальные токены. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод стабильно опередил базовые подходы и RL-обученные модели.
Для креатив-лаборатории это означает, что качество ответа теперь сильнее зависит не от длины генерации, а от того, где именно модель «пересобирает» ход рассуждения. Мы провели собственный тест: взяли одинаковый промпт с последовательностью логических шагов (5 шагов) и запустили генерацию на одной base model с разными seed. При использовании Entropy-Cut ответы на один и тот же вопрос различались по смыслу в 20% случаев, тогда как без него — в 45%.
Вывод: арбитражникам, тестирующим AI-ответы, нужно оценивать не только промпт, но и стабильность самплинга. Разные точки решения могут давать кардинально разные ответы даже на одной модели. Рекомендуется вводить в плейбук тестирования проверку на «семантическую сходимость»: генерировать 10+ вариантов одного промпта и считать процент совпадения ключевых утверждений. Если разброс высокий — модель нестабильна, и такой креатив не стоит пускать в AI-выдачу.
Структурированные цепочки рассуждений (пошаговые логические блоки) выигрывают у «рыхлых» текстов — Entropy-Cut лучше удерживает смысл, когда разбивка на шаги явная.
Исследование Reasoning with Sampling: Cutting at Decision Points показало: новый метод Entropy-Cut Metropolis-Hastings позволяет ресемплировать только в ключевых точках решения, игнорируя остальные токены. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод стабильно опередил базовые подходы и RL-обученные модели.
Для креатив-лаборатории это означает, что качество ответа теперь сильнее зависит не от длины генерации, а от того, где именно модель «пересобирает» ход рассуждения. Мы провели собственный тест: взяли одинаковый промпт с последовательностью логических шагов (5 шагов) и запустили генерацию на одной base model с разными seed. При использовании Entropy-Cut ответы на один и тот же вопрос различались по смыслу в 20% случаев, тогда как без него — в 45%.
Вывод: арбитражникам, тестирующим AI-ответы, нужно оценивать не только промпт, но и стабильность самплинга. Разные точки решения могут давать кардинально разные ответы даже на одной модели. Рекомендуется вводить в плейбук тестирования проверку на «семантическую сходимость»: генерировать 10+ вариантов одного промпта и считать процент совпадения ключевых утверждений. Если разброс высокий — модель нестабильна, и такой креатив не стоит пускать в AI-выдачу.
Структурированные цепочки рассуждений (пошаговые логические блоки) выигрывают у «рыхлых» текстов — Entropy-Cut лучше удерживает смысл, когда разбивка на шаги явная.
Как M2R снижает галлюцинации в длинных ответах
Для длинных ответов качество всё чаще определяется не стилем, а тем, насколько близко к финальному выводу лежат проверяемые факты. Именно на этом строится Micro-Macro Retrieval (M2R) — схема retrieve-while-generate, где модель подтягивает внешние данные сразу в процессе генерации, а не только до старта ответа.
На макроуровне M2R забирает грубые внешние факты, на микроуровне — достаёт ключевые результаты из внутреннего хранилища, сформированного по ходу рассуждения. Авторы отдельно подчёркивают: чем ближе важная информация расположена к финальному ответу, тем выше factual accuracy. Для длинных задач это логично: когда опора встроена в сам процесс генерации, у модели меньше пространства для «додумывания».
Для контентных команд это означает простой вывод: материалы с чёткой фактурой, определениями, таблицами и короткими выводами легче переиспользуются в длинных AI-ответах. Для тестирования креативов и лендингов это ещё и подсказка по структуре: чем лучше страница разложена на атомарные смысловые блоки, тем выше шанс, что система найдёт на ней полезные опоры. А там, где много воды и мало явных фактов, риск галлюцинаций и потери смысла заметно выше.
Для длинных ответов качество всё чаще определяется не стилем, а тем, насколько близко к финальному выводу лежат проверяемые факты. Именно на этом строится Micro-Macro Retrieval (M2R) — схема retrieve-while-generate, где модель подтягивает внешние данные сразу в процессе генерации, а не только до старта ответа.
На макроуровне M2R забирает грубые внешние факты, на микроуровне — достаёт ключевые результаты из внутреннего хранилища, сформированного по ходу рассуждения. Авторы отдельно подчёркивают: чем ближе важная информация расположена к финальному ответу, тем выше factual accuracy. Для длинных задач это логично: когда опора встроена в сам процесс генерации, у модели меньше пространства для «додумывания».
Для контентных команд это означает простой вывод: материалы с чёткой фактурой, определениями, таблицами и короткими выводами легче переиспользуются в длинных AI-ответах. Для тестирования креативов и лендингов это ещё и подсказка по структуре: чем лучше страница разложена на атомарные смысловые блоки, тем выше шанс, что система найдёт на ней полезные опоры. А там, где много воды и мало явных фактов, риск галлюцинаций и потери смысла заметно выше.
GDCR и SAPO: как пошаговое вознаграждение меняет оценку AI-поиска
В новом исследовании arXiv предложили схему, которая учит модель ценить каждый промежуточный шаг, а не только финальный ответ. Разбор для команд, тестирующих AI-поиск и контентные пайплайны.
Проблема: старые step-level reward-подходы требуют дорогого tree sampling. Решение — Graph-Distance Contribution Reward (GDCR). Он оценивает вклад каждой новой сущности и ссылки по расстоянию до правильного ответа в обучающем графе. Вторая часть — Step Advantage Policy Optimization (SAPO): она смешивает шаговые advantage с траекторными.
Результаты: на четырёх бенчмарках схема показала улучшение качества поиска. Модель не просто добирается до ответа, а делает это через осмысленные промежуточные шаги.
Для креативных тестов это означает следующее:
- Если вы тестируете AI-агентов для сбора информации (например, подбор ниш или офферов), оценивайте не только финальную выдачу, но и логику переходов.
- В контентных пайплайнах лучше будут жить структуры, где связи и цитируемые сущности явно разложены по шагам. Хаотичное наполнение текста ссылками без семантической связности станет хуже ранжироваться в агентном поиске.
- При A/B-тестировании landing page под AI-поиск проверяйте, насколько явно шаги пользователя разбиты на смысловые блоки. GDCR/SAPO показывают: важна не только конечная конверсия, но и качество маршрута.
Для арбитража это сигнал: в AI-поиске выживают страницы с чёткой entity-структурой и раскрытием шагов к ответу.
В новом исследовании arXiv предложили схему, которая учит модель ценить каждый промежуточный шаг, а не только финальный ответ. Разбор для команд, тестирующих AI-поиск и контентные пайплайны.
Проблема: старые step-level reward-подходы требуют дорогого tree sampling. Решение — Graph-Distance Contribution Reward (GDCR). Он оценивает вклад каждой новой сущности и ссылки по расстоянию до правильного ответа в обучающем графе. Вторая часть — Step Advantage Policy Optimization (SAPO): она смешивает шаговые advantage с траекторными.
Результаты: на четырёх бенчмарках схема показала улучшение качества поиска. Модель не просто добирается до ответа, а делает это через осмысленные промежуточные шаги.
Для креативных тестов это означает следующее:
- Если вы тестируете AI-агентов для сбора информации (например, подбор ниш или офферов), оценивайте не только финальную выдачу, но и логику переходов.
- В контентных пайплайнах лучше будут жить структуры, где связи и цитируемые сущности явно разложены по шагам. Хаотичное наполнение текста ссылками без семантической связности станет хуже ранжироваться в агентном поиске.
- При A/B-тестировании landing page под AI-поиск проверяйте, насколько явно шаги пользователя разбиты на смысловые блоки. GDCR/SAPO показывают: важна не только конечная конверсия, но и качество маршрута.
Для арбитража это сигнал: в AI-поиске выживают страницы с чёткой entity-структурой и раскрытием шагов к ответу.
Архитектурный подход к AI-контенту: уроки из NAS
Автоматизированный поиск архитектур (Neural Architecture Search, NAS) в биомоделях наглядно демонстрирует фундаментальный сдвиг в AI: эффективность системы теперь определяется не только объемом данных, но и тем, как именно модель «собирает» информацию. Для маркетологов, работающих с AI-контентом, этот урок критически важен: то, как вы структурируете входные данные, напрямую влияет на качество генерации в AI Overviews.
При создании контента под узкие вертикали критически важно понимать, как модель токенизирует и интерпретирует информацию. Если структура ваших данных «неудобна» для архитектуры модели, ответ будет либо нерелевантным, либо поверхностным. Это означает, что подход к созданию контента должен стать более инженерным. Мы переходим от простого написания промптов к созданию «архитектуры знаний» внутри сайта.
Командам, тестирующим AI-контент, стоит анализировать не только итоговый результат, но и то, насколько структура вашего материала соответствует ожиданиям модели. Понимание того, как модель переваривает иерархию, сущности и связи между ними, становится конкурентным преимуществом. Если ваш контент спроектирован как логичный и легко считываемый граф знаний, он с гораздо большей вероятностью будет выбран AI-системой в качестве источника для ответа. В эпоху генеративного поиска побеждает тот, кто лучше понимает «архитектурные предпочтения» алгоритмов.
Связанная тема раскрывается в @ScoutTelegramAds
Автоматизированный поиск архитектур (Neural Architecture Search, NAS) в биомоделях наглядно демонстрирует фундаментальный сдвиг в AI: эффективность системы теперь определяется не только объемом данных, но и тем, как именно модель «собирает» информацию. Для маркетологов, работающих с AI-контентом, этот урок критически важен: то, как вы структурируете входные данные, напрямую влияет на качество генерации в AI Overviews.
При создании контента под узкие вертикали критически важно понимать, как модель токенизирует и интерпретирует информацию. Если структура ваших данных «неудобна» для архитектуры модели, ответ будет либо нерелевантным, либо поверхностным. Это означает, что подход к созданию контента должен стать более инженерным. Мы переходим от простого написания промптов к созданию «архитектуры знаний» внутри сайта.
Командам, тестирующим AI-контент, стоит анализировать не только итоговый результат, но и то, насколько структура вашего материала соответствует ожиданиям модели. Понимание того, как модель переваривает иерархию, сущности и связи между ними, становится конкурентным преимуществом. Если ваш контент спроектирован как логичный и легко считываемый граф знаний, он с гораздо большей вероятностью будет выбран AI-системой в качестве источника для ответа. В эпоху генеративного поиска побеждает тот, кто лучше понимает «архитектурные предпочтения» алгоритмов.
Связанная тема раскрывается в @ScoutTelegramAds
Кейс: как сбой памяти в языковых моделях влияет на качество контента
Недавнее исследование механизмов работы языковых моделей показало: они не отслеживают состояние мира шаг за шагом. Релевантная информация накапливается параллельно и проявляется только в последнем токене. Это приводит к тому, что в длинных цепочках (сравнения, списки, многошаговые инструкции) модель теряет контекст.
На практике это подтверждается сбоями: в 30–40% случаев модель неправильно обрабатывает REMOVE-запросы или забывает предыдущие условия. Особенно критично это для контента, где важна последовательность: генерация статей, многоабзацевых лендингов, динамических описаний товаров.
Что это значит для тестирования креативов? Если вы проверяете объявления с несколькими вариантами текста внутри одного блока, построенные по принципу «первый вариант → второй → итог», модель может «забыть» первые и перепрыгнуть на последние. Решение — явно подсвечивать ключевую сущность в финальной части запроса и в каждом значимом блоке текста.
В исследовании предложено nullifying глобального тега подавления — это механистическое исправление, которое снижает частоту сбоев. При тестировании AI-генераций стоит включать этот патч или его аналог, чтобы избежать контекстных ошибок.
Недавнее исследование механизмов работы языковых моделей показало: они не отслеживают состояние мира шаг за шагом. Релевантная информация накапливается параллельно и проявляется только в последнем токене. Это приводит к тому, что в длинных цепочках (сравнения, списки, многошаговые инструкции) модель теряет контекст.
На практике это подтверждается сбоями: в 30–40% случаев модель неправильно обрабатывает REMOVE-запросы или забывает предыдущие условия. Особенно критично это для контента, где важна последовательность: генерация статей, многоабзацевых лендингов, динамических описаний товаров.
Что это значит для тестирования креативов? Если вы проверяете объявления с несколькими вариантами текста внутри одного блока, построенные по принципу «первый вариант → второй → итог», модель может «забыть» первые и перепрыгнуть на последние. Решение — явно подсвечивать ключевую сущность в финальной части запроса и в каждом значимом блоке текста.
В исследовании предложено nullifying глобального тега подавления — это механистическое исправление, которое снижает частоту сбоев. При тестировании AI-генераций стоит включать этот патч или его аналог, чтобы избежать контекстных ошибок.
LLM и контекст: почему структура запроса важнее длины текста
Исследования архитектуры больших языковых моделей (LLM) меняют наше понимание того, как AI обрабатывает информацию. Оказывается, модели не выстраивают последовательное «состояние мира» по мере чтения текста, как это делает человек. Вместо накопления контекста по слоям, релевантная информация агрегируется параллельно — преимущественно в финальном токене, когда запрос становится максимально конкретным.
Что это значит для специалистов в области контент-маркетинга и SEO? Во-первых, линейный сторителлинг может быть менее эффективен для AI-распознавания, чем четкая структуризация. Если модель собирает ответ «в конце», значит, порядок фактов и наличие явных триггеров в контенте критически важны для формирования выдачи (AI Overviews).
Для арбитража это серьезный аргумент в пользу коротких, жестко размеченных блоков информации. Избыточный текст, который не несет прямой смысловой нагрузки, не помогает модели «понять» ваш оффер лучше, а лишь размывает фокус. Структура запроса, явные указания на суть продукта и акцент на ключевых характеристиках в финальных частях текста дают гораздо больше шансов на то, что модель корректно интерпретирует ваш посыл. Не стоит полагаться на то, что AI «проникнется» контекстом статьи — он ищет маркеры для принятия решения в моменте.
Для соседнего контекста загляни в @TiktokAdsBrief
Исследования архитектуры больших языковых моделей (LLM) меняют наше понимание того, как AI обрабатывает информацию. Оказывается, модели не выстраивают последовательное «состояние мира» по мере чтения текста, как это делает человек. Вместо накопления контекста по слоям, релевантная информация агрегируется параллельно — преимущественно в финальном токене, когда запрос становится максимально конкретным.
Что это значит для специалистов в области контент-маркетинга и SEO? Во-первых, линейный сторителлинг может быть менее эффективен для AI-распознавания, чем четкая структуризация. Если модель собирает ответ «в конце», значит, порядок фактов и наличие явных триггеров в контенте критически важны для формирования выдачи (AI Overviews).
Для арбитража это серьезный аргумент в пользу коротких, жестко размеченных блоков информации. Избыточный текст, который не несет прямой смысловой нагрузки, не помогает модели «понять» ваш оффер лучше, а лишь размывает фокус. Структура запроса, явные указания на суть продукта и акцент на ключевых характеристиках в финальных частях текста дают гораздо больше шансов на то, что модель корректно интерпретирует ваш посыл. Не стоит полагаться на то, что AI «проникнется» контекстом статьи — он ищет маркеры для принятия решения в моменте.
Для соседнего контекста загляни в @TiktokAdsBrief
Кейс: почему Markov boundary не гарантирует рост метрик на 3450 задачах
Команда авторов проверила эффективность Markov boundary на синтетическом бенчмарке SCM3K — 3450 табличных задач, 40–1000 признаков, 6 семейств SCM и 6 регрессоров.
Ключевой вывод: если дать регрессору «оракульную» Markov boundary (идеальную выборку признаков), качество заметно растёт, особенно на широких и разреженных пространствах. Но существующие оценщики границы обычно упираются в вычислительный лимит до того, как достигают режима, где этот выигрыш становится заметен.
Для тестирования креативов это прямой сигнал: «умная» отборка признаков (feature selection) не гарантирует рост метрики, если она оптимизирует восстановление структуры, а не предсказание. На табличных моделях и скоринге креативов чаще выигрывает не идеальная граница, а набор, который лучше переживает false negatives и false positives.
Авторы выделяют три причины провала:
- смещение цели на structural recovery вместо predictive performance;
- асимметрия цены ошибок (цена пропуска важного признака выше цены включения шума);
- exact boundary — лишь один из многих наборов, способных обойти все признаки вместе.
Для ваших гипотез по креативам: тестируйте не только «умные» селекторы, но и случайные подмножества — иногда они дают более стабильный прирост.
Команда авторов проверила эффективность Markov boundary на синтетическом бенчмарке SCM3K — 3450 табличных задач, 40–1000 признаков, 6 семейств SCM и 6 регрессоров.
Ключевой вывод: если дать регрессору «оракульную» Markov boundary (идеальную выборку признаков), качество заметно растёт, особенно на широких и разреженных пространствах. Но существующие оценщики границы обычно упираются в вычислительный лимит до того, как достигают режима, где этот выигрыш становится заметен.
Для тестирования креативов это прямой сигнал: «умная» отборка признаков (feature selection) не гарантирует рост метрики, если она оптимизирует восстановление структуры, а не предсказание. На табличных моделях и скоринге креативов чаще выигрывает не идеальная граница, а набор, который лучше переживает false negatives и false positives.
Авторы выделяют три причины провала:
- смещение цели на structural recovery вместо predictive performance;
- асимметрия цены ошибок (цена пропуска важного признака выше цены включения шума);
- exact boundary — лишь один из многих наборов, способных обойти все признаки вместе.
Для ваших гипотез по креативам: тестируйте не только «умные» селекторы, но и случайные подмножества — иногда они дают более стабильный прирост.
Кейс: как двойные UTM-параметры сломали атрибуцию и что с этим делать
Команда тестировала четыре креативных варианта для e-commerce кампании. Через неделю GA4 показывал, что 70% конверсий пришло с utm_source=direct — хотя все ссылки были размечены. Анализ выявил ошибку: в URL landing page повторялись UTM-параметры (например, ?utm_source=facebook&utm_medium=paid&utm_source=meta). GA4 берёт последнее значение, поэтому source перезаписывался на «direct» или невалидное значение.
Результат: неверно распределён бюджет на 40 000 руб. за 5 дней теста, неверные выводы о лучшем креативе и потерянное время на дебаг sGTM и CAPI.
Методика обнаружения:
- Прогоните все активные UTM-ссылки через проверку на дубликаты параметров (можно через UTM Auditor Tool от DumbData).
- Введите правило: каждый UTM-параметр должен встречаться в URL ровно один раз.
- Настройте алерт в GTM Server на случай, если значение source/medium меняется неожиданно.
Проверка a posteriori: из 200 тестируемых ссылок 12 содержали дублирующиеся параметры. Исправление заняло 2 часа. После правок атрибуция вернулась к ожидаемым показателям, а лучший креатив набрал +18% конверсий без изменения креатива — просто за счёт корректной разметки.
Вывод: прежде чем обвинять креатив или таргетинг, проверьте URL hygiene. Это самый быстрый способ починить атрибуцию без доработки кода.
Похожий разбор есть в @DeskAttributionMeasurement
Команда тестировала четыре креативных варианта для e-commerce кампании. Через неделю GA4 показывал, что 70% конверсий пришло с utm_source=direct — хотя все ссылки были размечены. Анализ выявил ошибку: в URL landing page повторялись UTM-параметры (например, ?utm_source=facebook&utm_medium=paid&utm_source=meta). GA4 берёт последнее значение, поэтому source перезаписывался на «direct» или невалидное значение.
Результат: неверно распределён бюджет на 40 000 руб. за 5 дней теста, неверные выводы о лучшем креативе и потерянное время на дебаг sGTM и CAPI.
Методика обнаружения:
- Прогоните все активные UTM-ссылки через проверку на дубликаты параметров (можно через UTM Auditor Tool от DumbData).
- Введите правило: каждый UTM-параметр должен встречаться в URL ровно один раз.
- Настройте алерт в GTM Server на случай, если значение source/medium меняется неожиданно.
Проверка a posteriori: из 200 тестируемых ссылок 12 содержали дублирующиеся параметры. Исправление заняло 2 часа. После правок атрибуция вернулась к ожидаемым показателям, а лучший креатив набрал +18% конверсий без изменения креатива — просто за счёт корректной разметки.
Вывод: прежде чем обвинять креатив или таргетинг, проверьте URL hygiene. Это самый быстрый способ починить атрибуцию без доработки кода.
Похожий разбор есть в @DeskAttributionMeasurement
Compliance лендинга: почему «доверие» убивает конверсию
Частая причина отклонения рекламных кампаний — не качество креатива, а заложенные в лендинг признаки мислида (misleading content). Анализ типичных отказов показывает, что команды часто пытаются «дожать» лид через элементы социального доказательства, которые нарушают правила модерации площадок.
Критическими точками, которые приводят к блокировкам, являются: использование образов знаменитостей без официальных лицензий, публикация вымышленных финансовых отчетов или историй успеха, а также агрессивные призывы к действию (CTA), обещающие гарантированный заработок. Использование формулировок вроде «Activate My Investment» или «Secure My Profit» считывается алгоритмами как манипуляция.
Методически верный подход к созданию лендинга должен строиться на нейтральности. Вместо искусственного создания срочности через таймеры или обещания, стоит сфокусироваться на информативности. Замена CTA на «Request a Call» или «Get More Information» снижает риск модерации, так как снимает с бренда обвинение в недобросовестном маркетинге. Если целевая страница не проходит проверку, первым делом стоит провести аудит на соответствие правилам комплаенса, а не искать проблему в «слабом оффере». Доверие аудитории лучше строить через прозрачность условий, а не через сомнительные элементы дизайна.
Частая причина отклонения рекламных кампаний — не качество креатива, а заложенные в лендинг признаки мислида (misleading content). Анализ типичных отказов показывает, что команды часто пытаются «дожать» лид через элементы социального доказательства, которые нарушают правила модерации площадок.
Критическими точками, которые приводят к блокировкам, являются: использование образов знаменитостей без официальных лицензий, публикация вымышленных финансовых отчетов или историй успеха, а также агрессивные призывы к действию (CTA), обещающие гарантированный заработок. Использование формулировок вроде «Activate My Investment» или «Secure My Profit» считывается алгоритмами как манипуляция.
Методически верный подход к созданию лендинга должен строиться на нейтральности. Вместо искусственного создания срочности через таймеры или обещания, стоит сфокусироваться на информативности. Замена CTA на «Request a Call» или «Get More Information» снижает риск модерации, так как снимает с бренда обвинение в недобросовестном маркетинге. Если целевая страница не проходит проверку, первым делом стоит провести аудит на соответствие правилам комплаенса, а не искать проблему в «слабом оффере». Доверие аудитории лучше строить через прозрачность условий, а не через сомнительные элементы дизайна.
Кейс: устойчивость AI-моделей к сдвигам распределений в реальных задачах
Анализ новых подходов к каузальному обучению, таких как TTT-SCL, позволяет сделать важные выводы о надежности AI-систем в продакшене. Основная проблема большинства моделей — их уязвимость к изменению контекста, что критично для любого маркетингового инструмента, работающего с живой аудиторией. Исследования показывают, что динамическая настройка модели под конкретный запрос дает значительно более стабильные результаты, чем попытки обучить универсальный «черный ящик».
Для нас это означает необходимость смены парадигмы тестирования. В Creative Testing Lab мы часто видим, как гипотезы, работавшие на тестовых выборках, проваливаются при масштабировании. Причина часто кроется в том, что модель не понимает причинно-следственные связи в меняющемся потоке данных. Рекомендация для команд: при оценке эффективности AI-пайплайнов проводите стресс-тесты на «грязных» данных, имитирующих реальные колебания интереса пользователей. Если система не способна сохранять логику принятия решений при смене контекста, она не готова к работе с реальным трафиком. Фокус должен смещаться с «идеальных» метрик на способность сохранять точность в условиях высокой вариативности пользовательского поведения.
Анализ новых подходов к каузальному обучению, таких как TTT-SCL, позволяет сделать важные выводы о надежности AI-систем в продакшене. Основная проблема большинства моделей — их уязвимость к изменению контекста, что критично для любого маркетингового инструмента, работающего с живой аудиторией. Исследования показывают, что динамическая настройка модели под конкретный запрос дает значительно более стабильные результаты, чем попытки обучить универсальный «черный ящик».
Для нас это означает необходимость смены парадигмы тестирования. В Creative Testing Lab мы часто видим, как гипотезы, работавшие на тестовых выборках, проваливаются при масштабировании. Причина часто кроется в том, что модель не понимает причинно-следственные связи в меняющемся потоке данных. Рекомендация для команд: при оценке эффективности AI-пайплайнов проводите стресс-тесты на «грязных» данных, имитирующих реальные колебания интереса пользователей. Если система не способна сохранять логику принятия решений при смене контекста, она не готова к работе с реальным трафиком. Фокус должен смещаться с «идеальных» метрик на способность сохранять точность в условиях высокой вариативности пользовательского поведения.
Почему модели, обученные на синтетике, спотыкаются на живых кластерах
В кейсах по креативному тестированию всё чаще видно одну и ту же проблему: модель отлично выглядит на бенчмарке, но начинает проседать, как только сталкивается с реальными запросами, шумом и изменением формулировок. Работа про Test-Time Training for Supervised Causal Learning (TTT-SCL) как раз про это: фреймворк собирает обучающий контур под конкретный тестовый пример и тем самым пытается пережить distribution shift.
Самый важный вывод здесь не в самой архитектуре, а в логике проверки. Авторы отдельно указывают на три слабых места старых SCL-подходов: разрыв между synthetic и real-world, уязвимость к сдвигу распределений и слабую compositional generalization. Иными словами, если метод держится только на «чистой» лабораторной выборке, в бою он может не распознать новые комбинации признаков.
Для маркетинговых и аналитических команд это прямой сигнал: тестировать такие решения нужно на живых кластерах, а не только на синтетических наборах. Если у вас AI retrieval, классификация интента или кластеризация запросов, закладывайте в план проверки шум, смену формулировок и смешанные сценарии. Иначе на графиках будет высокая точность, а в операционной среде — падение качества и ложные срабатывания.
В кейсах по креативному тестированию всё чаще видно одну и ту же проблему: модель отлично выглядит на бенчмарке, но начинает проседать, как только сталкивается с реальными запросами, шумом и изменением формулировок. Работа про Test-Time Training for Supervised Causal Learning (TTT-SCL) как раз про это: фреймворк собирает обучающий контур под конкретный тестовый пример и тем самым пытается пережить distribution shift.
Самый важный вывод здесь не в самой архитектуре, а в логике проверки. Авторы отдельно указывают на три слабых места старых SCL-подходов: разрыв между synthetic и real-world, уязвимость к сдвигу распределений и слабую compositional generalization. Иными словами, если метод держится только на «чистой» лабораторной выборке, в бою он может не распознать новые комбинации признаков.
Для маркетинговых и аналитических команд это прямой сигнал: тестировать такие решения нужно на живых кластерах, а не только на синтетических наборах. Если у вас AI retrieval, классификация интента или кластеризация запросов, закладывайте в план проверки шум, смену формулировок и смешанные сценарии. Иначе на графиках будет высокая точность, а в операционной среде — падение качества и ложные срабатывания.