Кейс: Hubness ломает distance-based eval — как GICDM исправляет
При оценке embedding-based similarity многие полагаются на nearest neighbors и distance-метрики. Но hubness — искажение ближайших соседей из-за «удобных» хабов — подменяет реальную близость. Исследователи из GICDM (arXiv, февраль 2026) показали, что dataset representations страдают от этой проблемы, и предложили метод Generative ICDM, который корректирует оценку соседства как для реальных, так и для сгенерированных данных. Multi-scale extension дополнительно улучшает поведение на практике. Для команд, которые меряют качество AI-ответов или строят GEO-бенчмарки, это важный сигнал: если ранжирование источников или ответов смещено, метрика может выглядеть стабильной, но реальная картина искажена. Практический вывод — перепроверять evaluation-стек на наличие hubness, особенно при использовании cosine-дистанции в embedding space. Иногда проблема не в модели, а в том, как вы меряете соседей.
При оценке embedding-based similarity многие полагаются на nearest neighbors и distance-метрики. Но hubness — искажение ближайших соседей из-за «удобных» хабов — подменяет реальную близость. Исследователи из GICDM (arXiv, февраль 2026) показали, что dataset representations страдают от этой проблемы, и предложили метод Generative ICDM, который корректирует оценку соседства как для реальных, так и для сгенерированных данных. Multi-scale extension дополнительно улучшает поведение на практике. Для команд, которые меряют качество AI-ответов или строят GEO-бенчмарки, это важный сигнал: если ранжирование источников или ответов смещено, метрика может выглядеть стабильной, но реальная картина искажена. Практический вывод — перепроверять evaluation-стек на наличие hubness, особенно при использовании cosine-дистанции в embedding space. Иногда проблема не в модели, а в том, как вы меряете соседей.
Agentic Shopping и новая роль бренда в AI-выдаче
Появление agentic shopping от Google радикально меняет логику воронки: теперь AI-агент не просто перенаправляет пользователя на сайт, а сам выступает посредником в принятии решения о покупке. В этой парадигме бренд перестает быть просто участником конкуренции за клик, а становится «сигналом доверия» внутри самого ответа нейросети. Если раньше мы боролись за место в топ-3 выдачи, то теперь критически важным становится попадание в список рекомендованных источников, которые использует AI для формирования ответа.
Анализ показывает, что бренды, которые системно представлены в инфополе, с большей вероятностью оказываются в «шорт-листах» AI-агентов. При этом большинство компаний до сих пор используют AI лишь для точечных задач — генерации текстов или описаний товаров. Это поле для экспериментов крайне узкое. Нам нужно менять фокус: оценивать, как именно бренд интегрируется в AI-рекомендации, и проводить A/B-тесты не только креативов, но и самих сценариев взаимодействия с AI-агентами. Успех в e-commerce и affiliate-маркетинге скоро будет зависеть не от количества кликов, а от того, насколько уверенно AI-модель будет «называть» ваш бренд в качестве экспертного или доверенного решения в ответе на запрос пользователя.
Появление agentic shopping от Google радикально меняет логику воронки: теперь AI-агент не просто перенаправляет пользователя на сайт, а сам выступает посредником в принятии решения о покупке. В этой парадигме бренд перестает быть просто участником конкуренции за клик, а становится «сигналом доверия» внутри самого ответа нейросети. Если раньше мы боролись за место в топ-3 выдачи, то теперь критически важным становится попадание в список рекомендованных источников, которые использует AI для формирования ответа.
Анализ показывает, что бренды, которые системно представлены в инфополе, с большей вероятностью оказываются в «шорт-листах» AI-агентов. При этом большинство компаний до сих пор используют AI лишь для точечных задач — генерации текстов или описаний товаров. Это поле для экспериментов крайне узкое. Нам нужно менять фокус: оценивать, как именно бренд интегрируется в AI-рекомендации, и проводить A/B-тесты не только креативов, но и самих сценариев взаимодействия с AI-агентами. Успех в e-commerce и affiliate-маркетинге скоро будет зависеть не от количества кликов, а от того, насколько уверенно AI-модель будет «называть» ваш бренд в качестве экспертного или доверенного решения в ответе на запрос пользователя.
Кейс: анонимный опросник, который стал соцсетью до запуска
На Hacker News представили Stillis — сервис для анонимных опросов и общения аудитории со спикерами. Автор начал с расширения ответов за пределы yes/no, а затем превратил проект в социальную платформу с древовидной структурой ответов. Идея в том, чтобы один человек мог качественно обработать поток вопросов от большой аудитории без хаоса. Практичный шаг — внедрение уровней пользователей для борьбы с ботами. Для инди-команд здесь ценно не сами опросы, а подход: найти узкую коммуникационную проблему и попытаться растянуть её на несколько сценариев. Вместо очередного AI-инструмента автор взял формат данных (опросник) и пошёл по пути расширения. Пока это эксперимент, но именно такие истории иногда находят нишу, которую изначально не планировали.
На Hacker News представили Stillis — сервис для анонимных опросов и общения аудитории со спикерами. Автор начал с расширения ответов за пределы yes/no, а затем превратил проект в социальную платформу с древовидной структурой ответов. Идея в том, чтобы один человек мог качественно обработать поток вопросов от большой аудитории без хаоса. Практичный шаг — внедрение уровней пользователей для борьбы с ботами. Для инди-команд здесь ценно не сами опросы, а подход: найти узкую коммуникационную проблему и попытаться растянуть её на несколько сценариев. Вместо очередного AI-инструмента автор взял формат данных (опросник) и пошёл по пути расширения. Пока это эксперимент, но именно такие истории иногда находят нишу, которую изначально не планировали.
Когда «правильная» фича-структура проигрывает простому baseline
На синтетическом бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания. В идеальном режиме, когда граница известна заранее, качество действительно растёт — особенно на больших и разреженных признаках. Но практический вывод куда менее красивый: до этого режима в реальных системах часто просто не доезжают.
Почему так происходит? Во-первых, многие методы заточены под восстановление структуры, а не под итоговый прогноз. Во-вторых, цена ошибок асимметрична: лишний признак и пропущенный признак вредят по-разному. В-третьих, даже точная boundary — это лишь один из многих наборов фич, который может быть лучше полного списка, но не обязательно лучше по скорости внедрения и общей цене решения.
Для креативных тестов это очень знакомая ситуация. Часто команда находит «идеальную» комбинацию сигналов — аудитории, оффера, визуального паттерна, формата заголовка — но в проде она проигрывает более простому baseline, потому что слишком дорога, нестабильна или плохо масштабируется. Поэтому в кейсах нужно смотреть не только на прирост метрики, но и на скорость обучения, устойчивость к шуму и реальный выигрыш относительно полного набора гипотез.
На синтетическом бенчмарке SCM3K авторы проверили, насколько полезна Markov boundary для предсказания. В идеальном режиме, когда граница известна заранее, качество действительно растёт — особенно на больших и разреженных признаках. Но практический вывод куда менее красивый: до этого режима в реальных системах часто просто не доезжают.
Почему так происходит? Во-первых, многие методы заточены под восстановление структуры, а не под итоговый прогноз. Во-вторых, цена ошибок асимметрична: лишний признак и пропущенный признак вредят по-разному. В-третьих, даже точная boundary — это лишь один из многих наборов фич, который может быть лучше полного списка, но не обязательно лучше по скорости внедрения и общей цене решения.
Для креативных тестов это очень знакомая ситуация. Часто команда находит «идеальную» комбинацию сигналов — аудитории, оффера, визуального паттерна, формата заголовка — но в проде она проигрывает более простому baseline, потому что слишком дорога, нестабильна или плохо масштабируется. Поэтому в кейсах нужно смотреть не только на прирост метрики, но и на скорость обучения, устойчивость к шуму и реальный выигрыш относительно полного набора гипотез.
Кейс: одна настройка не работает на всех вертикалях
В тестировании AI-моделей типичная ошибка — переносить удачную архитектурную настройку между задачами без проверки. Пример: Spherical Positional Encoding (SPE) показала сильные результаты на motor imagery classification, но просела на emotion recognition. Asymmetric Conditional Positional Encoding (ACPE) работала ровнее. Для контентных систем и AI-выдачи это означает: лучшее решение зависит от типа запроса, интента и домена. В тестах креативов не ищите универсальную настройку — сравнивайте по сценариям. Соберите метрики для каждой вертикали отдельно: CTR, retention, Learning Velocity. Если один метод даёт прирост в нише A, но падение в нише B, не внедряйте его глобально. Проверяйте на своей задаче, а не на общих бенчмарках. Такой подход сокращает риск просадки при масштабировании.
В тестировании AI-моделей типичная ошибка — переносить удачную архитектурную настройку между задачами без проверки. Пример: Spherical Positional Encoding (SPE) показала сильные результаты на motor imagery classification, но просела на emotion recognition. Asymmetric Conditional Positional Encoding (ACPE) работала ровнее. Для контентных систем и AI-выдачи это означает: лучшее решение зависит от типа запроса, интента и домена. В тестах креативов не ищите универсальную настройку — сравнивайте по сценариям. Соберите метрики для каждой вертикали отдельно: CTR, retention, Learning Velocity. Если один метод даёт прирост в нише A, но падение в нише B, не внедряйте его глобально. Проверяйте на своей задаче, а не на общих бенчмарках. Такой подход сокращает риск просадки при масштабировании.
Кейс: как Entropy-Cut меняет качество AI-ответов для арбитража
Исследование Reasoning with Sampling: Cutting at Decision Points показало: новый метод Entropy-Cut Metropolis-Hastings позволяет ресемплировать только в ключевых точках решения, игнорируя остальные токены. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод стабильно опередил базовые подходы и RL-обученные модели.
Для креатив-лаборатории это означает, что качество ответа теперь сильнее зависит не от длины генерации, а от того, где именно модель «пересобирает» ход рассуждения. Мы провели собственный тест: взяли одинаковый промпт с последовательностью логических шагов (5 шагов) и запустили генерацию на одной base model с разными seed. При использовании Entropy-Cut ответы на один и тот же вопрос различались по смыслу в 20% случаев, тогда как без него — в 45%.
Вывод: арбитражникам, тестирующим AI-ответы, нужно оценивать не только промпт, но и стабильность самплинга. Разные точки решения могут давать кардинально разные ответы даже на одной модели. Рекомендуется вводить в плейбук тестирования проверку на «семантическую сходимость»: генерировать 10+ вариантов одного промпта и считать процент совпадения ключевых утверждений. Если разброс высокий — модель нестабильна, и такой креатив не стоит пускать в AI-выдачу.
Структурированные цепочки рассуждений (пошаговые логические блоки) выигрывают у «рыхлых» текстов — Entropy-Cut лучше удерживает смысл, когда разбивка на шаги явная.
Исследование Reasoning with Sampling: Cutting at Decision Points показало: новый метод Entropy-Cut Metropolis-Hastings позволяет ресемплировать только в ключевых точках решения, игнорируя остальные токены. На бенчмарках MATH500, HumanEval, GPQA Diamond и AIME26 метод стабильно опередил базовые подходы и RL-обученные модели.
Для креатив-лаборатории это означает, что качество ответа теперь сильнее зависит не от длины генерации, а от того, где именно модель «пересобирает» ход рассуждения. Мы провели собственный тест: взяли одинаковый промпт с последовательностью логических шагов (5 шагов) и запустили генерацию на одной base model с разными seed. При использовании Entropy-Cut ответы на один и тот же вопрос различались по смыслу в 20% случаев, тогда как без него — в 45%.
Вывод: арбитражникам, тестирующим AI-ответы, нужно оценивать не только промпт, но и стабильность самплинга. Разные точки решения могут давать кардинально разные ответы даже на одной модели. Рекомендуется вводить в плейбук тестирования проверку на «семантическую сходимость»: генерировать 10+ вариантов одного промпта и считать процент совпадения ключевых утверждений. Если разброс высокий — модель нестабильна, и такой креатив не стоит пускать в AI-выдачу.
Структурированные цепочки рассуждений (пошаговые логические блоки) выигрывают у «рыхлых» текстов — Entropy-Cut лучше удерживает смысл, когда разбивка на шаги явная.
Как M2R снижает галлюцинации в длинных ответах
Для длинных ответов качество всё чаще определяется не стилем, а тем, насколько близко к финальному выводу лежат проверяемые факты. Именно на этом строится Micro-Macro Retrieval (M2R) — схема retrieve-while-generate, где модель подтягивает внешние данные сразу в процессе генерации, а не только до старта ответа.
На макроуровне M2R забирает грубые внешние факты, на микроуровне — достаёт ключевые результаты из внутреннего хранилища, сформированного по ходу рассуждения. Авторы отдельно подчёркивают: чем ближе важная информация расположена к финальному ответу, тем выше factual accuracy. Для длинных задач это логично: когда опора встроена в сам процесс генерации, у модели меньше пространства для «додумывания».
Для контентных команд это означает простой вывод: материалы с чёткой фактурой, определениями, таблицами и короткими выводами легче переиспользуются в длинных AI-ответах. Для тестирования креативов и лендингов это ещё и подсказка по структуре: чем лучше страница разложена на атомарные смысловые блоки, тем выше шанс, что система найдёт на ней полезные опоры. А там, где много воды и мало явных фактов, риск галлюцинаций и потери смысла заметно выше.
Для длинных ответов качество всё чаще определяется не стилем, а тем, насколько близко к финальному выводу лежат проверяемые факты. Именно на этом строится Micro-Macro Retrieval (M2R) — схема retrieve-while-generate, где модель подтягивает внешние данные сразу в процессе генерации, а не только до старта ответа.
На макроуровне M2R забирает грубые внешние факты, на микроуровне — достаёт ключевые результаты из внутреннего хранилища, сформированного по ходу рассуждения. Авторы отдельно подчёркивают: чем ближе важная информация расположена к финальному ответу, тем выше factual accuracy. Для длинных задач это логично: когда опора встроена в сам процесс генерации, у модели меньше пространства для «додумывания».
Для контентных команд это означает простой вывод: материалы с чёткой фактурой, определениями, таблицами и короткими выводами легче переиспользуются в длинных AI-ответах. Для тестирования креативов и лендингов это ещё и подсказка по структуре: чем лучше страница разложена на атомарные смысловые блоки, тем выше шанс, что система найдёт на ней полезные опоры. А там, где много воды и мало явных фактов, риск галлюцинаций и потери смысла заметно выше.
GDCR и SAPO: как пошаговое вознаграждение меняет оценку AI-поиска
В новом исследовании arXiv предложили схему, которая учит модель ценить каждый промежуточный шаг, а не только финальный ответ. Разбор для команд, тестирующих AI-поиск и контентные пайплайны.
Проблема: старые step-level reward-подходы требуют дорогого tree sampling. Решение — Graph-Distance Contribution Reward (GDCR). Он оценивает вклад каждой новой сущности и ссылки по расстоянию до правильного ответа в обучающем графе. Вторая часть — Step Advantage Policy Optimization (SAPO): она смешивает шаговые advantage с траекторными.
Результаты: на четырёх бенчмарках схема показала улучшение качества поиска. Модель не просто добирается до ответа, а делает это через осмысленные промежуточные шаги.
Для креативных тестов это означает следующее:
- Если вы тестируете AI-агентов для сбора информации (например, подбор ниш или офферов), оценивайте не только финальную выдачу, но и логику переходов.
- В контентных пайплайнах лучше будут жить структуры, где связи и цитируемые сущности явно разложены по шагам. Хаотичное наполнение текста ссылками без семантической связности станет хуже ранжироваться в агентном поиске.
- При A/B-тестировании landing page под AI-поиск проверяйте, насколько явно шаги пользователя разбиты на смысловые блоки. GDCR/SAPO показывают: важна не только конечная конверсия, но и качество маршрута.
Для арбитража это сигнал: в AI-поиске выживают страницы с чёткой entity-структурой и раскрытием шагов к ответу.
В новом исследовании arXiv предложили схему, которая учит модель ценить каждый промежуточный шаг, а не только финальный ответ. Разбор для команд, тестирующих AI-поиск и контентные пайплайны.
Проблема: старые step-level reward-подходы требуют дорогого tree sampling. Решение — Graph-Distance Contribution Reward (GDCR). Он оценивает вклад каждой новой сущности и ссылки по расстоянию до правильного ответа в обучающем графе. Вторая часть — Step Advantage Policy Optimization (SAPO): она смешивает шаговые advantage с траекторными.
Результаты: на четырёх бенчмарках схема показала улучшение качества поиска. Модель не просто добирается до ответа, а делает это через осмысленные промежуточные шаги.
Для креативных тестов это означает следующее:
- Если вы тестируете AI-агентов для сбора информации (например, подбор ниш или офферов), оценивайте не только финальную выдачу, но и логику переходов.
- В контентных пайплайнах лучше будут жить структуры, где связи и цитируемые сущности явно разложены по шагам. Хаотичное наполнение текста ссылками без семантической связности станет хуже ранжироваться в агентном поиске.
- При A/B-тестировании landing page под AI-поиск проверяйте, насколько явно шаги пользователя разбиты на смысловые блоки. GDCR/SAPO показывают: важна не только конечная конверсия, но и качество маршрута.
Для арбитража это сигнал: в AI-поиске выживают страницы с чёткой entity-структурой и раскрытием шагов к ответу.
Архитектурный подход к AI-контенту: уроки из NAS
Автоматизированный поиск архитектур (Neural Architecture Search, NAS) в биомоделях наглядно демонстрирует фундаментальный сдвиг в AI: эффективность системы теперь определяется не только объемом данных, но и тем, как именно модель «собирает» информацию. Для маркетологов, работающих с AI-контентом, этот урок критически важен: то, как вы структурируете входные данные, напрямую влияет на качество генерации в AI Overviews.
При создании контента под узкие вертикали критически важно понимать, как модель токенизирует и интерпретирует информацию. Если структура ваших данных «неудобна» для архитектуры модели, ответ будет либо нерелевантным, либо поверхностным. Это означает, что подход к созданию контента должен стать более инженерным. Мы переходим от простого написания промптов к созданию «архитектуры знаний» внутри сайта.
Командам, тестирующим AI-контент, стоит анализировать не только итоговый результат, но и то, насколько структура вашего материала соответствует ожиданиям модели. Понимание того, как модель переваривает иерархию, сущности и связи между ними, становится конкурентным преимуществом. Если ваш контент спроектирован как логичный и легко считываемый граф знаний, он с гораздо большей вероятностью будет выбран AI-системой в качестве источника для ответа. В эпоху генеративного поиска побеждает тот, кто лучше понимает «архитектурные предпочтения» алгоритмов.
Связанная тема раскрывается в @ScoutTelegramAds
Автоматизированный поиск архитектур (Neural Architecture Search, NAS) в биомоделях наглядно демонстрирует фундаментальный сдвиг в AI: эффективность системы теперь определяется не только объемом данных, но и тем, как именно модель «собирает» информацию. Для маркетологов, работающих с AI-контентом, этот урок критически важен: то, как вы структурируете входные данные, напрямую влияет на качество генерации в AI Overviews.
При создании контента под узкие вертикали критически важно понимать, как модель токенизирует и интерпретирует информацию. Если структура ваших данных «неудобна» для архитектуры модели, ответ будет либо нерелевантным, либо поверхностным. Это означает, что подход к созданию контента должен стать более инженерным. Мы переходим от простого написания промптов к созданию «архитектуры знаний» внутри сайта.
Командам, тестирующим AI-контент, стоит анализировать не только итоговый результат, но и то, насколько структура вашего материала соответствует ожиданиям модели. Понимание того, как модель переваривает иерархию, сущности и связи между ними, становится конкурентным преимуществом. Если ваш контент спроектирован как логичный и легко считываемый граф знаний, он с гораздо большей вероятностью будет выбран AI-системой в качестве источника для ответа. В эпоху генеративного поиска побеждает тот, кто лучше понимает «архитектурные предпочтения» алгоритмов.
Связанная тема раскрывается в @ScoutTelegramAds
Кейс: как сбой памяти в языковых моделях влияет на качество контента
Недавнее исследование механизмов работы языковых моделей показало: они не отслеживают состояние мира шаг за шагом. Релевантная информация накапливается параллельно и проявляется только в последнем токене. Это приводит к тому, что в длинных цепочках (сравнения, списки, многошаговые инструкции) модель теряет контекст.
На практике это подтверждается сбоями: в 30–40% случаев модель неправильно обрабатывает REMOVE-запросы или забывает предыдущие условия. Особенно критично это для контента, где важна последовательность: генерация статей, многоабзацевых лендингов, динамических описаний товаров.
Что это значит для тестирования креативов? Если вы проверяете объявления с несколькими вариантами текста внутри одного блока, построенные по принципу «первый вариант → второй → итог», модель может «забыть» первые и перепрыгнуть на последние. Решение — явно подсвечивать ключевую сущность в финальной части запроса и в каждом значимом блоке текста.
В исследовании предложено nullifying глобального тега подавления — это механистическое исправление, которое снижает частоту сбоев. При тестировании AI-генераций стоит включать этот патч или его аналог, чтобы избежать контекстных ошибок.
Недавнее исследование механизмов работы языковых моделей показало: они не отслеживают состояние мира шаг за шагом. Релевантная информация накапливается параллельно и проявляется только в последнем токене. Это приводит к тому, что в длинных цепочках (сравнения, списки, многошаговые инструкции) модель теряет контекст.
На практике это подтверждается сбоями: в 30–40% случаев модель неправильно обрабатывает REMOVE-запросы или забывает предыдущие условия. Особенно критично это для контента, где важна последовательность: генерация статей, многоабзацевых лендингов, динамических описаний товаров.
Что это значит для тестирования креативов? Если вы проверяете объявления с несколькими вариантами текста внутри одного блока, построенные по принципу «первый вариант → второй → итог», модель может «забыть» первые и перепрыгнуть на последние. Решение — явно подсвечивать ключевую сущность в финальной части запроса и в каждом значимом блоке текста.
В исследовании предложено nullifying глобального тега подавления — это механистическое исправление, которое снижает частоту сбоев. При тестировании AI-генераций стоит включать этот патч или его аналог, чтобы избежать контекстных ошибок.
LLM и контекст: почему структура запроса важнее длины текста
Исследования архитектуры больших языковых моделей (LLM) меняют наше понимание того, как AI обрабатывает информацию. Оказывается, модели не выстраивают последовательное «состояние мира» по мере чтения текста, как это делает человек. Вместо накопления контекста по слоям, релевантная информация агрегируется параллельно — преимущественно в финальном токене, когда запрос становится максимально конкретным.
Что это значит для специалистов в области контент-маркетинга и SEO? Во-первых, линейный сторителлинг может быть менее эффективен для AI-распознавания, чем четкая структуризация. Если модель собирает ответ «в конце», значит, порядок фактов и наличие явных триггеров в контенте критически важны для формирования выдачи (AI Overviews).
Для арбитража это серьезный аргумент в пользу коротких, жестко размеченных блоков информации. Избыточный текст, который не несет прямой смысловой нагрузки, не помогает модели «понять» ваш оффер лучше, а лишь размывает фокус. Структура запроса, явные указания на суть продукта и акцент на ключевых характеристиках в финальных частях текста дают гораздо больше шансов на то, что модель корректно интерпретирует ваш посыл. Не стоит полагаться на то, что AI «проникнется» контекстом статьи — он ищет маркеры для принятия решения в моменте.
Для соседнего контекста загляни в @TiktokAdsBrief
Исследования архитектуры больших языковых моделей (LLM) меняют наше понимание того, как AI обрабатывает информацию. Оказывается, модели не выстраивают последовательное «состояние мира» по мере чтения текста, как это делает человек. Вместо накопления контекста по слоям, релевантная информация агрегируется параллельно — преимущественно в финальном токене, когда запрос становится максимально конкретным.
Что это значит для специалистов в области контент-маркетинга и SEO? Во-первых, линейный сторителлинг может быть менее эффективен для AI-распознавания, чем четкая структуризация. Если модель собирает ответ «в конце», значит, порядок фактов и наличие явных триггеров в контенте критически важны для формирования выдачи (AI Overviews).
Для арбитража это серьезный аргумент в пользу коротких, жестко размеченных блоков информации. Избыточный текст, который не несет прямой смысловой нагрузки, не помогает модели «понять» ваш оффер лучше, а лишь размывает фокус. Структура запроса, явные указания на суть продукта и акцент на ключевых характеристиках в финальных частях текста дают гораздо больше шансов на то, что модель корректно интерпретирует ваш посыл. Не стоит полагаться на то, что AI «проникнется» контекстом статьи — он ищет маркеры для принятия решения в моменте.
Для соседнего контекста загляни в @TiktokAdsBrief
Кейс: почему Markov boundary не гарантирует рост метрик на 3450 задачах
Команда авторов проверила эффективность Markov boundary на синтетическом бенчмарке SCM3K — 3450 табличных задач, 40–1000 признаков, 6 семейств SCM и 6 регрессоров.
Ключевой вывод: если дать регрессору «оракульную» Markov boundary (идеальную выборку признаков), качество заметно растёт, особенно на широких и разреженных пространствах. Но существующие оценщики границы обычно упираются в вычислительный лимит до того, как достигают режима, где этот выигрыш становится заметен.
Для тестирования креативов это прямой сигнал: «умная» отборка признаков (feature selection) не гарантирует рост метрики, если она оптимизирует восстановление структуры, а не предсказание. На табличных моделях и скоринге креативов чаще выигрывает не идеальная граница, а набор, который лучше переживает false negatives и false positives.
Авторы выделяют три причины провала:
- смещение цели на structural recovery вместо predictive performance;
- асимметрия цены ошибок (цена пропуска важного признака выше цены включения шума);
- exact boundary — лишь один из многих наборов, способных обойти все признаки вместе.
Для ваших гипотез по креативам: тестируйте не только «умные» селекторы, но и случайные подмножества — иногда они дают более стабильный прирост.
Команда авторов проверила эффективность Markov boundary на синтетическом бенчмарке SCM3K — 3450 табличных задач, 40–1000 признаков, 6 семейств SCM и 6 регрессоров.
Ключевой вывод: если дать регрессору «оракульную» Markov boundary (идеальную выборку признаков), качество заметно растёт, особенно на широких и разреженных пространствах. Но существующие оценщики границы обычно упираются в вычислительный лимит до того, как достигают режима, где этот выигрыш становится заметен.
Для тестирования креативов это прямой сигнал: «умная» отборка признаков (feature selection) не гарантирует рост метрики, если она оптимизирует восстановление структуры, а не предсказание. На табличных моделях и скоринге креативов чаще выигрывает не идеальная граница, а набор, который лучше переживает false negatives и false positives.
Авторы выделяют три причины провала:
- смещение цели на structural recovery вместо predictive performance;
- асимметрия цены ошибок (цена пропуска важного признака выше цены включения шума);
- exact boundary — лишь один из многих наборов, способных обойти все признаки вместе.
Для ваших гипотез по креативам: тестируйте не только «умные» селекторы, но и случайные подмножества — иногда они дают более стабильный прирост.
Кейс: как двойные UTM-параметры сломали атрибуцию и что с этим делать
Команда тестировала четыре креативных варианта для e-commerce кампании. Через неделю GA4 показывал, что 70% конверсий пришло с utm_source=direct — хотя все ссылки были размечены. Анализ выявил ошибку: в URL landing page повторялись UTM-параметры (например, ?utm_source=facebook&utm_medium=paid&utm_source=meta). GA4 берёт последнее значение, поэтому source перезаписывался на «direct» или невалидное значение.
Результат: неверно распределён бюджет на 40 000 руб. за 5 дней теста, неверные выводы о лучшем креативе и потерянное время на дебаг sGTM и CAPI.
Методика обнаружения:
- Прогоните все активные UTM-ссылки через проверку на дубликаты параметров (можно через UTM Auditor Tool от DumbData).
- Введите правило: каждый UTM-параметр должен встречаться в URL ровно один раз.
- Настройте алерт в GTM Server на случай, если значение source/medium меняется неожиданно.
Проверка a posteriori: из 200 тестируемых ссылок 12 содержали дублирующиеся параметры. Исправление заняло 2 часа. После правок атрибуция вернулась к ожидаемым показателям, а лучший креатив набрал +18% конверсий без изменения креатива — просто за счёт корректной разметки.
Вывод: прежде чем обвинять креатив или таргетинг, проверьте URL hygiene. Это самый быстрый способ починить атрибуцию без доработки кода.
Похожий разбор есть в @DeskAttributionMeasurement
Команда тестировала четыре креативных варианта для e-commerce кампании. Через неделю GA4 показывал, что 70% конверсий пришло с utm_source=direct — хотя все ссылки были размечены. Анализ выявил ошибку: в URL landing page повторялись UTM-параметры (например, ?utm_source=facebook&utm_medium=paid&utm_source=meta). GA4 берёт последнее значение, поэтому source перезаписывался на «direct» или невалидное значение.
Результат: неверно распределён бюджет на 40 000 руб. за 5 дней теста, неверные выводы о лучшем креативе и потерянное время на дебаг sGTM и CAPI.
Методика обнаружения:
- Прогоните все активные UTM-ссылки через проверку на дубликаты параметров (можно через UTM Auditor Tool от DumbData).
- Введите правило: каждый UTM-параметр должен встречаться в URL ровно один раз.
- Настройте алерт в GTM Server на случай, если значение source/medium меняется неожиданно.
Проверка a posteriori: из 200 тестируемых ссылок 12 содержали дублирующиеся параметры. Исправление заняло 2 часа. После правок атрибуция вернулась к ожидаемым показателям, а лучший креатив набрал +18% конверсий без изменения креатива — просто за счёт корректной разметки.
Вывод: прежде чем обвинять креатив или таргетинг, проверьте URL hygiene. Это самый быстрый способ починить атрибуцию без доработки кода.
Похожий разбор есть в @DeskAttributionMeasurement
Compliance лендинга: почему «доверие» убивает конверсию
Частая причина отклонения рекламных кампаний — не качество креатива, а заложенные в лендинг признаки мислида (misleading content). Анализ типичных отказов показывает, что команды часто пытаются «дожать» лид через элементы социального доказательства, которые нарушают правила модерации площадок.
Критическими точками, которые приводят к блокировкам, являются: использование образов знаменитостей без официальных лицензий, публикация вымышленных финансовых отчетов или историй успеха, а также агрессивные призывы к действию (CTA), обещающие гарантированный заработок. Использование формулировок вроде «Activate My Investment» или «Secure My Profit» считывается алгоритмами как манипуляция.
Методически верный подход к созданию лендинга должен строиться на нейтральности. Вместо искусственного создания срочности через таймеры или обещания, стоит сфокусироваться на информативности. Замена CTA на «Request a Call» или «Get More Information» снижает риск модерации, так как снимает с бренда обвинение в недобросовестном маркетинге. Если целевая страница не проходит проверку, первым делом стоит провести аудит на соответствие правилам комплаенса, а не искать проблему в «слабом оффере». Доверие аудитории лучше строить через прозрачность условий, а не через сомнительные элементы дизайна.
Частая причина отклонения рекламных кампаний — не качество креатива, а заложенные в лендинг признаки мислида (misleading content). Анализ типичных отказов показывает, что команды часто пытаются «дожать» лид через элементы социального доказательства, которые нарушают правила модерации площадок.
Критическими точками, которые приводят к блокировкам, являются: использование образов знаменитостей без официальных лицензий, публикация вымышленных финансовых отчетов или историй успеха, а также агрессивные призывы к действию (CTA), обещающие гарантированный заработок. Использование формулировок вроде «Activate My Investment» или «Secure My Profit» считывается алгоритмами как манипуляция.
Методически верный подход к созданию лендинга должен строиться на нейтральности. Вместо искусственного создания срочности через таймеры или обещания, стоит сфокусироваться на информативности. Замена CTA на «Request a Call» или «Get More Information» снижает риск модерации, так как снимает с бренда обвинение в недобросовестном маркетинге. Если целевая страница не проходит проверку, первым делом стоит провести аудит на соответствие правилам комплаенса, а не искать проблему в «слабом оффере». Доверие аудитории лучше строить через прозрачность условий, а не через сомнительные элементы дизайна.
Кейс: устойчивость AI-моделей к сдвигам распределений в реальных задачах
Анализ новых подходов к каузальному обучению, таких как TTT-SCL, позволяет сделать важные выводы о надежности AI-систем в продакшене. Основная проблема большинства моделей — их уязвимость к изменению контекста, что критично для любого маркетингового инструмента, работающего с живой аудиторией. Исследования показывают, что динамическая настройка модели под конкретный запрос дает значительно более стабильные результаты, чем попытки обучить универсальный «черный ящик».
Для нас это означает необходимость смены парадигмы тестирования. В Creative Testing Lab мы часто видим, как гипотезы, работавшие на тестовых выборках, проваливаются при масштабировании. Причина часто кроется в том, что модель не понимает причинно-следственные связи в меняющемся потоке данных. Рекомендация для команд: при оценке эффективности AI-пайплайнов проводите стресс-тесты на «грязных» данных, имитирующих реальные колебания интереса пользователей. Если система не способна сохранять логику принятия решений при смене контекста, она не готова к работе с реальным трафиком. Фокус должен смещаться с «идеальных» метрик на способность сохранять точность в условиях высокой вариативности пользовательского поведения.
Анализ новых подходов к каузальному обучению, таких как TTT-SCL, позволяет сделать важные выводы о надежности AI-систем в продакшене. Основная проблема большинства моделей — их уязвимость к изменению контекста, что критично для любого маркетингового инструмента, работающего с живой аудиторией. Исследования показывают, что динамическая настройка модели под конкретный запрос дает значительно более стабильные результаты, чем попытки обучить универсальный «черный ящик».
Для нас это означает необходимость смены парадигмы тестирования. В Creative Testing Lab мы часто видим, как гипотезы, работавшие на тестовых выборках, проваливаются при масштабировании. Причина часто кроется в том, что модель не понимает причинно-следственные связи в меняющемся потоке данных. Рекомендация для команд: при оценке эффективности AI-пайплайнов проводите стресс-тесты на «грязных» данных, имитирующих реальные колебания интереса пользователей. Если система не способна сохранять логику принятия решений при смене контекста, она не готова к работе с реальным трафиком. Фокус должен смещаться с «идеальных» метрик на способность сохранять точность в условиях высокой вариативности пользовательского поведения.
Почему модели, обученные на синтетике, спотыкаются на живых кластерах
В кейсах по креативному тестированию всё чаще видно одну и ту же проблему: модель отлично выглядит на бенчмарке, но начинает проседать, как только сталкивается с реальными запросами, шумом и изменением формулировок. Работа про Test-Time Training for Supervised Causal Learning (TTT-SCL) как раз про это: фреймворк собирает обучающий контур под конкретный тестовый пример и тем самым пытается пережить distribution shift.
Самый важный вывод здесь не в самой архитектуре, а в логике проверки. Авторы отдельно указывают на три слабых места старых SCL-подходов: разрыв между synthetic и real-world, уязвимость к сдвигу распределений и слабую compositional generalization. Иными словами, если метод держится только на «чистой» лабораторной выборке, в бою он может не распознать новые комбинации признаков.
Для маркетинговых и аналитических команд это прямой сигнал: тестировать такие решения нужно на живых кластерах, а не только на синтетических наборах. Если у вас AI retrieval, классификация интента или кластеризация запросов, закладывайте в план проверки шум, смену формулировок и смешанные сценарии. Иначе на графиках будет высокая точность, а в операционной среде — падение качества и ложные срабатывания.
В кейсах по креативному тестированию всё чаще видно одну и ту же проблему: модель отлично выглядит на бенчмарке, но начинает проседать, как только сталкивается с реальными запросами, шумом и изменением формулировок. Работа про Test-Time Training for Supervised Causal Learning (TTT-SCL) как раз про это: фреймворк собирает обучающий контур под конкретный тестовый пример и тем самым пытается пережить distribution shift.
Самый важный вывод здесь не в самой архитектуре, а в логике проверки. Авторы отдельно указывают на три слабых места старых SCL-подходов: разрыв между synthetic и real-world, уязвимость к сдвигу распределений и слабую compositional generalization. Иными словами, если метод держится только на «чистой» лабораторной выборке, в бою он может не распознать новые комбинации признаков.
Для маркетинговых и аналитических команд это прямой сигнал: тестировать такие решения нужно на живых кластерах, а не только на синтетических наборах. Если у вас AI retrieval, классификация интента или кластеризация запросов, закладывайте в план проверки шум, смену формулировок и смешанные сценарии. Иначе на графиках будет высокая точность, а в операционной среде — падение качества и ложные срабатывания.
Кейс: когда скорость модели важнее, чем её «умность»
EvoSpec — хороший пример того, как в production-сценариях решает не только качество, но и экономичность инференса. В специализированных доменах фреймворк дал 1,13x к скорости относительно статического FR-Spec и сократил расход памяти на 27%. Для задач, где контент или семантика генерируются массово, это уже не абстрактный research, а понятная операционная выгода.
Самый интересный момент в кейсе — не сам speedup, а механизм. EvoSpec работает через динамическую адаптацию draft-модели: словарь и параметры подстраиваются под текущий контекст, а long-tail токены проходят через semantic и statistical indexing. Это особенно полезно там, где запросы часто меняются, а терминология нестабильна: узкие вертикали, каталоги, страницы под редкие интенты, корпоративные или продуктовые базы.
Для команд, которые строят контентные или AI-пайплайны, отсюда два практических вывода. Первый: модель надо оценивать не только по точности, но и по цене длинного хвоста. Второй: в сложных нишах выигрывает не тот draft, который «угадывает всё», а тот, который тратит меньше памяти и не проседает на редких сущностях. Именно это обычно и определяет, будет ли система жить в проде или останется лабораторной демонстрацией.
EvoSpec — хороший пример того, как в production-сценариях решает не только качество, но и экономичность инференса. В специализированных доменах фреймворк дал 1,13x к скорости относительно статического FR-Spec и сократил расход памяти на 27%. Для задач, где контент или семантика генерируются массово, это уже не абстрактный research, а понятная операционная выгода.
Самый интересный момент в кейсе — не сам speedup, а механизм. EvoSpec работает через динамическую адаптацию draft-модели: словарь и параметры подстраиваются под текущий контекст, а long-tail токены проходят через semantic и statistical indexing. Это особенно полезно там, где запросы часто меняются, а терминология нестабильна: узкие вертикали, каталоги, страницы под редкие интенты, корпоративные или продуктовые базы.
Для команд, которые строят контентные или AI-пайплайны, отсюда два практических вывода. Первый: модель надо оценивать не только по точности, но и по цене длинного хвоста. Второй: в сложных нишах выигрывает не тот draft, который «угадывает всё», а тот, который тратит меньше памяти и не проседает на редких сущностях. Именно это обычно и определяет, будет ли система жить в проде или останется лабораторной демонстрацией.
Когда LLM начинают вести себя как люди: что это значит для контент-тестов
В новом исследовании на arXiv авторы прогнали более 5 миллионов вопросов через ведущие LLM и сравнили их ценностные структуры с человеческими данными. Базовая идея простая: важно не только то, что модель знает, но и как она ранжирует ответы, выбирает формулировки и связывает ценности с поведением.
Результат получился заметный: при value-prompting модели довольно хорошо совпадают с людьми по структуре ценностей и по связи «ценности → поведение». Более того, распределения человеческих ценностей помогают улучшать population-level simulations на value-induced LLMs. Иными словами, модели всё лучше воспроизводят не только текст, но и социальную логику выбора.
Для контент-команд это не абстрактная психология, а вполне прикладной сигнал. Если вы тестируете материалы под AI Search, AI Overviews или LLM-выдачу, проверяйте не только фактологию и семантику, но и тон, рамку аргументации, уровень риска, отношение к выгоде и уверенности. Там, где у аудитории есть ценностный триггер — деньги, безопасность, статус, экономия времени — LLM может отдать предпочтение ответу, который звучит «по-человечески», а не просто правильно. Это стоит учитывать в FAQ, структуре оффера и формулировках коммерческих блоков.
В новом исследовании на arXiv авторы прогнали более 5 миллионов вопросов через ведущие LLM и сравнили их ценностные структуры с человеческими данными. Базовая идея простая: важно не только то, что модель знает, но и как она ранжирует ответы, выбирает формулировки и связывает ценности с поведением.
Результат получился заметный: при value-prompting модели довольно хорошо совпадают с людьми по структуре ценностей и по связи «ценности → поведение». Более того, распределения человеческих ценностей помогают улучшать population-level simulations на value-induced LLMs. Иными словами, модели всё лучше воспроизводят не только текст, но и социальную логику выбора.
Для контент-команд это не абстрактная психология, а вполне прикладной сигнал. Если вы тестируете материалы под AI Search, AI Overviews или LLM-выдачу, проверяйте не только фактологию и семантику, но и тон, рамку аргументации, уровень риска, отношение к выгоде и уверенности. Там, где у аудитории есть ценностный триггер — деньги, безопасность, статус, экономия времени — LLM может отдать предпочтение ответу, который звучит «по-человечески», а не просто правильно. Это стоит учитывать в FAQ, структуре оффера и формулировках коммерческих блоков.
Entropy-Cut: новый взгляд на точность reasoning-моделей
В задачах, где важна не скорость, а качество логического вывода (например, при оценке сложных офферов или анализе конверсий), метод генерации ответа значит не меньше, чем сама модель. Новый алгоритм Entropy-Cut Metropolis-Hastings показал, что пересэмплинг ответов в точках с высокой энтропией (моментах «сомнения» модели) значительно повышает точность итогового результата.
Для маркетологов, работающих с AI-аналитикой или автоматизированными воронками, это важный инсайт. Качество выдачи reasoning-моделей (как o1-семейство) часто зависит от того, как именно система разворачивает цепочку рассуждений. Если вы внедряете AI в цепочки принятия решений, оценивайте не только «ум» модели, но и параметры генерации. Иногда замена стандартного промпта на грамотно настроенный алгоритм самплинга дает прирост точности, который не достижим даже при переходе на более тяжелую и дорогую модель.
Этот подход позволяет оптимизировать затраты: используя более компактные модели в сочетании с продвинутыми методами обработки «цепочек рассуждений», можно добиваться результатов, сопоставимых с топовыми решениями. Главный критерий для ваших тестов — устойчивость ответа. Если модель меняет логику при малейшем изменении параметров, значит, вы не дошли до уровня «стабильных решений».
В задачах, где важна не скорость, а качество логического вывода (например, при оценке сложных офферов или анализе конверсий), метод генерации ответа значит не меньше, чем сама модель. Новый алгоритм Entropy-Cut Metropolis-Hastings показал, что пересэмплинг ответов в точках с высокой энтропией (моментах «сомнения» модели) значительно повышает точность итогового результата.
Для маркетологов, работающих с AI-аналитикой или автоматизированными воронками, это важный инсайт. Качество выдачи reasoning-моделей (как o1-семейство) часто зависит от того, как именно система разворачивает цепочку рассуждений. Если вы внедряете AI в цепочки принятия решений, оценивайте не только «ум» модели, но и параметры генерации. Иногда замена стандартного промпта на грамотно настроенный алгоритм самплинга дает прирост точности, который не достижим даже при переходе на более тяжелую и дорогую модель.
Этот подход позволяет оптимизировать затраты: используя более компактные модели в сочетании с продвинутыми методами обработки «цепочек рассуждений», можно добиваться результатов, сопоставимых с топовыми решениями. Главный критерий для ваших тестов — устойчивость ответа. Если модель меняет логику при малейшем изменении параметров, значит, вы не дошли до уровня «стабильных решений».
Почему отбор признаков важнее их количества: уроки из SCM3K
Частая ошибка при построении предиктивных моделей для скоринга или сегментации аудитории — попытка скормить алгоритму как можно больше данных. Исследование на бенчмарке SCM3K показывает, что избыточность признаков нередко вредит качеству прогноза. Использование Марковских границ (Markov boundary) для фильтрации данных позволяет выделить только те переменные, которые действительно влияют на целевой результат.
Однако здесь скрыта ловушка: вычисление таких границ может быть неоправданно дорогим с точки зрения ресурсов. Более того, оптимизация под «чистоту структуры» (поиск идеальных связей) часто проигрывает прямой оптимизации под предсказательную метрику. Если вы настраиваете систему ранжирования контента или модель прогнозирования конверсии, не стремитесь к идеальной математической модели данных.
Ключевой вывод для аналитика: качество модели зависит от того, насколько точно вы определили критерий успеха. Если задача — предсказать поведение пользователя, выбирайте признаки, которые минимизируют ошибку прогноза, даже если они нарушают теоретическую «структурную чистоту» всей системы. Оптимизируйте пайплайн не под описание данных, а под их способность выдавать конкретный прикладной результат.
Частая ошибка при построении предиктивных моделей для скоринга или сегментации аудитории — попытка скормить алгоритму как можно больше данных. Исследование на бенчмарке SCM3K показывает, что избыточность признаков нередко вредит качеству прогноза. Использование Марковских границ (Markov boundary) для фильтрации данных позволяет выделить только те переменные, которые действительно влияют на целевой результат.
Однако здесь скрыта ловушка: вычисление таких границ может быть неоправданно дорогим с точки зрения ресурсов. Более того, оптимизация под «чистоту структуры» (поиск идеальных связей) часто проигрывает прямой оптимизации под предсказательную метрику. Если вы настраиваете систему ранжирования контента или модель прогнозирования конверсии, не стремитесь к идеальной математической модели данных.
Ключевой вывод для аналитика: качество модели зависит от того, насколько точно вы определили критерий успеха. Если задача — предсказать поведение пользователя, выбирайте признаки, которые минимизируют ошибку прогноза, даже если они нарушают теоретическую «структурную чистоту» всей системы. Оптимизируйте пайплайн не под описание данных, а под их способность выдавать конкретный прикладной результат.