Как бенчмарки для VLM меняют требования к данным в AdTech
Вышел CrystalXRD-Bench — небольшой, но показательный набор для оценки vision-language моделей. Там 250 примеров и 7 моделей, а задача сводится к довольно жёсткой проверке: система должна восстановить полный набор меток по изображению пика. По сути, это не про красивый ответ, а про точность попадания в структурированные данные.
Почему это важно не только для науки, но и для programmatic и martech? Потому что логика оценки здесь очень похожа на то, как сегодня проверяют ML- и AI-инструменты в маркетинге. Модель недостаточно «угадать смысл» по картинке или скриншоту. Её ответ сравнивают с исходной разметкой, и именно это отделяет демонстрацию от реально пригодного продукта.
В этом бенчмарке лучший Jaccard у GPT-5.4 — 0.5888, exact match — 37.6%. У остальных результаты заметно скромнее: у шести из семи моделей Jaccard не дотягивает до 0.50. Для рынка это важный сигнал: мультимодальные модели уже умеют помогать, но в задачах, где нужна извлекаемая структура, они всё ещё часто дают частичное совпадение, а не полный ответ.
Для рекламных и аналитических команд отсюда простой вывод. Если вы строите AI-инструмент для креативов, медиапланов, supply path analysis или privacy-отчётности, держите рядом не только изображение, но и исходные данные: схемы, атрибуты, JSON, таблицы, метки. Без этого любой красивый интерфейс быстро упирается в слабую измеримость качества.
Публичный релиз данных и кода ещё ожидается, но сам формат уже полезен как ориентир: AI в инструментах ценится не за эффектность, а за проверяемую точность.
Вышел CrystalXRD-Bench — небольшой, но показательный набор для оценки vision-language моделей. Там 250 примеров и 7 моделей, а задача сводится к довольно жёсткой проверке: система должна восстановить полный набор меток по изображению пика. По сути, это не про красивый ответ, а про точность попадания в структурированные данные.
Почему это важно не только для науки, но и для programmatic и martech? Потому что логика оценки здесь очень похожа на то, как сегодня проверяют ML- и AI-инструменты в маркетинге. Модель недостаточно «угадать смысл» по картинке или скриншоту. Её ответ сравнивают с исходной разметкой, и именно это отделяет демонстрацию от реально пригодного продукта.
В этом бенчмарке лучший Jaccard у GPT-5.4 — 0.5888, exact match — 37.6%. У остальных результаты заметно скромнее: у шести из семи моделей Jaccard не дотягивает до 0.50. Для рынка это важный сигнал: мультимодальные модели уже умеют помогать, но в задачах, где нужна извлекаемая структура, они всё ещё часто дают частичное совпадение, а не полный ответ.
Для рекламных и аналитических команд отсюда простой вывод. Если вы строите AI-инструмент для креативов, медиапланов, supply path analysis или privacy-отчётности, держите рядом не только изображение, но и исходные данные: схемы, атрибуты, JSON, таблицы, метки. Без этого любой красивый интерфейс быстро упирается в слабую измеримость качества.
Публичный релиз данных и кода ещё ожидается, но сам формат уже полезен как ориентир: AI в инструментах ценится не за эффектность, а за проверяемую точность.
Почему в programmatic спорят не о CPM, а о том, где теряются конверсии
В связке programmatic-медиа редко ломается один инструмент. Чаще рассыпается вся цепочка: DSP фиксирует показ или клик, MMP считает установку или событие по своим правилам, а postback доходит до трекера с задержкой или вообще без части параметров.
Отсюда и типичная ошибка в разборе: сравнивают интерфейсы и отчёты, хотя смотреть надо на путь сигнала. Если в системе нет отдельного времени получения postback, любой спор превращается в спор на уровне «похоже, всё сошлось» вместо нормальной диагностики.
Для adtech-команды здесь важно три слоя:
— платежный и supply-слой показывает реальный spend, отклонения и нестабильность инвентаря;
— MMP отражает событие в своём атрибуционном окне;
— трекер или BI-слой принимает postback и решает, куда записать конверсию.
На практике проблемы чаще всего всплывают не в красивых дашбордах, а в деталях: часть конверсий приходит позже окна, часть теряет click_id, часть выглядит «двойной» из-за разного времени фиксации на стороне платформ. Если чистить это вручную, можно долго искать виноватого между сетью, кабинетом и MMP.
Полезный быстрый тест — взять 20–30 спорных конверсий и сверить по четырём полям: click_id, время клика, время события и время получения postback. Если хотя бы одно из них не хранится отдельно, вы не измеряете расхождения, а угадываете их причину.
Для маркетинг-директора вывод простой: в programmatic нельзя управлять только по итоговому CPA. Когда signal chain рвётся, страдает не только отчётность, но и скорость обучения кампаний.
В связке programmatic-медиа редко ломается один инструмент. Чаще рассыпается вся цепочка: DSP фиксирует показ или клик, MMP считает установку или событие по своим правилам, а postback доходит до трекера с задержкой или вообще без части параметров.
Отсюда и типичная ошибка в разборе: сравнивают интерфейсы и отчёты, хотя смотреть надо на путь сигнала. Если в системе нет отдельного времени получения postback, любой спор превращается в спор на уровне «похоже, всё сошлось» вместо нормальной диагностики.
Для adtech-команды здесь важно три слоя:
— платежный и supply-слой показывает реальный spend, отклонения и нестабильность инвентаря;
— MMP отражает событие в своём атрибуционном окне;
— трекер или BI-слой принимает postback и решает, куда записать конверсию.
На практике проблемы чаще всего всплывают не в красивых дашбордах, а в деталях: часть конверсий приходит позже окна, часть теряет click_id, часть выглядит «двойной» из-за разного времени фиксации на стороне платформ. Если чистить это вручную, можно долго искать виноватого между сетью, кабинетом и MMP.
Полезный быстрый тест — взять 20–30 спорных конверсий и сверить по четырём полям: click_id, время клика, время события и время получения postback. Если хотя бы одно из них не хранится отдельно, вы не измеряете расхождения, а угадываете их причину.
Для маркетинг-директора вывод простой: в programmatic нельзя управлять только по итоговому CPA. Когда signal chain рвётся, страдает не только отчётность, но и скорость обучения кампаний.
YouTube становится заметнее в атрибуции: что меняется для programmatic-команд
TransUnion и Google объявили об интеграции, которая позволяет включать YouTube в multi-touch attribution — модель, где вклад канала оценивается не по последнему клику, а по всей цепочке касаний. Для рынка это важный сигнал: видео постепенно перестаёт быть «неучтённым влиянием» и становится частью формализованного measurement-подхода.
Почему это важно именно для programmatic и AdTech. В крупных медиамиксах YouTube часто жил в отдельной логике: охват есть, влияние чувствуется, но связать его с итоговой конверсией было сложнее, чем у поисковых или нижневороночных каналов. Теперь у брендов и performance-команд появляется ещё один способ встроить видео в общую модель распределения бюджета.
Но у инструмента есть и очевидные ограничения. Любая MTA-модель зависит от качества данных, выбранного окна атрибуции и того, как платформа считает касания. Поэтому вопрос для медиадиректора здесь не в том, «появилась ли атрибуция», а в том, насколько сравнимы будут результаты с другими источниками и не начнёт ли модель переоценивать удобные для платформы точки контакта.
С точки зрения supply path и measurement это ещё один шаг к более управляемому измерению внутри экосистемы Google. Для рынка полезно не столько само нововведение, сколько его эффект: YouTube всё меньше выглядит как имиджевый канал «на доверии» и всё больше — как измеряемый элемент медиаплана, который можно обсуждать в терминах вклада, а не только охвата.
TransUnion и Google объявили об интеграции, которая позволяет включать YouTube в multi-touch attribution — модель, где вклад канала оценивается не по последнему клику, а по всей цепочке касаний. Для рынка это важный сигнал: видео постепенно перестаёт быть «неучтённым влиянием» и становится частью формализованного measurement-подхода.
Почему это важно именно для programmatic и AdTech. В крупных медиамиксах YouTube часто жил в отдельной логике: охват есть, влияние чувствуется, но связать его с итоговой конверсией было сложнее, чем у поисковых или нижневороночных каналов. Теперь у брендов и performance-команд появляется ещё один способ встроить видео в общую модель распределения бюджета.
Но у инструмента есть и очевидные ограничения. Любая MTA-модель зависит от качества данных, выбранного окна атрибуции и того, как платформа считает касания. Поэтому вопрос для медиадиректора здесь не в том, «появилась ли атрибуция», а в том, насколько сравнимы будут результаты с другими источниками и не начнёт ли модель переоценивать удобные для платформы точки контакта.
С точки зрения supply path и measurement это ещё один шаг к более управляемому измерению внутри экосистемы Google. Для рынка полезно не столько само нововведение, сколько его эффект: YouTube всё меньше выглядит как имиджевый канал «на доверии» и всё больше — как измеряемый элемент медиаплана, который можно обсуждать в терминах вклада, а не только охвата.
LLM начинают лучше «считывать» не только текст, но и человеческие ценностные рамки
В свежем исследовании более 5 миллионов вопросов прогнали через ведущие LLM и сравнили их ответы с теорией ценностей из психологии. Идея простая: посмотреть, насколько модели воспроизводят не только факты, но и устойчивые способы выбора, интерпретации и приоритизации.
Вывод важен не только для AI Search. Авторы отмечают, что модели довольно хорошо совпадают с человеческими паттернами на уровне больших групп, а если подмешивать распределения ценностей, качество симуляции поведения заметно растёт. Иными словами, модель становится не просто «знающей», а более похожей на среднего пользователя в том, как она строит ответ.
Для programmatic и AdTech это полезный сигнал по трём причинам.
Во-первых, растёт роль формулировки. Один и тот же продуктовый смысл можно подать как про экономию бюджета, про контроль риска, про скорость запуска или про прозрачность supply path — и модель может по-разному ранжировать такой контент в ответах и суммаризациях.
Во-вторых, при работе с AI-поиском и LLM-инструментами выигрывают материалы, где есть не только ключевые термины, но и понятная логика принятия решения: что важно для бренда, что важно для агентства, где компромисс, где зона доверия.
В-третьих, для measurement и privacy это особенно заметно: чем сложнее тема, тем сильнее модель опирается на знакомые человеку рамки объяснения, а не на сухой набор терминов.
Практический вывод для команды: если вы делаете материал о DSP, SPO, инвентаре, атрибуции или data clean room, полезно думать не только о семантике, но и о том, какую ценность текст транслирует для читателя. Это уже влияет на то, как контент будет пересказан и в поиске, и внутри LLM-ассистентов.
Само исследование: https://arxiv.org/abs/2605.30036
В свежем исследовании более 5 миллионов вопросов прогнали через ведущие LLM и сравнили их ответы с теорией ценностей из психологии. Идея простая: посмотреть, насколько модели воспроизводят не только факты, но и устойчивые способы выбора, интерпретации и приоритизации.
Вывод важен не только для AI Search. Авторы отмечают, что модели довольно хорошо совпадают с человеческими паттернами на уровне больших групп, а если подмешивать распределения ценностей, качество симуляции поведения заметно растёт. Иными словами, модель становится не просто «знающей», а более похожей на среднего пользователя в том, как она строит ответ.
Для programmatic и AdTech это полезный сигнал по трём причинам.
Во-первых, растёт роль формулировки. Один и тот же продуктовый смысл можно подать как про экономию бюджета, про контроль риска, про скорость запуска или про прозрачность supply path — и модель может по-разному ранжировать такой контент в ответах и суммаризациях.
Во-вторых, при работе с AI-поиском и LLM-инструментами выигрывают материалы, где есть не только ключевые термины, но и понятная логика принятия решения: что важно для бренда, что важно для агентства, где компромисс, где зона доверия.
В-третьих, для measurement и privacy это особенно заметно: чем сложнее тема, тем сильнее модель опирается на знакомые человеку рамки объяснения, а не на сухой набор терминов.
Практический вывод для команды: если вы делаете материал о DSP, SPO, инвентаре, атрибуции или data clean room, полезно думать не только о семантике, но и о том, какую ценность текст транслирует для читателя. Это уже влияет на то, как контент будет пересказан и в поиске, и внутри LLM-ассистентов.
Само исследование: https://arxiv.org/abs/2605.30036
arXiv.org
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
Large Language Models (LLMs) demonstrate a remarkable capacity to adopt different personas and roles; however, it remains unclear whether they can manifest behavior that adheres to a coherent,...
Почему LLM стали полезнее не только для текста, но и для оценки аудитории
В новом исследовании модели проверили на совпадение с человеческими ценностными структурами — и прогнали через них больше 5 миллионов вопросов. Авторы сравнивали не просто ответы, а то, как ценности связаны с выбором и поведением, опираясь на психологическую теорию ценностей.
Что важно для AdTech и programmatic. Когда LLM начинают точнее воспроизводить человеческие паттерны, они полезны не только как генератор текстов, но и как слой для анализа спроса: сегментация аудиторий, формулировка сообщений, оценка реакции на креативы, подбор контекста в privacy-first среде. Иными словами, модель уже лучше имитирует не только «как люди пишут», но и «как люди выбирают».
Отдельный вывод исследования: если в моделях использовать распределение человеческих ценностей, улучшается имитация поведения на уровне популяции. Для маркетинга это похоже на более аккуратную работу с массовыми сценариями — когда нужно не угадывать вкус одного пользователя, а понимать, что сработает в группе, сегменте или когорте.
Для measurement это тоже сигнал. Чем ближе модель к человеческой логике принятия решений, тем полезнее она в задачах, где нужно интерпретировать слабые сигналы: от атрибуции креатива до прогноза отклика на сообщение в разных supply path и средах с ограниченными данными.
Источник: arXiv:2605.30036
В новом исследовании модели проверили на совпадение с человеческими ценностными структурами — и прогнали через них больше 5 миллионов вопросов. Авторы сравнивали не просто ответы, а то, как ценности связаны с выбором и поведением, опираясь на психологическую теорию ценностей.
Что важно для AdTech и programmatic. Когда LLM начинают точнее воспроизводить человеческие паттерны, они полезны не только как генератор текстов, но и как слой для анализа спроса: сегментация аудиторий, формулировка сообщений, оценка реакции на креативы, подбор контекста в privacy-first среде. Иными словами, модель уже лучше имитирует не только «как люди пишут», но и «как люди выбирают».
Отдельный вывод исследования: если в моделях использовать распределение человеческих ценностей, улучшается имитация поведения на уровне популяции. Для маркетинга это похоже на более аккуратную работу с массовыми сценариями — когда нужно не угадывать вкус одного пользователя, а понимать, что сработает в группе, сегменте или когорте.
Для measurement это тоже сигнал. Чем ближе модель к человеческой логике принятия решений, тем полезнее она в задачах, где нужно интерпретировать слабые сигналы: от атрибуции креатива до прогноза отклика на сообщение в разных supply path и средах с ограниченными данными.
Источник: arXiv:2605.30036
Виртуальные карты как инструмент закупки: что теряется за обёрткой из x15
Finup подвёл годовые итоги: множитель x15 и более 100 тысяч выпущенных виртуальных карт. Для fintech-рынка это привычный способ обозначить масштаб, но для programmatic-команды такая сводка остаётся набором нераспакованных цифр.
Когда речь идёт об оплате рекламного трафика, важны не счётчики эмиссии, а то, как карта проходит через платёжные цепочки рекламных платформ. Какая доля успешных списаний у крупных DSP и рекламных кабинетов? Какая комиссия ложится на единицу трафика при конвертации валют? Сколько времени занимает выпуск нового пула реквизитов под отключённый или замороженный аккаунт? Работает ли 3D Secure для верификации в международных сетях?
Рост в пятнадцать раз говорит о том, что спрос на инструмент есть. Но он не объясняет, насколько этот инструмент устойчив в ежедневной закупке, как распределяются карты по гео и валютам, и какой процент из них реально используется для оплаты рекламы, а не для других задач.
Для adtech-специалиста ключевой вопрос — не количество выпущенных карт, а то, как они вписываются в цепочку поставки рекламы и модель измерения расходов. Без этих данных x15 остаётся PR-метрикой, а не аргументом для включения сервиса в медиа-стек.
Finup подвёл годовые итоги: множитель x15 и более 100 тысяч выпущенных виртуальных карт. Для fintech-рынка это привычный способ обозначить масштаб, но для programmatic-команды такая сводка остаётся набором нераспакованных цифр.
Когда речь идёт об оплате рекламного трафика, важны не счётчики эмиссии, а то, как карта проходит через платёжные цепочки рекламных платформ. Какая доля успешных списаний у крупных DSP и рекламных кабинетов? Какая комиссия ложится на единицу трафика при конвертации валют? Сколько времени занимает выпуск нового пула реквизитов под отключённый или замороженный аккаунт? Работает ли 3D Secure для верификации в международных сетях?
Рост в пятнадцать раз говорит о том, что спрос на инструмент есть. Но он не объясняет, насколько этот инструмент устойчив в ежедневной закупке, как распределяются карты по гео и валютам, и какой процент из них реально используется для оплаты рекламы, а не для других задач.
Для adtech-специалиста ключевой вопрос — не количество выпущенных карт, а то, как они вписываются в цепочку поставки рекламы и модель измерения расходов. Без этих данных x15 остаётся PR-метрикой, а не аргументом для включения сервиса в медиа-стек.
Ценностные паттерны LLM как инструмент в programmatic-стеке
Исследователи выяснили, что крупные языковые модели после миллионов тестовых запросов воспроизводят не только факты, но и структуру человеческих ценностей вместе с поведенческими сценариями. Речь идёт не об имитации речи, а о предсказуемой связи между установками и действиями.
Для programmatic и ad-ops это открывает прикладной слой. По мере исчезновения third-party cookies команды теряют возможность быстро тестировать гипотезы на живых когортах. LLM с заданными ценностными параметрами могут частично заменить панели при оценке креативов, выборе площадок и прогнозировании спроса. По сути, это синтетическая аудитория с предсказуемой логикой ответа — инструмент для предварительного скрининга перед запуском на реальный supply path.
Важный нюанс: такие модели полезны на этапе планирования и измерения эффективности посылов, но не отменяют post-campaign аналитику и first-party валидацию. Для маркетинг-директоров это повод посмотреть на LLM не как на генератор текстов, а как на модуль предиктивной аналитики в media-стеке.
Исследователи выяснили, что крупные языковые модели после миллионов тестовых запросов воспроизводят не только факты, но и структуру человеческих ценностей вместе с поведенческими сценариями. Речь идёт не об имитации речи, а о предсказуемой связи между установками и действиями.
Для programmatic и ad-ops это открывает прикладной слой. По мере исчезновения third-party cookies команды теряют возможность быстро тестировать гипотезы на живых когортах. LLM с заданными ценностными параметрами могут частично заменить панели при оценке креативов, выборе площадок и прогнозировании спроса. По сути, это синтетическая аудитория с предсказуемой логикой ответа — инструмент для предварительного скрининга перед запуском на реальный supply path.
Важный нюанс: такие модели полезны на этапе планирования и измерения эффективности посылов, но не отменяют post-campaign аналитику и first-party валидацию. Для маркетинг-директоров это повод посмотреть на LLM не как на генератор текстов, а как на модуль предиктивной аналитики в media-стеке.
SFT и RL по-разному влияют на «память» модели: для AdTech это важно там, где LLM отвечает за классификацию инвентаря, нормализацию событий и подсказки по атрибуции.
Исследователи сравнили два подхода к дообучению и предложили метрику differential circuit vulnerability — она показывает, насколько внутренние механизмы модели деградируют после fine-tuning. Иными словами, насколько сильно новая настройка ломает прежние навыки.
Картина получилась ожидаемой, но полезной для практики. Supervised fine-tuning быстрее подгоняет модель под узкую задачу: можно оперативно улучшить ответы под конкретный формат, терминологию или шаблон. Но вместе с этим растёт риск, что модель начнёт хуже работать в смежных сценариях — например, перестанет стабильно распознавать вариации названий площадок, источников трафика или сигналов конверсии.
Reinforcement learning, наоборот, бережнее сохраняет базовое поведение. Он медленнее доводит модель до нужного качества, зато меньше ломает исходные паттерны. Для продуктовых LLM-слоёв это особенно заметно, если система живёт не в вакууме, а в потоке изменений: новые источники, другие taxonomies, обновления privacy-логики, смена схем measurement.
Практический вывод для команд простой: если вы строите инструмент поверх LLM для programmatic-процессов, стоит отдельно оценивать не только точность на целевой задаче, но и то, как дообучение влияет на устойчивость рядом лежащих функций. В медиа-стеке это часто важнее, чем локальный прирост качества.
Исходники и код проекта лежат на GitHub.
Исследователи сравнили два подхода к дообучению и предложили метрику differential circuit vulnerability — она показывает, насколько внутренние механизмы модели деградируют после fine-tuning. Иными словами, насколько сильно новая настройка ломает прежние навыки.
Картина получилась ожидаемой, но полезной для практики. Supervised fine-tuning быстрее подгоняет модель под узкую задачу: можно оперативно улучшить ответы под конкретный формат, терминологию или шаблон. Но вместе с этим растёт риск, что модель начнёт хуже работать в смежных сценариях — например, перестанет стабильно распознавать вариации названий площадок, источников трафика или сигналов конверсии.
Reinforcement learning, наоборот, бережнее сохраняет базовое поведение. Он медленнее доводит модель до нужного качества, зато меньше ломает исходные паттерны. Для продуктовых LLM-слоёв это особенно заметно, если система живёт не в вакууме, а в потоке изменений: новые источники, другие taxonomies, обновления privacy-логики, смена схем measurement.
Практический вывод для команд простой: если вы строите инструмент поверх LLM для programmatic-процессов, стоит отдельно оценивать не только точность на целевой задаче, но и то, как дообучение влияет на устойчивость рядом лежащих функций. В медиа-стеке это часто важнее, чем локальный прирост качества.
Исходники и код проекта лежат на GitHub.
RL и SFT: что выбор метода дообучения означает для AI в рекламе
Исследователи сравнили RL и SFT при адаптации модели Qwen2.5-3B-Instruct к научному question-answering. Их результаты — хороший сигнал для всех, кто использует языковые модели в programmatic или строит контент под AI-поиск.
SFT быстрее подстраивает модель под конкретную задачу, но сильнее разрушает исходные «схемы» (circuit) — те внутренние связи, на которых держится устойчивость ответов. RL, напротив, сохраняет больше базового контура, хотя обучение идёт медленнее.
Для AI Overviews и ChatGPT Search это напрямую касается качества выдачи. Чем агрессивнее SFT, тем выше риск, что модель начнёт «забывать» старые паттерны и выдавать менее стабильные ответы. RL позволяет держать поведение ближе к базовой модели, что может снижать резкие сбои при изменении запросов.
Авторы ввели метрику differential circuit vulnerability — она измеряет, как fine-tuning влияет на degradation circuit на уровне отдельных голов внимания. Если вы управляете контентом, который ранжируется AI-поисковиками, стоит тестировать не только точность ответа, но и стабильность выдачи после любого дообучения.
Репозиторий с инструментом: github.com/rl-sft-circuit-research/differential-circuit-vulnerability
Связанная тема раскрывается в @VectorIgamingMarketWatch
Исследователи сравнили RL и SFT при адаптации модели Qwen2.5-3B-Instruct к научному question-answering. Их результаты — хороший сигнал для всех, кто использует языковые модели в programmatic или строит контент под AI-поиск.
SFT быстрее подстраивает модель под конкретную задачу, но сильнее разрушает исходные «схемы» (circuit) — те внутренние связи, на которых держится устойчивость ответов. RL, напротив, сохраняет больше базового контура, хотя обучение идёт медленнее.
Для AI Overviews и ChatGPT Search это напрямую касается качества выдачи. Чем агрессивнее SFT, тем выше риск, что модель начнёт «забывать» старые паттерны и выдавать менее стабильные ответы. RL позволяет держать поведение ближе к базовой модели, что может снижать резкие сбои при изменении запросов.
Авторы ввели метрику differential circuit vulnerability — она измеряет, как fine-tuning влияет на degradation circuit на уровне отдельных голов внимания. Если вы управляете контентом, который ранжируется AI-поисковиками, стоит тестировать не только точность ответа, но и стабильность выдачи после любого дообучения.
Репозиторий с инструментом: github.com/rl-sft-circuit-research/differential-circuit-vulnerability
Связанная тема раскрывается в @VectorIgamingMarketWatch
GitHub
GitHub - rl-sft-circuit-research/differential-circuit-vulnerability
Contribute to rl-sft-circuit-research/differential-circuit-vulnerability development by creating an account on GitHub.
Как LLM имитируют человеческие ценности и что это значит для поисковых стратегий
Масштабное исследование, проанализировавшее более 5 миллионов пользовательских запросов, подтвердило важный сдвиг в развитии больших языковых моделей. Оказалось, что современные нейросети не просто генерируют текст, а успешно воспроизводят психологические структуры, свойственные людям. Модели демонстрируют высокую точность в сопоставлении абстрактных ценностей с конкретными моделями поведения.
Для специалистов, которые занимаются оптимизацией под нейросетевой поиск (AI Search), это фундаментальный сигнал. Если раньше мы фокусировались на семантическом ядре и частотности запросов, то теперь вектор смещается в сторону «ценностных кластеров».
Что это означает на практике:
1. Смена фокуса с ключей на интенты. Нейросети обучаются распознавать не столько формулировку, сколько скрытую мотивацию пользователя. Контент, который апеллирует к ценностям аудитории и предлагает логические связки «ценность — действие», получает приоритет в выдаче.
2. Рост значимости контекстуальных паттернов. Модели всё лучше имитируют человеческую логику принятия решений. Это значит, что экспертный контент, содержащий глубокие поведенческие обоснования, будет ранжироваться выше, чем сухая фактология.
3. Проектирование ответов. Чтобы быть релевантными для AI-поиска, материалы должны закрывать не только информационную потребность («что это»), но и ситуативную («почему это важно для меня»).
Мы переходим от эпохи оптимизации под поисковых роботов к эпохе оптимизации под «цифровые отражения» человеческого мышления. В текущих условиях побеждает тот, кто умеет транслировать устойчивые паттерны поведения, превращая их в основу своей контентной стратегии.
#AdTech #AISearch #Strategy
Масштабное исследование, проанализировавшее более 5 миллионов пользовательских запросов, подтвердило важный сдвиг в развитии больших языковых моделей. Оказалось, что современные нейросети не просто генерируют текст, а успешно воспроизводят психологические структуры, свойственные людям. Модели демонстрируют высокую точность в сопоставлении абстрактных ценностей с конкретными моделями поведения.
Для специалистов, которые занимаются оптимизацией под нейросетевой поиск (AI Search), это фундаментальный сигнал. Если раньше мы фокусировались на семантическом ядре и частотности запросов, то теперь вектор смещается в сторону «ценностных кластеров».
Что это означает на практике:
1. Смена фокуса с ключей на интенты. Нейросети обучаются распознавать не столько формулировку, сколько скрытую мотивацию пользователя. Контент, который апеллирует к ценностям аудитории и предлагает логические связки «ценность — действие», получает приоритет в выдаче.
2. Рост значимости контекстуальных паттернов. Модели всё лучше имитируют человеческую логику принятия решений. Это значит, что экспертный контент, содержащий глубокие поведенческие обоснования, будет ранжироваться выше, чем сухая фактология.
3. Проектирование ответов. Чтобы быть релевантными для AI-поиска, материалы должны закрывать не только информационную потребность («что это»), но и ситуативную («почему это важно для меня»).
Мы переходим от эпохи оптимизации под поисковых роботов к эпохе оптимизации под «цифровые отражения» человеческого мышления. В текущих условиях побеждает тот, кто умеет транслировать устойчивые паттерны поведения, превращая их в основу своей контентной стратегии.
#AdTech #AISearch #Strategy
Cloudflare CASB читает Claude Compliance API без эндпоинт-агентов
Cloudflare расширил возможности CASB — теперь платформа напрямую интегрируется с Claude Compliance API. Это значит, что compliance- и security-команды могут анализировать использование Claude внутри своего окружения прямо из дашборда Cloudflare, без установки дополнительных endpoint-агентов на рабочих станциях.
Для стеков, где Cloudflare уже выступает шлюзом перед SaaS-доступом, такой слой контроля даёт несколько преимуществ: меньше агентской инфраструктуры на устройствах, упрощённый аудит активности по Claude, возможность собирать findings по проектам, вложениям, чатам и артефактам быстрее и централизованно.
С точки зрения programmatic и AdTech, это важный шаг в сторону privacy-ориентированного мониторинга AI-инструментов. Если в вашем рабочем контуре уже используется Claude, стоит проверить, какие DLP-правила и типы объектов попадают в CASB findings. Такая интеграция убирает лишнее звено в цепочке compliance и снижает нагрузку на endpoint security. Cloudflare также анонсировал будущую поддержку Activity Feed, что расширит возможности отслеживания событий.
Для маркетинговых команд, работающих с конфиденциальными креативами или данными аудиторий, это дополнительный аргумент выбирать инфраструктуру, где контроль встроен, а не навешивается постфактум.
Cloudflare расширил возможности CASB — теперь платформа напрямую интегрируется с Claude Compliance API. Это значит, что compliance- и security-команды могут анализировать использование Claude внутри своего окружения прямо из дашборда Cloudflare, без установки дополнительных endpoint-агентов на рабочих станциях.
Для стеков, где Cloudflare уже выступает шлюзом перед SaaS-доступом, такой слой контроля даёт несколько преимуществ: меньше агентской инфраструктуры на устройствах, упрощённый аудит активности по Claude, возможность собирать findings по проектам, вложениям, чатам и артефактам быстрее и централизованно.
С точки зрения programmatic и AdTech, это важный шаг в сторону privacy-ориентированного мониторинга AI-инструментов. Если в вашем рабочем контуре уже используется Claude, стоит проверить, какие DLP-правила и типы объектов попадают в CASB findings. Такая интеграция убирает лишнее звено в цепочке compliance и снижает нагрузку на endpoint security. Cloudflare также анонсировал будущую поддержку Activity Feed, что расширит возможности отслеживания событий.
Для маркетинговых команд, работающих с конфиденциальными креативами или данными аудиторий, это дополнительный аргумент выбирать инфраструктуру, где контроль встроен, а не навешивается постфактум.
Инструментарий разработчика в эпоху перегруженных IDE
Выбор среды разработки для создания рекламных лендингов или масштабируемых SaaS-решений часто превращается в попытку усидеть на двух стульях: получить максимум функционала и не утонуть в тормозах. Современный рынок предлагает десятки IDE, однако фокус смещается с маркетинговых обещаний на реальный UX. Для работы с React или Next.js критически важными становятся три параметра: стабильность автокомплита, скорость индексации монорепозиториев и отсутствие конфликтов с линтерами.
Проблема многих «тяжелых» инструментов в том, что они пытаются решать задачи за программиста, замедляя итерации в критические моменты разработки. В условиях высокой конкуренции в Digital, где скорость вывода продукта на рынок определяет успех рекламной кампании, выбор редактора должен опираться на производительность в боевых условиях. Перед обновлением IDE или переходом на новый стек рекомендую провести стресс-тест на актуальном проекте: проверить скорость обработки RSC (React Server Components), корректность работы с длинными путями файлов и отсутствие «зависаний» при проверке типизации. Оптимизированный рабочий процесс — это не вопрос эстетики, а фундамент для быстрой поставки кода.
Выбор среды разработки для создания рекламных лендингов или масштабируемых SaaS-решений часто превращается в попытку усидеть на двух стульях: получить максимум функционала и не утонуть в тормозах. Современный рынок предлагает десятки IDE, однако фокус смещается с маркетинговых обещаний на реальный UX. Для работы с React или Next.js критически важными становятся три параметра: стабильность автокомплита, скорость индексации монорепозиториев и отсутствие конфликтов с линтерами.
Проблема многих «тяжелых» инструментов в том, что они пытаются решать задачи за программиста, замедляя итерации в критические моменты разработки. В условиях высокой конкуренции в Digital, где скорость вывода продукта на рынок определяет успех рекламной кампании, выбор редактора должен опираться на производительность в боевых условиях. Перед обновлением IDE или переходом на новый стек рекомендую провести стресс-тест на актуальном проекте: проверить скорость обработки RSC (React Server Components), корректность работы с длинными путями файлов и отсутствие «зависаний» при проверке типизации. Оптимизированный рабочий процесс — это не вопрос эстетики, а фундамент для быстрой поставки кода.
Meridian MMM и future conversions: что меняется в измерении Google
Google постепенно уводит измерение эффективности из логики «только факт и только последний клик» в сторону прогнозных сигналов. Связка Analytics 360 с Meridian MMM и анонс Qualified Future Conversions на GML 2026 — это не просто обновление интерфейса, а изменение самой модели оценки рекламы. Теперь часть выводов о кампании может опираться не на уже случившиеся конверсии, а на предсказанные будущие продажи, рассчитанные через Gemini.
Для programmatic и performance-команд это важный сдвиг. Чем длиннее цикл сделки и чем сложнее путь пользователя, тем полезнее выглядят прогнозные метрики. Но одновременно растёт риск путаницы: в отчётах рядом оказываются фактические события, моделируемый вклад медиа и будущие сигналы, которые нельзя трактовать как прямую выручку.
Практический вывод простой: в Measurement-стеке нужно жёстко разделять, где у вас наблюдаемая конверсия, где модель MMM, а где прогнозная оценка. Иначе финансовая команда будет сравнивать разные сущности как будто это одна и та же метрика. Для AdTech-рынка это ещё один шаг к тому, что качество измерения будет зависеть не только от трафика, но и от прозрачности самой аналитической модели.
Для соседнего контекста загляни в @VerticalWatchStack
Google постепенно уводит измерение эффективности из логики «только факт и только последний клик» в сторону прогнозных сигналов. Связка Analytics 360 с Meridian MMM и анонс Qualified Future Conversions на GML 2026 — это не просто обновление интерфейса, а изменение самой модели оценки рекламы. Теперь часть выводов о кампании может опираться не на уже случившиеся конверсии, а на предсказанные будущие продажи, рассчитанные через Gemini.
Для programmatic и performance-команд это важный сдвиг. Чем длиннее цикл сделки и чем сложнее путь пользователя, тем полезнее выглядят прогнозные метрики. Но одновременно растёт риск путаницы: в отчётах рядом оказываются фактические события, моделируемый вклад медиа и будущие сигналы, которые нельзя трактовать как прямую выручку.
Практический вывод простой: в Measurement-стеке нужно жёстко разделять, где у вас наблюдаемая конверсия, где модель MMM, а где прогнозная оценка. Иначе финансовая команда будет сравнивать разные сущности как будто это одна и та же метрика. Для AdTech-рынка это ещё один шаг к тому, что качество измерения будет зависеть не только от трафика, но и от прозрачности самой аналитической модели.
Для соседнего контекста загляни в @VerticalWatchStack
Instants от Meta: новый слой приватного общения и потенциальный сигнал для UA
Meta продолжает экспериментировать с форматом приватного контента внутри своей экосистемы. Новый продукт Instants ориентирован на быстрый обмен фотографиями между близкими контактами: контент открывается один раз, имеет ограниченный срок жизни и дополнительно защищён от распространения через скриншоты и запись экрана. При этом функция развивается сразу в двух плоскостях — как часть Instagram и как отдельное приложение на базе существующей учётной записи.
Для рынка programmatic это интересно не столько самой механикой обмена контентом, сколько продуктовой стратегией платформы. Meta регулярно тестирует отдельные сценарии потребления, выделяя их в самостоятельные точки взаимодействия. Если сервис начнёт получать собственное продвижение и пользовательскую базу, появится ещё одна поверхность для формирования событий, аудиторных сигналов и, потенциально, установочных кампаний.
Пока данных о масштабе распространения, удержании пользователей и влиянии на рекламную экосистему немного. Однако сам запуск показывает тренд на усиление приватных коммуникаций и сокращение времени жизни контента. Для маркетинг-директоров это дополнительное напоминание: всё больше пользовательской активности уходит из публичных лент в закрытые пространства, где традиционные сигналы измерения становятся менее доступными. В таких условиях возрастает значение агрегированных метрик, моделирования конверсий и корректной работы с first-party данными.
Связанная тема раскрывается в @DeskIgamingMarketWatch
Meta продолжает экспериментировать с форматом приватного контента внутри своей экосистемы. Новый продукт Instants ориентирован на быстрый обмен фотографиями между близкими контактами: контент открывается один раз, имеет ограниченный срок жизни и дополнительно защищён от распространения через скриншоты и запись экрана. При этом функция развивается сразу в двух плоскостях — как часть Instagram и как отдельное приложение на базе существующей учётной записи.
Для рынка programmatic это интересно не столько самой механикой обмена контентом, сколько продуктовой стратегией платформы. Meta регулярно тестирует отдельные сценарии потребления, выделяя их в самостоятельные точки взаимодействия. Если сервис начнёт получать собственное продвижение и пользовательскую базу, появится ещё одна поверхность для формирования событий, аудиторных сигналов и, потенциально, установочных кампаний.
Пока данных о масштабе распространения, удержании пользователей и влиянии на рекламную экосистему немного. Однако сам запуск показывает тренд на усиление приватных коммуникаций и сокращение времени жизни контента. Для маркетинг-директоров это дополнительное напоминание: всё больше пользовательской активности уходит из публичных лент в закрытые пространства, где традиционные сигналы измерения становятся менее доступными. В таких условиях возрастает значение агрегированных метрик, моделирования конверсий и корректной работы с first-party данными.
Связанная тема раскрывается в @DeskIgamingMarketWatch
Moloco и iOS-трафик: что обсудят сегодня в прямом эфире
Сегодня в 17:00 по московскому времени запланирована трансляция от Moloco, посвящённая работе с iOS-приложениями в условиях меняющейся экосистемы. Это не технический апдейт, а скорее операционный разбор текущих реалий для UA- и ad-ops-команд. В фокусе — практические аспекты настройки кампаний, управление бюджетами и адаптация к росту стоимости in-app inventory.
Ожидаемые темы: стратегии запуска приложений на iOS, обновления в подходах Moloco к таргетингу и оптимизации, реакция на дефицит качественного трафика и пересмотр параметров кампаний после изменений в системе. Особенно важно — как сегодня выстраивать настройки, чтобы не терять эффективность на фоне сокращения доступного охвата и роста цен.
Пока нет подтверждённых деталей по изменениям в API, логике биддинга или атрибуции, поэтому делать выводы о технических обновлениях стоит только после трансляции или официальных анонсов. Однако сам формат указывает на смещение фокуса: вендоры всё чаще делятся не просто продуктом, а контекстом его применения в реальных условиях. Для практиков это шанс увидеть, как адаптируются под privacy-ограничения не только технологии, но и процессы — от настройки до мониторинга эффективности.
Сегодня в 17:00 по московскому времени запланирована трансляция от Moloco, посвящённая работе с iOS-приложениями в условиях меняющейся экосистемы. Это не технический апдейт, а скорее операционный разбор текущих реалий для UA- и ad-ops-команд. В фокусе — практические аспекты настройки кампаний, управление бюджетами и адаптация к росту стоимости in-app inventory.
Ожидаемые темы: стратегии запуска приложений на iOS, обновления в подходах Moloco к таргетингу и оптимизации, реакция на дефицит качественного трафика и пересмотр параметров кампаний после изменений в системе. Особенно важно — как сегодня выстраивать настройки, чтобы не терять эффективность на фоне сокращения доступного охвата и роста цен.
Пока нет подтверждённых деталей по изменениям в API, логике биддинга или атрибуции, поэтому делать выводы о технических обновлениях стоит только после трансляции или официальных анонсов. Однако сам формат указывает на смещение фокуса: вендоры всё чаще делятся не просто продуктом, а контекстом его применения в реальных условиях. Для практиков это шанс увидеть, как адаптируются под privacy-ограничения не только технологии, но и процессы — от настройки до мониторинга эффективности.
Мультимодальные модели всё ещё путаются в сложных сигналах
На бенчмарке CrystalXRD-Bench, собранном из 10 публичных кристаллографических баз, проверяли, насколько vision-language модели умеют восстанавливать полный набор HKL для самого сильного пика на XRD-паттерне. В тесте участвовали 7 моделей, и лучший результат показала GPT-5.4: Jaccard 0.5888 при exact-match 37.6%. У шести из семи моделей показатель Jaccard оказался ниже 0.50.
Для AdTech это неплохая аналогия к тому, как работают сложные сигналы в programmatic: модель может уверенно выдавать правдоподобный ответ, но это не значит, что он пригоден для решений. Особенно если речь о privacy, measurement или supply path, где данные неполные, шумные и завязаны на несколько источников.
Практический вывод простой: в задачах с высокой ценой ошибки лучше держать рядом проверяемый источник фактов, а не опираться на один AI-ответ. Бенчмарки такого типа полезны не сами по себе, а как индикатор того, где автоматизация пока требует жёсткой валидации.
На бенчмарке CrystalXRD-Bench, собранном из 10 публичных кристаллографических баз, проверяли, насколько vision-language модели умеют восстанавливать полный набор HKL для самого сильного пика на XRD-паттерне. В тесте участвовали 7 моделей, и лучший результат показала GPT-5.4: Jaccard 0.5888 при exact-match 37.6%. У шести из семи моделей показатель Jaccard оказался ниже 0.50.
Для AdTech это неплохая аналогия к тому, как работают сложные сигналы в programmatic: модель может уверенно выдавать правдоподобный ответ, но это не значит, что он пригоден для решений. Особенно если речь о privacy, measurement или supply path, где данные неполные, шумные и завязаны на несколько источников.
Практический вывод простой: в задачах с высокой ценой ошибки лучше держать рядом проверяемый источник фактов, а не опираться на один AI-ответ. Бенчмарки такого типа полезны не сами по себе, а как индикатор того, где автоматизация пока требует жёсткой валидации.
Benchмарки для извлечения данных из изображений
CrystalXRD-Bench представил 250 образцов из 10 публичных кристаллографических баз для задачи восстановления полного набора HKL, формирующих основной пик XRD-паттерна. В тестировании участвовали семь vision-language моделей, где лидером оказался GPT-5.4 с Jaccard 0.5888 и точным совпадением 37,6%. Остальные модели показали Jaccard ниже 0,50. Для специалистов по SEO и AI Search это важный сигнал: генеративные модели пока делают ошибки на узких визуально-текстовых задачах. Практическое следствие — при работе с научными графиками и схемами стоит сочетать обработку изображений и текста и проверять данные на первичных источниках, а не полагаться только на генерацию модели.
CrystalXRD-Bench представил 250 образцов из 10 публичных кристаллографических баз для задачи восстановления полного набора HKL, формирующих основной пик XRD-паттерна. В тестировании участвовали семь vision-language моделей, где лидером оказался GPT-5.4 с Jaccard 0.5888 и точным совпадением 37,6%. Остальные модели показали Jaccard ниже 0,50. Для специалистов по SEO и AI Search это важный сигнал: генеративные модели пока делают ошибки на узких визуально-текстовых задачах. Практическое следствие — при работе с научными графиками и схемами стоит сочетать обработку изображений и текста и проверять данные на первичных источниках, а не полагаться только на генерацию модели.
Метрика differential circuit vulnerability — инструмент для оценки стабильности дообучения LLM
Исследователи из команды Qwen2.5-3B-Instruct предложили новую метрику — differential circuit vulnerability. На уровне attention heads она показывает, насколько fine-tuning деградирует исходные схемы модели. Сравнение двух методов дообучения — SFT и RL — дало чёткую картину: SFT быстрее адаптирует модель под задачу, но сильнее ломает circuits и ведёт к forgetting. RL сохраняет базовую схему, но адаптируется медленнее.
Для AI Overviews и ChatGPT Search это важный инструмент оценки. Агрессивный SFT может дать нужный стиль ответа, но сделает модель нестабильной на соседних запросах и перефразах. Метрика позволяет ещё до развёртывания проверить, насколько новое дообучение повлияло на общую логику модели.
Код проекта открыт на GitHub — это готовая утилита для тех, кто настраивает LLM под контентные пайплайны. Для adtech-специалистов это способ контролировать качество и стабильность AI-генерации, особенно при масштабировании. Вместо того чтобы полагаться только на финальные метрики, можно заглянуть «под капот» и увидеть, не потеряла ли модель исходное понимание.
Исследователи из команды Qwen2.5-3B-Instruct предложили новую метрику — differential circuit vulnerability. На уровне attention heads она показывает, насколько fine-tuning деградирует исходные схемы модели. Сравнение двух методов дообучения — SFT и RL — дало чёткую картину: SFT быстрее адаптирует модель под задачу, но сильнее ломает circuits и ведёт к forgetting. RL сохраняет базовую схему, но адаптируется медленнее.
Для AI Overviews и ChatGPT Search это важный инструмент оценки. Агрессивный SFT может дать нужный стиль ответа, но сделает модель нестабильной на соседних запросах и перефразах. Метрика позволяет ещё до развёртывания проверить, насколько новое дообучение повлияло на общую логику модели.
Код проекта открыт на GitHub — это готовая утилита для тех, кто настраивает LLM под контентные пайплайны. Для adtech-специалистов это способ контролировать качество и стабильность AI-генерации, особенно при масштабировании. Вместо того чтобы полагаться только на финальные метрики, можно заглянуть «под капот» и увидеть, не потеряла ли модель исходное понимание.
Ahrefs против AI: как ChatGPT почти не даёт трафика, но открывает серую зону
Масштабное исследование Ahrefs: миллиард точек данных, 14 отчётов, один главный вывод — ChatGPT генерирует в 190 раз меньше переходов на сайты по сравнению с Google. Почти треть страниц, которые AI регулярно цитирует, вообще не появляются в классическом поиске. Schema-разметка для AI Overviews и ChatGPT не даёт никакого эффекта.
Для тех, кто в AdTech управляет supply path и измеряет эффективность, это сигнал не гнаться за AI-овервью через SEO. Оптимизация контента под ChatGPT — игра без кликов. Но появляется новый грей-зона: страницы, невидимые для Google, но видимые для AI. Если вы работаете с лендингами и аукционами, стоит тестировать размещения, которые AI подхватывает, а классический поиск игнорирует. Рынок там пока пустой.
Инструментарий для отслеживания таких страниц только формируется. Пока что анализ ссылочной массы и паттернов цитирования AI — поле для ручной разведки. Ahrefs дал данные, но реальный инструментарий для работы с этим сегментом ещё предстоит собрать.
Масштабное исследование Ahrefs: миллиард точек данных, 14 отчётов, один главный вывод — ChatGPT генерирует в 190 раз меньше переходов на сайты по сравнению с Google. Почти треть страниц, которые AI регулярно цитирует, вообще не появляются в классическом поиске. Schema-разметка для AI Overviews и ChatGPT не даёт никакого эффекта.
Для тех, кто в AdTech управляет supply path и измеряет эффективность, это сигнал не гнаться за AI-овервью через SEO. Оптимизация контента под ChatGPT — игра без кликов. Но появляется новый грей-зона: страницы, невидимые для Google, но видимые для AI. Если вы работаете с лендингами и аукционами, стоит тестировать размещения, которые AI подхватывает, а классический поиск игнорирует. Рынок там пока пустой.
Инструментарий для отслеживания таких страниц только формируется. Пока что анализ ссылочной массы и паттернов цитирования AI — поле для ручной разведки. Ahrefs дал данные, но реальный инструментарий для работы с этим сегментом ещё предстоит собрать.
Creative study не равен атрибуции: где аналитики чаще всего делают лишний вывод
Reddit опубликовал исследование по 150 тысячам in-feed объявлений от 7 тысяч рекламодателей и попытался ответить на простой вопрос: какие креативные решения связаны с ростом конверсий. Для performance-команд здесь важен не сам вывод, а границы его применимости.
Это не история про CAPI, sGTM или server-side дедупликацию. Исследование смотрит на креатив внутри платформы, а не на всю цепочку измерения. Без прозрачной методологии, состава факторов и понимания, как именно Reddit считал uplift, такой материал нельзя напрямую переносить в медиамикс или attribution-модель.
Практический смысл в другом: подобные отчёты хороши как источник гипотез для creative testing. Но если у вас расходятся CAPI, Pixel и GA4, то любой «рост конверсий» может оказаться смесью реального эффекта и потерь трекинга. Поэтому сначала — стабильная передача событий, event_id и дедупликация, потом — выводы о креативе.
Для AdTech и measurement-команд это ещё одно напоминание: платформа может показать корреляцию, но не заменит собственную измерительную схему.
Reddit опубликовал исследование по 150 тысячам in-feed объявлений от 7 тысяч рекламодателей и попытался ответить на простой вопрос: какие креативные решения связаны с ростом конверсий. Для performance-команд здесь важен не сам вывод, а границы его применимости.
Это не история про CAPI, sGTM или server-side дедупликацию. Исследование смотрит на креатив внутри платформы, а не на всю цепочку измерения. Без прозрачной методологии, состава факторов и понимания, как именно Reddit считал uplift, такой материал нельзя напрямую переносить в медиамикс или attribution-модель.
Практический смысл в другом: подобные отчёты хороши как источник гипотез для creative testing. Но если у вас расходятся CAPI, Pixel и GA4, то любой «рост конверсий» может оказаться смесью реального эффекта и потерь трекинга. Поэтому сначала — стабильная передача событий, event_id и дедупликация, потом — выводы о креативе.
Для AdTech и measurement-команд это ещё одно напоминание: платформа может показать корреляцию, но не заменит собственную измерительную схему.