Как оценивать LLM не только по финальному ответу, а по тому, как он собирается
ProjectionBench — пример теста, который полезно читать не только исследователям, но и командам, работающим с programmatic, measurement и AI-поиском. В наборе сравнили GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro Preview на 45 научных статьях из разных областей материаловедения.
Фишка методики в том, что модель не получает весь контекст сразу. Сначала ей дают только тему и исследовательский вопрос, потом данные раскрывают по частям. После каждого шага смотрят, насколько меняется ответ и как он приближается к исходным выводам статьи. Оценка строится не на «понравилось / не понравилось», а на semantic similarity атомарных утверждений — то есть на совпадении отдельных смысловых единиц.
Почему это важно для AdTech.
Если вы строите инструменты для AI Search, тестируете ответы LLM в интерфейсах, делаете контент под генеративную выдачу или смотрите на новые сценарии измерения, обычный бенчмарк по одному промпту мало что показывает. В реальности модель почти всегда работает в условиях неполного контекста: сначала видит заголовок, потом фрагменты, потом уточнения. И именно на этом этапе начинают проявляться различия между моделями.
Отдельно показателен результат GPT-5.4: даже на минимальном контексте он держал около 0.7 F1 alignment с ground truth conclusions. Для инструментов, где важны устойчивость вывода и предсказуемость поведения, это заметно полезнее, чем просто высокий балл в статичном тесте.
Для маркетинг-директора вывод простой: если вы выбираете LLM для поиска, аналитики, контентных ассистентов или слоёв поверх данных, смотрите не только на финальную точность. Важно, как модель достраивает смысл по мере поступления сигнала.
ProjectionBench — пример теста, который полезно читать не только исследователям, но и командам, работающим с programmatic, measurement и AI-поиском. В наборе сравнили GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro Preview на 45 научных статьях из разных областей материаловедения.
Фишка методики в том, что модель не получает весь контекст сразу. Сначала ей дают только тему и исследовательский вопрос, потом данные раскрывают по частям. После каждого шага смотрят, насколько меняется ответ и как он приближается к исходным выводам статьи. Оценка строится не на «понравилось / не понравилось», а на semantic similarity атомарных утверждений — то есть на совпадении отдельных смысловых единиц.
Почему это важно для AdTech.
Если вы строите инструменты для AI Search, тестируете ответы LLM в интерфейсах, делаете контент под генеративную выдачу или смотрите на новые сценарии измерения, обычный бенчмарк по одному промпту мало что показывает. В реальности модель почти всегда работает в условиях неполного контекста: сначала видит заголовок, потом фрагменты, потом уточнения. И именно на этом этапе начинают проявляться различия между моделями.
Отдельно показателен результат GPT-5.4: даже на минимальном контексте он держал около 0.7 F1 alignment с ground truth conclusions. Для инструментов, где важны устойчивость вывода и предсказуемость поведения, это заметно полезнее, чем просто высокий балл в статичном тесте.
Для маркетинг-директора вывод простой: если вы выбираете LLM для поиска, аналитики, контентных ассистентов или слоёв поверх данных, смотрите не только на финальную точность. Важно, как модель достраивает смысл по мере поступления сигнала.
In-app и privacy: где чаще всего теряется контроль в programmatic
В мобильном in-app трафике приватность ломается не на уровне красивых политик, а в цепочке передачи сигналов. Для закупки это особенно чувствительно: здесь в ходу device ID, геосигналы и данные об устройстве, а прозрачность для пользователя нередко ниже, чем в web-окне согласия.
Проблема в том, что programmatic-сделки живут слишком быстро. Решения о показе принимаются за миллисекунды, а значит, проверка privacy и compliance раз в квартал или даже раз в месяц уже не успевает за реальным bidstream. К моменту, когда аудит покажет расхождение, часть бюджета могла уйти в связки, где consent оформлен не так, как ожидает команда.
Для marketing-директора и adtech-команды здесь важны не абстрактные правила, а три точки контроля:
- какие идентификаторы и location-сигналы попадают в аукцион;
- где именно фиксируется consent — у MMP, DSP или SSP;
- как используются данные в оптимизации и атрибуции после показа.
Если эти этапы не связаны между собой, модель атрибуции начинает опираться на сигналы, которые privacy-отдел увидит слишком поздно. В итоге страдает не только compliance, но и качество закупки: алгоритм оптимизируется по данным с сомнительной цепочкой происхождения.
Для in-app инвентаря полезнее не редкие проверки, а постоянный мониторинг того, как устроен supply path и какие данные реально доходят до DSP. Именно там сегодня чаще всего и возникает blind spot.
В мобильном in-app трафике приватность ломается не на уровне красивых политик, а в цепочке передачи сигналов. Для закупки это особенно чувствительно: здесь в ходу device ID, геосигналы и данные об устройстве, а прозрачность для пользователя нередко ниже, чем в web-окне согласия.
Проблема в том, что programmatic-сделки живут слишком быстро. Решения о показе принимаются за миллисекунды, а значит, проверка privacy и compliance раз в квартал или даже раз в месяц уже не успевает за реальным bidstream. К моменту, когда аудит покажет расхождение, часть бюджета могла уйти в связки, где consent оформлен не так, как ожидает команда.
Для marketing-директора и adtech-команды здесь важны не абстрактные правила, а три точки контроля:
- какие идентификаторы и location-сигналы попадают в аукцион;
- где именно фиксируется consent — у MMP, DSP или SSP;
- как используются данные в оптимизации и атрибуции после показа.
Если эти этапы не связаны между собой, модель атрибуции начинает опираться на сигналы, которые privacy-отдел увидит слишком поздно. В итоге страдает не только compliance, но и качество закупки: алгоритм оптимизируется по данным с сомнительной цепочкой происхождения.
Для in-app инвентаря полезнее не редкие проверки, а постоянный мониторинг того, как устроен supply path и какие данные реально доходят до DSP. Именно там сегодня чаще всего и возникает blind spot.
Что показывает CrystalXRD-Bench про границы мультимодальных моделей
В свежем бенчмарке CrystalXRD-Bench проверили 7 VLM-моделей на довольно узкой, но показательной задаче: по XRD-диаграмме восстановить полный набор HKL-пиков, отвечающих за самый интенсивный сигнал. Это 250 примеров, собранных из 10 публичных кристаллографических баз. Задача не про «распознать картинку», а про точную интерпретацию структурного сигнала.
Лидер теста — GPT-5.4: Jaccard 0.5888 и exact match 37.6%. Но важнее не первое место, а разброс по качеству. У шести из семи моделей Jaccard не дотянул до 0.50. То есть модели уже способны уловить общий паттерн и сделать полезный вывод, но при переходе к точному набору элементов уверенность резко падает.
Для AdTech это хороший аналог того, как работают современные AI-инструменты в measurement и privacy-аналитике. Если модель смотрит на дашборд, атрибуционную схему, цепочку supply path или таблицу с логикой инвентаря, она может быстро назвать общий смысл. Но когда нужно не «примерно понять», а безошибочно интерпретировать структуру, точность всё ещё ограничена.
Практический вывод для маркетинг-директоров и adtech-команд простой: AI полезен как слой ускоренного чтения сигналов, но не как финальный арбитр. Особенно там, где решение зависит от нюансов в данных, а не от общего визуального впечатления.
Отдельно важно, что авторы обещают выложить данные и код оценки публично. Для рынка это хороший знак: именно такие бенчмарки помогают трезво оценивать, где мультимодальные модели уже можно подключать к операционным сценариям, а где они пока годятся только для чернового анализа.
В свежем бенчмарке CrystalXRD-Bench проверили 7 VLM-моделей на довольно узкой, но показательной задаче: по XRD-диаграмме восстановить полный набор HKL-пиков, отвечающих за самый интенсивный сигнал. Это 250 примеров, собранных из 10 публичных кристаллографических баз. Задача не про «распознать картинку», а про точную интерпретацию структурного сигнала.
Лидер теста — GPT-5.4: Jaccard 0.5888 и exact match 37.6%. Но важнее не первое место, а разброс по качеству. У шести из семи моделей Jaccard не дотянул до 0.50. То есть модели уже способны уловить общий паттерн и сделать полезный вывод, но при переходе к точному набору элементов уверенность резко падает.
Для AdTech это хороший аналог того, как работают современные AI-инструменты в measurement и privacy-аналитике. Если модель смотрит на дашборд, атрибуционную схему, цепочку supply path или таблицу с логикой инвентаря, она может быстро назвать общий смысл. Но когда нужно не «примерно понять», а безошибочно интерпретировать структуру, точность всё ещё ограничена.
Практический вывод для маркетинг-директоров и adtech-команд простой: AI полезен как слой ускоренного чтения сигналов, но не как финальный арбитр. Особенно там, где решение зависит от нюансов в данных, а не от общего визуального впечатления.
Отдельно важно, что авторы обещают выложить данные и код оценки публично. Для рынка это хороший знак: именно такие бенчмарки помогают трезво оценивать, где мультимодальные модели уже можно подключать к операционным сценариям, а где они пока годятся только для чернового анализа.
Почему измерение в programmatic всё ещё упирается в «почти точно»
Новый бенчмарк из смежной для нас логики хорошо показывает старую проблему: модели и инструменты умеют распознавать паттерн, но на точном совпадении начинают ошибаться. В исследовании CrystalXRD-Bench проверили 7 vision-language моделей на 250 образцах из 10 открытых кристаллографических баз. Задача была строгая: по визуальному XRD-паттерну восстановить полный набор HKL, который соответствует самому интенсивному пику.
Результат оказался показательный. Лучшая модель — GPT-5.4 — дошла до 0.5888 по Jaccard, а exact-match rate составил 37.6%. У шести из семи моделей показатель остался ниже 0.50. Иными словами, распознавание есть, но до надёжного «совпало с источником один в один» пока далеко.
Для AdTech здесь параллель очень узнаваемая. Визуальные и AI-инструменты хорошо справляются с первичным разбором: находят закономерности, группируют сигналы, подсвечивают аномалии. Но как только речь заходит о точной атрибуции, сопоставлении событий или сверке разных источников данных, начинаются расхождения. Особенно там, где важны privacy-ограничения, lossy measurement и неидеальный supply path.
Практический вывод для маркетинг-директора и adtech-команды простой: AI-слой полезен как ускоритель анализа, но не как единственный источник истины. Если инструмент показывает «похоже», это ещё не значит «доказано». Для programmatic-стека это особенно важно в верификации инвентаря, post-bid анализе, дедупликации и построении отчётности, где ошибка на уровне совпадения потом превращается в ошибку в бюджете.
В общем, точность в сложных средах по-прежнему дороже красивой уверенности. И это касается не только науки, но и медиапокупки.
Новый бенчмарк из смежной для нас логики хорошо показывает старую проблему: модели и инструменты умеют распознавать паттерн, но на точном совпадении начинают ошибаться. В исследовании CrystalXRD-Bench проверили 7 vision-language моделей на 250 образцах из 10 открытых кристаллографических баз. Задача была строгая: по визуальному XRD-паттерну восстановить полный набор HKL, который соответствует самому интенсивному пику.
Результат оказался показательный. Лучшая модель — GPT-5.4 — дошла до 0.5888 по Jaccard, а exact-match rate составил 37.6%. У шести из семи моделей показатель остался ниже 0.50. Иными словами, распознавание есть, но до надёжного «совпало с источником один в один» пока далеко.
Для AdTech здесь параллель очень узнаваемая. Визуальные и AI-инструменты хорошо справляются с первичным разбором: находят закономерности, группируют сигналы, подсвечивают аномалии. Но как только речь заходит о точной атрибуции, сопоставлении событий или сверке разных источников данных, начинаются расхождения. Особенно там, где важны privacy-ограничения, lossy measurement и неидеальный supply path.
Практический вывод для маркетинг-директора и adtech-команды простой: AI-слой полезен как ускоритель анализа, но не как единственный источник истины. Если инструмент показывает «похоже», это ещё не значит «доказано». Для programmatic-стека это особенно важно в верификации инвентаря, post-bid анализе, дедупликации и построении отчётности, где ошибка на уровне совпадения потом превращается в ошибку в бюджете.
В общем, точность в сложных средах по-прежнему дороже красивой уверенности. И это касается не только науки, но и медиапокупки.
Точность моделей — это не только про AI, но и про измерения в programmatic
Вышел свежий бенчмарк по работе vision-language моделей с кристаллографическими данными: 250 сэмплов, 10 публичных баз, задача — корректно восстановить полный набор HKL для самого яркого пика на XRD-паттерне. Проверили 7 моделей, и даже лучший результат оказался далеко не идеальным: у GPT-5.4 Jaccard — 0.5888, exact match — 37.6%.
Для AdTech это хороший аналог того, что мы видим в measurement и data pipelines. Модель или система может “в целом понимать контекст”, но ломаться на узкой, структурной детали: атрибуция, дедупликация, сопоставление событий, разметка источников, классификация supply path. На уровне презентации всё выглядит убедительно, а на уровне точности — уже много шума.
Почему это важно для programmatic-рынка:
- верификация данных важнее красивого отчёта;
- любая ошибка на входе потом разрастается в MMM, MTA и BI;
- если сущности спрятаны или размазаны по разным слоям, автоматизация начинает угадывать вместо того, чтобы извлекать;
- в privacy-first среде особенно заметно, где система реально считает, а где просто достраивает недостающее.
Полезный вывод для маркетинг-директора и adtech-команды простой: чем критичнее измерение, тем жёстче должна быть структура данных. Не только текст и график, но и подписанные поля, явные идентификаторы, единые форматы событий, понятный supply path.
Проблема часто не в “понимании”, а в точности. И в programmatic это обычно и есть главная цена ошибки.
Вышел свежий бенчмарк по работе vision-language моделей с кристаллографическими данными: 250 сэмплов, 10 публичных баз, задача — корректно восстановить полный набор HKL для самого яркого пика на XRD-паттерне. Проверили 7 моделей, и даже лучший результат оказался далеко не идеальным: у GPT-5.4 Jaccard — 0.5888, exact match — 37.6%.
Для AdTech это хороший аналог того, что мы видим в measurement и data pipelines. Модель или система может “в целом понимать контекст”, но ломаться на узкой, структурной детали: атрибуция, дедупликация, сопоставление событий, разметка источников, классификация supply path. На уровне презентации всё выглядит убедительно, а на уровне точности — уже много шума.
Почему это важно для programmatic-рынка:
- верификация данных важнее красивого отчёта;
- любая ошибка на входе потом разрастается в MMM, MTA и BI;
- если сущности спрятаны или размазаны по разным слоям, автоматизация начинает угадывать вместо того, чтобы извлекать;
- в privacy-first среде особенно заметно, где система реально считает, а где просто достраивает недостающее.
Полезный вывод для маркетинг-директора и adtech-команды простой: чем критичнее измерение, тем жёстче должна быть структура данных. Не только текст и график, но и подписанные поля, явные идентификаторы, единые форматы событий, понятный supply path.
Проблема часто не в “понимании”, а в точности. И в programmatic это обычно и есть главная цена ошибки.
LLM всё лучше имитируют не только факты, но и человеческую логику выбора
Есть свежее исследование, где через несколько крупных LLM прогнали больше 5 млн вопросов и посмотрели не просто на точность ответов, а на ценностные паттерны: как модель склонна выбирать, сравнивать и объяснять решение. Сопоставляли это с психологическими моделями человеческих ценностей и данными о реальных людях.
Что важно для adtech и measurement. Когда модель обучается на типовом человеческом поведении, она начинает лучше воспроизводить не только «правильный ответ», но и то, как пользователь формулирует запрос, что считает важным и какой вариант считает нормальным. Для поиска, AI-ассистентов и генеративных ответов это уже влияет на то, какой контент будет чаще попадать в синтез и какие формулировки система сочтёт наиболее естественными.
Практический вывод для рынка медийки и performance такой: выигрывает не только контент с сухими характеристиками, но и материалы, где есть контекст выбора. Например, не просто «чем отличается SSP от DSP», а в каких условиях этот выбор делают, какие компромиссы между reach, quality и privacy возникают, как меняется решение при ограничениях по идентификаторам и атрибуции.
Для supply path это особенно заметно. Если в тексте не отражены реальные приоритеты покупателя — прозрачность цепочки, контроль качества инвентаря, latency, дедупликация, соответствие privacy-политикам — модель может считать его менее полезным, чем более «человечный» разбор с явными критериями выбора.
Итог простой: в эпоху AI Search контент должен описывать не только объект, но и поведение вокруг него. Для Programmatic & AdTech это означает более сильные шансы у материалов, где есть сценарии принятия решений, trade-offs и операционная логика. Это уже не только про SEO, но и про то, как системы ранжируют смысл.
Источник: arXiv 2605.30036
Есть свежее исследование, где через несколько крупных LLM прогнали больше 5 млн вопросов и посмотрели не просто на точность ответов, а на ценностные паттерны: как модель склонна выбирать, сравнивать и объяснять решение. Сопоставляли это с психологическими моделями человеческих ценностей и данными о реальных людях.
Что важно для adtech и measurement. Когда модель обучается на типовом человеческом поведении, она начинает лучше воспроизводить не только «правильный ответ», но и то, как пользователь формулирует запрос, что считает важным и какой вариант считает нормальным. Для поиска, AI-ассистентов и генеративных ответов это уже влияет на то, какой контент будет чаще попадать в синтез и какие формулировки система сочтёт наиболее естественными.
Практический вывод для рынка медийки и performance такой: выигрывает не только контент с сухими характеристиками, но и материалы, где есть контекст выбора. Например, не просто «чем отличается SSP от DSP», а в каких условиях этот выбор делают, какие компромиссы между reach, quality и privacy возникают, как меняется решение при ограничениях по идентификаторам и атрибуции.
Для supply path это особенно заметно. Если в тексте не отражены реальные приоритеты покупателя — прозрачность цепочки, контроль качества инвентаря, latency, дедупликация, соответствие privacy-политикам — модель может считать его менее полезным, чем более «человечный» разбор с явными критериями выбора.
Итог простой: в эпоху AI Search контент должен описывать не только объект, но и поведение вокруг него. Для Programmatic & AdTech это означает более сильные шансы у материалов, где есть сценарии принятия решений, trade-offs и операционная логика. Это уже не только про SEO, но и про то, как системы ранжируют смысл.
Источник: arXiv 2605.30036
Как бенчмарки для VLM меняют требования к данным в AdTech
Вышел CrystalXRD-Bench — небольшой, но показательный набор для оценки vision-language моделей. Там 250 примеров и 7 моделей, а задача сводится к довольно жёсткой проверке: система должна восстановить полный набор меток по изображению пика. По сути, это не про красивый ответ, а про точность попадания в структурированные данные.
Почему это важно не только для науки, но и для programmatic и martech? Потому что логика оценки здесь очень похожа на то, как сегодня проверяют ML- и AI-инструменты в маркетинге. Модель недостаточно «угадать смысл» по картинке или скриншоту. Её ответ сравнивают с исходной разметкой, и именно это отделяет демонстрацию от реально пригодного продукта.
В этом бенчмарке лучший Jaccard у GPT-5.4 — 0.5888, exact match — 37.6%. У остальных результаты заметно скромнее: у шести из семи моделей Jaccard не дотягивает до 0.50. Для рынка это важный сигнал: мультимодальные модели уже умеют помогать, но в задачах, где нужна извлекаемая структура, они всё ещё часто дают частичное совпадение, а не полный ответ.
Для рекламных и аналитических команд отсюда простой вывод. Если вы строите AI-инструмент для креативов, медиапланов, supply path analysis или privacy-отчётности, держите рядом не только изображение, но и исходные данные: схемы, атрибуты, JSON, таблицы, метки. Без этого любой красивый интерфейс быстро упирается в слабую измеримость качества.
Публичный релиз данных и кода ещё ожидается, но сам формат уже полезен как ориентир: AI в инструментах ценится не за эффектность, а за проверяемую точность.
Вышел CrystalXRD-Bench — небольшой, но показательный набор для оценки vision-language моделей. Там 250 примеров и 7 моделей, а задача сводится к довольно жёсткой проверке: система должна восстановить полный набор меток по изображению пика. По сути, это не про красивый ответ, а про точность попадания в структурированные данные.
Почему это важно не только для науки, но и для programmatic и martech? Потому что логика оценки здесь очень похожа на то, как сегодня проверяют ML- и AI-инструменты в маркетинге. Модель недостаточно «угадать смысл» по картинке или скриншоту. Её ответ сравнивают с исходной разметкой, и именно это отделяет демонстрацию от реально пригодного продукта.
В этом бенчмарке лучший Jaccard у GPT-5.4 — 0.5888, exact match — 37.6%. У остальных результаты заметно скромнее: у шести из семи моделей Jaccard не дотягивает до 0.50. Для рынка это важный сигнал: мультимодальные модели уже умеют помогать, но в задачах, где нужна извлекаемая структура, они всё ещё часто дают частичное совпадение, а не полный ответ.
Для рекламных и аналитических команд отсюда простой вывод. Если вы строите AI-инструмент для креативов, медиапланов, supply path analysis или privacy-отчётности, держите рядом не только изображение, но и исходные данные: схемы, атрибуты, JSON, таблицы, метки. Без этого любой красивый интерфейс быстро упирается в слабую измеримость качества.
Публичный релиз данных и кода ещё ожидается, но сам формат уже полезен как ориентир: AI в инструментах ценится не за эффектность, а за проверяемую точность.
Почему в programmatic спорят не о CPM, а о том, где теряются конверсии
В связке programmatic-медиа редко ломается один инструмент. Чаще рассыпается вся цепочка: DSP фиксирует показ или клик, MMP считает установку или событие по своим правилам, а postback доходит до трекера с задержкой или вообще без части параметров.
Отсюда и типичная ошибка в разборе: сравнивают интерфейсы и отчёты, хотя смотреть надо на путь сигнала. Если в системе нет отдельного времени получения postback, любой спор превращается в спор на уровне «похоже, всё сошлось» вместо нормальной диагностики.
Для adtech-команды здесь важно три слоя:
— платежный и supply-слой показывает реальный spend, отклонения и нестабильность инвентаря;
— MMP отражает событие в своём атрибуционном окне;
— трекер или BI-слой принимает postback и решает, куда записать конверсию.
На практике проблемы чаще всего всплывают не в красивых дашбордах, а в деталях: часть конверсий приходит позже окна, часть теряет click_id, часть выглядит «двойной» из-за разного времени фиксации на стороне платформ. Если чистить это вручную, можно долго искать виноватого между сетью, кабинетом и MMP.
Полезный быстрый тест — взять 20–30 спорных конверсий и сверить по четырём полям: click_id, время клика, время события и время получения postback. Если хотя бы одно из них не хранится отдельно, вы не измеряете расхождения, а угадываете их причину.
Для маркетинг-директора вывод простой: в programmatic нельзя управлять только по итоговому CPA. Когда signal chain рвётся, страдает не только отчётность, но и скорость обучения кампаний.
В связке programmatic-медиа редко ломается один инструмент. Чаще рассыпается вся цепочка: DSP фиксирует показ или клик, MMP считает установку или событие по своим правилам, а postback доходит до трекера с задержкой или вообще без части параметров.
Отсюда и типичная ошибка в разборе: сравнивают интерфейсы и отчёты, хотя смотреть надо на путь сигнала. Если в системе нет отдельного времени получения postback, любой спор превращается в спор на уровне «похоже, всё сошлось» вместо нормальной диагностики.
Для adtech-команды здесь важно три слоя:
— платежный и supply-слой показывает реальный spend, отклонения и нестабильность инвентаря;
— MMP отражает событие в своём атрибуционном окне;
— трекер или BI-слой принимает postback и решает, куда записать конверсию.
На практике проблемы чаще всего всплывают не в красивых дашбордах, а в деталях: часть конверсий приходит позже окна, часть теряет click_id, часть выглядит «двойной» из-за разного времени фиксации на стороне платформ. Если чистить это вручную, можно долго искать виноватого между сетью, кабинетом и MMP.
Полезный быстрый тест — взять 20–30 спорных конверсий и сверить по четырём полям: click_id, время клика, время события и время получения postback. Если хотя бы одно из них не хранится отдельно, вы не измеряете расхождения, а угадываете их причину.
Для маркетинг-директора вывод простой: в programmatic нельзя управлять только по итоговому CPA. Когда signal chain рвётся, страдает не только отчётность, но и скорость обучения кампаний.
YouTube становится заметнее в атрибуции: что меняется для programmatic-команд
TransUnion и Google объявили об интеграции, которая позволяет включать YouTube в multi-touch attribution — модель, где вклад канала оценивается не по последнему клику, а по всей цепочке касаний. Для рынка это важный сигнал: видео постепенно перестаёт быть «неучтённым влиянием» и становится частью формализованного measurement-подхода.
Почему это важно именно для programmatic и AdTech. В крупных медиамиксах YouTube часто жил в отдельной логике: охват есть, влияние чувствуется, но связать его с итоговой конверсией было сложнее, чем у поисковых или нижневороночных каналов. Теперь у брендов и performance-команд появляется ещё один способ встроить видео в общую модель распределения бюджета.
Но у инструмента есть и очевидные ограничения. Любая MTA-модель зависит от качества данных, выбранного окна атрибуции и того, как платформа считает касания. Поэтому вопрос для медиадиректора здесь не в том, «появилась ли атрибуция», а в том, насколько сравнимы будут результаты с другими источниками и не начнёт ли модель переоценивать удобные для платформы точки контакта.
С точки зрения supply path и measurement это ещё один шаг к более управляемому измерению внутри экосистемы Google. Для рынка полезно не столько само нововведение, сколько его эффект: YouTube всё меньше выглядит как имиджевый канал «на доверии» и всё больше — как измеряемый элемент медиаплана, который можно обсуждать в терминах вклада, а не только охвата.
TransUnion и Google объявили об интеграции, которая позволяет включать YouTube в multi-touch attribution — модель, где вклад канала оценивается не по последнему клику, а по всей цепочке касаний. Для рынка это важный сигнал: видео постепенно перестаёт быть «неучтённым влиянием» и становится частью формализованного measurement-подхода.
Почему это важно именно для programmatic и AdTech. В крупных медиамиксах YouTube часто жил в отдельной логике: охват есть, влияние чувствуется, но связать его с итоговой конверсией было сложнее, чем у поисковых или нижневороночных каналов. Теперь у брендов и performance-команд появляется ещё один способ встроить видео в общую модель распределения бюджета.
Но у инструмента есть и очевидные ограничения. Любая MTA-модель зависит от качества данных, выбранного окна атрибуции и того, как платформа считает касания. Поэтому вопрос для медиадиректора здесь не в том, «появилась ли атрибуция», а в том, насколько сравнимы будут результаты с другими источниками и не начнёт ли модель переоценивать удобные для платформы точки контакта.
С точки зрения supply path и measurement это ещё один шаг к более управляемому измерению внутри экосистемы Google. Для рынка полезно не столько само нововведение, сколько его эффект: YouTube всё меньше выглядит как имиджевый канал «на доверии» и всё больше — как измеряемый элемент медиаплана, который можно обсуждать в терминах вклада, а не только охвата.
LLM начинают лучше «считывать» не только текст, но и человеческие ценностные рамки
В свежем исследовании более 5 миллионов вопросов прогнали через ведущие LLM и сравнили их ответы с теорией ценностей из психологии. Идея простая: посмотреть, насколько модели воспроизводят не только факты, но и устойчивые способы выбора, интерпретации и приоритизации.
Вывод важен не только для AI Search. Авторы отмечают, что модели довольно хорошо совпадают с человеческими паттернами на уровне больших групп, а если подмешивать распределения ценностей, качество симуляции поведения заметно растёт. Иными словами, модель становится не просто «знающей», а более похожей на среднего пользователя в том, как она строит ответ.
Для programmatic и AdTech это полезный сигнал по трём причинам.
Во-первых, растёт роль формулировки. Один и тот же продуктовый смысл можно подать как про экономию бюджета, про контроль риска, про скорость запуска или про прозрачность supply path — и модель может по-разному ранжировать такой контент в ответах и суммаризациях.
Во-вторых, при работе с AI-поиском и LLM-инструментами выигрывают материалы, где есть не только ключевые термины, но и понятная логика принятия решения: что важно для бренда, что важно для агентства, где компромисс, где зона доверия.
В-третьих, для measurement и privacy это особенно заметно: чем сложнее тема, тем сильнее модель опирается на знакомые человеку рамки объяснения, а не на сухой набор терминов.
Практический вывод для команды: если вы делаете материал о DSP, SPO, инвентаре, атрибуции или data clean room, полезно думать не только о семантике, но и о том, какую ценность текст транслирует для читателя. Это уже влияет на то, как контент будет пересказан и в поиске, и внутри LLM-ассистентов.
Само исследование: https://arxiv.org/abs/2605.30036
В свежем исследовании более 5 миллионов вопросов прогнали через ведущие LLM и сравнили их ответы с теорией ценностей из психологии. Идея простая: посмотреть, насколько модели воспроизводят не только факты, но и устойчивые способы выбора, интерпретации и приоритизации.
Вывод важен не только для AI Search. Авторы отмечают, что модели довольно хорошо совпадают с человеческими паттернами на уровне больших групп, а если подмешивать распределения ценностей, качество симуляции поведения заметно растёт. Иными словами, модель становится не просто «знающей», а более похожей на среднего пользователя в том, как она строит ответ.
Для programmatic и AdTech это полезный сигнал по трём причинам.
Во-первых, растёт роль формулировки. Один и тот же продуктовый смысл можно подать как про экономию бюджета, про контроль риска, про скорость запуска или про прозрачность supply path — и модель может по-разному ранжировать такой контент в ответах и суммаризациях.
Во-вторых, при работе с AI-поиском и LLM-инструментами выигрывают материалы, где есть не только ключевые термины, но и понятная логика принятия решения: что важно для бренда, что важно для агентства, где компромисс, где зона доверия.
В-третьих, для measurement и privacy это особенно заметно: чем сложнее тема, тем сильнее модель опирается на знакомые человеку рамки объяснения, а не на сухой набор терминов.
Практический вывод для команды: если вы делаете материал о DSP, SPO, инвентаре, атрибуции или data clean room, полезно думать не только о семантике, но и о том, какую ценность текст транслирует для читателя. Это уже влияет на то, как контент будет пересказан и в поиске, и внутри LLM-ассистентов.
Само исследование: https://arxiv.org/abs/2605.30036
arXiv.org
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
Large Language Models (LLMs) demonstrate a remarkable capacity to adopt different personas and roles; however, it remains unclear whether they can manifest behavior that adheres to a coherent,...
Почему LLM стали полезнее не только для текста, но и для оценки аудитории
В новом исследовании модели проверили на совпадение с человеческими ценностными структурами — и прогнали через них больше 5 миллионов вопросов. Авторы сравнивали не просто ответы, а то, как ценности связаны с выбором и поведением, опираясь на психологическую теорию ценностей.
Что важно для AdTech и programmatic. Когда LLM начинают точнее воспроизводить человеческие паттерны, они полезны не только как генератор текстов, но и как слой для анализа спроса: сегментация аудиторий, формулировка сообщений, оценка реакции на креативы, подбор контекста в privacy-first среде. Иными словами, модель уже лучше имитирует не только «как люди пишут», но и «как люди выбирают».
Отдельный вывод исследования: если в моделях использовать распределение человеческих ценностей, улучшается имитация поведения на уровне популяции. Для маркетинга это похоже на более аккуратную работу с массовыми сценариями — когда нужно не угадывать вкус одного пользователя, а понимать, что сработает в группе, сегменте или когорте.
Для measurement это тоже сигнал. Чем ближе модель к человеческой логике принятия решений, тем полезнее она в задачах, где нужно интерпретировать слабые сигналы: от атрибуции креатива до прогноза отклика на сообщение в разных supply path и средах с ограниченными данными.
Источник: arXiv:2605.30036
В новом исследовании модели проверили на совпадение с человеческими ценностными структурами — и прогнали через них больше 5 миллионов вопросов. Авторы сравнивали не просто ответы, а то, как ценности связаны с выбором и поведением, опираясь на психологическую теорию ценностей.
Что важно для AdTech и programmatic. Когда LLM начинают точнее воспроизводить человеческие паттерны, они полезны не только как генератор текстов, но и как слой для анализа спроса: сегментация аудиторий, формулировка сообщений, оценка реакции на креативы, подбор контекста в privacy-first среде. Иными словами, модель уже лучше имитирует не только «как люди пишут», но и «как люди выбирают».
Отдельный вывод исследования: если в моделях использовать распределение человеческих ценностей, улучшается имитация поведения на уровне популяции. Для маркетинга это похоже на более аккуратную работу с массовыми сценариями — когда нужно не угадывать вкус одного пользователя, а понимать, что сработает в группе, сегменте или когорте.
Для measurement это тоже сигнал. Чем ближе модель к человеческой логике принятия решений, тем полезнее она в задачах, где нужно интерпретировать слабые сигналы: от атрибуции креатива до прогноза отклика на сообщение в разных supply path и средах с ограниченными данными.
Источник: arXiv:2605.30036
Виртуальные карты как инструмент закупки: что теряется за обёрткой из x15
Finup подвёл годовые итоги: множитель x15 и более 100 тысяч выпущенных виртуальных карт. Для fintech-рынка это привычный способ обозначить масштаб, но для programmatic-команды такая сводка остаётся набором нераспакованных цифр.
Когда речь идёт об оплате рекламного трафика, важны не счётчики эмиссии, а то, как карта проходит через платёжные цепочки рекламных платформ. Какая доля успешных списаний у крупных DSP и рекламных кабинетов? Какая комиссия ложится на единицу трафика при конвертации валют? Сколько времени занимает выпуск нового пула реквизитов под отключённый или замороженный аккаунт? Работает ли 3D Secure для верификации в международных сетях?
Рост в пятнадцать раз говорит о том, что спрос на инструмент есть. Но он не объясняет, насколько этот инструмент устойчив в ежедневной закупке, как распределяются карты по гео и валютам, и какой процент из них реально используется для оплаты рекламы, а не для других задач.
Для adtech-специалиста ключевой вопрос — не количество выпущенных карт, а то, как они вписываются в цепочку поставки рекламы и модель измерения расходов. Без этих данных x15 остаётся PR-метрикой, а не аргументом для включения сервиса в медиа-стек.
Finup подвёл годовые итоги: множитель x15 и более 100 тысяч выпущенных виртуальных карт. Для fintech-рынка это привычный способ обозначить масштаб, но для programmatic-команды такая сводка остаётся набором нераспакованных цифр.
Когда речь идёт об оплате рекламного трафика, важны не счётчики эмиссии, а то, как карта проходит через платёжные цепочки рекламных платформ. Какая доля успешных списаний у крупных DSP и рекламных кабинетов? Какая комиссия ложится на единицу трафика при конвертации валют? Сколько времени занимает выпуск нового пула реквизитов под отключённый или замороженный аккаунт? Работает ли 3D Secure для верификации в международных сетях?
Рост в пятнадцать раз говорит о том, что спрос на инструмент есть. Но он не объясняет, насколько этот инструмент устойчив в ежедневной закупке, как распределяются карты по гео и валютам, и какой процент из них реально используется для оплаты рекламы, а не для других задач.
Для adtech-специалиста ключевой вопрос — не количество выпущенных карт, а то, как они вписываются в цепочку поставки рекламы и модель измерения расходов. Без этих данных x15 остаётся PR-метрикой, а не аргументом для включения сервиса в медиа-стек.
Ценностные паттерны LLM как инструмент в programmatic-стеке
Исследователи выяснили, что крупные языковые модели после миллионов тестовых запросов воспроизводят не только факты, но и структуру человеческих ценностей вместе с поведенческими сценариями. Речь идёт не об имитации речи, а о предсказуемой связи между установками и действиями.
Для programmatic и ad-ops это открывает прикладной слой. По мере исчезновения third-party cookies команды теряют возможность быстро тестировать гипотезы на живых когортах. LLM с заданными ценностными параметрами могут частично заменить панели при оценке креативов, выборе площадок и прогнозировании спроса. По сути, это синтетическая аудитория с предсказуемой логикой ответа — инструмент для предварительного скрининга перед запуском на реальный supply path.
Важный нюанс: такие модели полезны на этапе планирования и измерения эффективности посылов, но не отменяют post-campaign аналитику и first-party валидацию. Для маркетинг-директоров это повод посмотреть на LLM не как на генератор текстов, а как на модуль предиктивной аналитики в media-стеке.
Исследователи выяснили, что крупные языковые модели после миллионов тестовых запросов воспроизводят не только факты, но и структуру человеческих ценностей вместе с поведенческими сценариями. Речь идёт не об имитации речи, а о предсказуемой связи между установками и действиями.
Для programmatic и ad-ops это открывает прикладной слой. По мере исчезновения third-party cookies команды теряют возможность быстро тестировать гипотезы на живых когортах. LLM с заданными ценностными параметрами могут частично заменить панели при оценке креативов, выборе площадок и прогнозировании спроса. По сути, это синтетическая аудитория с предсказуемой логикой ответа — инструмент для предварительного скрининга перед запуском на реальный supply path.
Важный нюанс: такие модели полезны на этапе планирования и измерения эффективности посылов, но не отменяют post-campaign аналитику и first-party валидацию. Для маркетинг-директоров это повод посмотреть на LLM не как на генератор текстов, а как на модуль предиктивной аналитики в media-стеке.
