Как оценивать LLM не только по финальному ответу, а по тому, как он собирается
ProjectionBench — пример теста, который полезно читать не только исследователям, но и командам, работающим с programmatic, measurement и AI-поиском. В наборе сравнили GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro Preview на 45 научных статьях из разных областей материаловедения.
Фишка методики в том, что модель не получает весь контекст сразу. Сначала ей дают только тему и исследовательский вопрос, потом данные раскрывают по частям. После каждого шага смотрят, насколько меняется ответ и как он приближается к исходным выводам статьи. Оценка строится не на «понравилось / не понравилось», а на semantic similarity атомарных утверждений — то есть на совпадении отдельных смысловых единиц.
Почему это важно для AdTech.
Если вы строите инструменты для AI Search, тестируете ответы LLM в интерфейсах, делаете контент под генеративную выдачу или смотрите на новые сценарии измерения, обычный бенчмарк по одному промпту мало что показывает. В реальности модель почти всегда работает в условиях неполного контекста: сначала видит заголовок, потом фрагменты, потом уточнения. И именно на этом этапе начинают проявляться различия между моделями.
Отдельно показателен результат GPT-5.4: даже на минимальном контексте он держал около 0.7 F1 alignment с ground truth conclusions. Для инструментов, где важны устойчивость вывода и предсказуемость поведения, это заметно полезнее, чем просто высокий балл в статичном тесте.
Для маркетинг-директора вывод простой: если вы выбираете LLM для поиска, аналитики, контентных ассистентов или слоёв поверх данных, смотрите не только на финальную точность. Важно, как модель достраивает смысл по мере поступления сигнала.
ProjectionBench — пример теста, который полезно читать не только исследователям, но и командам, работающим с programmatic, measurement и AI-поиском. В наборе сравнили GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro Preview на 45 научных статьях из разных областей материаловедения.
Фишка методики в том, что модель не получает весь контекст сразу. Сначала ей дают только тему и исследовательский вопрос, потом данные раскрывают по частям. После каждого шага смотрят, насколько меняется ответ и как он приближается к исходным выводам статьи. Оценка строится не на «понравилось / не понравилось», а на semantic similarity атомарных утверждений — то есть на совпадении отдельных смысловых единиц.
Почему это важно для AdTech.
Если вы строите инструменты для AI Search, тестируете ответы LLM в интерфейсах, делаете контент под генеративную выдачу или смотрите на новые сценарии измерения, обычный бенчмарк по одному промпту мало что показывает. В реальности модель почти всегда работает в условиях неполного контекста: сначала видит заголовок, потом фрагменты, потом уточнения. И именно на этом этапе начинают проявляться различия между моделями.
Отдельно показателен результат GPT-5.4: даже на минимальном контексте он держал около 0.7 F1 alignment с ground truth conclusions. Для инструментов, где важны устойчивость вывода и предсказуемость поведения, это заметно полезнее, чем просто высокий балл в статичном тесте.
Для маркетинг-директора вывод простой: если вы выбираете LLM для поиска, аналитики, контентных ассистентов или слоёв поверх данных, смотрите не только на финальную точность. Важно, как модель достраивает смысл по мере поступления сигнала.
In-app и privacy: где чаще всего теряется контроль в programmatic
В мобильном in-app трафике приватность ломается не на уровне красивых политик, а в цепочке передачи сигналов. Для закупки это особенно чувствительно: здесь в ходу device ID, геосигналы и данные об устройстве, а прозрачность для пользователя нередко ниже, чем в web-окне согласия.
Проблема в том, что programmatic-сделки живут слишком быстро. Решения о показе принимаются за миллисекунды, а значит, проверка privacy и compliance раз в квартал или даже раз в месяц уже не успевает за реальным bidstream. К моменту, когда аудит покажет расхождение, часть бюджета могла уйти в связки, где consent оформлен не так, как ожидает команда.
Для marketing-директора и adtech-команды здесь важны не абстрактные правила, а три точки контроля:
- какие идентификаторы и location-сигналы попадают в аукцион;
- где именно фиксируется consent — у MMP, DSP или SSP;
- как используются данные в оптимизации и атрибуции после показа.
Если эти этапы не связаны между собой, модель атрибуции начинает опираться на сигналы, которые privacy-отдел увидит слишком поздно. В итоге страдает не только compliance, но и качество закупки: алгоритм оптимизируется по данным с сомнительной цепочкой происхождения.
Для in-app инвентаря полезнее не редкие проверки, а постоянный мониторинг того, как устроен supply path и какие данные реально доходят до DSP. Именно там сегодня чаще всего и возникает blind spot.
В мобильном in-app трафике приватность ломается не на уровне красивых политик, а в цепочке передачи сигналов. Для закупки это особенно чувствительно: здесь в ходу device ID, геосигналы и данные об устройстве, а прозрачность для пользователя нередко ниже, чем в web-окне согласия.
Проблема в том, что programmatic-сделки живут слишком быстро. Решения о показе принимаются за миллисекунды, а значит, проверка privacy и compliance раз в квартал или даже раз в месяц уже не успевает за реальным bidstream. К моменту, когда аудит покажет расхождение, часть бюджета могла уйти в связки, где consent оформлен не так, как ожидает команда.
Для marketing-директора и adtech-команды здесь важны не абстрактные правила, а три точки контроля:
- какие идентификаторы и location-сигналы попадают в аукцион;
- где именно фиксируется consent — у MMP, DSP или SSP;
- как используются данные в оптимизации и атрибуции после показа.
Если эти этапы не связаны между собой, модель атрибуции начинает опираться на сигналы, которые privacy-отдел увидит слишком поздно. В итоге страдает не только compliance, но и качество закупки: алгоритм оптимизируется по данным с сомнительной цепочкой происхождения.
Для in-app инвентаря полезнее не редкие проверки, а постоянный мониторинг того, как устроен supply path и какие данные реально доходят до DSP. Именно там сегодня чаще всего и возникает blind spot.
Что показывает CrystalXRD-Bench про границы мультимодальных моделей
В свежем бенчмарке CrystalXRD-Bench проверили 7 VLM-моделей на довольно узкой, но показательной задаче: по XRD-диаграмме восстановить полный набор HKL-пиков, отвечающих за самый интенсивный сигнал. Это 250 примеров, собранных из 10 публичных кристаллографических баз. Задача не про «распознать картинку», а про точную интерпретацию структурного сигнала.
Лидер теста — GPT-5.4: Jaccard 0.5888 и exact match 37.6%. Но важнее не первое место, а разброс по качеству. У шести из семи моделей Jaccard не дотянул до 0.50. То есть модели уже способны уловить общий паттерн и сделать полезный вывод, но при переходе к точному набору элементов уверенность резко падает.
Для AdTech это хороший аналог того, как работают современные AI-инструменты в measurement и privacy-аналитике. Если модель смотрит на дашборд, атрибуционную схему, цепочку supply path или таблицу с логикой инвентаря, она может быстро назвать общий смысл. Но когда нужно не «примерно понять», а безошибочно интерпретировать структуру, точность всё ещё ограничена.
Практический вывод для маркетинг-директоров и adtech-команд простой: AI полезен как слой ускоренного чтения сигналов, но не как финальный арбитр. Особенно там, где решение зависит от нюансов в данных, а не от общего визуального впечатления.
Отдельно важно, что авторы обещают выложить данные и код оценки публично. Для рынка это хороший знак: именно такие бенчмарки помогают трезво оценивать, где мультимодальные модели уже можно подключать к операционным сценариям, а где они пока годятся только для чернового анализа.
В свежем бенчмарке CrystalXRD-Bench проверили 7 VLM-моделей на довольно узкой, но показательной задаче: по XRD-диаграмме восстановить полный набор HKL-пиков, отвечающих за самый интенсивный сигнал. Это 250 примеров, собранных из 10 публичных кристаллографических баз. Задача не про «распознать картинку», а про точную интерпретацию структурного сигнала.
Лидер теста — GPT-5.4: Jaccard 0.5888 и exact match 37.6%. Но важнее не первое место, а разброс по качеству. У шести из семи моделей Jaccard не дотянул до 0.50. То есть модели уже способны уловить общий паттерн и сделать полезный вывод, но при переходе к точному набору элементов уверенность резко падает.
Для AdTech это хороший аналог того, как работают современные AI-инструменты в measurement и privacy-аналитике. Если модель смотрит на дашборд, атрибуционную схему, цепочку supply path или таблицу с логикой инвентаря, она может быстро назвать общий смысл. Но когда нужно не «примерно понять», а безошибочно интерпретировать структуру, точность всё ещё ограничена.
Практический вывод для маркетинг-директоров и adtech-команд простой: AI полезен как слой ускоренного чтения сигналов, но не как финальный арбитр. Особенно там, где решение зависит от нюансов в данных, а не от общего визуального впечатления.
Отдельно важно, что авторы обещают выложить данные и код оценки публично. Для рынка это хороший знак: именно такие бенчмарки помогают трезво оценивать, где мультимодальные модели уже можно подключать к операционным сценариям, а где они пока годятся только для чернового анализа.
Почему измерение в programmatic всё ещё упирается в «почти точно»
Новый бенчмарк из смежной для нас логики хорошо показывает старую проблему: модели и инструменты умеют распознавать паттерн, но на точном совпадении начинают ошибаться. В исследовании CrystalXRD-Bench проверили 7 vision-language моделей на 250 образцах из 10 открытых кристаллографических баз. Задача была строгая: по визуальному XRD-паттерну восстановить полный набор HKL, который соответствует самому интенсивному пику.
Результат оказался показательный. Лучшая модель — GPT-5.4 — дошла до 0.5888 по Jaccard, а exact-match rate составил 37.6%. У шести из семи моделей показатель остался ниже 0.50. Иными словами, распознавание есть, но до надёжного «совпало с источником один в один» пока далеко.
Для AdTech здесь параллель очень узнаваемая. Визуальные и AI-инструменты хорошо справляются с первичным разбором: находят закономерности, группируют сигналы, подсвечивают аномалии. Но как только речь заходит о точной атрибуции, сопоставлении событий или сверке разных источников данных, начинаются расхождения. Особенно там, где важны privacy-ограничения, lossy measurement и неидеальный supply path.
Практический вывод для маркетинг-директора и adtech-команды простой: AI-слой полезен как ускоритель анализа, но не как единственный источник истины. Если инструмент показывает «похоже», это ещё не значит «доказано». Для programmatic-стека это особенно важно в верификации инвентаря, post-bid анализе, дедупликации и построении отчётности, где ошибка на уровне совпадения потом превращается в ошибку в бюджете.
В общем, точность в сложных средах по-прежнему дороже красивой уверенности. И это касается не только науки, но и медиапокупки.
Новый бенчмарк из смежной для нас логики хорошо показывает старую проблему: модели и инструменты умеют распознавать паттерн, но на точном совпадении начинают ошибаться. В исследовании CrystalXRD-Bench проверили 7 vision-language моделей на 250 образцах из 10 открытых кристаллографических баз. Задача была строгая: по визуальному XRD-паттерну восстановить полный набор HKL, который соответствует самому интенсивному пику.
Результат оказался показательный. Лучшая модель — GPT-5.4 — дошла до 0.5888 по Jaccard, а exact-match rate составил 37.6%. У шести из семи моделей показатель остался ниже 0.50. Иными словами, распознавание есть, но до надёжного «совпало с источником один в один» пока далеко.
Для AdTech здесь параллель очень узнаваемая. Визуальные и AI-инструменты хорошо справляются с первичным разбором: находят закономерности, группируют сигналы, подсвечивают аномалии. Но как только речь заходит о точной атрибуции, сопоставлении событий или сверке разных источников данных, начинаются расхождения. Особенно там, где важны privacy-ограничения, lossy measurement и неидеальный supply path.
Практический вывод для маркетинг-директора и adtech-команды простой: AI-слой полезен как ускоритель анализа, но не как единственный источник истины. Если инструмент показывает «похоже», это ещё не значит «доказано». Для programmatic-стека это особенно важно в верификации инвентаря, post-bid анализе, дедупликации и построении отчётности, где ошибка на уровне совпадения потом превращается в ошибку в бюджете.
В общем, точность в сложных средах по-прежнему дороже красивой уверенности. И это касается не только науки, но и медиапокупки.
Точность моделей — это не только про AI, но и про измерения в programmatic
Вышел свежий бенчмарк по работе vision-language моделей с кристаллографическими данными: 250 сэмплов, 10 публичных баз, задача — корректно восстановить полный набор HKL для самого яркого пика на XRD-паттерне. Проверили 7 моделей, и даже лучший результат оказался далеко не идеальным: у GPT-5.4 Jaccard — 0.5888, exact match — 37.6%.
Для AdTech это хороший аналог того, что мы видим в measurement и data pipelines. Модель или система может “в целом понимать контекст”, но ломаться на узкой, структурной детали: атрибуция, дедупликация, сопоставление событий, разметка источников, классификация supply path. На уровне презентации всё выглядит убедительно, а на уровне точности — уже много шума.
Почему это важно для programmatic-рынка:
- верификация данных важнее красивого отчёта;
- любая ошибка на входе потом разрастается в MMM, MTA и BI;
- если сущности спрятаны или размазаны по разным слоям, автоматизация начинает угадывать вместо того, чтобы извлекать;
- в privacy-first среде особенно заметно, где система реально считает, а где просто достраивает недостающее.
Полезный вывод для маркетинг-директора и adtech-команды простой: чем критичнее измерение, тем жёстче должна быть структура данных. Не только текст и график, но и подписанные поля, явные идентификаторы, единые форматы событий, понятный supply path.
Проблема часто не в “понимании”, а в точности. И в programmatic это обычно и есть главная цена ошибки.
Вышел свежий бенчмарк по работе vision-language моделей с кристаллографическими данными: 250 сэмплов, 10 публичных баз, задача — корректно восстановить полный набор HKL для самого яркого пика на XRD-паттерне. Проверили 7 моделей, и даже лучший результат оказался далеко не идеальным: у GPT-5.4 Jaccard — 0.5888, exact match — 37.6%.
Для AdTech это хороший аналог того, что мы видим в measurement и data pipelines. Модель или система может “в целом понимать контекст”, но ломаться на узкой, структурной детали: атрибуция, дедупликация, сопоставление событий, разметка источников, классификация supply path. На уровне презентации всё выглядит убедительно, а на уровне точности — уже много шума.
Почему это важно для programmatic-рынка:
- верификация данных важнее красивого отчёта;
- любая ошибка на входе потом разрастается в MMM, MTA и BI;
- если сущности спрятаны или размазаны по разным слоям, автоматизация начинает угадывать вместо того, чтобы извлекать;
- в privacy-first среде особенно заметно, где система реально считает, а где просто достраивает недостающее.
Полезный вывод для маркетинг-директора и adtech-команды простой: чем критичнее измерение, тем жёстче должна быть структура данных. Не только текст и график, но и подписанные поля, явные идентификаторы, единые форматы событий, понятный supply path.
Проблема часто не в “понимании”, а в точности. И в programmatic это обычно и есть главная цена ошибки.
LLM всё лучше имитируют не только факты, но и человеческую логику выбора
Есть свежее исследование, где через несколько крупных LLM прогнали больше 5 млн вопросов и посмотрели не просто на точность ответов, а на ценностные паттерны: как модель склонна выбирать, сравнивать и объяснять решение. Сопоставляли это с психологическими моделями человеческих ценностей и данными о реальных людях.
Что важно для adtech и measurement. Когда модель обучается на типовом человеческом поведении, она начинает лучше воспроизводить не только «правильный ответ», но и то, как пользователь формулирует запрос, что считает важным и какой вариант считает нормальным. Для поиска, AI-ассистентов и генеративных ответов это уже влияет на то, какой контент будет чаще попадать в синтез и какие формулировки система сочтёт наиболее естественными.
Практический вывод для рынка медийки и performance такой: выигрывает не только контент с сухими характеристиками, но и материалы, где есть контекст выбора. Например, не просто «чем отличается SSP от DSP», а в каких условиях этот выбор делают, какие компромиссы между reach, quality и privacy возникают, как меняется решение при ограничениях по идентификаторам и атрибуции.
Для supply path это особенно заметно. Если в тексте не отражены реальные приоритеты покупателя — прозрачность цепочки, контроль качества инвентаря, latency, дедупликация, соответствие privacy-политикам — модель может считать его менее полезным, чем более «человечный» разбор с явными критериями выбора.
Итог простой: в эпоху AI Search контент должен описывать не только объект, но и поведение вокруг него. Для Programmatic & AdTech это означает более сильные шансы у материалов, где есть сценарии принятия решений, trade-offs и операционная логика. Это уже не только про SEO, но и про то, как системы ранжируют смысл.
Источник: arXiv 2605.30036
Есть свежее исследование, где через несколько крупных LLM прогнали больше 5 млн вопросов и посмотрели не просто на точность ответов, а на ценностные паттерны: как модель склонна выбирать, сравнивать и объяснять решение. Сопоставляли это с психологическими моделями человеческих ценностей и данными о реальных людях.
Что важно для adtech и measurement. Когда модель обучается на типовом человеческом поведении, она начинает лучше воспроизводить не только «правильный ответ», но и то, как пользователь формулирует запрос, что считает важным и какой вариант считает нормальным. Для поиска, AI-ассистентов и генеративных ответов это уже влияет на то, какой контент будет чаще попадать в синтез и какие формулировки система сочтёт наиболее естественными.
Практический вывод для рынка медийки и performance такой: выигрывает не только контент с сухими характеристиками, но и материалы, где есть контекст выбора. Например, не просто «чем отличается SSP от DSP», а в каких условиях этот выбор делают, какие компромиссы между reach, quality и privacy возникают, как меняется решение при ограничениях по идентификаторам и атрибуции.
Для supply path это особенно заметно. Если в тексте не отражены реальные приоритеты покупателя — прозрачность цепочки, контроль качества инвентаря, latency, дедупликация, соответствие privacy-политикам — модель может считать его менее полезным, чем более «человечный» разбор с явными критериями выбора.
Итог простой: в эпоху AI Search контент должен описывать не только объект, но и поведение вокруг него. Для Programmatic & AdTech это означает более сильные шансы у материалов, где есть сценарии принятия решений, trade-offs и операционная логика. Это уже не только про SEO, но и про то, как системы ранжируют смысл.
Источник: arXiv 2605.30036
