Как оценивать LLM не только по финальному ответу, а по тому, как он собирается
ProjectionBench — пример теста, который полезно читать не только исследователям, но и командам, работающим с programmatic, measurement и AI-поиском. В наборе сравнили GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro Preview на 45 научных статьях из разных областей материаловедения.
Фишка методики в том, что модель не получает весь контекст сразу. Сначала ей дают только тему и исследовательский вопрос, потом данные раскрывают по частям. После каждого шага смотрят, насколько меняется ответ и как он приближается к исходным выводам статьи. Оценка строится не на «понравилось / не понравилось», а на semantic similarity атомарных утверждений — то есть на совпадении отдельных смысловых единиц.
Почему это важно для AdTech.
Если вы строите инструменты для AI Search, тестируете ответы LLM в интерфейсах, делаете контент под генеративную выдачу или смотрите на новые сценарии измерения, обычный бенчмарк по одному промпту мало что показывает. В реальности модель почти всегда работает в условиях неполного контекста: сначала видит заголовок, потом фрагменты, потом уточнения. И именно на этом этапе начинают проявляться различия между моделями.
Отдельно показателен результат GPT-5.4: даже на минимальном контексте он держал около 0.7 F1 alignment с ground truth conclusions. Для инструментов, где важны устойчивость вывода и предсказуемость поведения, это заметно полезнее, чем просто высокий балл в статичном тесте.
Для маркетинг-директора вывод простой: если вы выбираете LLM для поиска, аналитики, контентных ассистентов или слоёв поверх данных, смотрите не только на финальную точность. Важно, как модель достраивает смысл по мере поступления сигнала.
ProjectionBench — пример теста, который полезно читать не только исследователям, но и командам, работающим с programmatic, measurement и AI-поиском. В наборе сравнили GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro Preview на 45 научных статьях из разных областей материаловедения.
Фишка методики в том, что модель не получает весь контекст сразу. Сначала ей дают только тему и исследовательский вопрос, потом данные раскрывают по частям. После каждого шага смотрят, насколько меняется ответ и как он приближается к исходным выводам статьи. Оценка строится не на «понравилось / не понравилось», а на semantic similarity атомарных утверждений — то есть на совпадении отдельных смысловых единиц.
Почему это важно для AdTech.
Если вы строите инструменты для AI Search, тестируете ответы LLM в интерфейсах, делаете контент под генеративную выдачу или смотрите на новые сценарии измерения, обычный бенчмарк по одному промпту мало что показывает. В реальности модель почти всегда работает в условиях неполного контекста: сначала видит заголовок, потом фрагменты, потом уточнения. И именно на этом этапе начинают проявляться различия между моделями.
Отдельно показателен результат GPT-5.4: даже на минимальном контексте он держал около 0.7 F1 alignment с ground truth conclusions. Для инструментов, где важны устойчивость вывода и предсказуемость поведения, это заметно полезнее, чем просто высокий балл в статичном тесте.
Для маркетинг-директора вывод простой: если вы выбираете LLM для поиска, аналитики, контентных ассистентов или слоёв поверх данных, смотрите не только на финальную точность. Важно, как модель достраивает смысл по мере поступления сигнала.
In-app и privacy: где чаще всего теряется контроль в programmatic
В мобильном in-app трафике приватность ломается не на уровне красивых политик, а в цепочке передачи сигналов. Для закупки это особенно чувствительно: здесь в ходу device ID, геосигналы и данные об устройстве, а прозрачность для пользователя нередко ниже, чем в web-окне согласия.
Проблема в том, что programmatic-сделки живут слишком быстро. Решения о показе принимаются за миллисекунды, а значит, проверка privacy и compliance раз в квартал или даже раз в месяц уже не успевает за реальным bidstream. К моменту, когда аудит покажет расхождение, часть бюджета могла уйти в связки, где consent оформлен не так, как ожидает команда.
Для marketing-директора и adtech-команды здесь важны не абстрактные правила, а три точки контроля:
- какие идентификаторы и location-сигналы попадают в аукцион;
- где именно фиксируется consent — у MMP, DSP или SSP;
- как используются данные в оптимизации и атрибуции после показа.
Если эти этапы не связаны между собой, модель атрибуции начинает опираться на сигналы, которые privacy-отдел увидит слишком поздно. В итоге страдает не только compliance, но и качество закупки: алгоритм оптимизируется по данным с сомнительной цепочкой происхождения.
Для in-app инвентаря полезнее не редкие проверки, а постоянный мониторинг того, как устроен supply path и какие данные реально доходят до DSP. Именно там сегодня чаще всего и возникает blind spot.
В мобильном in-app трафике приватность ломается не на уровне красивых политик, а в цепочке передачи сигналов. Для закупки это особенно чувствительно: здесь в ходу device ID, геосигналы и данные об устройстве, а прозрачность для пользователя нередко ниже, чем в web-окне согласия.
Проблема в том, что programmatic-сделки живут слишком быстро. Решения о показе принимаются за миллисекунды, а значит, проверка privacy и compliance раз в квартал или даже раз в месяц уже не успевает за реальным bidstream. К моменту, когда аудит покажет расхождение, часть бюджета могла уйти в связки, где consent оформлен не так, как ожидает команда.
Для marketing-директора и adtech-команды здесь важны не абстрактные правила, а три точки контроля:
- какие идентификаторы и location-сигналы попадают в аукцион;
- где именно фиксируется consent — у MMP, DSP или SSP;
- как используются данные в оптимизации и атрибуции после показа.
Если эти этапы не связаны между собой, модель атрибуции начинает опираться на сигналы, которые privacy-отдел увидит слишком поздно. В итоге страдает не только compliance, но и качество закупки: алгоритм оптимизируется по данным с сомнительной цепочкой происхождения.
Для in-app инвентаря полезнее не редкие проверки, а постоянный мониторинг того, как устроен supply path и какие данные реально доходят до DSP. Именно там сегодня чаще всего и возникает blind spot.
Что показывает CrystalXRD-Bench про границы мультимодальных моделей
В свежем бенчмарке CrystalXRD-Bench проверили 7 VLM-моделей на довольно узкой, но показательной задаче: по XRD-диаграмме восстановить полный набор HKL-пиков, отвечающих за самый интенсивный сигнал. Это 250 примеров, собранных из 10 публичных кристаллографических баз. Задача не про «распознать картинку», а про точную интерпретацию структурного сигнала.
Лидер теста — GPT-5.4: Jaccard 0.5888 и exact match 37.6%. Но важнее не первое место, а разброс по качеству. У шести из семи моделей Jaccard не дотянул до 0.50. То есть модели уже способны уловить общий паттерн и сделать полезный вывод, но при переходе к точному набору элементов уверенность резко падает.
Для AdTech это хороший аналог того, как работают современные AI-инструменты в measurement и privacy-аналитике. Если модель смотрит на дашборд, атрибуционную схему, цепочку supply path или таблицу с логикой инвентаря, она может быстро назвать общий смысл. Но когда нужно не «примерно понять», а безошибочно интерпретировать структуру, точность всё ещё ограничена.
Практический вывод для маркетинг-директоров и adtech-команд простой: AI полезен как слой ускоренного чтения сигналов, но не как финальный арбитр. Особенно там, где решение зависит от нюансов в данных, а не от общего визуального впечатления.
Отдельно важно, что авторы обещают выложить данные и код оценки публично. Для рынка это хороший знак: именно такие бенчмарки помогают трезво оценивать, где мультимодальные модели уже можно подключать к операционным сценариям, а где они пока годятся только для чернового анализа.
В свежем бенчмарке CrystalXRD-Bench проверили 7 VLM-моделей на довольно узкой, но показательной задаче: по XRD-диаграмме восстановить полный набор HKL-пиков, отвечающих за самый интенсивный сигнал. Это 250 примеров, собранных из 10 публичных кристаллографических баз. Задача не про «распознать картинку», а про точную интерпретацию структурного сигнала.
Лидер теста — GPT-5.4: Jaccard 0.5888 и exact match 37.6%. Но важнее не первое место, а разброс по качеству. У шести из семи моделей Jaccard не дотянул до 0.50. То есть модели уже способны уловить общий паттерн и сделать полезный вывод, но при переходе к точному набору элементов уверенность резко падает.
Для AdTech это хороший аналог того, как работают современные AI-инструменты в measurement и privacy-аналитике. Если модель смотрит на дашборд, атрибуционную схему, цепочку supply path или таблицу с логикой инвентаря, она может быстро назвать общий смысл. Но когда нужно не «примерно понять», а безошибочно интерпретировать структуру, точность всё ещё ограничена.
Практический вывод для маркетинг-директоров и adtech-команд простой: AI полезен как слой ускоренного чтения сигналов, но не как финальный арбитр. Особенно там, где решение зависит от нюансов в данных, а не от общего визуального впечатления.
Отдельно важно, что авторы обещают выложить данные и код оценки публично. Для рынка это хороший знак: именно такие бенчмарки помогают трезво оценивать, где мультимодальные модели уже можно подключать к операционным сценариям, а где они пока годятся только для чернового анализа.
