Vector Programmatic & AdTech
3 subscribers
1 photo
16 links
Programmatic & AdTech / Deep analysis
Download Telegram
Тестирование LLM в условиях прогрессивного раскрытия: новый бенчмарк для AI Search

Когда мы говорим о качестве языковых моделей в поисковых сценариях, стандартные тесты на точность по одному запросу мало что дают. В реальной выдаче модель видит не полный текст, а фрагменты: заголовок, сниппет, контекст. Именно для этого полезен недавний бенчмарк ProjectionBench.

ProjectionBench оценивает GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro preview на 45 научных работах из областей биоактивных материалов, механических материалов и наноматериалов. Моделям даётся только тема и исследовательский вопрос, а технические детали раскрываются пошагово. Гипотезы сравниваются с выводами оригинальной статьи через семантическую схожесть атомарных утверждений.

Такой подход важен для AI Search и GEO (Generative Engine Optimization). Ответы нельзя оценивать лишь по принципу «похоже/не похоже». Progressive disclosure показывает, как модель удерживает гипотезу без полного контекста. Для контентных сценариев это ближе к реальной выдаче, где модель собирает сигнал из кусков.

Если вы тестируете RAG, суммаризацию или генерацию ответов под SERP, ProjectionBench даёт более реалистичную метрику, чем обычная точность по одному промпту. Рекомендуется учитывать такие бенчмарки при оценке выбранной модели для поисковых продуктов.

Для соседнего контекста загляни в @CpaMarketBrief
CrystalXRD-Bench: как модели учатся читать дифрактограммы

Опубликован бенчмарк CrystalXRD-Bench: 250 образцов из 10 кристаллографических баз с задачей восстановления набора HKL, дающих самый сильный пик на XRD-паттерне. Протестированы 7 vision-language моделей.

Лучший результат — Jaccard 0.5888 у GPT-5.4, exact-match 37.6%. Шесть моделей не дотянули до 0.50. Каждый пример включает рендер дифрактограммы, исходный CIF-файл и химическую формулу.

Для контентных стратегий в B2B-вертикалях это важный сигнал. Модели уже оценивают не просто текст, а комбинацию изображения, структуры и данных. Поверхностные объяснения становятся менее конкурентоспособными: AI-ассистенты и поиск предпочитают материалы, которые точно передают сложную предметную область. Выход — углублять контент с визуализациями и ссылками на исходные данные.
Почему уход руководителя Prebid важен для programmatic-рынка

Новость об уходе президента Prebid сама по себе не выглядит драматичной, но для рынка programmatic такие изменения редко бывают чисто кадровыми. Prebid — это инфраструктурный слой, через который проходят аукционные механики и часть header bidding-экосистемы. Поэтому любые перестановки внутри организации обычно отражаются не столько на заголовках, сколько на темпе развития продукта и предсказуемости обновлений.

Если смотреть на это глазами закупщика или маркетинг-директора, важен не сам факт ротации, а возможные последствия: кто будет задавать приоритеты, как быстро будут выходить релизы, не изменится ли логика работы с партнёрами и не появится ли временная пауза в согласованиях. Для тех, кто работает через цепочки вроде MGID, Taboola или Outbrain, такие сигналы особенно чувствительны, потому что стабильность supply path и повторяемость аукциона напрямую влияют на качество закупки.

В programmatic новости про команду часто читаются как новости про инфраструктуру. И именно инфраструктура обычно даёт рынку понять, будет ли следующий этап эволюции спокойным или затяжным.
Автоматизация в кабинетах меняет не только скорость, но и состав стека

На рынке снова обсуждают инструменты, которые обещают собрать управление сотнями кампаний в одном окне и убрать часть привычной инфраструктуры байера. Сам по себе тренд не новый: индустрия давно движется в сторону объединения запусков, автоматизации рутины и снижения ручной нагрузки. Но сейчас меняется масштаб ожиданий — от отдельной функции к почти полной замене операционного слоя.

Для команд это важнее, чем кажется. Если система действительно берёт на себя массовый запуск, планирование и базовую оптимизацию, меняется не только скорость тестов, но и структура команды. Меньше времени уходит на механическую работу, больше — на воронку, аналитику и принятие решений. Одновременно растёт зависимость от того, насколько прозрачны правила автоматизации и можно ли понять, почему система сделала именно такой выбор.

Есть и обратная сторона. Когда антидетект, прокси, трекинг и управление кампаниями сводятся в единый слой, байер теряет часть гибкости в сборке собственного стека. Удобство покупается ценой меньшего контроля. И дальше рынок будет сравнивать уже не только CPM и CTR, но и стоимость этого удобства: в деньгах, времени и управляемости процессов.
Анализ рынка Латам: консолидация и модели роста в Q1 2026

Первый квартал 2026 года в Латинской Америке демонстрирует четкую дифференциацию стратегий развития операторского бизнеса. Регион, традиционно считающийся одним из самых перспективных для масштабирования, переходит от стадии экстенсивного захвата рынка к осознанной консолидации и укреплению позиций через M&A-сделки.

Бразилия задает тон через крупные слияния: покупка локальных игроков международными гигантами позволяет быстро наращивать активную базу пользователей, достигая многократного роста выручки. В то же время другие страны региона выбирают иные пути. Например, Перу демонстрирует высокую эффективность за счет глубокой интеграции брендов в повседневное потребление, а в Мексике наблюдается умеренный, но устойчивый рост операционных показателей. Колумбия же остается примером рынка с доминированием крупных B2B-платформ, что создает барьер для входа новых игроков, но обеспечивает стабильность экосистемы.

Для AdTech-специалистов и маркетинг-директоров эти данные служат индикатором того, что Латам перестает быть «единым рынком». Стратегии продвижения должны учитывать локальные особенности законодательства и предпочтения пользователей. M&A-активность в Бразилии указывает на то, что в ближайшее время рынок будет принадлежать игрокам с сильными финансовыми ресурсами и отлаженной инфраструктурой. Маркетологам стоит фокусироваться на партнерствах с крупными платформами, которые уже заняли доминирующие позиции, и учитывать риск-профили каждой конкретной страны при планировании бюджетов на вторую половину года.
Инкрементальная ценность конверсий: почему CPA не главное

В performance-маркетинге растет популярность офлайн-конверсий. Google Ads и Microsoft Ads позволяют загружать данные о реальных продажах. Но практика показывает: рост MQL и SQL не гарантирует рост лидов. На примере B2B-кампании за две недели количество MQL выросло, а лиды остались на месте. При увеличении spend на 50% средний CPA почти не изменился, но marginal CPA оказался на 25% выше. Причина — добавление новых primary conversion actions, которые "раздули" общее число конверсий. Для programmatic-закупок это знакомый паттерн: оптимизация по ванильным метрикам (CPA, ROAS) часто ведет к субоптимальным результатам. Решение — использовать инкрементальное тестирование (holdout groups) и тщательно выбирать, какие события считать primary. Особенно это важно при передаче offline conversion data: не все лиды одинаково ценны. Value-based bidding может помочь, если правильно настроить ценности. Иначе система будет гоняться за дешёвыми, но пустыми конверсиями. Вывод: не доверяйте одному счетчику, смотрите на инкрементальный прирост.
Разрыв между визуальным образом и смыслом: извлекаем уроки из CrystalXRD-Bench

Результаты тестирования семи VLM на новом бенчмарке CrystalXRD-Bench наглядно демонстрируют фундаментальную проблему современных нейросетей: неспособность точно интерпретировать сложную визуальную информацию. Даже передовые модели, включая GPT-5.4, показывают далекие от идеала результаты в задачах, требующих точной разметки графиков и узкоспециализированных схем. Для специалистов в SEO и контентном маркетинге это важный инсайт. Когда мы говорим об AI Search, важно помнить, что ИИ все еще склонен «галлюцинировать» при анализе лабораторных данных, графиков или сложных структур. Опора на визуальный контент в нишах, где критична точность терминологии и схем, может привести к искажению выдачи. Появление публичных бенчмарков, подобных CrystalXRD, дает нам инструмент для проверки моделей на профпригодность. Прежде чем делегировать ИИ автоматизацию аналитической работы с визуальными данными, стоит понимать границы их «зрения», чтобы случайно не транслировать аудитории неверно интерпретированную информацию.

Связанная тема раскрывается в @OfferIntelligenceStack
SFT против RL: как методы дообучения влияют на стабильность моделей в AI-поиске

Выбор метода дообучения (fine-tuning) нейросети — это всегда компромисс между скоростью адаптации и сохранением «знаний» модели. Сравнительный анализ SFT (supervised fine-tuning) и RL (reinforcement learning) на базе Qwen2.5-3B показывает фундаментальную проблему: SFT, будучи более быстрым инструментом, агрессивно разрушает исходные нейронные связи, что часто ведет к эффекту «забывания» базовых навыков.

Для AdTech-специалистов и тех, кто оптимизирует контент под AI-поиск (GEO/AIO), это имеет прямое прикладное значение. Если поисковая выдача строится на моделях, дообученных через SFT под узкие задачи, качество ответов на смежные запросы неизбежно деградирует. Это создает риск внезапных просадок трафика, когда модель, «заточенная» под один тип запросов, начинает выдавать нерелевантный результат на околотематических темах.

Внедрение метрик вроде differential circuit vulnerability позволяет оценить, насколько глубоко дообучение повреждает архитектуру модели. Для бизнеса это сигнал: при выборе AI-решений для работы с контентом следует отдавать предпочтение тем пайплайнам, которые сохраняют стабильность на длинном хвосте запросов, а не тем, что показывают быстрый результат на узких бенчмарках. Стабильность структуры модели — это залог того, что ваш контент не вылетит из индекса при очередном обновлении поискового алгоритма.

Похожий разбор есть в @IndexCpaMarketTakes
Границы возможностей AI: почему технический контент требует человеческого контроля

Появление специализированных бенчмарков вроде CrystalXRD-Bench подсвечивает фундаментальную проблему современных Vision-Language моделей. Они отлично справляются с узнаванием общих образов, но пасуют перед задачами, где требуется извлечение точных структурных данных. Результаты GPT-5.4 в 37.6% при поиске точных параметров подтверждают: автоматизированный анализ, основанный только на визуальном ряде, пока не способен заменить экспертную проверку.

Для adtech-рынка и команд, работающих с контентными стратегиями, это критически важный инсайт. Отраслевые ниши, где качество контента измеряется профессиональной точностью, требуют гибридного подхода. Нельзя полагаться на то, что AI-алгоритмы поиска самостоятельно «поймут» специфику продукта, если в обучающей выборке не было достаточного количества верифицированных данных. Стратегия «просто загрузить картинку в LLM» больше не является эффективной. Чтобы не терять позиции в выдаче и доверие аудитории, необходимо связывать визуальный контент с проверенными источниками данных и жестко валидировать результаты, которые выдает нейросетевой поиск по вашим материалам.
ProjectionBench: как модель достраивает гипотезу и что это даёт GEO

ProjectionBench проверил GPT-5, GPT-5.4, Gemini 2.5 pro и Gemini 3.1 pro preview на 45 статьях по материаловедению. Особенность: модели сначала видели только тему и исследовательский вопрос, затем контекст раскрывали поэтапно. Ответы сравнивали с выводами оригинальных работ через семантическую близость атомарных утверждений.

Результат: GPT-5.4 при минимальном контексте сохранял 0.7 F1 alignment с ground truth. Это принципиально иной способ оценки, чем обычный бенч по одному промпту. Для AI Search и Generative Engine Optimization (GEO) такая метрика ближе к реальному поведению: пользователь задаёт короткий запрос, модель достраивает гипотезу, а затем уточняет.

Вывод для контент-стратегии под генеративный поиск: если ваш текст не даёт модели достаточных зацепок для поэтапного вывода фактов, полнота ответа просядет. Нужно строить контент как цепочку утверждений, где каждый следующий шаг опирается на предыдущий. Это особенно критично для сложных B2B-продуктов, где ответ должен быть точным, а не просто релевантным. Минимальный контекст уже не спасает — важна структура данных.
In-app privacy blind spot: почему миллисекундный bidding ломает квартальные аудиты

Мобильная in-app-среда остаётся зоной с пониженной прозрачностью для пользователя: device IDs и геолокация собираются в реальном времени, но механизмы согласия часто уступают веб-поп-апам. Это не просто этическая проблема — это риск для атрибуции и оптимизации.

AdMonsters обращают внимание: media buying исполняется за миллисекунды, а privacy-аудит проводится раз в квартал или месяц. Такая модель откровенно не успевает за bidstream. Пока compliance-команда проверяет логи, алгоритмы уже сотни тысяч раз приняли решения на основе сигналов, которые privacy-политика могла бы заблокировать.

Для mobile UA это означает: если вы закупаете in-app инвентарь, важно контролировать, какие именно device ID и location signals передаются через цепочку MMP → DSP → SSP. Где фиксируется consent? Какие data usage тэги проставлены? Без этого attribution может строиться на данных, которые позже признают невалидными, и оптимизация пойдёт по ложному следу.

Решение не в том, чтобы замедлить bidding, — а в том, чтобы сделать compliance проверки непрерывными. Например, внедрить real-time мониторинг consent signals на уровне bid request. Или добавить автоматические блокировки источников, которые не проходят проверку по privacy. Квартальный аудит как единый инструмент контроля в in-app — анахронизм.

Источник: AdMonsters, анализ канала.
Визуальный интеллект AI: пределы точности в анализе графических данных

Развитие Vision-Language Models (VLM) ставит перед нами вопрос о том, насколько можно доверять AI при работе со сложной аналитикой. Тестирование семи моделей на бенчмарке CrystalXRD-Bench, посвященном кристаллографическим данным, показало неоднозначные результаты. Даже лидер рейтинга, GPT-5.4, демонстрирует точность (exact-match) на уровне 37.6%, при этом большинство моделей не дотягивает до коэффициента Жаккара 0.50.

Для специалистов в области SEO и контент-маркетинга, работающих с визуальными данными, графиками или технической документацией, это тревожный звонок. Несмотря на прогресс в распознавании образов, интерпретация структурной информации остается «зоной риска». Ошибки здесь возникают не на уровне распознавания самих объектов, а на этапе логического вывода и анализа связей внутри визуального контента. В нишах, где критически важна интерпретация таблиц, схем и научных отчетов, полагаться исключительно на AI-анализ пока преждевременно. Любая автоматизация генерации контента на основе графиков требует обязательной верификации экспертом, так как скрытые погрешности в интерпретации данных могут критически исказить итоговую информацию.
CrystalXRD-Bench: why точный matching остаётся слабым местом AI

Новый бенчмарк CrystalXRD-Bench (250 образцов из 10 кристаллографических баз) протестировал 7 vision-language моделей на задаче восстановления набора HKL, дающего самый интенсивный пик в XRD-паттерне. Лучший результат — 0.5888 Jaccard у GPT-5.4 при exact-match rate 37.6%. Шесть из семи моделей показали результат ниже 0.50. Данные и код оценки обещают опубликовать. Для programmatic и AI search это важный сигнал: модели неплохо извлекают общую структуру из визуальных паттернов, но на точном сопоставлении с источником всё ещё сбоят. В рекламных технологиях это бьёт по автоматической атрибуции, подбору инвентаря по точным параметрам и генерации отчётов. Если AI-система не может надёжно восстановить точное значение из визуального ввода, доверять ей слепое принятие решений в real-time bidding рискованно. Для команд, использующих AI в цепочке подбора креативов или анализа конкурентов, это аргумент в пользу гибридных подходов: машинное зрение как первый фильтр, а затем верификация через точные API или базы. Инвестиции в качество размеченных данных и структурированных источников окупаются, когда AI спотыкается на exact match.
Когда технический контент становится тестом на точность для AI

CrystalXRD-Bench выглядит как узкоспециализированная история про кристаллографию, но на деле это полезный маркер для всей AI-индустрии. Авторы собрали 250 сэмплов из 10 публичных баз и проверили 7 vision-language моделей на одной задаче: восстановить полный набор HKL для самого сильного пика в XRD-паттерне. Лучший результат показал GPT-5.4 — 0.5888 Jaccard, exact-match — 37.6%.

Что здесь важно для рынка? Такие тесты показывают пределы не «понимания» как такового, а точности извлечения структуры. Для AI Search, SEO и технических библиотек это критично: система может уверенно пересказать тему, но ошибиться в формуле, подписи, графике или единице измерения. А именно на таких объектах строится доверие к контенту.

Если у вас сложные материалы, их стоит проектировать не только под читателя, но и под машинное чтение. Ключевые сущности лучше дублировать в тексте, заголовках, подписях к визуалам и в сопровождающих метаданных. В технических вертикалях качество часто теряется не в смысле, а в деталях.

Для соседнего контекста загляни в @VerticalWatchReview
LLM и ценности: как модели учатся предсказывать человеческое поведение и что это значит для AI Search

Новое исследование на выборке из 5 млн вопросов сравнило ценностные структуры LLM и людей, используя established psychological value theory. Модели с value-prompting продемонстрировали сильное совпадение с человеческими паттернами по обеим осям. Добавление распределения ценностей улучшило population-level simulations на value-induced LLM.

Для programmatic и content-маркетинга это означает, что AI-поиск всё лучше воспроизводит не просто факты, а поведенческие сигналы пользователей. Контент, написанный в логике типичного выбора и ценностных приоритетов, имеет больше шансов быть включённым в синтезированные ответы LLM. Сухая «информационка» без поведенческого слоя может потерять в видимости.

Важный нюанс: модели остаются калиброванными в отношении уверенности — их предсказания не страдают типичной для глубинных сетей overconfidence. Это делает их прогнозы более надёжными для ранжирования и ответов с неопределённостью. Для supply path в поиске это шаг к снижению шума и повышению качества доверия к результатам.

Источник: arXiv 2605.30036

Связанная тема раскрывается в @AffiliateComplianceHow
Vector Programmatic & AdTech: что смотреть в paid acquisition

Операционная заметка по теме канала Vector Programmatic & AdTech.

Фокус: conversion tracking. Смотри на CPA как на рабочий сигнал, а не как на красивую цифру в отчете.

Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется CPA.
3. Оставить короткий вывод для следующего теста.

Практическая логика: оставляй в отчете следующий шаг, а не только итоговую цифру. Серые обходы не нужны: достаточно метрик, качества и аккуратной гипотезы.
Короткий разбор: audience split для Vector Programmatic & AdTech

Мини-playbook для paid acquisition.

Гипотеза: audience split влияет на CPA. Не меняй сразу всю связку: фиксируй причину решения, чтобы через неделю не спорить с собственной статистикой.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Не смешивай compliance-риск с маркетинговым тестом.
Vector Programmatic & AdTech: проверка CTR

Мини-playbook по теме канала Vector Programmatic & AdTech.

Фокус: budget pacing. Смотри на CTR как на рабочий сигнал, а не как на красивую цифру в отчете.

Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется CTR.
3. Оставить короткий вывод для следующего теста.

Практическая логика: перед масштабированием проверь, не растет ли скрытая цена ошибки. Любой рост проверяй через качество, а не только через объем.
Наблюдение для теста: paid acquisition и creative fatigue

Мини-playbook для paid acquisition.

Гипотеза: creative fatigue влияет на CTR. Не меняй сразу всю связку: сначала меняй один элемент, потом сравнивай результат с чистым контролем.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Без обещаний результата и без реферальных ссылок.
Vector Programmatic & AdTech: что смотреть в paid acquisition

Операционная заметка по теме канала Vector Programmatic & AdTech.

Фокус: creative fatigue. Смотри на CVR как на рабочий сигнал, а не как на красивую цифру в отчете.

Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется CVR.
3. Оставить короткий вывод для следующего теста.

Практическая логика: разделяй выводы по источнику, офферу и посадочной странице. Если формулировка звучит как гарантия, ее лучше переписать.

Смежная тема: @OfferIntelligenceKit4
Короткий разбор: budget pacing для Vector Programmatic & AdTech

Мини-playbook для paid acquisition.

Гипотеза: budget pacing влияет на CPC. Не меняй сразу всю связку: разделяй выводы по источнику, офферу и посадочной странице.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Серые обходы не нужны: достаточно метрик, качества и аккуратной гипотезы.