Vector Programmatic & AdTech
3 subscribers
1 photo
16 links
Programmatic & AdTech / Deep analysis
Download Telegram
Когда в отчётах растут MQL и SQL, это ещё не значит, что media-buying начал приносить больше денег. Для programmatic и B2B-перформанса здесь важен другой вопрос: что именно счётчик

Типичная проблема выглядит так. В аккаунте подключают несколько conversion actions, часть из них делают primary, и система начинает оптимизироваться по сумме сигналов. На графике всё красиво: total conversions идут вверх, CPL может выглядеть терпимо, а коммерческий результат остаётся почти без изменений. По сути, воронка раздувается за счёт промежуточных событий, которые слабо отражают качество спроса.

Это особенно заметно, когда бюджет масштабируют. Пока spend растёт с умеренной скоростью, CPA кажется стабильным. Но на следующем шаге marginal CPA начинает уходить выше среднего, и именно там видно, что дополнительный бюджет покупает не лучший инкремент, а более дорогой шум.

Для adtech-команды вывод простой: смотреть только на итоговые конверсии опасно. Нужно отдельно проверять, какие события реально являются бизнес-сигналом, нет ли дублей и не переоценены ли MQL/SQL в логике оптимизации. Иначе алгоритм учится не на ценности, а на удобных для отчёта действиях.

В таких сценариях особенно полезна связка с offline conversion data в Google Ads и Microsoft Ads. Когда в систему возвращаются данные уже из CRM или продаж, bidding начинает опираться не на прокси-метрики, а на более близкий к деньгам сигнал. Для маркетинг-директора это обычно и есть разница между «ростом отчётности» и ростом результата.
Когда модель начинает «думать» как аудитория, у маркетинга меняются правила игры

В свежем исследовании LLM прогнали через более чем 5 миллионов вопросов и сравнили их ценностные профили с человеческими. Использовали established psychological value theory — то есть не просто смотрели на ответы, а сопоставляли, насколько совпадают внутренние приоритеты и связи между ними.

Вывод получился показательный: если модели получают подсказки, связанные с ценностями, их поведение заметно сближается с человеческим. Более того, при добавлении распределений человеческих ценностей качество population-level симуляций становится лучше. Иными словами, модель точнее воспроизводит не только отдельные ответы, но и типичные паттерны группы.

Почему это важно для adtech и media buying.

Во-первых, AI Search и ассистенты всё лучше ранжируют не «набор слов», а текст, который выглядит логичным в человеческой системе координат. Простая оптимизация под ключи постепенно уступает место оптимизации под предполагаемый способ мышления пользователя.

Во-вторых, это влияет на креатив и контент в programmatic. Если системы лучше улавливают ценностные и поведенческие шаблоны, то выигрывают материалы, где есть не только тематика и частотность, но и ясная позиция, контекст, ожидаемый сценарий выбора.

В-третьих, для measurement это ещё один сигнал: часть эффективности будет зависеть не от прямого совпадения запроса и объявления, а от того, насколько сообщение совпадает с моделью принятия решения у аудитории.

Практический вывод для рынка простой: в связке programmatic, search и AI-интерфейсов всё важнее становится не «что написано», а «как это прочитается» — человеком и машиной одновременно. Это уже вопрос не только семантики, но и вероятностной модели поведения.

Источник: arXiv: 2605.30036
Как длина контекста влияет на качество AI-поиска и почему это важно для AdTech

В тесте ProjectionBench сравнили несколько моделей на 45 научных статьях и проверяли не «красоту ответа», а то, насколько вывод совпадает с исходной публикацией. Логика эксперимента простая: сначала модели дают только тему и исследовательский вопрос, а фактуру раскрывают постепенно. Затем ответы сверяют по атомарным утверждениям и семантическому сходству с итогами статьи.

Главный вывод для нас не в том, что одна модель «лучше» другой. Интереснее другое: GPT-5.4 удерживает около 0.7 F1 alignment даже при минимальном контексте. То есть модель способна довольно точно угадать направление вывода, когда на входе ещё мало деталей.

Для programmatic и adtech это полезный сигнал по трем причинам.

Во-первых, AI Search и GEO всё сильнее завязаны не только на выбор модели, но и на подачу материала. Если система получает сжатый, но логично структурированный текст, она уже может корректно восстановить смысл и использовать его в ответе.

Во-вторых, в технических темах — privacy, measurement, supply path, identity — выигрывают не самые длинные материалы, а те, где тезис быстро подтверждается фактурой. Для алгоритма это снижает риск «додумывания» и повышает шанс, что ваш контент попадёт в нужный ответный фрагмент.

В-третьих, это аргумент в пользу более аккуратной редакционной архитектуры. Не перегружать текст вступлением, раньше давать определение, сразу показывать связь между проблемой и выводом, держать терминологию стабильной.

Итог для маркетинг-директора простой: в AI-поиске конкурирует не только экспертность, но и плотность смысла. Короткий, точный и хорошо собранный материал может обойти более длинный, если он быстрее «схватывается» моделью и не теряет основной вывод по дороге.
Почему в programmatic дообучение ломает систему, а не только улучшает её

В свежем исследовании на Qwen2.5-3B-Instruct сравнили два подхода к дообучению: supervised fine-tuning и reinforcement learning. Вывод полезен не только для AI-команд, но и для всех, кто строит рекламную инфраструктуру на моделях и автоматизации.

SFT быстрее подгоняет модель под новую задачу, но сильнее вмешивается в уже сложившиеся внутренние связи. Проще говоря, она охотнее «перепрошивает» поведение целиком. RL ведёт себя осторожнее: адаптация идёт медленнее, зато базовые паттерны сохраняются лучше.

Для AdTech это особенно важно там, где модель не живёт в вакууме. В рекомендательных системах, генерации креативов, антифроде, классификации инвентаря и в слоях measurement любая потеря старого поведения может бить по стабильности. Сегодня модель точнее распознаёт новый формат, а завтра уже хуже держит прежние сценарии, на которых строилась часть пайплайна.

Авторы предложили ещё и метрику differential circuit vulnerability — она показывает, какие внутренние узлы модели деградируют после fine-tuning. Для индустрии это полезная рамка: оценивать не только итоговый score, но и то, насколько дообучение разрушает рабочую архитектуру внутри.

Практический вывод простой: если модель встроена в production-цепочку, где важны privacy, воспроизводимость и стабильный supply path решений, агрессивное SFT может быть опаснее, чем кажется. Иногда лучше чуть медленнее адаптироваться, чем получить систему, которая красиво отвечает на новый запрос, но теряет устойчивость на старых.
Массовый арбитраж против Google Ads: что это значит для рекламного рынка

В США юрфирма Keller Postman пытается запустить массовый арбитраж против Google в интересах компаний, которые покупали рекламу через платформу с 2016 года. Суть претензий — не в обычных жалобах на дорогой клик, а в предполагаемых переплатах за размещение и в том, как эти расходы были сформированы внутри рекламной экосистемы.

Почему это важно не только для юристов, но и для AdTech-рынка. Когда спор касается не отдельного аккаунта, а модели ценообразования крупнейшей платформы, разговор быстро уходит из плоскости «почему вырос CPC» в сторону более неудобных вопросов: как считается итоговая стоимость показа, где проходит граница между аукционной динамикой и рыночной властью, и насколько прозрачно для рекламодателя устроена цепочка закупки.

Отдельный интерес здесь вызывает масштаб. Если в публичном поле звучат оценки на сотни миллиардов долларов рекламных расходов, это автоматически делает кейс не локальным конфликтом, а потенциальным индикатором накопленного недоверия к измерению и биллингу в больших закрытых платформах.

Для маркетинг-директоров и закупщиков это напоминание о старой проблеме: рост затрат нельзя анализировать только на уровне медиаплана. Нужны сопоставимые данные по аукциону, логике атрибуции, комиссии и качеству инвентаря. Чем меньше прозрачности в supply path, тем легче спор из операционного превращается в юридический.

Если подобные процессы получат развитие, рынок снова будет обсуждать не только performance, но и вопрос, где заканчивается эффективность платформы и начинается спор о справедливости цены.
Почему один и тот же AI-компонент ломает переносимость результатов между задачами

Недавний эксперимент с архитектурой для анализа EEG-сигналов показал проблему, которая давно знакома AdTech и MarTech-командам: локальная оптимизация редко гарантирует стабильный результат в другой среде.

Исследователи сравнили несколько вариантов positional encoding — механизма, который помогает модели учитывать положение и структуру данных. Выяснилось, что схема, дававшая лучший результат в одной задаче, заметно теряла эффективность в другой. При этом более «универсальные» подходы не всегда становились лидерами по отдельным метрикам, зато показывали более предсказуемое поведение между сценариями.

Для специалистов по programmatic это хороший пример того, почему нельзя оценивать модель, алгоритм или источник данных по одному тесту. Мы регулярно сталкиваемся с похожей ситуацией в измерениях и оптимизации закупки трафика:

— модель атрибуции отлично работает на одном типе кампаний и начинает ошибаться после смены аудитории;
— алгоритм прогнозирования конверсий показывает сильный результат на исторических данных, но теряет точность после изменений в privacy-среде;
— DSP или optimisation layer выигрывают в одном наборе KPI, но ухудшают качество инвентаря или устойчивость закупки в долгосрочной перспективе.

Главный вывод не связан с EEG как таковым. Он касается методологии оценки любых foundation-моделей и ML-компонентов. Если система проверена только на одной задаче, одной выборке или одном наборе метрик, мы знаем лишь её локальный максимум. Для понимания реальной надёжности важнее смотреть на переносимость результатов между разными сценариями, чем на рекордное значение в отдельном бенчмарке.

В эпоху privacy-ограничений и фрагментации данных именно устойчивость модели к смене условий становится более ценным свойством, чем лидерство в одной таблице результатов.
Почему AI Search скоро перестанет довольствоваться «правильным ответом»

Новое исследование сравнило поведение крупных языковых моделей с человеческими ценностными установками на массиве более чем из пяти миллионов вопросов. Интересно здесь не само совпадение результатов, а то, что модели начинают воспроизводить логику выбора людей, а не только статистически собранный текст.

Для рынка AdTech это гораздо важнее, чем может показаться на первый взгляд. Сегодня многие системы измерения и прогнозирования опираются на усреднённые поведенческие сигналы: клики, просмотры, конверсии. Но если модели всё лучше отражают структуру человеческих предпочтений, их можно использовать для более сложных задач — от моделирования аудиторий до оценки реакции пользователей на разные сценарии коммуникации.

Отдельного внимания заслуживает вывод о том, что добавление распределений человеческих ценностей повышает качество популяционных симуляций. По сути, речь идёт о переходе от абстрактного «среднего пользователя» к моделированию групп с разной мотивацией и разными критериями выбора.

Для экосистемы поиска это ещё один сигнал. AI Search постепенно смещается от извлечения фактов к интерпретации намерений. Когда модель способна учитывать конфликт интересов, компромиссы и причины принятия решений, преимущество получают материалы, которые объясняют контекст, а не просто перечисляют ответы.

Есть и практический вывод для measurement-команд. Тестирование контента, рекламных сообщений и поисковой видимости становится менее зависимым от проверки фактической корректности. Всё большее значение приобретают сценарии поведения: как пользователь сравнивает варианты, что считает риском, какие аргументы воспринимает как убедительные.

Если этот тренд сохранится, следующая конкуренция в цифровой рекламе развернётся не вокруг объёма данных, а вокруг качества моделей, способных объяснять и прогнозировать человеческий выбор. Именно там сегодня начинает формироваться новое преимущество в programmatic и AI-driven media.
Как дообучение меняет «поведение» модели и почему это важно для AdTech

В исследовании на Qwen2.5-3B-Instruct сравнили два подхода к дообучению и посмотрели не только на качество ответа, но и на то, как меняется внутренняя архитектура модели. Для этого авторы ввели метрику differential circuit vulnerability — она показывает, какие attention-head и связанные с ними цепочки сильнее всего деградируют после адаптации.

Вывод получился практичный: supervised fine-tuning быстрее подгоняет модель под новую задачу, но заметнее ломает уже существующие механизмы. Проще говоря, она начинает лучше отвечать на узкий набор запросов, но ценой большего забывания прежнего поведения. Reinforcement learning, наоборот, медленнее перестраивает ответы, зато лучше сохраняет исходную «базовую схему».

Для рынка programmatic и AdTech это хороший метафорический тест на устойчивость системы. Когда вы меняете логику bid optimization, rules engine, классификацию инвентаря или слой измерения, важно не только добиться локального улучшения, но и не разрушить уже работающие контуры: атрибуцию, pacing, частотный контроль, brand safety-сигналы и согласованность отчётности.

То же относится и к AI-системам в медиабаинге. Если модель используется для генерации, классификации или поддержки закупки, тип адаптации влияет на предсказуемость результата. Слишком агрессивная подстройка может дать краткосрочный выигрыш, но ухудшить стабильность на длинной дистанции — а в закупке это обычно дороже, чем кажется.

Именно поэтому при оценке AI-решений в рекламном стеке стоит смотреть не только на метрики качества, но и на то, как решение ведёт себя после дообучения: сохраняет ли базовую логику, не расползаются ли ответы, не деградируют ли соседние сценарии.

Исследование, кстати, опубликовано с кодом — и оно хорошо напоминает: в AdTech побеждает не самая «умная» модель, а та, которая умеет меняться без потери устойчивости.
Supply Path Optimization в малых GEO: уроки почтовой модели

Когда экономика классического банковского отделения в сельском районе перестаёт сходиться, банки ищут альтернативу. На Intersect by Diebold Nixdorf в Каннах прозвучало: post offices становятся тем самым каналом, который позволяет сохранить физическое присутствие без неподъёмного cost-to-serve. Почтовая сеть берёт на себя платёжную инженерию, выдачу наличных, консультации — и делает это дешевле, чем собственный филиал банка.

Для adtech-рынка это прямая иллюстрация supply path optimization на практике. В программатик мы часто оказываемся в похожей ловушке: пытаемся доставить инвентарь до аудитории в малом GEO через премиальные SSP или открытый auction, не замечая, что экономика каждой сделки уходит в минус. Плата за вход, комиссии биддера, cost-per-mile доставки креатива — всё это складывается в cost-to-serve, который для аудитории с низкой LTV становится фатальным.

Аналог «почтового отделения» в digital — это direct deal с локальным издателем, private marketplace с региональным inventory или даже owned & operated каналы, которые не проходят через цепочку посредников. Они не дают премиум-окружения и не блещут viewability, но их price per mille — на уровне выживаемости кампании в регионе.

Банки переложили часть операционной нагрузки на почту, сохранив контроль над продуктом. В adtech то же самое: мы можем отдать «розничную» дистрибуцию рекламы в более дешёвые сети (long-tail publisher, programmatic direct с fixed CPM), а премиум-инвентарь оставить для high-margin кампаний. Вопрос не «нужен ли офлайн» — вопрос, какой слой доступа выдерживает маржинальность.

Модель, которую банки только начали копировать, в программатик уже работает — но далеко не все её грамотно нарезают. Присмотритесь к supply chain для малых гео: если cost-to-serve съедает больше 30% бюджета, пора искать свой «почтовый канал».
Airflow 3 в продакшене: как строят orchestration с AI

Airflow 3 отмечает почти год с момента релиза, и за это время проект получил широкое распространение — десятки тысяч организаций используют его для автоматизации рабочих процессов. Для команд, которые занимаются performance-маркетингом и медиа-байингом, интерес представляет не сам движок, а то, как поверх него строят слой умной оркестрации.

В частности, важно понимать, где и как можно подключать «человеческий контроль» (human-in-the-loop) и какие задачи реально делегировать автоматическим агентам на базе AI — от проверки креативов до ежедневной отчетности. Анализируя DAG’и в продакшене, а не на демо, можно увидеть типичные точки отказа: триггеры, таски или уровни подтверждения.

Примерно такие вопросы обсуждаются на AMA от Astronomer, компании, которая сопровождает коммерческую версию Airflow. Для практикующих команд это шанс сравнить подходы к автоматизации: где агенты помогают без вмешательства человека, а где необходим контроль.

Если у вас уже есть workflow на Airflow, стоит взглянуть на опыт коллег и оценить, какие шаги вашей оркестрации можно улучшить с AI, а где автономность пока ограничена. В этом и ценность таких сессий: конкретные решения и узкие места, а не общие презентации возможностей.

Продолжительность и частота обновлений Airflow, а также масштабы внедрения, показывают, что грамотная интеграция AI в существующие DAG’и становится одним из ключевых трендов для тех, кто строит автоматизацию маркетинга и медиа-байинга.
Позиционные кодировки и контекст: почему один подход не работает везде

Исследование на модели CBraMod для обработки EEG-сигналов выявило важный принцип, актуальный далеко за пределами нейротехнологий. Учёные сравнили пять типов positional encoding и обнаружили, что эффективность одного и того же технического решения сильно зависит от задачи. Например, Spherical Positional Encoding хорошо справляется с классификацией двигательных образов, но слабо работает в распознавании эмоций. В то же время Asymmetric Conditional Positional Encoding демонстрирует более сбалансированную производительность.

Для adtech-экосистемы это метафора масштабом: универсальных решений не существует. То, что работает в одном сегменте — например, в таргетинге по поведению — может провалиться в другом, скажем, в контекстной или интент-ориентированной выдаче. Особенно это касается AI-компонентов в programmatic-цепочках: от ранжирования до генерации креативов. Вывод для практиков — нельзя полагаться на усреднённые метрики. Необходимо тестировать стратегии по типам запросов, интентам и сценариям потребления. Только так можно избежать ситуации, когда система стабильна в целом, но теряет эффективность в ключевых сегментах. Это подчёркивает важность модульного подхода к настройке алгоритмов: гибкость и контекстная адаптация становятся критическими факторами.

Для соседнего контекста загляни в @FraudQualitySignalsDeep
RL vs SFT: как методы дообучения влияют на стабильность AI-выдачи

Новое исследование на модели Qwen2.5-3B-Instruct сравнило reinforcement learning (RL) и supervised fine-tuning (SFT) для научного Q&A. Введена метрика differential circuit vulnerability — она показывает, насколько схема модели деградирует после дообучения. Результаты: SFT быстрее подгоняет модель под целевую задачу, но при этом сильнее разрушает исходные нейронные цепи и ведёт к большему забыванию. RL сохраняет большую часть базовой схемы, но адаптируется медленнее. Для мира AI Search и ChatGPT Search это важный сигнал. Модели, обученные агрессивным SFT, могут быстрее менять ответы под новые запросы, но их ответы больше отклоняются от базовой логики. Для контент-маркетологов и медиабайеров это означает, что стабильность AI-выдачи для их контента может зависеть от того, каким методом была дообучена модель поисковика. Если в AI Overviews используются модели с RL, выдача будет более консервативной и предсказуемой. Если преобладает SFT — возможны резкие сдвиги. Код проекта открыт на GitHub. Маркетологам стоит учитывать эту динамику при построении стратегии контента под AI-поиск: нужно закладываться на разные сценарии поведения моделей.

Связанная тема раскрывается в @ForgeCpaMarketNotes
SFT vs RL в дообучении LLM: скорость против стабильности

Исследование на модели Qwen2.5-3B-Instruct показало, что выбор метода дообучения напрямую влияет на устойчивость архитектуры. При работе с scientific QA выявился чёткий компромисс: supervised fine-tuning (SFT) быстрее адаптирует модель под новую задачу, но сильнее разрушает существующие когнитивные цепочки. Reinforcement learning (RL), напротив, сохраняет больше базовой логики, но требует больше времени и данных.

Авторы ввели метрику differential circuit vulnerability — оценку на уровне attention heads, которая показывает, насколько fine-tuning повреждает исходные механизмы рассуждений. Это важно для систем, где критична согласованность: например, в AI Overviews или ChatGPT Search, где пользователь ожидает стабильного поведения модели.

Для продуктов, использующих дообученные LLM в выдаче, это означает необходимость двойного контроля. Оценка должна идти не только по качеству ответов на целевом датасете, но и по сохранности базовых паттернов — например, способности к логическому выводу вне новой тематики. Игнорирование этого может привести к эффекту «переобученного узкого специалиста», который хорошо отвечает на узкие вопросы, но теряется в смежных.

Код исследования опубликован на GitHub, что даёт возможность протестировать подход на своих задачах. Для adtech-команд, работающих с кастомными моделями, это методологический ориентир: баланс между адаптацией и целостностью нужно измерять, а не угадывать.
Регуляторные барьеры в travel-нише: как сбор данных влияет на воронку продаж

Дискуссии вокруг ужесточения правил въезда в США для участников Visa Waiver Program — это не просто политическая повестка, а серьезный вызов для performance-маркетинга. Требование раскрывать историю соцсетей при въезде в страну создает существенное трение на пути пользователя (user friction), что неизбежно отражается на конверсии в travel и смежных вертикалях.

Когда мы анализируем подобные рыночные риски, важно учитывать их влияние на психологию потребителя. Любое усложнение процедуры сбора данных на этапе оформления заявки или бронирования увеличивает процент отказов (drop-off rate). Кейс с падением посещаемости Лас-Вегаса служит наглядным примером того, как административные барьеры могут влиять на рыночные показатели в масштабе целых индустрий.

Для маркетологов, работающих с глобальными рынками, это сигнал к пересмотру consent-логики и структуры воронок. Если ваша аудитория сталкивается с дополнительными барьерами при прохождении пути, стандартные подходы к оптимизации конверсии перестают работать. Необходим более тонкий подход к коммуникации и сбору данных, чтобы минимизировать стресс пользователя. В текущих реалиях доверие к бренду и прозрачность в вопросах обработки персональных данных становятся не просто юридическим требованием, а инструментом удержания аудитории в условиях растущего регуляторного давления.

По этой же логике полезен @IgamingMarketWatchResearch4
Почему серверная атрибуция чаще ломается на правах доступа, чем на интеграциях

Когда в компании возникают проблемы с качеством атрибуции в Meta, первое подозрение обычно падает на пиксель, серверные события или настройки трекера. Однако на практике значительная часть ошибок появляется гораздо раньше — на уровне структуры активов и управления доступами.

Типичная ситуация выглядит знакомо многим командам. Пиксель установлен, события передаются через серверную интеграцию, данные поступают в систему аналитики, но отчёты показывают неполную картину. Конверсии учитываются не полностью, дедупликация работает нестабильно, а показатели качества совпадения данных не соответствуют ожиданиям.

Причина часто кроется в организационном слое инфраструктуры. Неверно связанные источники данных, отсутствующие разрешения для рекламных кабинетов, путаница между партнёрскими и внутренними доступами способны создать больше проблем, чем ошибки в коде. В результате разные компоненты экосистемы формально существуют, но фактически работают изолированно друг от друга.

Для руководителей маркетинга это важный управленческий вывод. Развитие серверной атрибуции требует не только технической экспертизы, но и контроля над архитектурой аккаунтов. Чем больше агентств, подрядчиков, брендов и бизнес-юнитов участвуют в работе, тем выше вероятность накопления скрытых проблем с правами доступа.

Поэтому аудит инфраструктуры стоит проводить не только на уровне передачи событий. Не менее важно регулярно проверять связи между источниками данных, рекламными активами и ролями пользователей. Во многих случаях именно такая ревизия позволяет устранить расхождения в отчётности быстрее, чем очередная доработка трекера или серверного шлюза.
Единичные сигналы не равны тренду: чему учит кейс с рекламой в Discover

На рекламном рынке регулярно возникают ситуации, когда один необычный показ быстро превращается в масштабную теорию о переменах в отрасли. Именно поэтому специалистам по programmatic важно разделять наблюдаемый факт и выводы, которые из него пытаются сделать.

Недавнее появление рекламы продукта Яндекса в ленте Discover привлекло внимание именно по этой причине. Само размещение заслуживает фиксации как рыночное событие: оно показывает, что русскоязычная аудитория продолжает присутствовать в различных зарубежных цифровых экосистемах и может контактировать с рекламой за пределами привычного локального инвентаря.

Однако на этом этапе количество подтверждённых данных ограничено. Один или несколько зафиксированных показов не позволяют судить о масштабах кампании, доступности канала для широкого круга рекламодателей или изменении долгосрочной стратегии участников рынка.

Для маркетинг-директоров здесь интереснее другое наблюдение. Фрагментация пользовательского пути становится всё заметнее. Аудитория может одновременно использовать локальные сервисы, международные платформы и различные инструменты доступа к контенту. В результате традиционные представления о том, где именно находится пользователь и через какие интерфейсы он потребляет информацию, становятся менее надёжными.

С точки зрения измерений и медиапланирования это очередное напоминание о необходимости работать с подтверждёнными данными, а не с предположениями. Отдельный сигнал может быть любопытным индикатором, но превращать его в доказательство масштабного тренда преждевременно.

В programmatic именно способность отделять наблюдение от интерпретации остаётся одним из ключевых навыков аналитика.

Похожий разбор есть в @VectorSweepstakesDatingMarkets
Языковые модели и накопление контекста

Недавнее исследование показало: современные языковые модели не ведут пошаговое состояние по мере обработки текста. Вместо этого они собирают нужный контекст к моменту последнего токена запроса. Особое внимание уделено операции REMOVE, которая реализуется через хрупкий глобальный тег, вызывающий типовые сбои. Для AI Search и SEO это важный сигнал: длинные цепочки инструкций и уточнения фактов могут работать иначе, чем ожидается, если модель не «держит» информацию последовательно. Для работы с контентом и промптами это значит: структурированные ответы, явные сущности и короткие логические связи дают более надёжный результат, чем попытки растянуть логику на длинный текст.
Как LLM учатся ценностям и что это значит для programmatic-контента

Исследование с 5 миллионами вопросов показало: современные языковые модели всё точнее имитируют структуру человеческих ценностей и поведенческих паттернов. Авторы сравнили ценностные оси у LLM и людей и зафиксировали сильное согласие между ними. Отдельно отмечено, что учёт распределений человеческих ценностей улучшает популяционные симуляции на базе моделей.

Для programmatic-рекламы и AI Search это принципиальный сдвиг. Если раньше контент оптимизировали под семантику ключей, то теперь в приоритете формулировки, сценарии и поведенческие маркеры, которые совпадают с логикой человеческого выбора. Модели не просто находят совпадения слов — они ранжируют по смыслу и ценностной близости.

Вывод для стратегий контента: смотреть не только на ключи, но и на то, как текст выглядит в контексте решений пользователя. Для supply path это означает, что AI-источники будут отдавать предпочтение материалам, построенным вокруг намерений и ценностей, а не просто релевантных терминов. Это меняет подход к созданию контента под programmatic-закупки и органическую выдачу в AI-среде.
Почему узкие бенчмарки полезнее общих оценок

CrystalXRD-Bench интересен не столько самой кристаллографией, сколько форматом проверки. Авторы собрали 250 примеров из 10 публичных баз и попросили модели восстановить полный набор HKL, отвечающий за самый сильный пик в XRD-паттерне. То есть задача заведомо структурная: рядом есть изображение, текстовое описание и химическая формула, а оценка идёт по тому, насколько модель действительно связывает эти слои.

В тесте участвовали семь vision-language-моделей. Лучшая — GPT-5.4 с Jaccard 0.5888 и exact-match 37.6%. Остальные в основном остались ниже 0.50 по Jaccard. Это типичная картина для узких бенчмарков: общая уверенность модели ещё не означает, что она стабильно читает сложный визуальный сигнал. Она может хорошо отвечать в «среднем», но начинать ошибаться на форматах, где нужна не генерация текста, а точное сопоставление структур.

Для программатика и measurement это полезная аналогия. Визуальные и структурные данные в отчётности, креативах и аналитике стоит тестировать отдельно от общего качества модели. Иначе легко переоценить систему по усреднённой метрике и недооценить ошибки именно в тех случаях, где бизнес-решение принимается по одному изображению или одной таблице.
Гигиена доступа: зачем переходить на read-only в Ad Manager API

Google Ad Manager наконец-то внедрил полноценный read-only OAuth scope, что стало важным шагом для безопасности в AdTech-интеграциях. Теперь для аналитических инструментов, BI-систем и дашбордов можно запрашивать доступ, исключающий возможность внесения правок в кампании или настройки аккаунта. Это решение закрывает давнюю проблему, когда интеграции, требующие лишь получения статистики, по ошибке получали права на запись.

Важный нюанс для тех, кто работает с легаси-системами: эта опция актуальна только для актуального Ad Manager API. Старый SOAP API по-прежнему требует «полного доступа» (full-access scope), что создает лишние риски безопасности. Использование прав с избытком — это классическая уязвимость, которую часто игнорируют до первого инцидента с непреднамеренным изменением настроек. Для команд, масштабирующих аналитические решения, переход на read-only доступ должен стать обязательным стандартом. Это базовая гигиена, которая минимизирует человеческий фактор и предотвращает случайные сбои в работе рекламных кампаний, особенно если доступ к данным имеют внешние подрядчики или автоматизированные системы.

Связанная тема раскрывается в @VerticalWatchSignal
Эволюция обучения моделей: RL vs SFT в контексте AdTech-решений

Вопрос выбора метода дообучения LLM перестал быть чисто академическим и перешел в плоскость прикладной инженерии. Сравнение Reinforcement Learning (RL) и Supervised Fine-Tuning (SFT) на примере модели Qwen2.5-3B-Instruct при выполнении научно-ориентированных задач дает важную пищу для размышлений специалистам, работающим с AI-генерацией контента и поисковыми движками.

Исследователи ввели метрику «дифференциальной уязвимости контуров» (differential circuit vulnerability), которая наглядно показывает, как меняется внутренняя архитектура модели при дообучении. Вывод однозначен: SFT демонстрирует высокую адаптивность к узким задачам, но ценой этого становится ускоренная деградация базовых навыков и размытие исходных паттернов. В то же время RL действует консервативнее, сохраняя стабильность базовых «контуров» модели, хотя и требует больше времени на адаптацию.

Для разработки AI-ориентированных продуктов, таких как AI Overviews или семантический поиск, этот баланс критичен. Если задача требует высокой предсказуемости и устойчивости ответов, RL выглядит предпочтительнее. SFT же несет риски «забывания» контекста, что может негативно сказаться на качестве ответов в смежных с обучением областях. Инженерам, внедряющим LLM в рекламные стеки, стоит учитывать: скорость специализации модели часто прямо пропорциональна риску потери ее базовой надежности.

По этой же логике полезен @IgamingMarketWatchBrief