Instants от Meta: новый слой приватного общения и потенциальный сигнал для UA
Meta продолжает экспериментировать с форматом приватного контента внутри своей экосистемы. Новый продукт Instants ориентирован на быстрый обмен фотографиями между близкими контактами: контент открывается один раз, имеет ограниченный срок жизни и дополнительно защищён от распространения через скриншоты и запись экрана. При этом функция развивается сразу в двух плоскостях — как часть Instagram и как отдельное приложение на базе существующей учётной записи.
Для рынка programmatic это интересно не столько самой механикой обмена контентом, сколько продуктовой стратегией платформы. Meta регулярно тестирует отдельные сценарии потребления, выделяя их в самостоятельные точки взаимодействия. Если сервис начнёт получать собственное продвижение и пользовательскую базу, появится ещё одна поверхность для формирования событий, аудиторных сигналов и, потенциально, установочных кампаний.
Пока данных о масштабе распространения, удержании пользователей и влиянии на рекламную экосистему немного. Однако сам запуск показывает тренд на усиление приватных коммуникаций и сокращение времени жизни контента. Для маркетинг-директоров это дополнительное напоминание: всё больше пользовательской активности уходит из публичных лент в закрытые пространства, где традиционные сигналы измерения становятся менее доступными. В таких условиях возрастает значение агрегированных метрик, моделирования конверсий и корректной работы с first-party данными.
Связанная тема раскрывается в @DeskIgamingMarketWatch
Meta продолжает экспериментировать с форматом приватного контента внутри своей экосистемы. Новый продукт Instants ориентирован на быстрый обмен фотографиями между близкими контактами: контент открывается один раз, имеет ограниченный срок жизни и дополнительно защищён от распространения через скриншоты и запись экрана. При этом функция развивается сразу в двух плоскостях — как часть Instagram и как отдельное приложение на базе существующей учётной записи.
Для рынка programmatic это интересно не столько самой механикой обмена контентом, сколько продуктовой стратегией платформы. Meta регулярно тестирует отдельные сценарии потребления, выделяя их в самостоятельные точки взаимодействия. Если сервис начнёт получать собственное продвижение и пользовательскую базу, появится ещё одна поверхность для формирования событий, аудиторных сигналов и, потенциально, установочных кампаний.
Пока данных о масштабе распространения, удержании пользователей и влиянии на рекламную экосистему немного. Однако сам запуск показывает тренд на усиление приватных коммуникаций и сокращение времени жизни контента. Для маркетинг-директоров это дополнительное напоминание: всё больше пользовательской активности уходит из публичных лент в закрытые пространства, где традиционные сигналы измерения становятся менее доступными. В таких условиях возрастает значение агрегированных метрик, моделирования конверсий и корректной работы с first-party данными.
Связанная тема раскрывается в @DeskIgamingMarketWatch
Moloco и iOS-трафик: что обсудят сегодня в прямом эфире
Сегодня в 17:00 по московскому времени запланирована трансляция от Moloco, посвящённая работе с iOS-приложениями в условиях меняющейся экосистемы. Это не технический апдейт, а скорее операционный разбор текущих реалий для UA- и ad-ops-команд. В фокусе — практические аспекты настройки кампаний, управление бюджетами и адаптация к росту стоимости in-app inventory.
Ожидаемые темы: стратегии запуска приложений на iOS, обновления в подходах Moloco к таргетингу и оптимизации, реакция на дефицит качественного трафика и пересмотр параметров кампаний после изменений в системе. Особенно важно — как сегодня выстраивать настройки, чтобы не терять эффективность на фоне сокращения доступного охвата и роста цен.
Пока нет подтверждённых деталей по изменениям в API, логике биддинга или атрибуции, поэтому делать выводы о технических обновлениях стоит только после трансляции или официальных анонсов. Однако сам формат указывает на смещение фокуса: вендоры всё чаще делятся не просто продуктом, а контекстом его применения в реальных условиях. Для практиков это шанс увидеть, как адаптируются под privacy-ограничения не только технологии, но и процессы — от настройки до мониторинга эффективности.
Сегодня в 17:00 по московскому времени запланирована трансляция от Moloco, посвящённая работе с iOS-приложениями в условиях меняющейся экосистемы. Это не технический апдейт, а скорее операционный разбор текущих реалий для UA- и ad-ops-команд. В фокусе — практические аспекты настройки кампаний, управление бюджетами и адаптация к росту стоимости in-app inventory.
Ожидаемые темы: стратегии запуска приложений на iOS, обновления в подходах Moloco к таргетингу и оптимизации, реакция на дефицит качественного трафика и пересмотр параметров кампаний после изменений в системе. Особенно важно — как сегодня выстраивать настройки, чтобы не терять эффективность на фоне сокращения доступного охвата и роста цен.
Пока нет подтверждённых деталей по изменениям в API, логике биддинга или атрибуции, поэтому делать выводы о технических обновлениях стоит только после трансляции или официальных анонсов. Однако сам формат указывает на смещение фокуса: вендоры всё чаще делятся не просто продуктом, а контекстом его применения в реальных условиях. Для практиков это шанс увидеть, как адаптируются под privacy-ограничения не только технологии, но и процессы — от настройки до мониторинга эффективности.
Мультимодальные модели всё ещё путаются в сложных сигналах
На бенчмарке CrystalXRD-Bench, собранном из 10 публичных кристаллографических баз, проверяли, насколько vision-language модели умеют восстанавливать полный набор HKL для самого сильного пика на XRD-паттерне. В тесте участвовали 7 моделей, и лучший результат показала GPT-5.4: Jaccard 0.5888 при exact-match 37.6%. У шести из семи моделей показатель Jaccard оказался ниже 0.50.
Для AdTech это неплохая аналогия к тому, как работают сложные сигналы в programmatic: модель может уверенно выдавать правдоподобный ответ, но это не значит, что он пригоден для решений. Особенно если речь о privacy, measurement или supply path, где данные неполные, шумные и завязаны на несколько источников.
Практический вывод простой: в задачах с высокой ценой ошибки лучше держать рядом проверяемый источник фактов, а не опираться на один AI-ответ. Бенчмарки такого типа полезны не сами по себе, а как индикатор того, где автоматизация пока требует жёсткой валидации.
На бенчмарке CrystalXRD-Bench, собранном из 10 публичных кристаллографических баз, проверяли, насколько vision-language модели умеют восстанавливать полный набор HKL для самого сильного пика на XRD-паттерне. В тесте участвовали 7 моделей, и лучший результат показала GPT-5.4: Jaccard 0.5888 при exact-match 37.6%. У шести из семи моделей показатель Jaccard оказался ниже 0.50.
Для AdTech это неплохая аналогия к тому, как работают сложные сигналы в programmatic: модель может уверенно выдавать правдоподобный ответ, но это не значит, что он пригоден для решений. Особенно если речь о privacy, measurement или supply path, где данные неполные, шумные и завязаны на несколько источников.
Практический вывод простой: в задачах с высокой ценой ошибки лучше держать рядом проверяемый источник фактов, а не опираться на один AI-ответ. Бенчмарки такого типа полезны не сами по себе, а как индикатор того, где автоматизация пока требует жёсткой валидации.
Benchмарки для извлечения данных из изображений
CrystalXRD-Bench представил 250 образцов из 10 публичных кристаллографических баз для задачи восстановления полного набора HKL, формирующих основной пик XRD-паттерна. В тестировании участвовали семь vision-language моделей, где лидером оказался GPT-5.4 с Jaccard 0.5888 и точным совпадением 37,6%. Остальные модели показали Jaccard ниже 0,50. Для специалистов по SEO и AI Search это важный сигнал: генеративные модели пока делают ошибки на узких визуально-текстовых задачах. Практическое следствие — при работе с научными графиками и схемами стоит сочетать обработку изображений и текста и проверять данные на первичных источниках, а не полагаться только на генерацию модели.
CrystalXRD-Bench представил 250 образцов из 10 публичных кристаллографических баз для задачи восстановления полного набора HKL, формирующих основной пик XRD-паттерна. В тестировании участвовали семь vision-language моделей, где лидером оказался GPT-5.4 с Jaccard 0.5888 и точным совпадением 37,6%. Остальные модели показали Jaccard ниже 0,50. Для специалистов по SEO и AI Search это важный сигнал: генеративные модели пока делают ошибки на узких визуально-текстовых задачах. Практическое следствие — при работе с научными графиками и схемами стоит сочетать обработку изображений и текста и проверять данные на первичных источниках, а не полагаться только на генерацию модели.
Метрика differential circuit vulnerability — инструмент для оценки стабильности дообучения LLM
Исследователи из команды Qwen2.5-3B-Instruct предложили новую метрику — differential circuit vulnerability. На уровне attention heads она показывает, насколько fine-tuning деградирует исходные схемы модели. Сравнение двух методов дообучения — SFT и RL — дало чёткую картину: SFT быстрее адаптирует модель под задачу, но сильнее ломает circuits и ведёт к forgetting. RL сохраняет базовую схему, но адаптируется медленнее.
Для AI Overviews и ChatGPT Search это важный инструмент оценки. Агрессивный SFT может дать нужный стиль ответа, но сделает модель нестабильной на соседних запросах и перефразах. Метрика позволяет ещё до развёртывания проверить, насколько новое дообучение повлияло на общую логику модели.
Код проекта открыт на GitHub — это готовая утилита для тех, кто настраивает LLM под контентные пайплайны. Для adtech-специалистов это способ контролировать качество и стабильность AI-генерации, особенно при масштабировании. Вместо того чтобы полагаться только на финальные метрики, можно заглянуть «под капот» и увидеть, не потеряла ли модель исходное понимание.
Исследователи из команды Qwen2.5-3B-Instruct предложили новую метрику — differential circuit vulnerability. На уровне attention heads она показывает, насколько fine-tuning деградирует исходные схемы модели. Сравнение двух методов дообучения — SFT и RL — дало чёткую картину: SFT быстрее адаптирует модель под задачу, но сильнее ломает circuits и ведёт к forgetting. RL сохраняет базовую схему, но адаптируется медленнее.
Для AI Overviews и ChatGPT Search это важный инструмент оценки. Агрессивный SFT может дать нужный стиль ответа, но сделает модель нестабильной на соседних запросах и перефразах. Метрика позволяет ещё до развёртывания проверить, насколько новое дообучение повлияло на общую логику модели.
Код проекта открыт на GitHub — это готовая утилита для тех, кто настраивает LLM под контентные пайплайны. Для adtech-специалистов это способ контролировать качество и стабильность AI-генерации, особенно при масштабировании. Вместо того чтобы полагаться только на финальные метрики, можно заглянуть «под капот» и увидеть, не потеряла ли модель исходное понимание.
Ahrefs против AI: как ChatGPT почти не даёт трафика, но открывает серую зону
Масштабное исследование Ahrefs: миллиард точек данных, 14 отчётов, один главный вывод — ChatGPT генерирует в 190 раз меньше переходов на сайты по сравнению с Google. Почти треть страниц, которые AI регулярно цитирует, вообще не появляются в классическом поиске. Schema-разметка для AI Overviews и ChatGPT не даёт никакого эффекта.
Для тех, кто в AdTech управляет supply path и измеряет эффективность, это сигнал не гнаться за AI-овервью через SEO. Оптимизация контента под ChatGPT — игра без кликов. Но появляется новый грей-зона: страницы, невидимые для Google, но видимые для AI. Если вы работаете с лендингами и аукционами, стоит тестировать размещения, которые AI подхватывает, а классический поиск игнорирует. Рынок там пока пустой.
Инструментарий для отслеживания таких страниц только формируется. Пока что анализ ссылочной массы и паттернов цитирования AI — поле для ручной разведки. Ahrefs дал данные, но реальный инструментарий для работы с этим сегментом ещё предстоит собрать.
Масштабное исследование Ahrefs: миллиард точек данных, 14 отчётов, один главный вывод — ChatGPT генерирует в 190 раз меньше переходов на сайты по сравнению с Google. Почти треть страниц, которые AI регулярно цитирует, вообще не появляются в классическом поиске. Schema-разметка для AI Overviews и ChatGPT не даёт никакого эффекта.
Для тех, кто в AdTech управляет supply path и измеряет эффективность, это сигнал не гнаться за AI-овервью через SEO. Оптимизация контента под ChatGPT — игра без кликов. Но появляется новый грей-зона: страницы, невидимые для Google, но видимые для AI. Если вы работаете с лендингами и аукционами, стоит тестировать размещения, которые AI подхватывает, а классический поиск игнорирует. Рынок там пока пустой.
Инструментарий для отслеживания таких страниц только формируется. Пока что анализ ссылочной массы и паттернов цитирования AI — поле для ручной разведки. Ahrefs дал данные, но реальный инструментарий для работы с этим сегментом ещё предстоит собрать.
Creative study не равен атрибуции: где аналитики чаще всего делают лишний вывод
Reddit опубликовал исследование по 150 тысячам in-feed объявлений от 7 тысяч рекламодателей и попытался ответить на простой вопрос: какие креативные решения связаны с ростом конверсий. Для performance-команд здесь важен не сам вывод, а границы его применимости.
Это не история про CAPI, sGTM или server-side дедупликацию. Исследование смотрит на креатив внутри платформы, а не на всю цепочку измерения. Без прозрачной методологии, состава факторов и понимания, как именно Reddit считал uplift, такой материал нельзя напрямую переносить в медиамикс или attribution-модель.
Практический смысл в другом: подобные отчёты хороши как источник гипотез для creative testing. Но если у вас расходятся CAPI, Pixel и GA4, то любой «рост конверсий» может оказаться смесью реального эффекта и потерь трекинга. Поэтому сначала — стабильная передача событий, event_id и дедупликация, потом — выводы о креативе.
Для AdTech и measurement-команд это ещё одно напоминание: платформа может показать корреляцию, но не заменит собственную измерительную схему.
Reddit опубликовал исследование по 150 тысячам in-feed объявлений от 7 тысяч рекламодателей и попытался ответить на простой вопрос: какие креативные решения связаны с ростом конверсий. Для performance-команд здесь важен не сам вывод, а границы его применимости.
Это не история про CAPI, sGTM или server-side дедупликацию. Исследование смотрит на креатив внутри платформы, а не на всю цепочку измерения. Без прозрачной методологии, состава факторов и понимания, как именно Reddit считал uplift, такой материал нельзя напрямую переносить в медиамикс или attribution-модель.
Практический смысл в другом: подобные отчёты хороши как источник гипотез для creative testing. Но если у вас расходятся CAPI, Pixel и GA4, то любой «рост конверсий» может оказаться смесью реального эффекта и потерь трекинга. Поэтому сначала — стабильная передача событий, event_id и дедупликация, потом — выводы о креативе.
Для AdTech и measurement-команд это ещё одно напоминание: платформа может показать корреляцию, но не заменит собственную измерительную схему.
Universal Cart: новая архитектура агентской коммерции от Google
Google продолжает выстраивать экосистему агентской коммерции, представив Universal Cart — интеллектуальную корзину, интегрированную в поисковую выдачу и Gemini. Инструмент формально базируется на Universal Commerce Protocol (UCP) и меняет привычную воронку продаж, замыкая цикл от поиска товара до оформления покупки через Google Pay.
С точки зрения performance-маркетинга, мы наблюдаем сдвиг парадигмы: теперь точкой оптимизации становится не только клик или переход на сайт, но и момент принятия решения внутри интерфейса агента. Когда Gemini берет на себя поиск ценовых предложений и управление корзиной, рекламодатель сталкивается с вызовом прозрачности данных. Главный вопрос для нас — какие сигналы о поведении пользователя будут доступны в рамках UCP, а какие данные останутся «черным ящиком» Google.
Без глубокой интеграции с системами аналитики рекламодателя, агентская коммерция может превратиться в изолированную среду, где сложно отследить инкрементальность и реальную ценность конверсии. Для команд, работающих с close-loop аналитикой, это сигнал к пересмотру стратегий сбора данных: если путь пользователя к покупке сокращается внутри экосистемы платформы, нам необходимы новые инструменты для верификации attribution-моделей в условиях ограниченного доступа к пользовательским идентификаторам.
Google продолжает выстраивать экосистему агентской коммерции, представив Universal Cart — интеллектуальную корзину, интегрированную в поисковую выдачу и Gemini. Инструмент формально базируется на Universal Commerce Protocol (UCP) и меняет привычную воронку продаж, замыкая цикл от поиска товара до оформления покупки через Google Pay.
С точки зрения performance-маркетинга, мы наблюдаем сдвиг парадигмы: теперь точкой оптимизации становится не только клик или переход на сайт, но и момент принятия решения внутри интерфейса агента. Когда Gemini берет на себя поиск ценовых предложений и управление корзиной, рекламодатель сталкивается с вызовом прозрачности данных. Главный вопрос для нас — какие сигналы о поведении пользователя будут доступны в рамках UCP, а какие данные останутся «черным ящиком» Google.
Без глубокой интеграции с системами аналитики рекламодателя, агентская коммерция может превратиться в изолированную среду, где сложно отследить инкрементальность и реальную ценность конверсии. Для команд, работающих с close-loop аналитикой, это сигнал к пересмотру стратегий сбора данных: если путь пользователя к покупке сокращается внутри экосистемы платформы, нам необходимы новые инструменты для верификации attribution-моделей в условиях ограниченного доступа к пользовательским идентификаторам.
Когда агент масштабируется: уроки от Agentforce для команд, строящих маркетинговых ботов
Salesforce объявил, что Agentforce превысил $1 млрд годовой регулярной выручки. За 15 месяцев агент автономно обработал 4 млн обращений в каналах поддержки — вдвое больше, чем обработали люди. Для рынка это сигнал, что стадия «может ли агент работать в проде» уже пройдена для крупного enterprise.
Главный вопрос теперь — наблюдаемость. Когда агент ведёт миллионы диалогов, даже редкие ошибки становятся системной проблемой. Где теряется контекст? Как отследить сбой на длинной цепочке? Какие маршруты эскалации остаются у человека?
Для команд, строящих CRM-агентов или retention-агентов, именно эти кейсы стоит изучать. Метрики внедрения — только первая часть. Реальная ценность начинается с инструментов мониторинга, логирования и быстрого отката. Пока upstream инструменты наблюдаемости для LLM-агентов остаются нишевыми, но спрос на них растёт.
Урок Salesforce: сначала кажется, что проблема в том, чтобы агент работал. Потом — чтобы он работал стабильно на масштабе. Если вы проектируете маркетинговых агентов, закладывайте наблюдаемость с первого дня.
Salesforce объявил, что Agentforce превысил $1 млрд годовой регулярной выручки. За 15 месяцев агент автономно обработал 4 млн обращений в каналах поддержки — вдвое больше, чем обработали люди. Для рынка это сигнал, что стадия «может ли агент работать в проде» уже пройдена для крупного enterprise.
Главный вопрос теперь — наблюдаемость. Когда агент ведёт миллионы диалогов, даже редкие ошибки становятся системной проблемой. Где теряется контекст? Как отследить сбой на длинной цепочке? Какие маршруты эскалации остаются у человека?
Для команд, строящих CRM-агентов или retention-агентов, именно эти кейсы стоит изучать. Метрики внедрения — только первая часть. Реальная ценность начинается с инструментов мониторинга, логирования и быстрого отката. Пока upstream инструменты наблюдаемости для LLM-агентов остаются нишевыми, но спрос на них растёт.
Урок Salesforce: сначала кажется, что проблема в том, чтобы агент работал. Потом — чтобы он работал стабильно на масштабе. Если вы проектируете маркетинговых агентов, закладывайте наблюдаемость с первого дня.
Как не запутаться в B2B-конверсиях: проверка primary actions
Одна из частых ловушек в B2B PPC — уверенность, что рост MQL и SQL автоматически означает рост продаж. На практике leads могут стоять на месте, а total conversions расти за счёт добавления новых conversion actions, которые автоматически переводятся в primary. Алгоритм начинает оптимизироваться на «лёгкие» конверсии — отправку формы вместо реального контакта.
Решение лежит в инструментальной плоскости: пересмотрите primary actions. Разнесите лиды (MQL, SQL) и downstream-события (например, демо-звонок, оплата). Для value-based bidding передавайте данные только с фактом оплаты или подтверждённым offline-этапом. Offline conversion data теперь легко загружается и в Google Ads, и в Microsoft Ads, так что проверка CRM-качества перестала быть опцией.
Главный совет: если total conversions растут, а сквозная аналитика молчит — проверьте, какие события стали primary. Скорее всего, машина оптимизируется на то, что просто «удобно» измерять, а не на деньги.
Одна из частых ловушек в B2B PPC — уверенность, что рост MQL и SQL автоматически означает рост продаж. На практике leads могут стоять на месте, а total conversions расти за счёт добавления новых conversion actions, которые автоматически переводятся в primary. Алгоритм начинает оптимизироваться на «лёгкие» конверсии — отправку формы вместо реального контакта.
Решение лежит в инструментальной плоскости: пересмотрите primary actions. Разнесите лиды (MQL, SQL) и downstream-события (например, демо-звонок, оплата). Для value-based bidding передавайте данные только с фактом оплаты или подтверждённым offline-этапом. Offline conversion data теперь легко загружается и в Google Ads, и в Microsoft Ads, так что проверка CRM-качества перестала быть опцией.
Главный совет: если total conversions растут, а сквозная аналитика молчит — проверьте, какие события стали primary. Скорее всего, машина оптимизируется на то, что просто «удобно» измерять, а не на деньги.
Что показало исследование LLM о человеческих ценностях
Исследование, в котором более 5 миллионов вопросов прогнали через ведущие LLM на базе established psychological value theory, показало любопытную вещь: модели довольно близко воспроизводят человеческие ценностные структуры и связанное с ними поведение. Более того, если в симуляции добавить распределения человеческих ценностей, результаты становятся точнее.
Для рынка AI Search это важный сигнал. Генеративные модели уже не просто подбирают слова по вероятности — они всё лучше собирают ответы так, как это делает человек, опираясь на устойчивые паттерны выбора и оценки. А значит, контент, который совпадает с человеческой логикой решения задачи, может оказываться ближе к тому, как модель ранжирует, пересобирает и формирует ответ.
Для команд, которые строят контент под AI Overviews и другие генеративные интерфейсы, это ещё один аргумент в пользу работы не только с семантикой, но и с намерением, контекстом и структурой аргумента. Источник: https://arxiv.org/abs/2605.30036
Исследование, в котором более 5 миллионов вопросов прогнали через ведущие LLM на базе established psychological value theory, показало любопытную вещь: модели довольно близко воспроизводят человеческие ценностные структуры и связанное с ними поведение. Более того, если в симуляции добавить распределения человеческих ценностей, результаты становятся точнее.
Для рынка AI Search это важный сигнал. Генеративные модели уже не просто подбирают слова по вероятности — они всё лучше собирают ответы так, как это делает человек, опираясь на устойчивые паттерны выбора и оценки. А значит, контент, который совпадает с человеческой логикой решения задачи, может оказываться ближе к тому, как модель ранжирует, пересобирает и формирует ответ.
Для команд, которые строят контент под AI Overviews и другие генеративные интерфейсы, это ещё один аргумент в пользу работы не только с семантикой, но и с намерением, контекстом и структурой аргумента. Источник: https://arxiv.org/abs/2605.30036
arXiv.org
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
Large Language Models (LLMs) demonstrate a remarkable capacity to adopt different personas and roles; however, it remains unclear whether they can manifest behavior that adheres to a coherent,...
SFT и RL: почему разница важна для стабильности AI-поиска
Сравнение supervised fine-tuning и reinforcement learning в дообучении языковых моделей важно не только для ML-специалистов. Для рынка adtech и performance-маркетинга здесь есть прикладной вывод: способ дообучения влияет не только на точность ответа, но и на устойчивость поведения модели.
В одном из исследований на Qwen2.5-3B-Instruct показали, что SFT быстрее адаптирует модель под новую задачу, но заметнее ломает базовые паттерны и сильнее провоцирует забывание прежних навыков. RL, напротив, меняет поведение осторожнее и лучше сохраняет исходный «каркас», хотя адаптация идёт медленнее. Это важная разница для систем, которые используются в AI Search, генерации ответов и сценариях, где стабильность формулировок не менее важна, чем релевантность.
Для маркетинга это сигнал о том, что не каждое улучшение модели полезно в продуктовой логике. Если дообучение слишком агрессивно, ответы могут стать менее повторяемыми, начать плавающим образом интерпретировать факты и хуже вести себя на длинной дистанции. Поэтому при выборе инструментов для поиска, анализа и автоматизации стоит смотреть не только на качество в моменте, но и на сохранность базовой логики системы.
Сравнение supervised fine-tuning и reinforcement learning в дообучении языковых моделей важно не только для ML-специалистов. Для рынка adtech и performance-маркетинга здесь есть прикладной вывод: способ дообучения влияет не только на точность ответа, но и на устойчивость поведения модели.
В одном из исследований на Qwen2.5-3B-Instruct показали, что SFT быстрее адаптирует модель под новую задачу, но заметнее ломает базовые паттерны и сильнее провоцирует забывание прежних навыков. RL, напротив, меняет поведение осторожнее и лучше сохраняет исходный «каркас», хотя адаптация идёт медленнее. Это важная разница для систем, которые используются в AI Search, генерации ответов и сценариях, где стабильность формулировок не менее важна, чем релевантность.
Для маркетинга это сигнал о том, что не каждое улучшение модели полезно в продуктовой логике. Если дообучение слишком агрессивно, ответы могут стать менее повторяемыми, начать плавающим образом интерпретировать факты и хуже вести себя на длинной дистанции. Поэтому при выборе инструментов для поиска, анализа и автоматизации стоит смотреть не только на качество в моменте, но и на сохранность базовой логики системы.
AI и точность данных: уроки бенчмарка CrystalXRD
Появление бенчмарка CrystalXRD-Bench, сфокусированного на интерпретации сложных кристаллографических данных, дает важную пищу для размышлений в контексте развития ИИ-моделей. Результаты тестирования 7 vision-language-моделей показали, что даже передовые архитектуры, такие как GPT-5.4, сталкиваются с серьезными трудностями при анализе научной графики (XRD-диаграмм) и связывании этих данных с химическими формулами.
Для индустрии поиска, SEO и контент-маркетинга этот кейс является показательным сигналом. В узкоспециализированных нишах, где точность интерпретации данных критически важна, модели все еще склонны к «галлюцинациям» или логическим ошибкам при обработке визуальной информации. Это ставит под сомнение эффективность использования автоматизированного контента для сложных технических запросов в ближайшей перспективе.
Вывод для владельцев информационных ресурсов очевиден: экспертный контент, основанный на верифицированных табличных данных и структурированной разметке, сохранит свое преимущество перед генеративными ответами ИИ. Пока модели демонстрируют нестабильность в связке «визуал + исходные данные», сайты, предоставляющие пользователю точные, структурированные ответы (а не их вероятностную имитацию), будут иметь более высокие шансы на ранжирование и лояльность целевой аудитории. Надежность данных остается главным конкурентным преимуществом в эпоху, когда качество генерации все еще ограничено технической сложностью предметной области.
Появление бенчмарка CrystalXRD-Bench, сфокусированного на интерпретации сложных кристаллографических данных, дает важную пищу для размышлений в контексте развития ИИ-моделей. Результаты тестирования 7 vision-language-моделей показали, что даже передовые архитектуры, такие как GPT-5.4, сталкиваются с серьезными трудностями при анализе научной графики (XRD-диаграмм) и связывании этих данных с химическими формулами.
Для индустрии поиска, SEO и контент-маркетинга этот кейс является показательным сигналом. В узкоспециализированных нишах, где точность интерпретации данных критически важна, модели все еще склонны к «галлюцинациям» или логическим ошибкам при обработке визуальной информации. Это ставит под сомнение эффективность использования автоматизированного контента для сложных технических запросов в ближайшей перспективе.
Вывод для владельцев информационных ресурсов очевиден: экспертный контент, основанный на верифицированных табличных данных и структурированной разметке, сохранит свое преимущество перед генеративными ответами ИИ. Пока модели демонстрируют нестабильность в связке «визуал + исходные данные», сайты, предоставляющие пользователю точные, структурированные ответы (а не их вероятностную имитацию), будут иметь более высокие шансы на ранжирование и лояльность целевой аудитории. Надежность данных остается главным конкурентным преимуществом в эпоху, когда качество генерации все еще ограничено технической сложностью предметной области.
Единый ledger для PSP: как data immobility мешает маршрутизации
Проблема разрозненных данных характерна не только для инвестиционных платформ. В платежной инфраструктуре — эквайринг, выплаты, диспуты — данные часто живут в разных системах. Это приводит к ручной сверке и реактивной маршрутизации. Аналогия с wealth-платформами: там data immobility мешает получить единую картину активов клиента. В PSP-цепочках эффект тот же: если PSP, payout-провайдер и reconciliation не связаны общим ledger'ом, каждый сбой требует ручного вмешательства. Решение — построить единую систему учета, где все транзакции, комиссии и статусы диспутов фиксируются централизованно. Это позволяет автоматизировать маршрутизацию на основе правил, а не постфактум. Например, при превышении лимитов или частоты чарджбеков можно сразу переключать платежи на другой шлюз. Для programmatic-рекламодателей, работающих с множеством PSP, такой подход экономит время и снижает operational overhead. Вопрос к аудитории: с какими проблемами интеграции данных вы сталкиваетесь чаще всего?
Проблема разрозненных данных характерна не только для инвестиционных платформ. В платежной инфраструктуре — эквайринг, выплаты, диспуты — данные часто живут в разных системах. Это приводит к ручной сверке и реактивной маршрутизации. Аналогия с wealth-платформами: там data immobility мешает получить единую картину активов клиента. В PSP-цепочках эффект тот же: если PSP, payout-провайдер и reconciliation не связаны общим ledger'ом, каждый сбой требует ручного вмешательства. Решение — построить единую систему учета, где все транзакции, комиссии и статусы диспутов фиксируются централизованно. Это позволяет автоматизировать маршрутизацию на основе правил, а не постфактум. Например, при превышении лимитов или частоты чарджбеков можно сразу переключать платежи на другой шлюз. Для programmatic-рекламодателей, работающих с множеством PSP, такой подход экономит время и снижает operational overhead. Вопрос к аудитории: с какими проблемами интеграции данных вы сталкиваетесь чаще всего?
Автоматический анализ privacy policy: как это меняет due diligence в programmatic
Chrome-расширение, которое автоматически читает privacy policies, — не просто удобство, а потенциальный инструмент для adtech-команд. Суть не в том, чтобы сэкономить время юриста, а в том, чтобы быстро извлекать проверяемые сигналы: какие данные хранятся, с кем делятся, как долго, какие disclosure обязательства.
Для SSP и DSP это критично на этапе vendor due diligence. Ручной разбор политик десятков партнёров не масштабируется, а ошибки стоят дорого. Автоматическое снятие ключевых полей позволяет быстрее классифицировать интеграцию и передавать в legal review уже структурированные данные, а не сырые тексты.
Важный нюанс: такой инструмент не заменяет экспертизу, но задаёт правильный first pass. В programmatic, где каждый пиксель может нести риски CCPA или GDPR, автоматизация первого прохода по privacy policy — это уже не роскошь, а гигиена. Особенно когда речь о десятках SSP, паблишеров и data partners.
Источник: обзор AdExchanger на расширение для Chrome. Инструмент на стадии бета, но направление показательное: privacy compliance перестаёт быть только юридической задачей и становится частью supply path оптимизации.
Похожий разбор есть в @IndexCryptoAdsWeb3GrowthBrief
Chrome-расширение, которое автоматически читает privacy policies, — не просто удобство, а потенциальный инструмент для adtech-команд. Суть не в том, чтобы сэкономить время юриста, а в том, чтобы быстро извлекать проверяемые сигналы: какие данные хранятся, с кем делятся, как долго, какие disclosure обязательства.
Для SSP и DSP это критично на этапе vendor due diligence. Ручной разбор политик десятков партнёров не масштабируется, а ошибки стоят дорого. Автоматическое снятие ключевых полей позволяет быстрее классифицировать интеграцию и передавать в legal review уже структурированные данные, а не сырые тексты.
Важный нюанс: такой инструмент не заменяет экспертизу, но задаёт правильный first pass. В programmatic, где каждый пиксель может нести риски CCPA или GDPR, автоматизация первого прохода по privacy policy — это уже не роскошь, а гигиена. Особенно когда речь о десятках SSP, паблишеров и data partners.
Источник: обзор AdExchanger на расширение для Chrome. Инструмент на стадии бета, но направление показательное: privacy compliance перестаёт быть только юридической задачей и становится частью supply path оптимизации.
Похожий разбор есть в @IndexCryptoAdsWeb3GrowthBrief
Assert, инварианты и почему в проде лучше не полагаться на них вслепую
В Python assert часто воспринимают как удобный способ быстро зафиксировать предположение в коде: значение не пустое, объект нужного типа, промежуточное состояние совпадает с ожиданием. Для локальной отладки это действительно полезный инструмент. Но в production у него есть важное ограничение: такие проверки не должны подменять бизнес-логику и обработку ошибок.
Это особенно заметно в backend-сервисах и скриптах, где код проходит разные режимы запуска. То, что сработало в тестах, может вести себя иначе в воркере, в контейнере или при запуске с оптимизациями. Если assert используется как единственная защита для критичного сценария, возникает риск тихой деградации поведения или трудноуловимых багов после релиза.
Для команд в programmatic и adtech это актуально и в вспомогательных сервисах: ETL-скриптах, валидации событий, проверках payload’ов, internal tooling. Полезно отдельно пересмотреть, где assert остаётся как временная локальная проверка, а где уже нужен явный if с понятной ошибкой, логированием и контролируемой реакцией системы.
В Python assert часто воспринимают как удобный способ быстро зафиксировать предположение в коде: значение не пустое, объект нужного типа, промежуточное состояние совпадает с ожиданием. Для локальной отладки это действительно полезный инструмент. Но в production у него есть важное ограничение: такие проверки не должны подменять бизнес-логику и обработку ошибок.
Это особенно заметно в backend-сервисах и скриптах, где код проходит разные режимы запуска. То, что сработало в тестах, может вести себя иначе в воркере, в контейнере или при запуске с оптимизациями. Если assert используется как единственная защита для критичного сценария, возникает риск тихой деградации поведения или трудноуловимых багов после релиза.
Для команд в programmatic и adtech это актуально и в вспомогательных сервисах: ETL-скриптах, валидации событий, проверках payload’ов, internal tooling. Полезно отдельно пересмотреть, где assert остаётся как временная локальная проверка, а где уже нужен явный if с понятной ошибкой, логированием и контролируемой реакцией системы.
CrystalXRD-Bench как тест на точность мультимодальных моделей
CrystalXRD-Bench — это не просто ещё один академический набор, а довольно показательный стресс-тест для VLM: 250 примеров из 10 публичных кристаллографических баз, где модель должна восстановить полный набор HKL для самого сильного пика в XRD-паттерне. Задача узкая, почти «лабораторная», но именно в таких сценариях лучше всего видно, где мультимодальная система умеет работать с фактом, а где начинает достраивать ответ по вероятности.
Результаты тоже показательные: лучший Jaccard у GPT-5.4 — 0.5888, exact-match — 37.6%. Это значит, что даже у лидера точное совпадение получилось реже, чем в четырёх случаях из десяти. Для рынка adtech это хороший аналог проблемы с автоматическим чтением графиков, таблиц, PDF и сканов в медиапланировании, отчётности и валидации supply path: визуальный слой ещё не гарантирует корректное извлечение смысла.
Вывод простой: чем выше цена ошибки, тем меньше оснований считать AI-обработку источника финальной. Для технических и коммерческих материалов по-прежнему нужен контроль первички, особенно если речь идёт о структурированных данных и узких атрибутах.
CrystalXRD-Bench — это не просто ещё один академический набор, а довольно показательный стресс-тест для VLM: 250 примеров из 10 публичных кристаллографических баз, где модель должна восстановить полный набор HKL для самого сильного пика в XRD-паттерне. Задача узкая, почти «лабораторная», но именно в таких сценариях лучше всего видно, где мультимодальная система умеет работать с фактом, а где начинает достраивать ответ по вероятности.
Результаты тоже показательные: лучший Jaccard у GPT-5.4 — 0.5888, exact-match — 37.6%. Это значит, что даже у лидера точное совпадение получилось реже, чем в четырёх случаях из десяти. Для рынка adtech это хороший аналог проблемы с автоматическим чтением графиков, таблиц, PDF и сканов в медиапланировании, отчётности и валидации supply path: визуальный слой ещё не гарантирует корректное извлечение смысла.
Вывод простой: чем выше цена ошибки, тем меньше оснований считать AI-обработку источника финальной. Для технических и коммерческих материалов по-прежнему нужен контроль первички, особенно если речь идёт о структурированных данных и узких атрибутах.
Бенчмарк для vision-language моделей: как измерять точность в нишевых данных
Вышел CrystalXRD-Bench — бенчмарк из 250 кристаллографических сэмплов, собранных из 10 публичных баз. Задача: по картинке XRD-паттерна и текстовому описанию (CIF + формула) восстановить набор HKL, дающий самый сильный пик. Протестировали 7 vision-language моделей. Лучшая — GPT-5.4 с Jaccard 0.5888 и exact-match rate 37.6%. У шести из семи моделей Jaccard ниже 0.50.
Для AdTech это не про кристаллографию, а про формат оценки: модель одновременно работает с визуальным и текстовым входом, и ошибка на любом из каналов ломает результат. В рекламных сценариях похожие задачи — распознавание логотипов, проверка креативов по брифу, верификация контента в programmatic. Если модель путает атрибуты, весь таргетинг летит впустую.
Такие бенчмарки становятся аргументом для более жёсткой валидации AI-ответов в узких темах, где один неверный атрибут (например, неправильный размер баннера или запрещённый элемент) ломает всю логику покупки. Данные и код обещают выложить открыто — стоит следить за развитием.
Для соседнего контекста загляни в @CpaMarketStack
Вышел CrystalXRD-Bench — бенчмарк из 250 кристаллографических сэмплов, собранных из 10 публичных баз. Задача: по картинке XRD-паттерна и текстовому описанию (CIF + формула) восстановить набор HKL, дающий самый сильный пик. Протестировали 7 vision-language моделей. Лучшая — GPT-5.4 с Jaccard 0.5888 и exact-match rate 37.6%. У шести из семи моделей Jaccard ниже 0.50.
Для AdTech это не про кристаллографию, а про формат оценки: модель одновременно работает с визуальным и текстовым входом, и ошибка на любом из каналов ломает результат. В рекламных сценариях похожие задачи — распознавание логотипов, проверка креативов по брифу, верификация контента в programmatic. Если модель путает атрибуты, весь таргетинг летит впустую.
Такие бенчмарки становятся аргументом для более жёсткой валидации AI-ответов в узких темах, где один неверный атрибут (например, неправильный размер баннера или запрещённый элемент) ломает всю логику покупки. Данные и код обещают выложить открыто — стоит следить за развитием.
Для соседнего контекста загляни в @CpaMarketStack
14 CTA-примеров без контекста: когда списки бесполезны
Инструменты вроде Zapier публикуют подборки call to action — 14 шаблонов, 20 фраз, «лучшие призывы». Но любой CRO-специалист знает: CTA работает только в связке с контекстом. Оффер, длина формы, цена клика, тип трафика, мобильный экран — всё это меняет конверсию сильнее, чем формулировка.
Проблема в том, что готовые списки дают иллюзию выбора. Вы читаете «Попробуйте бесплатно» и думаете: «Отлично, ставлю». Но на lead-gen лендинге с B2B-аудиторией этот же призыв может провалиться, если форма длинная, а контраст кнопки низкий.
Инструментальный подход к CTA — это не коллекционирование примеров, а гипотезы, которые проверяются на одном сегменте трафика. Меняйте только текст или только цвет. Считайте CR плюс downstream-метрику (доходимость до цели, отписки, повторные визиты). Добирайте выборку до статистической значимости, а не до «уже понятно, что работает».
Вывод: Zapier — полезный сервис для автоматизации, но его статьи про CTA стоит воспринимать как сырьё для гипотез. Настоящая ценность возникает, когда вы проверяете эти примеры на своих данных. Иначе это просто красивый список без привязки к реальности.
Инструменты вроде Zapier публикуют подборки call to action — 14 шаблонов, 20 фраз, «лучшие призывы». Но любой CRO-специалист знает: CTA работает только в связке с контекстом. Оффер, длина формы, цена клика, тип трафика, мобильный экран — всё это меняет конверсию сильнее, чем формулировка.
Проблема в том, что готовые списки дают иллюзию выбора. Вы читаете «Попробуйте бесплатно» и думаете: «Отлично, ставлю». Но на lead-gen лендинге с B2B-аудиторией этот же призыв может провалиться, если форма длинная, а контраст кнопки низкий.
Инструментальный подход к CTA — это не коллекционирование примеров, а гипотезы, которые проверяются на одном сегменте трафика. Меняйте только текст или только цвет. Считайте CR плюс downstream-метрику (доходимость до цели, отписки, повторные визиты). Добирайте выборку до статистической значимости, а не до «уже понятно, что работает».
Вывод: Zapier — полезный сервис для автоматизации, но его статьи про CTA стоит воспринимать как сырьё для гипотез. Настоящая ценность возникает, когда вы проверяете эти примеры на своих данных. Иначе это просто красивый список без привязки к реальности.
Прозрачность медиазакупок: почему аудит агентских контрактов снова в центре внимания
Спустя десять лет после публикации знакового отчета K2, индустрия снова возвращается к обсуждению прозрачности медиазакупок. Организация ANA вновь поднимает вопросы скрытых комиссий, рибейтов (rebate leakage) и непрозрачных условий контрактов с агентствами. Несмотря на десятилетие цифровизации рынка, проблема principal media и комиссионных схем остается для рекламодателей одной из самых болезненных.
Для команд, работающих с programmatic-инструментами, этот кейс служит напоминанием о необходимости жесткого контроля за цепочкой поставок (supply path). Существование «мутных» агентских договоров может приводить к тому, что значительная часть бюджета оседает не в охватах или конверсиях, а в скрытых наценках. Сегодня это не вопрос деловой этики, а вопрос операционной эффективности. Маркетинговым департаментам следует внедрять регулярный fee audit и сверять инвойсы с данными bid/win-логов. Только так можно обнаружить реальные потери маржи, которые часто маскируются за агрегированными отчетами агентств по pacing. Если контракт не дает полной ясности в том, как именно распределяются средства, риск утечки бюджета остается максимальным независимо от качества используемых технологий.
Спустя десять лет после публикации знакового отчета K2, индустрия снова возвращается к обсуждению прозрачности медиазакупок. Организация ANA вновь поднимает вопросы скрытых комиссий, рибейтов (rebate leakage) и непрозрачных условий контрактов с агентствами. Несмотря на десятилетие цифровизации рынка, проблема principal media и комиссионных схем остается для рекламодателей одной из самых болезненных.
Для команд, работающих с programmatic-инструментами, этот кейс служит напоминанием о необходимости жесткого контроля за цепочкой поставок (supply path). Существование «мутных» агентских договоров может приводить к тому, что значительная часть бюджета оседает не в охватах или конверсиях, а в скрытых наценках. Сегодня это не вопрос деловой этики, а вопрос операционной эффективности. Маркетинговым департаментам следует внедрять регулярный fee audit и сверять инвойсы с данными bid/win-логов. Только так можно обнаружить реальные потери маржи, которые часто маскируются за агрегированными отчетами агентств по pacing. Если контракт не дает полной ясности в том, как именно распределяются средства, риск утечки бюджета остается максимальным независимо от качества используемых технологий.
Ahrefs: 28% страниц, цитируемых ChatGPT, не видны Google — сигнал для контентных прелендов
Ahrefs за полгода проанализировал миллиард точек данных и 14 исследований. Цифры: ChatGPT приносит сайтам в 190 раз меньше трафика, чем Google. Но важнее перекос: 28.3% страниц, которые ChatGPT цитирует повторно, в Google вообще не индексируются. При этом 43.8% цитат ChatGPT — это списки, топы и сравнения. Schema-разметка не дала заметного буста ни в AI Overviews, ни в AI Mode, ни в ChatGPT. Для programmatic-специалистов, работающих с контентными прелендами, вывод прост: при подготовке страниц под AI-цитирование формат важнее разметки. «Экспертные простыни» уступают структурированным перечням и рейтингам. Если завтра запускаете тест преленда — проверьте, насколько легко AI может вычленить из страницы ключевые позиции. Также стоит помнить, что отсутствие страницы в индексе Google не мешает ChatGPT её цитировать, но без собственного трафика от поиска такой источник живёт только за счёт AI-ссылок. Для устойчивой стратегии лучше добиваться присутствия в обоих каналах, делая ставку на формат, понятный и людям, и моделям.
Ahrefs за полгода проанализировал миллиард точек данных и 14 исследований. Цифры: ChatGPT приносит сайтам в 190 раз меньше трафика, чем Google. Но важнее перекос: 28.3% страниц, которые ChatGPT цитирует повторно, в Google вообще не индексируются. При этом 43.8% цитат ChatGPT — это списки, топы и сравнения. Schema-разметка не дала заметного буста ни в AI Overviews, ни в AI Mode, ни в ChatGPT. Для programmatic-специалистов, работающих с контентными прелендами, вывод прост: при подготовке страниц под AI-цитирование формат важнее разметки. «Экспертные простыни» уступают структурированным перечням и рейтингам. Если завтра запускаете тест преленда — проверьте, насколько легко AI может вычленить из страницы ключевые позиции. Также стоит помнить, что отсутствие страницы в индексе Google не мешает ChatGPT её цитировать, но без собственного трафика от поиска такой источник живёт только за счёт AI-ссылок. Для устойчивой стратегии лучше добиваться присутствия в обоих каналах, делая ставку на формат, понятный и людям, и моделям.