Ценностные паттерны LLM как инструмент в programmatic-стеке
Исследователи выяснили, что крупные языковые модели после миллионов тестовых запросов воспроизводят не только факты, но и структуру человеческих ценностей вместе с поведенческими сценариями. Речь идёт не об имитации речи, а о предсказуемой связи между установками и действиями.
Для programmatic и ad-ops это открывает прикладной слой. По мере исчезновения third-party cookies команды теряют возможность быстро тестировать гипотезы на живых когортах. LLM с заданными ценностными параметрами могут частично заменить панели при оценке креативов, выборе площадок и прогнозировании спроса. По сути, это синтетическая аудитория с предсказуемой логикой ответа — инструмент для предварительного скрининга перед запуском на реальный supply path.
Важный нюанс: такие модели полезны на этапе планирования и измерения эффективности посылов, но не отменяют post-campaign аналитику и first-party валидацию. Для маркетинг-директоров это повод посмотреть на LLM не как на генератор текстов, а как на модуль предиктивной аналитики в media-стеке.
Исследователи выяснили, что крупные языковые модели после миллионов тестовых запросов воспроизводят не только факты, но и структуру человеческих ценностей вместе с поведенческими сценариями. Речь идёт не об имитации речи, а о предсказуемой связи между установками и действиями.
Для programmatic и ad-ops это открывает прикладной слой. По мере исчезновения third-party cookies команды теряют возможность быстро тестировать гипотезы на живых когортах. LLM с заданными ценностными параметрами могут частично заменить панели при оценке креативов, выборе площадок и прогнозировании спроса. По сути, это синтетическая аудитория с предсказуемой логикой ответа — инструмент для предварительного скрининга перед запуском на реальный supply path.
Важный нюанс: такие модели полезны на этапе планирования и измерения эффективности посылов, но не отменяют post-campaign аналитику и first-party валидацию. Для маркетинг-директоров это повод посмотреть на LLM не как на генератор текстов, а как на модуль предиктивной аналитики в media-стеке.
SFT и RL по-разному влияют на «память» модели: для AdTech это важно там, где LLM отвечает за классификацию инвентаря, нормализацию событий и подсказки по атрибуции.
Исследователи сравнили два подхода к дообучению и предложили метрику differential circuit vulnerability — она показывает, насколько внутренние механизмы модели деградируют после fine-tuning. Иными словами, насколько сильно новая настройка ломает прежние навыки.
Картина получилась ожидаемой, но полезной для практики. Supervised fine-tuning быстрее подгоняет модель под узкую задачу: можно оперативно улучшить ответы под конкретный формат, терминологию или шаблон. Но вместе с этим растёт риск, что модель начнёт хуже работать в смежных сценариях — например, перестанет стабильно распознавать вариации названий площадок, источников трафика или сигналов конверсии.
Reinforcement learning, наоборот, бережнее сохраняет базовое поведение. Он медленнее доводит модель до нужного качества, зато меньше ломает исходные паттерны. Для продуктовых LLM-слоёв это особенно заметно, если система живёт не в вакууме, а в потоке изменений: новые источники, другие taxonomies, обновления privacy-логики, смена схем measurement.
Практический вывод для команд простой: если вы строите инструмент поверх LLM для programmatic-процессов, стоит отдельно оценивать не только точность на целевой задаче, но и то, как дообучение влияет на устойчивость рядом лежащих функций. В медиа-стеке это часто важнее, чем локальный прирост качества.
Исходники и код проекта лежат на GitHub.
Исследователи сравнили два подхода к дообучению и предложили метрику differential circuit vulnerability — она показывает, насколько внутренние механизмы модели деградируют после fine-tuning. Иными словами, насколько сильно новая настройка ломает прежние навыки.
Картина получилась ожидаемой, но полезной для практики. Supervised fine-tuning быстрее подгоняет модель под узкую задачу: можно оперативно улучшить ответы под конкретный формат, терминологию или шаблон. Но вместе с этим растёт риск, что модель начнёт хуже работать в смежных сценариях — например, перестанет стабильно распознавать вариации названий площадок, источников трафика или сигналов конверсии.
Reinforcement learning, наоборот, бережнее сохраняет базовое поведение. Он медленнее доводит модель до нужного качества, зато меньше ломает исходные паттерны. Для продуктовых LLM-слоёв это особенно заметно, если система живёт не в вакууме, а в потоке изменений: новые источники, другие taxonomies, обновления privacy-логики, смена схем measurement.
Практический вывод для команд простой: если вы строите инструмент поверх LLM для programmatic-процессов, стоит отдельно оценивать не только точность на целевой задаче, но и то, как дообучение влияет на устойчивость рядом лежащих функций. В медиа-стеке это часто важнее, чем локальный прирост качества.
Исходники и код проекта лежат на GitHub.
RL и SFT: что выбор метода дообучения означает для AI в рекламе
Исследователи сравнили RL и SFT при адаптации модели Qwen2.5-3B-Instruct к научному question-answering. Их результаты — хороший сигнал для всех, кто использует языковые модели в programmatic или строит контент под AI-поиск.
SFT быстрее подстраивает модель под конкретную задачу, но сильнее разрушает исходные «схемы» (circuit) — те внутренние связи, на которых держится устойчивость ответов. RL, напротив, сохраняет больше базового контура, хотя обучение идёт медленнее.
Для AI Overviews и ChatGPT Search это напрямую касается качества выдачи. Чем агрессивнее SFT, тем выше риск, что модель начнёт «забывать» старые паттерны и выдавать менее стабильные ответы. RL позволяет держать поведение ближе к базовой модели, что может снижать резкие сбои при изменении запросов.
Авторы ввели метрику differential circuit vulnerability — она измеряет, как fine-tuning влияет на degradation circuit на уровне отдельных голов внимания. Если вы управляете контентом, который ранжируется AI-поисковиками, стоит тестировать не только точность ответа, но и стабильность выдачи после любого дообучения.
Репозиторий с инструментом: github.com/rl-sft-circuit-research/differential-circuit-vulnerability
Связанная тема раскрывается в @VectorIgamingMarketWatch
Исследователи сравнили RL и SFT при адаптации модели Qwen2.5-3B-Instruct к научному question-answering. Их результаты — хороший сигнал для всех, кто использует языковые модели в programmatic или строит контент под AI-поиск.
SFT быстрее подстраивает модель под конкретную задачу, но сильнее разрушает исходные «схемы» (circuit) — те внутренние связи, на которых держится устойчивость ответов. RL, напротив, сохраняет больше базового контура, хотя обучение идёт медленнее.
Для AI Overviews и ChatGPT Search это напрямую касается качества выдачи. Чем агрессивнее SFT, тем выше риск, что модель начнёт «забывать» старые паттерны и выдавать менее стабильные ответы. RL позволяет держать поведение ближе к базовой модели, что может снижать резкие сбои при изменении запросов.
Авторы ввели метрику differential circuit vulnerability — она измеряет, как fine-tuning влияет на degradation circuit на уровне отдельных голов внимания. Если вы управляете контентом, который ранжируется AI-поисковиками, стоит тестировать не только точность ответа, но и стабильность выдачи после любого дообучения.
Репозиторий с инструментом: github.com/rl-sft-circuit-research/differential-circuit-vulnerability
Связанная тема раскрывается в @VectorIgamingMarketWatch
GitHub
GitHub - rl-sft-circuit-research/differential-circuit-vulnerability
Contribute to rl-sft-circuit-research/differential-circuit-vulnerability development by creating an account on GitHub.
Как LLM имитируют человеческие ценности и что это значит для поисковых стратегий
Масштабное исследование, проанализировавшее более 5 миллионов пользовательских запросов, подтвердило важный сдвиг в развитии больших языковых моделей. Оказалось, что современные нейросети не просто генерируют текст, а успешно воспроизводят психологические структуры, свойственные людям. Модели демонстрируют высокую точность в сопоставлении абстрактных ценностей с конкретными моделями поведения.
Для специалистов, которые занимаются оптимизацией под нейросетевой поиск (AI Search), это фундаментальный сигнал. Если раньше мы фокусировались на семантическом ядре и частотности запросов, то теперь вектор смещается в сторону «ценностных кластеров».
Что это означает на практике:
1. Смена фокуса с ключей на интенты. Нейросети обучаются распознавать не столько формулировку, сколько скрытую мотивацию пользователя. Контент, который апеллирует к ценностям аудитории и предлагает логические связки «ценность — действие», получает приоритет в выдаче.
2. Рост значимости контекстуальных паттернов. Модели всё лучше имитируют человеческую логику принятия решений. Это значит, что экспертный контент, содержащий глубокие поведенческие обоснования, будет ранжироваться выше, чем сухая фактология.
3. Проектирование ответов. Чтобы быть релевантными для AI-поиска, материалы должны закрывать не только информационную потребность («что это»), но и ситуативную («почему это важно для меня»).
Мы переходим от эпохи оптимизации под поисковых роботов к эпохе оптимизации под «цифровые отражения» человеческого мышления. В текущих условиях побеждает тот, кто умеет транслировать устойчивые паттерны поведения, превращая их в основу своей контентной стратегии.
#AdTech #AISearch #Strategy
Масштабное исследование, проанализировавшее более 5 миллионов пользовательских запросов, подтвердило важный сдвиг в развитии больших языковых моделей. Оказалось, что современные нейросети не просто генерируют текст, а успешно воспроизводят психологические структуры, свойственные людям. Модели демонстрируют высокую точность в сопоставлении абстрактных ценностей с конкретными моделями поведения.
Для специалистов, которые занимаются оптимизацией под нейросетевой поиск (AI Search), это фундаментальный сигнал. Если раньше мы фокусировались на семантическом ядре и частотности запросов, то теперь вектор смещается в сторону «ценностных кластеров».
Что это означает на практике:
1. Смена фокуса с ключей на интенты. Нейросети обучаются распознавать не столько формулировку, сколько скрытую мотивацию пользователя. Контент, который апеллирует к ценностям аудитории и предлагает логические связки «ценность — действие», получает приоритет в выдаче.
2. Рост значимости контекстуальных паттернов. Модели всё лучше имитируют человеческую логику принятия решений. Это значит, что экспертный контент, содержащий глубокие поведенческие обоснования, будет ранжироваться выше, чем сухая фактология.
3. Проектирование ответов. Чтобы быть релевантными для AI-поиска, материалы должны закрывать не только информационную потребность («что это»), но и ситуативную («почему это важно для меня»).
Мы переходим от эпохи оптимизации под поисковых роботов к эпохе оптимизации под «цифровые отражения» человеческого мышления. В текущих условиях побеждает тот, кто умеет транслировать устойчивые паттерны поведения, превращая их в основу своей контентной стратегии.
#AdTech #AISearch #Strategy
Cloudflare CASB читает Claude Compliance API без эндпоинт-агентов
Cloudflare расширил возможности CASB — теперь платформа напрямую интегрируется с Claude Compliance API. Это значит, что compliance- и security-команды могут анализировать использование Claude внутри своего окружения прямо из дашборда Cloudflare, без установки дополнительных endpoint-агентов на рабочих станциях.
Для стеков, где Cloudflare уже выступает шлюзом перед SaaS-доступом, такой слой контроля даёт несколько преимуществ: меньше агентской инфраструктуры на устройствах, упрощённый аудит активности по Claude, возможность собирать findings по проектам, вложениям, чатам и артефактам быстрее и централизованно.
С точки зрения programmatic и AdTech, это важный шаг в сторону privacy-ориентированного мониторинга AI-инструментов. Если в вашем рабочем контуре уже используется Claude, стоит проверить, какие DLP-правила и типы объектов попадают в CASB findings. Такая интеграция убирает лишнее звено в цепочке compliance и снижает нагрузку на endpoint security. Cloudflare также анонсировал будущую поддержку Activity Feed, что расширит возможности отслеживания событий.
Для маркетинговых команд, работающих с конфиденциальными креативами или данными аудиторий, это дополнительный аргумент выбирать инфраструктуру, где контроль встроен, а не навешивается постфактум.
Cloudflare расширил возможности CASB — теперь платформа напрямую интегрируется с Claude Compliance API. Это значит, что compliance- и security-команды могут анализировать использование Claude внутри своего окружения прямо из дашборда Cloudflare, без установки дополнительных endpoint-агентов на рабочих станциях.
Для стеков, где Cloudflare уже выступает шлюзом перед SaaS-доступом, такой слой контроля даёт несколько преимуществ: меньше агентской инфраструктуры на устройствах, упрощённый аудит активности по Claude, возможность собирать findings по проектам, вложениям, чатам и артефактам быстрее и централизованно.
С точки зрения programmatic и AdTech, это важный шаг в сторону privacy-ориентированного мониторинга AI-инструментов. Если в вашем рабочем контуре уже используется Claude, стоит проверить, какие DLP-правила и типы объектов попадают в CASB findings. Такая интеграция убирает лишнее звено в цепочке compliance и снижает нагрузку на endpoint security. Cloudflare также анонсировал будущую поддержку Activity Feed, что расширит возможности отслеживания событий.
Для маркетинговых команд, работающих с конфиденциальными креативами или данными аудиторий, это дополнительный аргумент выбирать инфраструктуру, где контроль встроен, а не навешивается постфактум.
Инструментарий разработчика в эпоху перегруженных IDE
Выбор среды разработки для создания рекламных лендингов или масштабируемых SaaS-решений часто превращается в попытку усидеть на двух стульях: получить максимум функционала и не утонуть в тормозах. Современный рынок предлагает десятки IDE, однако фокус смещается с маркетинговых обещаний на реальный UX. Для работы с React или Next.js критически важными становятся три параметра: стабильность автокомплита, скорость индексации монорепозиториев и отсутствие конфликтов с линтерами.
Проблема многих «тяжелых» инструментов в том, что они пытаются решать задачи за программиста, замедляя итерации в критические моменты разработки. В условиях высокой конкуренции в Digital, где скорость вывода продукта на рынок определяет успех рекламной кампании, выбор редактора должен опираться на производительность в боевых условиях. Перед обновлением IDE или переходом на новый стек рекомендую провести стресс-тест на актуальном проекте: проверить скорость обработки RSC (React Server Components), корректность работы с длинными путями файлов и отсутствие «зависаний» при проверке типизации. Оптимизированный рабочий процесс — это не вопрос эстетики, а фундамент для быстрой поставки кода.
Выбор среды разработки для создания рекламных лендингов или масштабируемых SaaS-решений часто превращается в попытку усидеть на двух стульях: получить максимум функционала и не утонуть в тормозах. Современный рынок предлагает десятки IDE, однако фокус смещается с маркетинговых обещаний на реальный UX. Для работы с React или Next.js критически важными становятся три параметра: стабильность автокомплита, скорость индексации монорепозиториев и отсутствие конфликтов с линтерами.
Проблема многих «тяжелых» инструментов в том, что они пытаются решать задачи за программиста, замедляя итерации в критические моменты разработки. В условиях высокой конкуренции в Digital, где скорость вывода продукта на рынок определяет успех рекламной кампании, выбор редактора должен опираться на производительность в боевых условиях. Перед обновлением IDE или переходом на новый стек рекомендую провести стресс-тест на актуальном проекте: проверить скорость обработки RSC (React Server Components), корректность работы с длинными путями файлов и отсутствие «зависаний» при проверке типизации. Оптимизированный рабочий процесс — это не вопрос эстетики, а фундамент для быстрой поставки кода.
Meridian MMM и future conversions: что меняется в измерении Google
Google постепенно уводит измерение эффективности из логики «только факт и только последний клик» в сторону прогнозных сигналов. Связка Analytics 360 с Meridian MMM и анонс Qualified Future Conversions на GML 2026 — это не просто обновление интерфейса, а изменение самой модели оценки рекламы. Теперь часть выводов о кампании может опираться не на уже случившиеся конверсии, а на предсказанные будущие продажи, рассчитанные через Gemini.
Для programmatic и performance-команд это важный сдвиг. Чем длиннее цикл сделки и чем сложнее путь пользователя, тем полезнее выглядят прогнозные метрики. Но одновременно растёт риск путаницы: в отчётах рядом оказываются фактические события, моделируемый вклад медиа и будущие сигналы, которые нельзя трактовать как прямую выручку.
Практический вывод простой: в Measurement-стеке нужно жёстко разделять, где у вас наблюдаемая конверсия, где модель MMM, а где прогнозная оценка. Иначе финансовая команда будет сравнивать разные сущности как будто это одна и та же метрика. Для AdTech-рынка это ещё один шаг к тому, что качество измерения будет зависеть не только от трафика, но и от прозрачности самой аналитической модели.
Для соседнего контекста загляни в @VerticalWatchStack
Google постепенно уводит измерение эффективности из логики «только факт и только последний клик» в сторону прогнозных сигналов. Связка Analytics 360 с Meridian MMM и анонс Qualified Future Conversions на GML 2026 — это не просто обновление интерфейса, а изменение самой модели оценки рекламы. Теперь часть выводов о кампании может опираться не на уже случившиеся конверсии, а на предсказанные будущие продажи, рассчитанные через Gemini.
Для programmatic и performance-команд это важный сдвиг. Чем длиннее цикл сделки и чем сложнее путь пользователя, тем полезнее выглядят прогнозные метрики. Но одновременно растёт риск путаницы: в отчётах рядом оказываются фактические события, моделируемый вклад медиа и будущие сигналы, которые нельзя трактовать как прямую выручку.
Практический вывод простой: в Measurement-стеке нужно жёстко разделять, где у вас наблюдаемая конверсия, где модель MMM, а где прогнозная оценка. Иначе финансовая команда будет сравнивать разные сущности как будто это одна и та же метрика. Для AdTech-рынка это ещё один шаг к тому, что качество измерения будет зависеть не только от трафика, но и от прозрачности самой аналитической модели.
Для соседнего контекста загляни в @VerticalWatchStack
Instants от Meta: новый слой приватного общения и потенциальный сигнал для UA
Meta продолжает экспериментировать с форматом приватного контента внутри своей экосистемы. Новый продукт Instants ориентирован на быстрый обмен фотографиями между близкими контактами: контент открывается один раз, имеет ограниченный срок жизни и дополнительно защищён от распространения через скриншоты и запись экрана. При этом функция развивается сразу в двух плоскостях — как часть Instagram и как отдельное приложение на базе существующей учётной записи.
Для рынка programmatic это интересно не столько самой механикой обмена контентом, сколько продуктовой стратегией платформы. Meta регулярно тестирует отдельные сценарии потребления, выделяя их в самостоятельные точки взаимодействия. Если сервис начнёт получать собственное продвижение и пользовательскую базу, появится ещё одна поверхность для формирования событий, аудиторных сигналов и, потенциально, установочных кампаний.
Пока данных о масштабе распространения, удержании пользователей и влиянии на рекламную экосистему немного. Однако сам запуск показывает тренд на усиление приватных коммуникаций и сокращение времени жизни контента. Для маркетинг-директоров это дополнительное напоминание: всё больше пользовательской активности уходит из публичных лент в закрытые пространства, где традиционные сигналы измерения становятся менее доступными. В таких условиях возрастает значение агрегированных метрик, моделирования конверсий и корректной работы с first-party данными.
Связанная тема раскрывается в @DeskIgamingMarketWatch
Meta продолжает экспериментировать с форматом приватного контента внутри своей экосистемы. Новый продукт Instants ориентирован на быстрый обмен фотографиями между близкими контактами: контент открывается один раз, имеет ограниченный срок жизни и дополнительно защищён от распространения через скриншоты и запись экрана. При этом функция развивается сразу в двух плоскостях — как часть Instagram и как отдельное приложение на базе существующей учётной записи.
Для рынка programmatic это интересно не столько самой механикой обмена контентом, сколько продуктовой стратегией платформы. Meta регулярно тестирует отдельные сценарии потребления, выделяя их в самостоятельные точки взаимодействия. Если сервис начнёт получать собственное продвижение и пользовательскую базу, появится ещё одна поверхность для формирования событий, аудиторных сигналов и, потенциально, установочных кампаний.
Пока данных о масштабе распространения, удержании пользователей и влиянии на рекламную экосистему немного. Однако сам запуск показывает тренд на усиление приватных коммуникаций и сокращение времени жизни контента. Для маркетинг-директоров это дополнительное напоминание: всё больше пользовательской активности уходит из публичных лент в закрытые пространства, где традиционные сигналы измерения становятся менее доступными. В таких условиях возрастает значение агрегированных метрик, моделирования конверсий и корректной работы с first-party данными.
Связанная тема раскрывается в @DeskIgamingMarketWatch
Moloco и iOS-трафик: что обсудят сегодня в прямом эфире
Сегодня в 17:00 по московскому времени запланирована трансляция от Moloco, посвящённая работе с iOS-приложениями в условиях меняющейся экосистемы. Это не технический апдейт, а скорее операционный разбор текущих реалий для UA- и ad-ops-команд. В фокусе — практические аспекты настройки кампаний, управление бюджетами и адаптация к росту стоимости in-app inventory.
Ожидаемые темы: стратегии запуска приложений на iOS, обновления в подходах Moloco к таргетингу и оптимизации, реакция на дефицит качественного трафика и пересмотр параметров кампаний после изменений в системе. Особенно важно — как сегодня выстраивать настройки, чтобы не терять эффективность на фоне сокращения доступного охвата и роста цен.
Пока нет подтверждённых деталей по изменениям в API, логике биддинга или атрибуции, поэтому делать выводы о технических обновлениях стоит только после трансляции или официальных анонсов. Однако сам формат указывает на смещение фокуса: вендоры всё чаще делятся не просто продуктом, а контекстом его применения в реальных условиях. Для практиков это шанс увидеть, как адаптируются под privacy-ограничения не только технологии, но и процессы — от настройки до мониторинга эффективности.
Сегодня в 17:00 по московскому времени запланирована трансляция от Moloco, посвящённая работе с iOS-приложениями в условиях меняющейся экосистемы. Это не технический апдейт, а скорее операционный разбор текущих реалий для UA- и ad-ops-команд. В фокусе — практические аспекты настройки кампаний, управление бюджетами и адаптация к росту стоимости in-app inventory.
Ожидаемые темы: стратегии запуска приложений на iOS, обновления в подходах Moloco к таргетингу и оптимизации, реакция на дефицит качественного трафика и пересмотр параметров кампаний после изменений в системе. Особенно важно — как сегодня выстраивать настройки, чтобы не терять эффективность на фоне сокращения доступного охвата и роста цен.
Пока нет подтверждённых деталей по изменениям в API, логике биддинга или атрибуции, поэтому делать выводы о технических обновлениях стоит только после трансляции или официальных анонсов. Однако сам формат указывает на смещение фокуса: вендоры всё чаще делятся не просто продуктом, а контекстом его применения в реальных условиях. Для практиков это шанс увидеть, как адаптируются под privacy-ограничения не только технологии, но и процессы — от настройки до мониторинга эффективности.
Мультимодальные модели всё ещё путаются в сложных сигналах
На бенчмарке CrystalXRD-Bench, собранном из 10 публичных кристаллографических баз, проверяли, насколько vision-language модели умеют восстанавливать полный набор HKL для самого сильного пика на XRD-паттерне. В тесте участвовали 7 моделей, и лучший результат показала GPT-5.4: Jaccard 0.5888 при exact-match 37.6%. У шести из семи моделей показатель Jaccard оказался ниже 0.50.
Для AdTech это неплохая аналогия к тому, как работают сложные сигналы в programmatic: модель может уверенно выдавать правдоподобный ответ, но это не значит, что он пригоден для решений. Особенно если речь о privacy, measurement или supply path, где данные неполные, шумные и завязаны на несколько источников.
Практический вывод простой: в задачах с высокой ценой ошибки лучше держать рядом проверяемый источник фактов, а не опираться на один AI-ответ. Бенчмарки такого типа полезны не сами по себе, а как индикатор того, где автоматизация пока требует жёсткой валидации.
На бенчмарке CrystalXRD-Bench, собранном из 10 публичных кристаллографических баз, проверяли, насколько vision-language модели умеют восстанавливать полный набор HKL для самого сильного пика на XRD-паттерне. В тесте участвовали 7 моделей, и лучший результат показала GPT-5.4: Jaccard 0.5888 при exact-match 37.6%. У шести из семи моделей показатель Jaccard оказался ниже 0.50.
Для AdTech это неплохая аналогия к тому, как работают сложные сигналы в programmatic: модель может уверенно выдавать правдоподобный ответ, но это не значит, что он пригоден для решений. Особенно если речь о privacy, measurement или supply path, где данные неполные, шумные и завязаны на несколько источников.
Практический вывод простой: в задачах с высокой ценой ошибки лучше держать рядом проверяемый источник фактов, а не опираться на один AI-ответ. Бенчмарки такого типа полезны не сами по себе, а как индикатор того, где автоматизация пока требует жёсткой валидации.
Benchмарки для извлечения данных из изображений
CrystalXRD-Bench представил 250 образцов из 10 публичных кристаллографических баз для задачи восстановления полного набора HKL, формирующих основной пик XRD-паттерна. В тестировании участвовали семь vision-language моделей, где лидером оказался GPT-5.4 с Jaccard 0.5888 и точным совпадением 37,6%. Остальные модели показали Jaccard ниже 0,50. Для специалистов по SEO и AI Search это важный сигнал: генеративные модели пока делают ошибки на узких визуально-текстовых задачах. Практическое следствие — при работе с научными графиками и схемами стоит сочетать обработку изображений и текста и проверять данные на первичных источниках, а не полагаться только на генерацию модели.
CrystalXRD-Bench представил 250 образцов из 10 публичных кристаллографических баз для задачи восстановления полного набора HKL, формирующих основной пик XRD-паттерна. В тестировании участвовали семь vision-language моделей, где лидером оказался GPT-5.4 с Jaccard 0.5888 и точным совпадением 37,6%. Остальные модели показали Jaccard ниже 0,50. Для специалистов по SEO и AI Search это важный сигнал: генеративные модели пока делают ошибки на узких визуально-текстовых задачах. Практическое следствие — при работе с научными графиками и схемами стоит сочетать обработку изображений и текста и проверять данные на первичных источниках, а не полагаться только на генерацию модели.
Метрика differential circuit vulnerability — инструмент для оценки стабильности дообучения LLM
Исследователи из команды Qwen2.5-3B-Instruct предложили новую метрику — differential circuit vulnerability. На уровне attention heads она показывает, насколько fine-tuning деградирует исходные схемы модели. Сравнение двух методов дообучения — SFT и RL — дало чёткую картину: SFT быстрее адаптирует модель под задачу, но сильнее ломает circuits и ведёт к forgetting. RL сохраняет базовую схему, но адаптируется медленнее.
Для AI Overviews и ChatGPT Search это важный инструмент оценки. Агрессивный SFT может дать нужный стиль ответа, но сделает модель нестабильной на соседних запросах и перефразах. Метрика позволяет ещё до развёртывания проверить, насколько новое дообучение повлияло на общую логику модели.
Код проекта открыт на GitHub — это готовая утилита для тех, кто настраивает LLM под контентные пайплайны. Для adtech-специалистов это способ контролировать качество и стабильность AI-генерации, особенно при масштабировании. Вместо того чтобы полагаться только на финальные метрики, можно заглянуть «под капот» и увидеть, не потеряла ли модель исходное понимание.
Исследователи из команды Qwen2.5-3B-Instruct предложили новую метрику — differential circuit vulnerability. На уровне attention heads она показывает, насколько fine-tuning деградирует исходные схемы модели. Сравнение двух методов дообучения — SFT и RL — дало чёткую картину: SFT быстрее адаптирует модель под задачу, но сильнее ломает circuits и ведёт к forgetting. RL сохраняет базовую схему, но адаптируется медленнее.
Для AI Overviews и ChatGPT Search это важный инструмент оценки. Агрессивный SFT может дать нужный стиль ответа, но сделает модель нестабильной на соседних запросах и перефразах. Метрика позволяет ещё до развёртывания проверить, насколько новое дообучение повлияло на общую логику модели.
Код проекта открыт на GitHub — это готовая утилита для тех, кто настраивает LLM под контентные пайплайны. Для adtech-специалистов это способ контролировать качество и стабильность AI-генерации, особенно при масштабировании. Вместо того чтобы полагаться только на финальные метрики, можно заглянуть «под капот» и увидеть, не потеряла ли модель исходное понимание.
Ahrefs против AI: как ChatGPT почти не даёт трафика, но открывает серую зону
Масштабное исследование Ahrefs: миллиард точек данных, 14 отчётов, один главный вывод — ChatGPT генерирует в 190 раз меньше переходов на сайты по сравнению с Google. Почти треть страниц, которые AI регулярно цитирует, вообще не появляются в классическом поиске. Schema-разметка для AI Overviews и ChatGPT не даёт никакого эффекта.
Для тех, кто в AdTech управляет supply path и измеряет эффективность, это сигнал не гнаться за AI-овервью через SEO. Оптимизация контента под ChatGPT — игра без кликов. Но появляется новый грей-зона: страницы, невидимые для Google, но видимые для AI. Если вы работаете с лендингами и аукционами, стоит тестировать размещения, которые AI подхватывает, а классический поиск игнорирует. Рынок там пока пустой.
Инструментарий для отслеживания таких страниц только формируется. Пока что анализ ссылочной массы и паттернов цитирования AI — поле для ручной разведки. Ahrefs дал данные, но реальный инструментарий для работы с этим сегментом ещё предстоит собрать.
Масштабное исследование Ahrefs: миллиард точек данных, 14 отчётов, один главный вывод — ChatGPT генерирует в 190 раз меньше переходов на сайты по сравнению с Google. Почти треть страниц, которые AI регулярно цитирует, вообще не появляются в классическом поиске. Schema-разметка для AI Overviews и ChatGPT не даёт никакого эффекта.
Для тех, кто в AdTech управляет supply path и измеряет эффективность, это сигнал не гнаться за AI-овервью через SEO. Оптимизация контента под ChatGPT — игра без кликов. Но появляется новый грей-зона: страницы, невидимые для Google, но видимые для AI. Если вы работаете с лендингами и аукционами, стоит тестировать размещения, которые AI подхватывает, а классический поиск игнорирует. Рынок там пока пустой.
Инструментарий для отслеживания таких страниц только формируется. Пока что анализ ссылочной массы и паттернов цитирования AI — поле для ручной разведки. Ahrefs дал данные, но реальный инструментарий для работы с этим сегментом ещё предстоит собрать.
Creative study не равен атрибуции: где аналитики чаще всего делают лишний вывод
Reddit опубликовал исследование по 150 тысячам in-feed объявлений от 7 тысяч рекламодателей и попытался ответить на простой вопрос: какие креативные решения связаны с ростом конверсий. Для performance-команд здесь важен не сам вывод, а границы его применимости.
Это не история про CAPI, sGTM или server-side дедупликацию. Исследование смотрит на креатив внутри платформы, а не на всю цепочку измерения. Без прозрачной методологии, состава факторов и понимания, как именно Reddit считал uplift, такой материал нельзя напрямую переносить в медиамикс или attribution-модель.
Практический смысл в другом: подобные отчёты хороши как источник гипотез для creative testing. Но если у вас расходятся CAPI, Pixel и GA4, то любой «рост конверсий» может оказаться смесью реального эффекта и потерь трекинга. Поэтому сначала — стабильная передача событий, event_id и дедупликация, потом — выводы о креативе.
Для AdTech и measurement-команд это ещё одно напоминание: платформа может показать корреляцию, но не заменит собственную измерительную схему.
Reddit опубликовал исследование по 150 тысячам in-feed объявлений от 7 тысяч рекламодателей и попытался ответить на простой вопрос: какие креативные решения связаны с ростом конверсий. Для performance-команд здесь важен не сам вывод, а границы его применимости.
Это не история про CAPI, sGTM или server-side дедупликацию. Исследование смотрит на креатив внутри платформы, а не на всю цепочку измерения. Без прозрачной методологии, состава факторов и понимания, как именно Reddit считал uplift, такой материал нельзя напрямую переносить в медиамикс или attribution-модель.
Практический смысл в другом: подобные отчёты хороши как источник гипотез для creative testing. Но если у вас расходятся CAPI, Pixel и GA4, то любой «рост конверсий» может оказаться смесью реального эффекта и потерь трекинга. Поэтому сначала — стабильная передача событий, event_id и дедупликация, потом — выводы о креативе.
Для AdTech и measurement-команд это ещё одно напоминание: платформа может показать корреляцию, но не заменит собственную измерительную схему.
Universal Cart: новая архитектура агентской коммерции от Google
Google продолжает выстраивать экосистему агентской коммерции, представив Universal Cart — интеллектуальную корзину, интегрированную в поисковую выдачу и Gemini. Инструмент формально базируется на Universal Commerce Protocol (UCP) и меняет привычную воронку продаж, замыкая цикл от поиска товара до оформления покупки через Google Pay.
С точки зрения performance-маркетинга, мы наблюдаем сдвиг парадигмы: теперь точкой оптимизации становится не только клик или переход на сайт, но и момент принятия решения внутри интерфейса агента. Когда Gemini берет на себя поиск ценовых предложений и управление корзиной, рекламодатель сталкивается с вызовом прозрачности данных. Главный вопрос для нас — какие сигналы о поведении пользователя будут доступны в рамках UCP, а какие данные останутся «черным ящиком» Google.
Без глубокой интеграции с системами аналитики рекламодателя, агентская коммерция может превратиться в изолированную среду, где сложно отследить инкрементальность и реальную ценность конверсии. Для команд, работающих с close-loop аналитикой, это сигнал к пересмотру стратегий сбора данных: если путь пользователя к покупке сокращается внутри экосистемы платформы, нам необходимы новые инструменты для верификации attribution-моделей в условиях ограниченного доступа к пользовательским идентификаторам.
Google продолжает выстраивать экосистему агентской коммерции, представив Universal Cart — интеллектуальную корзину, интегрированную в поисковую выдачу и Gemini. Инструмент формально базируется на Universal Commerce Protocol (UCP) и меняет привычную воронку продаж, замыкая цикл от поиска товара до оформления покупки через Google Pay.
С точки зрения performance-маркетинга, мы наблюдаем сдвиг парадигмы: теперь точкой оптимизации становится не только клик или переход на сайт, но и момент принятия решения внутри интерфейса агента. Когда Gemini берет на себя поиск ценовых предложений и управление корзиной, рекламодатель сталкивается с вызовом прозрачности данных. Главный вопрос для нас — какие сигналы о поведении пользователя будут доступны в рамках UCP, а какие данные останутся «черным ящиком» Google.
Без глубокой интеграции с системами аналитики рекламодателя, агентская коммерция может превратиться в изолированную среду, где сложно отследить инкрементальность и реальную ценность конверсии. Для команд, работающих с close-loop аналитикой, это сигнал к пересмотру стратегий сбора данных: если путь пользователя к покупке сокращается внутри экосистемы платформы, нам необходимы новые инструменты для верификации attribution-моделей в условиях ограниченного доступа к пользовательским идентификаторам.
Когда агент масштабируется: уроки от Agentforce для команд, строящих маркетинговых ботов
Salesforce объявил, что Agentforce превысил $1 млрд годовой регулярной выручки. За 15 месяцев агент автономно обработал 4 млн обращений в каналах поддержки — вдвое больше, чем обработали люди. Для рынка это сигнал, что стадия «может ли агент работать в проде» уже пройдена для крупного enterprise.
Главный вопрос теперь — наблюдаемость. Когда агент ведёт миллионы диалогов, даже редкие ошибки становятся системной проблемой. Где теряется контекст? Как отследить сбой на длинной цепочке? Какие маршруты эскалации остаются у человека?
Для команд, строящих CRM-агентов или retention-агентов, именно эти кейсы стоит изучать. Метрики внедрения — только первая часть. Реальная ценность начинается с инструментов мониторинга, логирования и быстрого отката. Пока upstream инструменты наблюдаемости для LLM-агентов остаются нишевыми, но спрос на них растёт.
Урок Salesforce: сначала кажется, что проблема в том, чтобы агент работал. Потом — чтобы он работал стабильно на масштабе. Если вы проектируете маркетинговых агентов, закладывайте наблюдаемость с первого дня.
Salesforce объявил, что Agentforce превысил $1 млрд годовой регулярной выручки. За 15 месяцев агент автономно обработал 4 млн обращений в каналах поддержки — вдвое больше, чем обработали люди. Для рынка это сигнал, что стадия «может ли агент работать в проде» уже пройдена для крупного enterprise.
Главный вопрос теперь — наблюдаемость. Когда агент ведёт миллионы диалогов, даже редкие ошибки становятся системной проблемой. Где теряется контекст? Как отследить сбой на длинной цепочке? Какие маршруты эскалации остаются у человека?
Для команд, строящих CRM-агентов или retention-агентов, именно эти кейсы стоит изучать. Метрики внедрения — только первая часть. Реальная ценность начинается с инструментов мониторинга, логирования и быстрого отката. Пока upstream инструменты наблюдаемости для LLM-агентов остаются нишевыми, но спрос на них растёт.
Урок Salesforce: сначала кажется, что проблема в том, чтобы агент работал. Потом — чтобы он работал стабильно на масштабе. Если вы проектируете маркетинговых агентов, закладывайте наблюдаемость с первого дня.
Как не запутаться в B2B-конверсиях: проверка primary actions
Одна из частых ловушек в B2B PPC — уверенность, что рост MQL и SQL автоматически означает рост продаж. На практике leads могут стоять на месте, а total conversions расти за счёт добавления новых conversion actions, которые автоматически переводятся в primary. Алгоритм начинает оптимизироваться на «лёгкие» конверсии — отправку формы вместо реального контакта.
Решение лежит в инструментальной плоскости: пересмотрите primary actions. Разнесите лиды (MQL, SQL) и downstream-события (например, демо-звонок, оплата). Для value-based bidding передавайте данные только с фактом оплаты или подтверждённым offline-этапом. Offline conversion data теперь легко загружается и в Google Ads, и в Microsoft Ads, так что проверка CRM-качества перестала быть опцией.
Главный совет: если total conversions растут, а сквозная аналитика молчит — проверьте, какие события стали primary. Скорее всего, машина оптимизируется на то, что просто «удобно» измерять, а не на деньги.
Одна из частых ловушек в B2B PPC — уверенность, что рост MQL и SQL автоматически означает рост продаж. На практике leads могут стоять на месте, а total conversions расти за счёт добавления новых conversion actions, которые автоматически переводятся в primary. Алгоритм начинает оптимизироваться на «лёгкие» конверсии — отправку формы вместо реального контакта.
Решение лежит в инструментальной плоскости: пересмотрите primary actions. Разнесите лиды (MQL, SQL) и downstream-события (например, демо-звонок, оплата). Для value-based bidding передавайте данные только с фактом оплаты или подтверждённым offline-этапом. Offline conversion data теперь легко загружается и в Google Ads, и в Microsoft Ads, так что проверка CRM-качества перестала быть опцией.
Главный совет: если total conversions растут, а сквозная аналитика молчит — проверьте, какие события стали primary. Скорее всего, машина оптимизируется на то, что просто «удобно» измерять, а не на деньги.
Что показало исследование LLM о человеческих ценностях
Исследование, в котором более 5 миллионов вопросов прогнали через ведущие LLM на базе established psychological value theory, показало любопытную вещь: модели довольно близко воспроизводят человеческие ценностные структуры и связанное с ними поведение. Более того, если в симуляции добавить распределения человеческих ценностей, результаты становятся точнее.
Для рынка AI Search это важный сигнал. Генеративные модели уже не просто подбирают слова по вероятности — они всё лучше собирают ответы так, как это делает человек, опираясь на устойчивые паттерны выбора и оценки. А значит, контент, который совпадает с человеческой логикой решения задачи, может оказываться ближе к тому, как модель ранжирует, пересобирает и формирует ответ.
Для команд, которые строят контент под AI Overviews и другие генеративные интерфейсы, это ещё один аргумент в пользу работы не только с семантикой, но и с намерением, контекстом и структурой аргумента. Источник: https://arxiv.org/abs/2605.30036
Исследование, в котором более 5 миллионов вопросов прогнали через ведущие LLM на базе established psychological value theory, показало любопытную вещь: модели довольно близко воспроизводят человеческие ценностные структуры и связанное с ними поведение. Более того, если в симуляции добавить распределения человеческих ценностей, результаты становятся точнее.
Для рынка AI Search это важный сигнал. Генеративные модели уже не просто подбирают слова по вероятности — они всё лучше собирают ответы так, как это делает человек, опираясь на устойчивые паттерны выбора и оценки. А значит, контент, который совпадает с человеческой логикой решения задачи, может оказываться ближе к тому, как модель ранжирует, пересобирает и формирует ответ.
Для команд, которые строят контент под AI Overviews и другие генеративные интерфейсы, это ещё один аргумент в пользу работы не только с семантикой, но и с намерением, контекстом и структурой аргумента. Источник: https://arxiv.org/abs/2605.30036
arXiv.org
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
Large Language Models (LLMs) demonstrate a remarkable capacity to adopt different personas and roles; however, it remains unclear whether they can manifest behavior that adheres to a coherent,...
SFT и RL: почему разница важна для стабильности AI-поиска
Сравнение supervised fine-tuning и reinforcement learning в дообучении языковых моделей важно не только для ML-специалистов. Для рынка adtech и performance-маркетинга здесь есть прикладной вывод: способ дообучения влияет не только на точность ответа, но и на устойчивость поведения модели.
В одном из исследований на Qwen2.5-3B-Instruct показали, что SFT быстрее адаптирует модель под новую задачу, но заметнее ломает базовые паттерны и сильнее провоцирует забывание прежних навыков. RL, напротив, меняет поведение осторожнее и лучше сохраняет исходный «каркас», хотя адаптация идёт медленнее. Это важная разница для систем, которые используются в AI Search, генерации ответов и сценариях, где стабильность формулировок не менее важна, чем релевантность.
Для маркетинга это сигнал о том, что не каждое улучшение модели полезно в продуктовой логике. Если дообучение слишком агрессивно, ответы могут стать менее повторяемыми, начать плавающим образом интерпретировать факты и хуже вести себя на длинной дистанции. Поэтому при выборе инструментов для поиска, анализа и автоматизации стоит смотреть не только на качество в моменте, но и на сохранность базовой логики системы.
Сравнение supervised fine-tuning и reinforcement learning в дообучении языковых моделей важно не только для ML-специалистов. Для рынка adtech и performance-маркетинга здесь есть прикладной вывод: способ дообучения влияет не только на точность ответа, но и на устойчивость поведения модели.
В одном из исследований на Qwen2.5-3B-Instruct показали, что SFT быстрее адаптирует модель под новую задачу, но заметнее ломает базовые паттерны и сильнее провоцирует забывание прежних навыков. RL, напротив, меняет поведение осторожнее и лучше сохраняет исходный «каркас», хотя адаптация идёт медленнее. Это важная разница для систем, которые используются в AI Search, генерации ответов и сценариях, где стабильность формулировок не менее важна, чем релевантность.
Для маркетинга это сигнал о том, что не каждое улучшение модели полезно в продуктовой логике. Если дообучение слишком агрессивно, ответы могут стать менее повторяемыми, начать плавающим образом интерпретировать факты и хуже вести себя на длинной дистанции. Поэтому при выборе инструментов для поиска, анализа и автоматизации стоит смотреть не только на качество в моменте, но и на сохранность базовой логики системы.
AI и точность данных: уроки бенчмарка CrystalXRD
Появление бенчмарка CrystalXRD-Bench, сфокусированного на интерпретации сложных кристаллографических данных, дает важную пищу для размышлений в контексте развития ИИ-моделей. Результаты тестирования 7 vision-language-моделей показали, что даже передовые архитектуры, такие как GPT-5.4, сталкиваются с серьезными трудностями при анализе научной графики (XRD-диаграмм) и связывании этих данных с химическими формулами.
Для индустрии поиска, SEO и контент-маркетинга этот кейс является показательным сигналом. В узкоспециализированных нишах, где точность интерпретации данных критически важна, модели все еще склонны к «галлюцинациям» или логическим ошибкам при обработке визуальной информации. Это ставит под сомнение эффективность использования автоматизированного контента для сложных технических запросов в ближайшей перспективе.
Вывод для владельцев информационных ресурсов очевиден: экспертный контент, основанный на верифицированных табличных данных и структурированной разметке, сохранит свое преимущество перед генеративными ответами ИИ. Пока модели демонстрируют нестабильность в связке «визуал + исходные данные», сайты, предоставляющие пользователю точные, структурированные ответы (а не их вероятностную имитацию), будут иметь более высокие шансы на ранжирование и лояльность целевой аудитории. Надежность данных остается главным конкурентным преимуществом в эпоху, когда качество генерации все еще ограничено технической сложностью предметной области.
Появление бенчмарка CrystalXRD-Bench, сфокусированного на интерпретации сложных кристаллографических данных, дает важную пищу для размышлений в контексте развития ИИ-моделей. Результаты тестирования 7 vision-language-моделей показали, что даже передовые архитектуры, такие как GPT-5.4, сталкиваются с серьезными трудностями при анализе научной графики (XRD-диаграмм) и связывании этих данных с химическими формулами.
Для индустрии поиска, SEO и контент-маркетинга этот кейс является показательным сигналом. В узкоспециализированных нишах, где точность интерпретации данных критически важна, модели все еще склонны к «галлюцинациям» или логическим ошибкам при обработке визуальной информации. Это ставит под сомнение эффективность использования автоматизированного контента для сложных технических запросов в ближайшей перспективе.
Вывод для владельцев информационных ресурсов очевиден: экспертный контент, основанный на верифицированных табличных данных и структурированной разметке, сохранит свое преимущество перед генеративными ответами ИИ. Пока модели демонстрируют нестабильность в связке «визуал + исходные данные», сайты, предоставляющие пользователю точные, структурированные ответы (а не их вероятностную имитацию), будут иметь более высокие шансы на ранжирование и лояльность целевой аудитории. Надежность данных остается главным конкурентным преимуществом в эпоху, когда качество генерации все еще ограничено технической сложностью предметной области.