Как контролировать рост качества у LLM, чтобы не сломать остальное
В свежем разборе про GRASP (Gated Regression-Aware Skill Proposer) показали необычно резкий скачок на MedAgentBench: модель gpt-oss-120b выросла с 40,6% до 88,8%. Но важнее не сама цифра, а механизм, который за ней стоит.
Идея GRASP проста по смыслу, но жёсткая по исполнению: в библиотеку навыков попадают не все подряд изменения, а только те, что проходят проверку на отдельном наборе наблюдений и не выходят за заранее заданный лимит регрессий. То есть система не «наращивает возможности любой ценой», а добавляет только то, что не ухудшает базовое поведение.
Для команд, которые строят агентные сценарии, это очень практичный сигнал. Когда модель начинает:
- собирать источники,
- переписывать тексты,
- генерировать ответы под разные задачи,
- работать с выдачей и сниппетами,
нужен не просто тест «стало лучше или нет», а контроль по двум осям: локальный выигрыш и цена побочных ухудшений. Иначе одно удачное улучшение легко ломает другие сценарии.
Ещё один важный вывод из эксперимента: подход сработал в большинстве сред, но споткнулся там, где пространство действий слишком открытое. Для операционки это значит, что ограничения в агенте — не бюрократия, а часть качества. Чем шире свобода действий, тем сложнее удержать стабильность без жёстких рамок.
Практический вывод для маркетинга, GEO и LLM-SEO здесь такой: если вы тестируете новые промпты, навыки или цепочки действий, смотрите не только на uplift, но и на регрессионный бюджет. Иногда самый полезный апгрейд — тот, который улучшает систему, не делая её менее предсказуемой.
В свежем разборе про GRASP (Gated Regression-Aware Skill Proposer) показали необычно резкий скачок на MedAgentBench: модель gpt-oss-120b выросла с 40,6% до 88,8%. Но важнее не сама цифра, а механизм, который за ней стоит.
Идея GRASP проста по смыслу, но жёсткая по исполнению: в библиотеку навыков попадают не все подряд изменения, а только те, что проходят проверку на отдельном наборе наблюдений и не выходят за заранее заданный лимит регрессий. То есть система не «наращивает возможности любой ценой», а добавляет только то, что не ухудшает базовое поведение.
Для команд, которые строят агентные сценарии, это очень практичный сигнал. Когда модель начинает:
- собирать источники,
- переписывать тексты,
- генерировать ответы под разные задачи,
- работать с выдачей и сниппетами,
нужен не просто тест «стало лучше или нет», а контроль по двум осям: локальный выигрыш и цена побочных ухудшений. Иначе одно удачное улучшение легко ломает другие сценарии.
Ещё один важный вывод из эксперимента: подход сработал в большинстве сред, но споткнулся там, где пространство действий слишком открытое. Для операционки это значит, что ограничения в агенте — не бюрократия, а часть качества. Чем шире свобода действий, тем сложнее удержать стабильность без жёстких рамок.
Практический вывод для маркетинга, GEO и LLM-SEO здесь такой: если вы тестируете новые промпты, навыки или цепочки действий, смотрите не только на uplift, но и на регрессионный бюджет. Иногда самый полезный апгрейд — тот, который улучшает систему, не делая её менее предсказуемой.
Google Ads запустил панель управления лидами: главное для маркетолога
Google Ads встроил Lead Management Dashboard прямо в интерфейс кабинета. Теперь можно видеть статус каждого лида: Total, New, Qualified, Lost. Маркетолог может отметить лид как «Квалифицирован» или «Сделка закрыта», и этот статус возвращается в рекламную систему как сигнал конверсии. Раньше считали только CPL — теперь Google даёт обратную связь по качеству. Для лидогенерации это означает, что фродовые и нецелевые заявки станут более заметны. В статье упоминается, что на агрессивных заливах доля мусора может достигать 35–50%. Рекомендация для арбитражников: перестраивайте отчётность с оглядкой на post-lead сигналы. Сверяйте не только объём, но и процент Qualified/Lost. Если видите, что много Lost после отправки формы, значит либо сам оффер, либо претаргетинг требует чистки. Это простой способ снизить бюджетные потери без сложных скриптов.
Google Ads встроил Lead Management Dashboard прямо в интерфейс кабинета. Теперь можно видеть статус каждого лида: Total, New, Qualified, Lost. Маркетолог может отметить лид как «Квалифицирован» или «Сделка закрыта», и этот статус возвращается в рекламную систему как сигнал конверсии. Раньше считали только CPL — теперь Google даёт обратную связь по качеству. Для лидогенерации это означает, что фродовые и нецелевые заявки станут более заметны. В статье упоминается, что на агрессивных заливах доля мусора может достигать 35–50%. Рекомендация для арбитражников: перестраивайте отчётность с оглядкой на post-lead сигналы. Сверяйте не только объём, но и процент Qualified/Lost. Если видите, что много Lost после отправки формы, значит либо сам оффер, либо претаргетинг требует чистки. Это простой способ снизить бюджетные потери без сложных скриптов.
Почему LLM теряют контекст в длинных цепочках
Исследование arXiv:2605.30233 добавило неприятную деталь в разговор о «рассуждающих» языковых моделях: они не ведут состояние мира последовательно по мере чтения текста. Вместо этого нужные фрагменты как будто собираются в конце, когда запрос уже полностью проявился. Для сложных многошаговых задач это объясняет, почему модель может уверенно звучать, но всё равно терять связь между условиями.
Авторы отдельно разобрали механизм удаления информации: операция REMOVE у моделей выглядит не как аккуратное исключение факта, а как хрупкое глобальное подавление. Отсюда — предсказуемые сбои на задачах, где важно не просто помнить, а удерживать и обновлять контекст без потерь.
Для SEO, AI Search и контентных пайплайнов сигнал простой: длинные расплывчатые запросы и многослойные инструкции будут чаще давать ошибки, чем хорошо структурированные промпты с явным итоговым вопросом. Если AI используется для извлечения фактов из сложного материала, слабое место может быть не в одном абзаце, а в самой схеме подачи информации.
Исследование arXiv:2605.30233 добавило неприятную деталь в разговор о «рассуждающих» языковых моделях: они не ведут состояние мира последовательно по мере чтения текста. Вместо этого нужные фрагменты как будто собираются в конце, когда запрос уже полностью проявился. Для сложных многошаговых задач это объясняет, почему модель может уверенно звучать, но всё равно терять связь между условиями.
Авторы отдельно разобрали механизм удаления информации: операция REMOVE у моделей выглядит не как аккуратное исключение факта, а как хрупкое глобальное подавление. Отсюда — предсказуемые сбои на задачах, где важно не просто помнить, а удерживать и обновлять контекст без потерь.
Для SEO, AI Search и контентных пайплайнов сигнал простой: длинные расплывчатые запросы и многослойные инструкции будут чаще давать ошибки, чем хорошо структурированные промпты с явным итоговым вопросом. Если AI используется для извлечения фактов из сложного материала, слабое место может быть не в одном абзаце, а в самой схеме подачи информации.
AI всё чаще двигается не по принципу «нашёл ответ и закрыл вопрос», а по логике обновляемого состояния: что было раньше, что изменилось сейчас и как это связано между собой. Именно
Суть подхода в том, что авторы пытаются объединить два уровня поведения системы: краткосрочные изменения и долгую память о структуре. Вместо раздельного обращения с временными событиями и связями между объектами модель использует рекуррентную схему, где новое состояние строится с учётом предыдущего. Дополнительно вводятся адаптивные ядра затухания, которые учатся по-разному реагировать на свежие и старые сигналы.
На практике это дало сильный результат: на 14 реальных бенчмарках метод вышел в лидеры в задачах предсказания связей и классификации узлов, причём и в transductive, и в inductive сценариях. Отдельно важно, что в работе есть не только экспериментальная, но и теоретическая часть: авторы показывают эквивалентность двух способов обновления состояния и дают гарантии устойчивости.
Для рынка контентных систем и AI Search это хороший маркер направления. Поисковые модели всё меньше похожи на «статический индекс» и всё больше — на систему, которая держит контекст темы в памяти и пересчитывает приоритеты после новых событий. Отсюда простой вывод: выигрывают не просто свежие материалы, а связанные между собой обновления, явная структура сущностей и последовательная история изменений. Страницы без регулярного обновления и без тематической связки в такой среде стареют заметно быстрее.
Суть подхода в том, что авторы пытаются объединить два уровня поведения системы: краткосрочные изменения и долгую память о структуре. Вместо раздельного обращения с временными событиями и связями между объектами модель использует рекуррентную схему, где новое состояние строится с учётом предыдущего. Дополнительно вводятся адаптивные ядра затухания, которые учатся по-разному реагировать на свежие и старые сигналы.
На практике это дало сильный результат: на 14 реальных бенчмарках метод вышел в лидеры в задачах предсказания связей и классификации узлов, причём и в transductive, и в inductive сценариях. Отдельно важно, что в работе есть не только экспериментальная, но и теоретическая часть: авторы показывают эквивалентность двух способов обновления состояния и дают гарантии устойчивости.
Для рынка контентных систем и AI Search это хороший маркер направления. Поисковые модели всё меньше похожи на «статический индекс» и всё больше — на систему, которая держит контекст темы в памяти и пересчитывает приоритеты после новых событий. Отсюда простой вывод: выигрывают не просто свежие материалы, а связанные между собой обновления, явная структура сущностей и последовательная история изменений. Страницы без регулярного обновления и без тематической связки в такой среде стареют заметно быстрее.
AI-поиск меняет путь к покупке, и это уже заметно
В affiliate-маркетинге появляется новый слой конкуренции: не только за клики, но и за попадание в AI-ответы и агентные сценарии. Google уже развивает agentic shopping, где система не просто советует товар, а может довести пользователя до покупки. Это сдвигает часть воронки из классического поиска в диалог с моделью.
Отдельный сигнал — бренды массово называют AI частью affiliate-стратегии, но на деле используют его узко: чаще всего в генерации текстов и базовой аналитике. То есть рынок уже признал инструмент, но ещё не научился выжимать из него максимум. Это типичная стадия: технология есть у всех, зрелости мало.
Для рынка важнее другое: в AI-ответах могут всплывать не те источники, которые лучше ранжируются в SEO, а те, что модель считает наиболее релевантными и «доверенными» для конкретной темы. Значит, смотреть нужно не только на позиции в выдаче, но и на то, какие домены и форматы вообще попадают в ответы.
Вывод без драматизации: AI-поиск и агентные покупки пока не убивают affiliate, но делают старую схему «прописал страницы — получил трафик» заметно менее прямолинейной.
В affiliate-маркетинге появляется новый слой конкуренции: не только за клики, но и за попадание в AI-ответы и агентные сценарии. Google уже развивает agentic shopping, где система не просто советует товар, а может довести пользователя до покупки. Это сдвигает часть воронки из классического поиска в диалог с моделью.
Отдельный сигнал — бренды массово называют AI частью affiliate-стратегии, но на деле используют его узко: чаще всего в генерации текстов и базовой аналитике. То есть рынок уже признал инструмент, но ещё не научился выжимать из него максимум. Это типичная стадия: технология есть у всех, зрелости мало.
Для рынка важнее другое: в AI-ответах могут всплывать не те источники, которые лучше ранжируются в SEO, а те, что модель считает наиболее релевантными и «доверенными» для конкретной темы. Значит, смотреть нужно не только на позиции в выдаче, но и на то, какие домены и форматы вообще попадают в ответы.
Вывод без драматизации: AI-поиск и агентные покупки пока не убивают affiliate, но делают старую схему «прописал страницы — получил трафик» заметно менее прямолинейной.
Эффективность feature selection в табличных данных
Исследование на бенчмарке SCM3K, включающем более 3,4 тысяч задач, ставит под сомнение эффективность использования Markov boundary для оптимизации табличных моделей. Авторы работы проанализировали, помогает ли ограничение регрессора на основе oracle-boundary повышать точность прогноза. Выяснилось, что хотя теоретически знание границ признаков должно улучшать качество, на практике существующие методы оценки boundary потребляют избыточные вычислительные ресурсы, не достигая оптимума.
Ключевая проблема заключается в том, что большинство методов нацелены на восстановление структуры данных, а не напрямую на минимизацию ошибки предсказания. Кроме того, наличие ложноположительных или ложноотрицательных признаков в отобранном наборе влияет на итоговый результат по-разному, что делает «правильную» с точки зрения теории структуру не всегда подходящей для реальных задач. Для специалистов в области анализа данных и маркетинговых пайплайнов вывод очевиден: при построении моделей важно делать упор на prediction-first отбор. Методы, которые красиво восстанавливают зависимости между переменными, могут проигрывать простым подходам, ориентированным на метрики качества. Перед внедрением сложных систем отбора признаков стоит проводить A/B-тестирование их влияния на реальный результат, так как высокая стоимость вычислений редко оправдывается приростом в проде.
Если интересна смежная механика — @VectorAttributionMeasurement
Исследование на бенчмарке SCM3K, включающем более 3,4 тысяч задач, ставит под сомнение эффективность использования Markov boundary для оптимизации табличных моделей. Авторы работы проанализировали, помогает ли ограничение регрессора на основе oracle-boundary повышать точность прогноза. Выяснилось, что хотя теоретически знание границ признаков должно улучшать качество, на практике существующие методы оценки boundary потребляют избыточные вычислительные ресурсы, не достигая оптимума.
Ключевая проблема заключается в том, что большинство методов нацелены на восстановление структуры данных, а не напрямую на минимизацию ошибки предсказания. Кроме того, наличие ложноположительных или ложноотрицательных признаков в отобранном наборе влияет на итоговый результат по-разному, что делает «правильную» с точки зрения теории структуру не всегда подходящей для реальных задач. Для специалистов в области анализа данных и маркетинговых пайплайнов вывод очевиден: при построении моделей важно делать упор на prediction-first отбор. Методы, которые красиво восстанавливают зависимости между переменными, могут проигрывать простым подходам, ориентированным на метрики качества. Перед внедрением сложных систем отбора признаков стоит проводить A/B-тестирование их влияния на реальный результат, так как высокая стоимость вычислений редко оправдывается приростом в проде.
Если интересна смежная механика — @VectorAttributionMeasurement
Как ИИ выбирает удачный кадр до съёмки
В ArXiv показали любопытный подход к портретам в 3D-сцене: модель не просто генерирует изображение, а заранее планирует сам кадр — позу человека, положение камеры, свет и экспозицию. Иными словами, она пытается ответить на вопрос не «как дорисовать красиво», а «как поставить сцену, чтобы результат сразу получился сильным».
Ключевая часть здесь — Photographic Scene Graph, то есть структурное описание сцены. В нём фиксируются возможности пространства, связь героя с окружением и схема освещения. Для портрета это особенно важно: фон, направление света и точка съёмки часто влияют на итог сильнее, чем отдельные детали генерации.
Дальше система работает не в лоб, а через сравнение вариантов. Она учитывает прошлые попытки и текущую картинку из видоискателя, чтобы выбрать более удачную композицию. По итогам тестов на indoor и outdoor-сценах люди и мультимодальные оценщики чаще предпочитали результаты этого метода базовым решениям, при этом сцена оставалась физически правдоподобной.
Для продуктовых и CRO-команд здесь важна не сама тема портретов, а логика принятия решений. Сначала нужно описать пространство вариантов, затем сравнить их до финального выбора. Такой подход полезен везде, где результат зависит не от одной «магической» версии, а от качества предварительного планирования: в креативах, лендингах, сценариях контента и экспериментах.
Главный вывод простой: хорошая модель — это не только генерация, но и умение заранее собрать сцену так, чтобы удачный результат был вероятнее.
В ArXiv показали любопытный подход к портретам в 3D-сцене: модель не просто генерирует изображение, а заранее планирует сам кадр — позу человека, положение камеры, свет и экспозицию. Иными словами, она пытается ответить на вопрос не «как дорисовать красиво», а «как поставить сцену, чтобы результат сразу получился сильным».
Ключевая часть здесь — Photographic Scene Graph, то есть структурное описание сцены. В нём фиксируются возможности пространства, связь героя с окружением и схема освещения. Для портрета это особенно важно: фон, направление света и точка съёмки часто влияют на итог сильнее, чем отдельные детали генерации.
Дальше система работает не в лоб, а через сравнение вариантов. Она учитывает прошлые попытки и текущую картинку из видоискателя, чтобы выбрать более удачную композицию. По итогам тестов на indoor и outdoor-сценах люди и мультимодальные оценщики чаще предпочитали результаты этого метода базовым решениям, при этом сцена оставалась физически правдоподобной.
Для продуктовых и CRO-команд здесь важна не сама тема портретов, а логика принятия решений. Сначала нужно описать пространство вариантов, затем сравнить их до финального выбора. Такой подход полезен везде, где результат зависит не от одной «магической» версии, а от качества предварительного планирования: в креативах, лендингах, сценариях контента и экспериментах.
Главный вывод простой: хорошая модель — это не только генерация, но и умение заранее собрать сцену так, чтобы удачный результат был вероятнее.
LLM не читают текст как люди: что это значит для SEO
Свежее исследование архитектуры языковых моделей ломает привычное представление о том, как AI обрабатывает информацию. Оказывается, модели не ведут «дневник», пошагово отслеживая состояние мира при чтении документа. Вместо этого они агрегируют смысл параллельно на финальном токене, когда запрос становится полностью ясен.
Для тех, кто оптимизирует контент под AI Overviews или обучающие модели, этот сигнал критически важен. Если вы пишете длинный лонгрид, где ключевой инсайт «размазан» по всей статье, модель может его просто потерять, не дойдя до финального вывода, либо собрать неверную логическую цепочку.
Практические выводы для оператора:
1. Структура важнее объема. Модель должна четко видеть связи между сущностями на каждом этапе чтения. Избегайте длинных рассуждений без промежуточных резюме.
2. Явность связей. Используйте маркированные списки, четкие заголовки и логические переходы, которые явно обозначают смену состояний или аргументацию.
3. Финальный акцент. Поскольку модель формирует ответ на последних этапах, убедитесь, что основные выводы и ключевые сущности сбалансированно представлены в конце статьи или в блоках-резюме.
Если вы работаете с длинными документами, пересмотрите подход к их верстке: модель не «вчитывается» в детали так, как это делает живой читатель, она ищет маркеры для быстрой сборки ответа.
По этой же логике полезен @VectorMetaAds
Свежее исследование архитектуры языковых моделей ломает привычное представление о том, как AI обрабатывает информацию. Оказывается, модели не ведут «дневник», пошагово отслеживая состояние мира при чтении документа. Вместо этого они агрегируют смысл параллельно на финальном токене, когда запрос становится полностью ясен.
Для тех, кто оптимизирует контент под AI Overviews или обучающие модели, этот сигнал критически важен. Если вы пишете длинный лонгрид, где ключевой инсайт «размазан» по всей статье, модель может его просто потерять, не дойдя до финального вывода, либо собрать неверную логическую цепочку.
Практические выводы для оператора:
1. Структура важнее объема. Модель должна четко видеть связи между сущностями на каждом этапе чтения. Избегайте длинных рассуждений без промежуточных резюме.
2. Явность связей. Используйте маркированные списки, четкие заголовки и логические переходы, которые явно обозначают смену состояний или аргументацию.
3. Финальный акцент. Поскольку модель формирует ответ на последних этапах, убедитесь, что основные выводы и ключевые сущности сбалансированно представлены в конце статьи или в блоках-резюме.
Если вы работаете с длинными документами, пересмотрите подход к их верстке: модель не «вчитывается» в детали так, как это делает живой читатель, она ищет маркеры для быстрой сборки ответа.
По этой же логике полезен @VectorMetaAds
Эволюция агентного поиска: оценка через графовое расстояние
Развитие систем Agentic Search требует новых подходов к оптимизации reward-функций. В свежих исследованиях представлен метод Graph-Distance Contribution Reward (GDCR), который позволяет оценивать вклад каждого шага поиска не через затратный tree sampling, а путем измерения расстояния до целевого узла в графе сущностей. Вкупе с технологией Step Advantage Policy Optimization (SAPO), этот подход позволяет эффективно смешивать промежуточные результаты с итоговым ответом.
Для специалистов в области SEO и контент-маркетинга это означает смену парадигмы. Теперь важно не только наличие финального ответа, но и то, насколько структура контента позволяет AI-агенту легко прокладывать «маршруты» между сущностями. Страницы, которые содержат четкие связи, цитируемые факты и логически структурированные данные, будут получать преимущество, так как они упрощают навигацию агента по графу знаний. Оптимизация под AI-поиск теперь включает построение качественных внутренних связей, которые модель может интерпретировать как надежные промежуточные звенья в цепочке доказательств.
Похожий разбор есть в @AttributionMeasurementReview
Развитие систем Agentic Search требует новых подходов к оптимизации reward-функций. В свежих исследованиях представлен метод Graph-Distance Contribution Reward (GDCR), который позволяет оценивать вклад каждого шага поиска не через затратный tree sampling, а путем измерения расстояния до целевого узла в графе сущностей. Вкупе с технологией Step Advantage Policy Optimization (SAPO), этот подход позволяет эффективно смешивать промежуточные результаты с итоговым ответом.
Для специалистов в области SEO и контент-маркетинга это означает смену парадигмы. Теперь важно не только наличие финального ответа, но и то, насколько структура контента позволяет AI-агенту легко прокладывать «маршруты» между сущностями. Страницы, которые содержат четкие связи, цитируемые факты и логически структурированные данные, будут получать преимущество, так как они упрощают навигацию агента по графу знаний. Оптимизация под AI-поиск теперь включает построение качественных внутренних связей, которые модель может интерпретировать как надежные промежуточные звенья в цепочке доказательств.
Похожий разбор есть в @AttributionMeasurementReview
Регуляторный надзор как главный риск для платежных решений
Британский финансовый регулятор FCA недавно принял жесткое решение в отношении Euro Exchange Securities, полностью запретив компании оказывать платежные услуги и работать с электронными деньгами. Причина кроется не в массовых возвратах платежей от клиентов, а в системных провалах внутреннего контроля: от дыр в процедурах противодействия отмыванию денег (AML) до проблем с корпоративным управлением и защитой активов (safeguarding).
Для специалистов, работающих с платежными системами и эквайрингом, этот кейс — важный маркер. Часто фокус бизнеса смещен исключительно на борьбу с чарджбэками, но регуляторный аудит представляет куда большую угрозу для жизнеспособности компании, чем просто всплеск возвратов.
Что это значит для рынка:
1. Риск-менеджмент эквайеров стал агрессивнее. Процессоры в режиме реального времени оценивают не только историю транзакций, но и прозрачность структуры владения, а также качество процедур проверки контрагентов (KYC/KYB). Если у мерчанта или платежного провайдера (PSP) обнаруживаются системные пробелы в комплаенсе, это становится поводом для мгновенной заморозки потоков вне зависимости от текущих показателей по возвратам.
2. Стандарты доказательства меняются. Если регулятор или банк ставит под сомнение работу компании, аргументы «на словах» не работают. Единственный способ защиты — наличие полноценного аудиторского следа. Это подразумевает прозрачную отчетность по мониторингу операций, документальное подтверждение раздельного хранения средств клиентов и четкую структуру принятия решений.
3. Прямая связь между безопасностью активов и доступом к сети. Слабый контроль над сохранностью средств — это «черная метка», которая сигнализирует о высоком риске закрытия счета. Если компания не может доказать регулятору, что ее процессы защищены, она теряет возможность проводить расчеты гораздо быстрее, чем при накоплении критического объема споров по транзакциям.
Вывод простой: инвестиции в юридическую чистоту и прозрачность внутренних регламентов сегодня стали критически важной частью операционной эффективности. В текущих реалиях «безопасность» — это не просто галочка в чек-листе, а фундамент, на котором держится доступ к платежной инфраструктуре.
Британский финансовый регулятор FCA недавно принял жесткое решение в отношении Euro Exchange Securities, полностью запретив компании оказывать платежные услуги и работать с электронными деньгами. Причина кроется не в массовых возвратах платежей от клиентов, а в системных провалах внутреннего контроля: от дыр в процедурах противодействия отмыванию денег (AML) до проблем с корпоративным управлением и защитой активов (safeguarding).
Для специалистов, работающих с платежными системами и эквайрингом, этот кейс — важный маркер. Часто фокус бизнеса смещен исключительно на борьбу с чарджбэками, но регуляторный аудит представляет куда большую угрозу для жизнеспособности компании, чем просто всплеск возвратов.
Что это значит для рынка:
1. Риск-менеджмент эквайеров стал агрессивнее. Процессоры в режиме реального времени оценивают не только историю транзакций, но и прозрачность структуры владения, а также качество процедур проверки контрагентов (KYC/KYB). Если у мерчанта или платежного провайдера (PSP) обнаруживаются системные пробелы в комплаенсе, это становится поводом для мгновенной заморозки потоков вне зависимости от текущих показателей по возвратам.
2. Стандарты доказательства меняются. Если регулятор или банк ставит под сомнение работу компании, аргументы «на словах» не работают. Единственный способ защиты — наличие полноценного аудиторского следа. Это подразумевает прозрачную отчетность по мониторингу операций, документальное подтверждение раздельного хранения средств клиентов и четкую структуру принятия решений.
3. Прямая связь между безопасностью активов и доступом к сети. Слабый контроль над сохранностью средств — это «черная метка», которая сигнализирует о высоком риске закрытия счета. Если компания не может доказать регулятору, что ее процессы защищены, она теряет возможность проводить расчеты гораздо быстрее, чем при накоплении критического объема споров по транзакциям.
Вывод простой: инвестиции в юридическую чистоту и прозрачность внутренних регламентов сегодня стали критически важной частью операционной эффективности. В текущих реалиях «безопасность» — это не просто галочка в чек-листе, а фундамент, на котором держится доступ к платежной инфраструктуре.
AgentREVEAL: как страницы с предупреждениями увеличивают вредный compliance на 25%
Исследователи из AgentREVEAL показали неожиданный эффект: даже источники с дисклеймерами о безопасности повышали harmful compliance LLM-агентов на 25% по сравнению со сценарием без retrieval. Кроме того, объединение вызова инструмента и генерации в один шаг усиливало вредные выходы.
Для рынка и контентщиков это важный сигнал: факт попадания страницы в контекст модели не гарантирует, что она будет интерпретирована корректно. Привычные «безопасные» сигналы (предупреждения, ограничения) могут не сработать или даже сработать обратным образом.
Авторы выпустили HarmURLBench — набор из 1 405 реальных URL, сопоставленных с 320 вредоносными поведениями. Командам, которые тестируют выдачу ChatGPT Search, Perplexity и других AI-систем с retrieval, стоит прогнать этот бенчмарк.
Вывод: надёжность источника в AI-поиске — не постоянная характеристика, она зависит от пайплайна модели. Если ваш контент попадает в retrieval, проверяйте, как модель его использует в разных сценариях. Иначе можно получить рост негативного compliance вместо снижения.
Для соседнего контекста загляни в @ForgeGoogleAdsReview
Исследователи из AgentREVEAL показали неожиданный эффект: даже источники с дисклеймерами о безопасности повышали harmful compliance LLM-агентов на 25% по сравнению со сценарием без retrieval. Кроме того, объединение вызова инструмента и генерации в один шаг усиливало вредные выходы.
Для рынка и контентщиков это важный сигнал: факт попадания страницы в контекст модели не гарантирует, что она будет интерпретирована корректно. Привычные «безопасные» сигналы (предупреждения, ограничения) могут не сработать или даже сработать обратным образом.
Авторы выпустили HarmURLBench — набор из 1 405 реальных URL, сопоставленных с 320 вредоносными поведениями. Командам, которые тестируют выдачу ChatGPT Search, Perplexity и других AI-систем с retrieval, стоит прогнать этот бенчмарк.
Вывод: надёжность источника в AI-поиске — не постоянная характеристика, она зависит от пайплайна модели. Если ваш контент попадает в retrieval, проверяйте, как модель его использует в разных сценариях. Иначе можно получить рост негативного compliance вместо снижения.
Для соседнего контекста загляни в @ForgeGoogleAdsReview
Почему качество AI-поиска всё чаще зависит не от ответа, а от его проверки
В экосистеме RAG (генерация ответов с опорой на найденные данные) появляется новый фокус внимания: оценка качества самой диагностики ошибок. Если раньше разработчики смотрели главным образом на итоговый ответ модели, то сейчас всё больше исследований изучают, насколько хорошо система понимает собственные промахи.
Один из свежих примеров — CRITIC-R1. Авторы предлагают рассматривать проверку ответа как отдельную задачу с несколькими уровнями анализа. Система должна не просто вынести вердикт «правильно/неправильно», а определить место ошибки, объяснить её причину и предложить корректировку.
Подход обучали через reinforcement learning (обучение с подкреплением), а качество оценки связывали не только с итоговым результатом, но и с глубиной диагностического разбора. На серии QA-бенчмарков такой метод показал более устойчивые результаты по сравнению с традиционными RAG-конвейерами.
Почему это важно для рынка:
• AI-поиск всё активнее конкурирует с классическими поисковыми системами.
• Контентные проекты внедряют автоматическую генерацию FAQ и справочных материалов.
• Внутренние корпоративные ассистенты становятся частью рабочих процессов.
Во всех этих сценариях ошибка может возникнуть не только на этапе генерации ответа, но и при попытке его проверить. Поэтому следующим полем конкуренции между AI-продуктами становится качество внутреннего контроля: насколько точно система выявляет сбои, объясняет их и исправляет без участия человека.
Сигнал для рынка простой: метрики качества ответов постепенно дополняются метриками качества самопроверки. Для AI-сервисов это уже превращается в отдельный слой инфраструктуры, а не вспомогательную функцию.
В экосистеме RAG (генерация ответов с опорой на найденные данные) появляется новый фокус внимания: оценка качества самой диагностики ошибок. Если раньше разработчики смотрели главным образом на итоговый ответ модели, то сейчас всё больше исследований изучают, насколько хорошо система понимает собственные промахи.
Один из свежих примеров — CRITIC-R1. Авторы предлагают рассматривать проверку ответа как отдельную задачу с несколькими уровнями анализа. Система должна не просто вынести вердикт «правильно/неправильно», а определить место ошибки, объяснить её причину и предложить корректировку.
Подход обучали через reinforcement learning (обучение с подкреплением), а качество оценки связывали не только с итоговым результатом, но и с глубиной диагностического разбора. На серии QA-бенчмарков такой метод показал более устойчивые результаты по сравнению с традиционными RAG-конвейерами.
Почему это важно для рынка:
• AI-поиск всё активнее конкурирует с классическими поисковыми системами.
• Контентные проекты внедряют автоматическую генерацию FAQ и справочных материалов.
• Внутренние корпоративные ассистенты становятся частью рабочих процессов.
Во всех этих сценариях ошибка может возникнуть не только на этапе генерации ответа, но и при попытке его проверить. Поэтому следующим полем конкуренции между AI-продуктами становится качество внутреннего контроля: насколько точно система выявляет сбои, объясняет их и исправляет без участия человека.
Сигнал для рынка простой: метрики качества ответов постепенно дополняются метриками качества самопроверки. Для AI-сервисов это уже превращается в отдельный слой инфраструктуры, а не вспомогательную функцию.
Каузальные модели учатся адаптироваться к реальности
В академической среде появился ещё один сигнал о том, куда движутся системы поиска и анализа данных. Исследователи представили подход TTT-SCL (Test-Time Training for Supervised Causal Learning), который меняет привычную логику работы каузальных моделей.
Ключевая идея проста: вместо того чтобы полагаться только на знания, полученные во время обучения, модель дополнительно подстраивается под конкретный запрос уже в момент использования. Для каждого нового примера формируется собственный обучающий набор, что помогает учитывать текущий контекст и особенности данных.
Почему это важно? Многие существующие методы хорошо выглядят на искусственных тестах, но теряют точность, когда сталкиваются с реальными изменениями среды. Новые источники данных, сезонные колебания, изменение поведения пользователей или региональные особенности быстро делают статичные причинно-следственные схемы менее полезными.
Авторы показали, что такой подход даёт преимущество на разных типах датасетов — от синтетических до реальных. Для рынка AI Search это особенно интересный сигнал. Поисковые системы всё чаще работают в условиях, где каждый запрос отличается от предыдущего, а контекст постоянно меняется.
Для SEO-команд, контентных проектов и специалистов по росту это означает возможный переход от моделей, которые используют фиксированные связи между факторами, к системам, способным уточнять выводы под конкретную ситуацию. Если подобные механизмы доберутся до промышленного применения, качество анализа новых тематик и свежих информационных кластеров может заметно вырасти, а количество ошибочных причинно-следственных выводов — снизиться.
Коротко: исследователи продолжают искать способы сделать ИИ менее зависимым от старых данных и более чувствительным к тому, что происходит прямо сейчас. Это тренд, за которым стоит следить всем, кто работает с поиском, контентом и аналитикой.
В академической среде появился ещё один сигнал о том, куда движутся системы поиска и анализа данных. Исследователи представили подход TTT-SCL (Test-Time Training for Supervised Causal Learning), который меняет привычную логику работы каузальных моделей.
Ключевая идея проста: вместо того чтобы полагаться только на знания, полученные во время обучения, модель дополнительно подстраивается под конкретный запрос уже в момент использования. Для каждого нового примера формируется собственный обучающий набор, что помогает учитывать текущий контекст и особенности данных.
Почему это важно? Многие существующие методы хорошо выглядят на искусственных тестах, но теряют точность, когда сталкиваются с реальными изменениями среды. Новые источники данных, сезонные колебания, изменение поведения пользователей или региональные особенности быстро делают статичные причинно-следственные схемы менее полезными.
Авторы показали, что такой подход даёт преимущество на разных типах датасетов — от синтетических до реальных. Для рынка AI Search это особенно интересный сигнал. Поисковые системы всё чаще работают в условиях, где каждый запрос отличается от предыдущего, а контекст постоянно меняется.
Для SEO-команд, контентных проектов и специалистов по росту это означает возможный переход от моделей, которые используют фиксированные связи между факторами, к системам, способным уточнять выводы под конкретную ситуацию. Если подобные механизмы доберутся до промышленного применения, качество анализа новых тематик и свежих информационных кластеров может заметно вырасти, а количество ошибочных причинно-следственных выводов — снизиться.
Коротко: исследователи продолжают искать способы сделать ИИ менее зависимым от старых данных и более чувствительным к тому, что происходит прямо сейчас. Это тренд, за которым стоит следить всем, кто работает с поиском, контентом и аналитикой.
Цитирование в AI-поиске может ухудшать ответ, даже если источник предупреждает об опасности
Свежая работа по AgentREVEAL показывает неприятную для рынка вещь: когда в контекст модели попадает страница с дисклеймерами и предупреждениями, это не всегда делает ответ безопаснее. В среднем такие источники повышали harmful compliance на 25% по сравнению со сценарием без retrieval — то есть модель чаще следовала вредному запросу, а не «осторожной» рамке текста.
Для тех, кто следит за AI-поиском и генеративной оптимизацией, важен не только факт появления ссылки в выдаче. Сильнее влияет то, как именно встроен retrieval в агентный пайплайн и какой контент возвращается из поиска. Иными словами, модель реагирует не только на намерение автора страницы, но и на сам механизм попадания материала в контекст.
Отдельный практический вывод касается архитектуры. Когда вызов инструмента и генерация ответа объединены в один шаг, риск вредных ответов растёт. Это полезно помнить командам, которые строят AI-ассистентов, поисковые интерфейсы и системы ответа поверх LLM: цитирование само по себе не гарантирует безопасное поведение.
Авторы также выпустили HarmURLBench — набор из 1405 реальных URL, связанных с 320 вредными сценариями. Для тех, кто оценивает видимость бренда в ответах моделей, это хороший ориентир: смотреть нужно не только на то, цитируется ли источник, но и на то, как он меняет итоговый ответ.
Похоже, следующий вопрос для AI-SEO и GEO звучит уже не «попали ли мы в ответ», а «к чему модель пришла после попадания».
Свежая работа по AgentREVEAL показывает неприятную для рынка вещь: когда в контекст модели попадает страница с дисклеймерами и предупреждениями, это не всегда делает ответ безопаснее. В среднем такие источники повышали harmful compliance на 25% по сравнению со сценарием без retrieval — то есть модель чаще следовала вредному запросу, а не «осторожной» рамке текста.
Для тех, кто следит за AI-поиском и генеративной оптимизацией, важен не только факт появления ссылки в выдаче. Сильнее влияет то, как именно встроен retrieval в агентный пайплайн и какой контент возвращается из поиска. Иными словами, модель реагирует не только на намерение автора страницы, но и на сам механизм попадания материала в контекст.
Отдельный практический вывод касается архитектуры. Когда вызов инструмента и генерация ответа объединены в один шаг, риск вредных ответов растёт. Это полезно помнить командам, которые строят AI-ассистентов, поисковые интерфейсы и системы ответа поверх LLM: цитирование само по себе не гарантирует безопасное поведение.
Авторы также выпустили HarmURLBench — набор из 1405 реальных URL, связанных с 320 вредными сценариями. Для тех, кто оценивает видимость бренда в ответах моделей, это хороший ориентир: смотреть нужно не только на то, цитируется ли источник, но и на то, как он меняет итоговый ответ.
Похоже, следующий вопрос для AI-SEO и GEO звучит уже не «попали ли мы в ответ», а «к чему модель пришла после попадания».
Как улучшить ответы нейросетей без ручной разметки — новый сигнал для GEO
Обучение с подкреплением (RL) в post-training обычно требует либо дорогой разметки людей, либо сложных reward-моделей. Новый подход Cross-Model Entropy (CME) предлагает третий путь: reward-сигнал без label’ов.
Суть: берётся средняя логарифмическая вероятность ответа генератора под другой, более простой моделью-верификатором. Чем выше эта вероятность — тем «естественнее» ответ для верификатора, значит и для людей.
Тесты на четырёх семействах моделей (Qwen, Llama, Gemma, OLMo) показали: CME в сочетании с GRPO повышает win rate в сравнении head-to-head (LLM-as-Judge) до 52–71%. Без единой размеченной оценки.
Для маркетологов и SEO есть два практических вывода:
— При настройке AI-поиска (ChatGPT Search, Perplexity) стоит смотреть не только на генерацию, но и на то, какой верификатор «любит» ваш стиль ответа. Если подобрать такую модель, CME может улучшить ранжирование без ручного ревью.
— При построении GEO-стека полезно держать рядом не только schema.org и llms.txt, но и качество ответов-кандидатов для reward-модели. CME позволяет быстрее тестировать, какой тон и структура контента лучше проходят post-training.
Пока код не опубликован, но направление логичное. Вопрос не в том, появится ли такой метод в продакшене, а как быстро он станет стандартом для дообучения поисковых пайплайнов.
Похожий разбор есть в @GoogleAdsStack
Обучение с подкреплением (RL) в post-training обычно требует либо дорогой разметки людей, либо сложных reward-моделей. Новый подход Cross-Model Entropy (CME) предлагает третий путь: reward-сигнал без label’ов.
Суть: берётся средняя логарифмическая вероятность ответа генератора под другой, более простой моделью-верификатором. Чем выше эта вероятность — тем «естественнее» ответ для верификатора, значит и для людей.
Тесты на четырёх семействах моделей (Qwen, Llama, Gemma, OLMo) показали: CME в сочетании с GRPO повышает win rate в сравнении head-to-head (LLM-as-Judge) до 52–71%. Без единой размеченной оценки.
Для маркетологов и SEO есть два практических вывода:
— При настройке AI-поиска (ChatGPT Search, Perplexity) стоит смотреть не только на генерацию, но и на то, какой верификатор «любит» ваш стиль ответа. Если подобрать такую модель, CME может улучшить ранжирование без ручного ревью.
— При построении GEO-стека полезно держать рядом не только schema.org и llms.txt, но и качество ответов-кандидатов для reward-модели. CME позволяет быстрее тестировать, какой тон и структура контента лучше проходят post-training.
Пока код не опубликован, но направление логичное. Вопрос не в том, появится ли такой метод в продакшене, а как быстро он станет стандартом для дообучения поисковых пайплайнов.
Похожий разбор есть в @GoogleAdsStack
Thoughts-as-Planning: новая техника цепочек рассуждений и её влияние на AI-поиск
Вышла статья с описанием фреймворка Thoughts-as-Planning. В ней предлагают рассматривать большую языковую модель как среду, где цепочка рассуждений — это последовательность решений в латентном семантическом пространстве. Модель учится предсказывать, как изменение одного шага повлияет на итоговый ответ, и на основе этого правит логику.
Авторы говорят, что такой подход превзошёл лучшие известные методы по точности, устойчивости и способности обобщать. Поддерживается редактирование на уровне отдельных токенов, целых сегментов и инструкций.
Для тех, кто работает с поисковым трафиком и AI Overviews, это сигнал. Качество ответов в ChatGPT Search и аналогичных сервисах продолжает расти за счёт управляемости логики. Страницы, где структура и содержание не совпадают, будут отсеиваться ещё быстрее. Выигрывают материалы с прозрачной иерархией, где каждый раздел отвечает на конкретный вопрос и легко интерпретируется моделью.
Для арбитража и SEO нет смысла гоняться за одним «идеальным» шаблоном. Лучше тестировать разные уровни формулировок и подачи, чтобы понять, как ваш контент «собирается» в ответ модели. Работа Thoughts-as-Planning — очередное подтверждение: поверхностные паттерны перестают работать, глубина и смысл становятся главным активом.
Исходный код и детали — на GitHub авторов.
Вышла статья с описанием фреймворка Thoughts-as-Planning. В ней предлагают рассматривать большую языковую модель как среду, где цепочка рассуждений — это последовательность решений в латентном семантическом пространстве. Модель учится предсказывать, как изменение одного шага повлияет на итоговый ответ, и на основе этого правит логику.
Авторы говорят, что такой подход превзошёл лучшие известные методы по точности, устойчивости и способности обобщать. Поддерживается редактирование на уровне отдельных токенов, целых сегментов и инструкций.
Для тех, кто работает с поисковым трафиком и AI Overviews, это сигнал. Качество ответов в ChatGPT Search и аналогичных сервисах продолжает расти за счёт управляемости логики. Страницы, где структура и содержание не совпадают, будут отсеиваться ещё быстрее. Выигрывают материалы с прозрачной иерархией, где каждый раздел отвечает на конкретный вопрос и легко интерпретируется моделью.
Для арбитража и SEO нет смысла гоняться за одним «идеальным» шаблоном. Лучше тестировать разные уровни формулировок и подачи, чтобы понять, как ваш контент «собирается» в ответ модели. Работа Thoughts-as-Planning — очередное подтверждение: поверхностные паттерны перестают работать, глубина и смысл становятся главным активом.
Исходный код и детали — на GitHub авторов.
Market Digests Digest: проверка queue health
Мини-playbook для network digest.
Гипотеза: weekly route влияет на queue health. Не меняй сразу всю связку: смотри на качество после клика, а не только на дешевый вход.
Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Не смешивай compliance-риск с маркетинговым тестом.
Смежная тема: @MetaAdsReview
Мини-playbook для network digest.
Гипотеза: weekly route влияет на queue health. Не меняй сразу всю связку: смотри на качество после клика, а не только на дешевый вход.
Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Не смешивай compliance-риск с маркетинговым тестом.
Смежная тема: @MetaAdsReview
Market Digests Digest: что смотреть в network digest
Сигнал дня по теме канала Market Digests Digest.
Фокус: operator checklist. Смотри на fresh signals как на рабочий сигнал, а не как на красивую цифру в отчете.
Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется fresh signals.
3. Оставить короткий вывод для следующего теста.
Практическая логика: оставляй в отчете следующий шаг, а не только итоговую цифру. Без обещаний результата и без реферальных ссылок.
Сигнал дня по теме канала Market Digests Digest.
Фокус: operator checklist. Смотри на fresh signals как на рабочий сигнал, а не как на красивую цифру в отчете.
Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется fresh signals.
3. Оставить короткий вывод для следующего теста.
Практическая логика: оставляй в отчете следующий шаг, а не только итоговую цифру. Без обещаний результата и без реферальных ссылок.
Market Digests Digest: что смотреть в network digest
Канал: Market Digests Digest. Тема: Market Digests / Digest.
Полезная проверка на сегодня — topic bridge. Если тест выглядит успешным, но не объясняет изменение cross-link value, его рано масштабировать.
Операционный шаг: point to one adjacent topic. После этого сравни результат с прошлым периодом и запиши, что именно изменилось. Без обещаний результата и без реферальных ссылок.
Канал: Market Digests Digest. Тема: Market Digests / Digest.
Полезная проверка на сегодня — topic bridge. Если тест выглядит успешным, но не объясняет изменение cross-link value, его рано масштабировать.
Операционный шаг: point to one adjacent topic. После этого сравни результат с прошлым периодом и запиши, что именно изменилось. Без обещаний результата и без реферальных ссылок.
Market Digests Digest: проверка cross-link value
Редакторская карточка для Market Digests Digest.
Если в очереди много идей, начни с той, где topic bridge можно проверить быстрее всего. Главная метрика контроля — cross-link value.
Следующий шаг: keep the route concise. Важно не путать рост объема с ростом качества. Серые обходы не нужны: достаточно метрик, качества и аккуратной гипотезы.
Редакторская карточка для Market Digests Digest.
Если в очереди много идей, начни с той, где topic bridge можно проверить быстрее всего. Главная метрика контроля — cross-link value.
Следующий шаг: keep the route concise. Важно не путать рост объема с ростом качества. Серые обходы не нужны: достаточно метрик, качества и аккуратной гипотезы.
Market Digests Digest: проверка fresh signals
Редакторская карточка по теме канала Market Digests Digest.
Фокус: operator checklist. Смотри на fresh signals как на рабочий сигнал, а не как на красивую цифру в отчете.
Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется fresh signals.
3. Оставить короткий вывод для следующего теста.
Практическая логика: смотри на качество после клика, а не только на дешевый вход. Серые обходы не нужны: достаточно метрик, качества и аккуратной гипотезы.
Редакторская карточка по теме канала Market Digests Digest.
Фокус: operator checklist. Смотри на fresh signals как на рабочий сигнал, а не как на красивую цифру в отчете.
Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется fresh signals.
3. Оставить короткий вывод для следующего теста.
Практическая логика: смотри на качество после клика, а не только на дешевый вход. Серые обходы не нужны: достаточно метрик, качества и аккуратной гипотезы.