AI Creative Tools Stack
3 subscribers
1 photo
15 links
AI creative tools / наблюдения
Download Telegram
Закат эпохи WER: почему мы учим ИИ понимать смыслы, а не слова

Традиционные метрики оценки качества распознавания речи — WER (Word Error Rate) и CER (Character Error Rate) — стремительно теряют актуальность в задачах, где важна не точность транскрипции, а результат. В недавних исследованиях фокус смещается в сторону Agentic ASR. Теперь процесс распознавания — это не линейный перевод аудио в текст, а итеративное уточнение, где модель занимается коррекцией семантики и маршрутизацией интента.

Ключевым нововведением становится метрика S²ER (Sentence-level Semantic Error Rate). Она оценивает не количество совпавших слов, а глубину понимания смысла. Для тех, кто выстраивает AI-агентов, контентные пайплайны или работает с голосовыми интерфейсами, это критический сигнал: оценка «правильности» ответа теперь должна происходить на уровне концептов. Если ваша система выдает грамматически безупречный, но бесполезный с точки зрения интента текст, старые метрики покажут успех, а пользователь — отток. В эпоху AI Search побеждает тот, чьи модели лучше улавливают контекстуальный запрос, даже если при транскрипции были допущены мелкие лексические погрешности.

Связанная тема раскрывается в @TrackingStackSignal
Как меняется ценность AI-ответов, когда их оценивает другая модель

В посттренинге для LLM появляется любопытный сдвиг: модель учат не только отвечать, но и проходить оценку у отдельного verifier-а. В одной из свежих работ предложили Cross-Model Entropy — сигнал награды, который считает среднюю log-likelihood генерации под другой моделью-судьёй. Это встроили в GRPO без перестройки цикла обучения, то есть механизм оказался довольно прикладным.

На open-ended instruction following такой подход дал прирост против базовой версии на нескольких семействах моделей. Для креативной и контентной индустрии здесь важна не сама формула, а эффект: качество ответа всё сильнее определяется не только фактической точностью, но и тем, насколько он выглядит цельным, убедительным и легко принимается оценщиком.

Для продюсеров и редакторов это сигнал к более строгому контролю структуры. Если материал потом пойдёт в AI Search, обзоры, ассистенты или внутренние knowledge-системы, выигрывают тексты, где мысль собрана без шума, а каждый блок можно быстро подтвердить. Иначе говоря, «хорошо звучит» и «проходит проверку» всё чаще становятся одной метрикой.
Google I/O как сигнал для креативных команд: AI уходит в продакшн, а не только в демонстрации

На этой I/O интереснее не сама сцена, а то, куда Google двигает инструменты вокруг неё. Universal Cart — это попытка сделать покупку сквозной между разными поверхностями. Для ecom и affiliate это важнее очередной яркой генерации: путь пользователя всё сильнее собирается в один маршрут от поиска до оплаты.

Для креативщиков здесь есть важный вывод. Если интерфейсы, поиск и корзина становятся частью одной системы, то выигрывают не самые «красивые» креативы, а те, которые лучше попадают в намерение пользователя и не ломаются на разных этапах воронки. Иными словами, креатив теперь нужно думать не только как объявление, но и как элемент маршрута.

Ещё один маркер — Google отдельно сказал, что в прошлом квартале поисковых запросов было рекордно много. На фоне разговоров о «смерти поиска» это напоминание: поиск не исчезает, он меняет форму и становится более встроенным в AI-опыт.

Отдельно показательно сообщение для паблишеров: писать для людей, а не для AI. Это хороший сигнал для всех, кто работает с креативом и контентом через генеративные модели. Массовый текст ради массового текста уже не выглядит как стратегия, которую платформы готовы поощрять.

Для команд, которые строят автоматизацию, тоже есть движение: Gemini 3.5 Flash используется в Antigravity — инструменте, который по духу ближе к среде для сборки и разработки, чем к обычному чат-боту. То есть AI всё меньше ограничивается генерацией и всё больше влияет на то, как собираются продукты и процессы.

Практический вывод простой: пока рано перестраивать рабочие схемы под новые фичи, но уже пора следить за тем, как Google связывает поиск, покупку и создание. Это может поменять требования и к креативам, и к контролю качества, и к тому, как выглядит «нормальный» AI-воркфлоу.
Как LLM учатся без разметки и что это меняет для AI Search

В посттренинге LLM постепенно появляется интересный обходной путь: вместо человеческой разметки модель можно дообучать через сигнал от другой модели. В arXiv-работе предложили Cross-Model Entropy — reward, который считают как среднюю log-likelihood ответа генератора под verifier-моделью. Иными словами, одна модель оценивает ответ другой, а этот сигнал идёт в RL.

Авторы встроили подход в GRPO без изменения самого training loop и получили заметный выигрыш на open-ended instruction following. По тестам на нескольких семействах моделей метод обгонял базовую версию в head-to-head сравнениях.

Для тех, кто делает контент под AI Search, AI Overviews или ответные интерфейсы, тут важная практическая мысль: качество всё сильнее определяется не только тем, как текст выглядит для человека, но и тем, как его “считывает” вторая модель. Значит, привычные метрики вроде CTR и дочитывания уже недостаточны. Нужен ещё слой проверки: как текст оценивает LLM-верификатор, насколько он считается надёжным, структурным и удобным для цитирования. Это особенно важно, если вы пишете материалы, которые должны попадать в выдачу с ответами, а не просто собирать клики.

Похожий разбор есть в @VectorPrivacyFirstMeasurement
AI-агенты как креативные проверяющие: новый взгляд на защиту через имитацию

Когда речь заходит о безопасности, креативные команды обычно в стороне. Но недавнее исследование показало: технологии, похожие на те, что мы используем для генерации контента, могут стать инструментом не только для создания, но и для проверки — даже в смежных областях вроде кибербезопасности.

Учёные разработали систему под названием Honeyval — она тестирует так называемые ханипоты, ловушки для злоумышленников, где вместо жёстких правил используются LLM. Представьте: бот, имитирующий админку сайта, ведёт диалог с атакующим, отвечает на запросы, "путается" в логике, но при этом держит его в системе дольше, чем стандартные заглушки. Цель — не просто зафиксировать вторжение, а вытянуть из атакующего как можно больше поведенческих данных.

Интересно, что такие AI-ханипоты оказались заметно эффективнее rule-based аналогов: сессии взаимодействия длились дольше, а сами ловушки реже распознавались. Особенно любопытно поведение cost-efficient моделей — дешёвые, но умелые в поддержании диалога. Это напоминает, как мы в креативе выбираем инструменты: не всегда топовая модель даёт лучший результат, важна настройка и сценарий.

Что из этого можно взять для продюсеров и креативщиков? Сам принцип — использовать ИИ не только как генератор, но как активного участника процесса проверки. Например, в тестировании UX-потоков, валидации рекламных кампаний или симуляции поведения аудитории. Если бот может вести правдоподобный диалог с хакером, почему бы не попробовать его как "псевдозритель" для проверки креативов?

Сейчас многие собирают метрики по фактам взаимодействия. Но ключевой вопрос — а сколько времени пользователь проводит в системе? Длительность, а не количество, может стать новой метрикой убедительности.
Когда интонация запроса управляет траекторией AI-агента

Новый подход E3AD в end-to-end driving показал: чтобы машина правильно выполнила естественную команду, нужно отдельно моделировать эмоцию (через continuous Valence-Arousal-Dominance) и пространственные рассуждения через dual-pathway spatial reasoning. На реальных датасетах модель дала SOTA по VAD correlation для оценки эмоций, улучшила visual grounding и waypoint planning. Ключевой элемент — preference-based alignment, соединяющий намерение и действие.

Наблюдение для тех, кто строит AI-агентов для CRM, саппорта или генерации кампаний: длинная команда часто теряет тон и приоритет, а план исполнения «уезжает» в сторону. Проблема не в модели, а в пайплайне — если не разделить «интонацию запроса» и «план исполнения», coherence ломается.

Проверьте своих агентов: совпадает ли intent пользователя с тем, что реально делает система? Часто execution живёт отдельно. Добавьте отдельный блок анализа тона и намерения перед генерацией ответа — это улучшит связность без переобучения всей модели. Следующий шаг — убедиться, что план действий действительно отражает исходную команду, а не свою логику.
Чем меньше бриф, тем больше правды в догадках модели

Недавний тест четырёх крупных языковых моделей показал: одна из них удерживала 70% точности выводов даже при минимальном контексте. Исследователи давали только тему и исследовательский вопрос, а детали раскрывали порциями, сверяя итог с первоисточником через семантическое сходство отдельных утверждений.

Для креативной индустрии это узнаваемая ситуация. Продюсер редко выдаёт полный бриф сразу: обычно это референс, потом уточнение, потом правки. Когда модель генерирует концепт, скрипт или раскадровку по кускам входящих данных, важно не столько качество картинки, сколько её соответствие изначальному замыслу после каждой итерации.

Вывод для практики: проверяйте не финальный результат, а каждый шаг. Сравнивайте промежуточные выводы с исходной задачей отдельно. Если модель схватила суть на первых двух предложениях брифа, дальнейшие правки уточнят детали, не разрушив логику. Если нет — чем больше контекста вы добавите, тем глубже она закопается в неверной интерпретации.
InsightEval: когда агент пишет красиво, но не находит новых идей

Новый датасет и бенчмарк InsightEval вскрывает разрыв между связным ответом LLM-агента и реальным обнаружением инсайтов. Авторы построили pipeline для сбора датасета и метрику exploratory performance, и обнаружили, что существующий InsightBench страдает от проблем с форматом, нечёткими целями и повторяющимися выводами.

Наблюдение: агент может сгенерировать отчёт, который выглядит логично, но не содержит ни одной новой аномалии — он просто пересказывает таблицу. Для креативной аналитики (daily reports, creative mining, postback-анализ) это критично.

Если вы используете LLM-агентов для поиска идей или выявления трендов, ставьте несколько жёстких проверок:
- Coverage: охвачены ли все значимые сегменты данных?
- Novelty: сколько выводов повторяют уже известное?
- Redundancy: не дублируются ли инсайты?

Практический вывод: не доверяйте одной задаче «сделай выводы». Лучше добавить пару метрик, которые отслеживают, насколько глубоко агент исследовал данные, а не просто переформулировал средние значения. Если ваш AI-инструмент генерирует отчёты — проверьте, не пропускает ли он аномалии, которые заметил бы человек.
Гибридные идентификаторы: как избежать потери данных в рекомендательных системах

Работа рекомендательных систем и поисковых алгоритмов часто упирается в конфликт между семантической близостью объектов и их уникальной идентичностью. Использование только семантических ID (SID) может приводить к размытию уникальности из-за квантизации, тогда как жесткие хэш-идентификаторы (HID) плохо передают контекстную связь между элементами. Фреймворк H2Rec предлагает решение через двухуровневое выравнивание: создание архитектуры, где семантика и коллаборативная идентификация сосуществуют параллельно.

Для разработчиков MarTech-решений это показательный пример того, как важно не пытаться заменить одну методику другой, а искать способы их синтеза. В коммерческих тестах такой подход позволил сбалансировать рекомендации как для популярных, так и для редких объектов (head и tail). Если ваш продукт использует сложные схемы идентификации контента или пользователей, стоит проанализировать, не происходит ли «каннибализация» одного типа данных другим в процессе обучения. Гибридные подходы становятся стандартом для систем, где требуется высокая точность выдачи в условиях большого объема разнородного контента.
Парафраз теперь ломает не только стиль, но и проверку происхождения текста

В AI-креативе это особенно заметно: один и тот же материал может пройти через переписывание, сокращение, суммаризацию или склейку предложений и на выходе выглядеть «новым», хотя по сути остаться тем же. Для систем контроля качества это плохая новость — обычного сравнения по словам уже мало.

AliMark предлагает смотреть на sentence-level watermarking как на задачу кодирования и последующего сопоставления. Сначала модель генерирует несколько переработанных версий текста, а затем выстраивает извлечённые из них биты в нужную последовательность с учётом секретного шаблона. Смысл в том, чтобы снизить цену выравнивания и не терять метку при сильной переформулировке.

Что важно для креативщиков и продюсеров:
- текст может быть переписан без потери структуры смысла;
- разбиение и объединение предложений часто вредят сильнее, чем сам парафраз;
- детектору теперь нужно сравнивать не одну версию, а несколько возможных представлений одного и того же текста.

По сути, это хороший сигнал для всех, кто строит пайплайны на AI-контенте: если у вас есть верификация, дедупликация, контроль оригинальности или защита авторских материалов, проверять надо не только «что написано», но и «как текст был пересобран».

Именно на этом уровне современные переписыватели становятся опаснее: они не просто меняют формулировки, а разрывают механики, на которых держится автоматическая проверка.

По этой же логике полезен @DeskTrackingStack
Как LLM «собирают» ответ: не накоплением, а скачком

Языковые модели не строят понимание текста постепенно, как человек. Новое исследование показывает: они не ведут внутреннее состояние ни по миру, ни по логике запроса в процессе чтения токенов. Вместо этого — ключевые фрагменты активируются почти одновременно, а финальный ответ формируется в последних слоях, как сборка пазла.

Это значит, что модель не «думает» от начала к концу, а скорее ждёт сигнала — и только тогда запускает процесс компоновки. Важные сущности, факты, логические связи должны быть легко доступны в момент этого скачка. Если информация размазана по тексту, скрыта за метафорами или требует цепочки умозаключений — шансы, что она попадёт в ответ, резко падают.

Интересно и другое: операция подавления, например, когда модель должна «забыть» или исключить что-то, работает через хрупкий глобальный механизм. Его можно нарушить — и тогда модель начнёт включать то, что явно просили убрать. Причём сбой предсказуем: он связан с тем, как этот «тег подавления» распространяется по слоям. В экспериментах его удавалось обнулить механистически — и поведение модели менялось.

Для креативов на базе LLM — особенно в видео, сценариях, генерации образов — это сигнал: структура важна не только для человека. Чёткие переходы, явные указания на состояние («теперь он злится», «объект исчезает»), выделенные ключевые метки — всё это повышает шанс, что модель правильно соберёт кадр, сцену или описание.

Не рассчитывайте на постепенное накопление смысла. Думайте, как о последнем шаге перед выдачей — и оформляйте контент так, чтобы он «собирался» легко.
Когда LLM оценивают только по финальному ответу, теряется важная часть картины: как модель ведёт себя по мере поступления фактов. Для креативных AI-инструментов это особенно заметн

В одном из свежих бенчмарков проверяли GPT-5, GPT-5.4, Gemini 2.5 Pro и Gemini 3.1 Pro preview на 45 научных статьях по материалам. Сценарий был не совсем привычный: модели сначала показывали только тему и исследовательский вопрос, а затем раскрывали данные по шагам. После каждого этапа ответ сопоставляли с выводами исходной статьи не по общему ощущению, а по набору атомарных утверждений — маленьких смысловых единиц.

Что здесь полезно для продюсеров и креативных команд:
- модель может быть сильной в «первом впечатлении», но терять точность, когда контекст расширяется;
- хороший результат на коротком промпте не гарантирует стабильность на длинном пайплайне;
- проверять нужно не один финальный текст, а несколько состояний одного и того же задания.

У GPT-5.4, по данным этого теста, даже при минимальном контексте получилось высокое совпадение с исходными выводами. Но ценность бенчмарка не только в цифре. Он показывает более практичную вещь: в AI-креативе и AI-search важна не разовая генерация, а устойчивость смысла на разных этапах раскрытия брифа.

Для своей работы это можно перевести в простой принцип: тестируйте не один запрос, а цепочку из нескольких шагов — короткий ввод, уточнение, полный бриф. Так быстрее видно, где инструмент держит задачу, а где начинает додумывать лишнее.
AI Creative Tools Stack: проверка cost per asset

Мини-playbook для AI and martech.

Гипотеза: tool stack влияет на cost per asset. Не меняй сразу всю связку: фиксируй причину решения, чтобы через неделю не спорить с собственной статистикой.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Не смешивай compliance-риск с маркетинговым тестом.
Редакторская карточка: AI and martech и agent QA

Редакторская карточка по теме канала AI Creative Tools Stack.

Фокус: agent QA. Смотри на error rate как на рабочий сигнал, а не как на красивую цифру в отчете.

Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется error rate.
3. Оставить короткий вывод для следующего теста.

Практическая логика: смотри на качество после клика, а не только на дешевый вход. Любой рост проверяй через качество, а не только через объем.
AI Creative Tools Stack: что смотреть в AI and martech

Мини-playbook для AI and martech.

Гипотеза: data handoff влияет на cost per asset. Не меняй сразу всю связку: разделяй выводы по источнику, офферу и посадочной странице.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Без обещаний результата и без реферальных ссылок.
Сигнал дня: data handoff для AI Creative Tools Stack

Сигнал дня по теме канала AI Creative Tools Stack.

Фокус: data handoff. Смотри на cost per asset как на рабочий сигнал, а не как на красивую цифру в отчете.

Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется cost per asset.
3. Оставить короткий вывод для следующего теста.

Практическая логика: оставляй в отчете следующий шаг, а не только итоговую цифру. Если формулировка звучит как гарантия, ее лучше переписать.
AI Creative Tools Stack: проверка cost per asset

Мини-playbook для AI and martech.

Гипотеза: human review влияет на cost per asset. Не меняй сразу всю связку: фиксируй причину решения, чтобы через неделю не спорить с собственной статистикой.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Серые обходы не нужны: достаточно метрик, качества и аккуратной гипотезы.

Смежная тема: @VectorWebviewMobileFunnels
Редакторская карточка: AI and martech и data handoff

Редакторская карточка по теме канала AI Creative Tools Stack.

Фокус: data handoff. Смотри на cost per asset как на рабочий сигнал, а не как на красивую цифру в отчете.

Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется cost per asset.
3. Оставить короткий вывод для следующего теста.

Практическая логика: оставляй в отчете следующий шаг, а не только итоговую цифру. Не смешивай compliance-риск с маркетинговым тестом.
AI Creative Tools Stack: что смотреть в AI and martech

Мини-playbook для AI and martech.

Гипотеза: data handoff влияет на reuse rate. Не меняй сразу всю связку: смотри на качество после клика, а не только на дешевый вход.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Любой рост проверяй через качество, а не только через объем.
Сигнал дня: prompt quality для AI Creative Tools Stack

Сигнал дня по теме канала AI Creative Tools Stack.

Фокус: prompt quality. Смотри на cost per asset как на рабочий сигнал, а не как на красивую цифру в отчете.

Что сделать сегодня:
1. Зафиксировать исходную гипотезу.
2. Проверить, где меняется cost per asset.
3. Оставить короткий вывод для следующего теста.

Практическая логика: фиксируй причину решения, чтобы через неделю не спорить с собственной статистикой. Без обещаний результата и без реферальных ссылок.
AI Creative Tools Stack: проверка handoff latency

Мини-playbook для AI and martech.

Гипотеза: data handoff влияет на handoff latency. Не меняй сразу всю связку: перед масштабированием проверь, не растет ли скрытая цена ошибки.

Хороший отчет по такому тесту помещается в три строки: что поменяли, какой сигнал увидели, что делаем дальше. Если формулировка звучит как гарантия, ее лучше переписать.