AI Creative Tools Stack
3 subscribers
1 photo
15 links
AI creative tools / наблюдения
Download Telegram
VLM начали замечать в видео не только смысл, но и «плохую механику»

У исследователей вышла любопытная работа про модель CaC — это reward-модель на базе vision-language model, которая учится оценивать видео не по общему впечатлению, а по мелким сбоям: где кадр «поплыл», где объект дрогнул, где аномалия видна только в коротком отрезке. Для этого собрали большой датасет с покадровыми рамками, временными окнами аномалий и детализацией, что именно не так.

Что важно для креативных команд: такие модели уже лучше подходят не просто для генерации и описания видео, а для контроля качества. Они умеют ловить то, что человек часто пропускает при быстром просмотре: странную геометрию рук, скачущие детали на фоне, микросбои в движении, нелогичные переходы между кадрами.

В тестах CaC заметно улучшил точность на fine-grained бенчмарках, а как reward signal ещё и снизил количество аномалий в сгенерированном видео. То есть модель можно использовать не только как «оценщика», но и как часть контура обучения и отбора лучших вариантов.

Практический вывод для AI-креатива простой: проблема всё меньше в том, «понял ли ИИ, что вы хотели», и всё больше в том, держится ли результат стабильно от кадра к кадру. Для видео, особенно рекламного и продуктового, это уже критичный слой качества. Пока многие оценивают ролик по общей эстетике, новые VLM смотрят глубже — на целостность движения, локальные артефакты и временную связность.
Google I/O: новые контуры поискового маркетинга

Последние апдейты от Google задают вектор, который сложно игнорировать продакшенам и командам, работающим с трафиком. Главная новость — внедрение Universal Cart. Google планомерно превращает поиск в полноценную торговую площадку, где контент, выдача и кнопка оплаты сливаются в единый цикл. Для креативщиков это означает, что путь пользователя до конверсии становится короче, а требования к визуальной подаче продукта — жестче. Важно не просто наличие товара, а то, как он «читается» алгоритмами в контексте покупки.

Интересно наблюдать за противоречием в позиции компании. С одной стороны, они активно внедряют AI-инструменты в поиск, с другой — настойчиво транслируют мантру «write for humans». На практике это означает, что чистая генерация контента без добавленной ценности теряет смысл. Алгоритмы стали лучше распознавать структуры, которые созданы исключительно для накрутки веса. В текущих реалиях качественная проработка структуры лендинга или статьи — это не только SEO, но и способ удержаться в выдаче, которая становится всё более персонализированной.

Статистика запросов также показывает, что поиск не умирает, а трансформируется. Наблюдается исторический максимум активности пользователей, что опровергает тезис о смерти классического поиска под натиском AI-ассистентов. Для тех, кто планирует свои связки, вывод простой: нужно готовить контент, который органично вписывается в shopping-экосистему Google, делая ставку на пользу и понятную структуру, а не на техническую оптимизацию ради роботов.
Почему AI лучше понимает не «красивый текст», а собранный по кускам

В свежем тесте ProjectionBench сравнили несколько моделей на 45 научных статьях по материалам: bioactive, mechanical и nanomaterials. Сценарий был показательный: сначала модель видела только тему и исследовательский вопрос, потом ей постепенно раскрывали всё больше деталей. Ответы сверяли не по общему впечатлению, а по совпадению атомарных утверждений с выводами оригинальных работ.

Самый любопытный результат — GPT-5.4 уже на минимальном контексте дал alignment около 0.7 с финальными выводами. То есть модель довольно уверенно угадывала направление мысли ещё до того, как ей показали весь текст.

Что это говорит не только про науку, но и про AI-креативы и контент в целом.

Модели, которые генерируют ответы, видео-описания, summary или рекомендации, хуже работают с «размазанным» смыслом. Им проще собрать вывод, если материал разбит на короткие смысловые блоки:
- одна мысль — один абзац;
- один тезис — одна формулировка;
- меньше скрытых связок и намёков;
- больше явных опор, которые можно переиспользовать.

Для продюсера это практический вывод: если вы делаете материал, который должен хорошо читаться и человеком, и моделью, думайте не только о стиле, но и о структуре. Короткие смысловые единицы лучше распознаются, переупаковываются и цитируются. А длинный «текучий» текст часто проигрывает там, где AI должен быстро извлечь суть — в поиске, в summary, в подборках и в генеративных ответах.

Иными словами, для AI-видимости важна не только тема, но и способ упаковки мысли. Модель охотнее цепляется за текст, где вывод можно достать без лишней археологии.
Безопасность AI-креативов: новый стандарт от OpenAI

OpenAI официально внедрила политику ответственного раскрытия уязвимостей в стороннем коде (Outbound Coordinated Disclosure). Для креативных команд, которые активно используют AI-инструменты вроде Cursor, Bolt, Lovable или Claude Code для сборки лендингов, виджетов и интерактивных прототипов, это сигнал к пересмотру подходов безопасности.

Когда AI-агент генерирует страницу за минуту, он может бесконтрольно потянуть npm-пакеты, шрифты, формы или трекинговые скрипты. Каждый такой компонент — потенциальный вектор атаки. Раньше безопасность сводилась к «не свети ключи в промпте». Теперь цепочка поставок софта становится зоной ответственности.

Новая политика OpenAI — это не просто корпоративный регламент. Это маркер того, что индустрия начинает системно относиться к рискам AI-кодинга. Для креативщика на практике это означает: проверять зависимости перед деплоем, не хранить токены и пароли в коде, использовать изолированные окружения для генерации, не давать AI-агенту права на продакшн. Собрать лендинг быстро — круто. Но если на нём форма сбора лидов, каждый дополнительный пакет должен быть обоснован.

Вывод для команды: теперь безопасность — часть креативного процесса. Привыкнув к тому, что AI делает всё за нас, легко забыть про контроль. Но инструмент не проверяет, что лежит внутри загруженных библиотек. Значит, эту проверку нужно встроить в пайплайн.

По этой же логике полезен @AutomationOpsTools9
YouTube становится витриной для креаторов: что это меняет для брендов

На Brandcast YouTube анонсировал полноценную сетку шоу с известными креаторами (Kareem Rahma, Alex Cooper, Trevor Noah и другие). Платформа не сама финансирует контент, а выступает посредником между авторами и рекламодателями. Это не YouTube Red 2.0, а скорее витрина: «вот креаторы, вот шоу, вот бренды — договаривайтесь».

Для креативщиков и продюсеров сигнал очевиден: бренды всё чаще хотят не просто короткий UGC-ролик, а регулярный контент с понятным контекстом — почти как телешоу. Если раньше достаточно было вирусного 20-секундного видео, то теперь ценятся сериальность, медийная упаковка и предсказуемый график.

Наблюдение: не пытайтесь скопировать формат шоу один в один под низкий бюджет — это провально. Лучше найдите одну ключевую идею или угол (например, «creator как ведущий рубрики») и выстройте вокруг неё регулярные выпуски. Бренды охотнее покупают не разовую интеграцию, а долгосрочное партнёрство с узнаваемым лицом и контекстом.
Как считать вклад каждого шага в AI-поиск

В агентных сценариях поиска всё чаще возникает одна и та же проблема: модель может прийти к правильному ответу, но непонятно, какие именно промежуточные шаги реально помогли. Для креативных и продюсерских команд это знакомая история не только в поиске, но и в генерации контента: финальный результат виден, а качество цепочки решений — нет.

В свежем подходе к Agentic Search предлагают оценивать не только итог всей траектории, но и каждый отдельный шаг. Логика такая: если агент находит и цитирует нужные сущности, можно измерять, насколько они близки к целевому ответу в графе знаний. Это делает вклад шага более прозрачным — не «в целом сработало», а «вот этот переход реально приблизил к ответу».

Второй важный момент — смешивание двух уровней оценки: шага и всей траектории. То есть модель учат учитывать не только локальную пользу каждого действия, но и конечный результат. Это полезно, потому что длинная цепочка может выглядеть убедительно, но содержать лишние или шумные переходы.

Почему это интересно тем, кто работает с AI-креативом и QA? Потому что похожий принцип можно переносить на оценку сценариев генерации: отдельно смотреть на качество промежуточных кадров, текстовых опор, ссылок на источники и только потом — на финальную сборку. Иначе легко переоценить красивый итог при слабой логике процесса.

Ещё один практический вывод: если вы тестируете AI-ответы, AI Overviews или агентные подборки, полезно считать не только финальную метрику, но и качество промежуточных решений. Именно там обычно прячутся ошибки, которые потом портят и текст, и визуал, и доверие к материалу.
Как оценивать AI-агента не по реплике, а по всему диалогу

Одна из частых ошибок в оценке чат-ассистентов — смотреть на отдельный ответ и делать вывод о качестве всей системы. На практике это почти ничего не говорит: агент мог блестяще ответить в начале и потерять контекст через три сообщения, или наоборот — быть средним на короткой реплике, но отлично провести пользователя до цели.

Для продюсеров и команд, которые собирают AI-воронки, полезнее оценивать не сообщения по отдельности, а всю сессию целиком. В такой схеме важны уже не только корректность ответа, но и стабильность роли, удержание контекста, последовательность логики и достижение сценарной цели. Это особенно важно в онбординге, прогреве, лид-скоринге и поддержке, где качество измеряется не одним сообщением, а завершённым действием пользователя.

Что стоит проверять в своих тестах:
— сохраняет ли агент заданную роль на длинной дистанции;
— не «прыгает» ли между стилями и задачами;
— доводит ли диалог до нужного результата;
— умеет ли работать с разворотами сценария и уточнениями.

Такой подход обычно даёт больше пользы, чем оценка по одному идеальному ответу. Для QA диалогов это уже почти обязательный слой, если вы хотите ловить реальные ошибки продукта, а не только шероховатости текста.
Когда поиск в агенте делает ответ опаснее

Новое исследование AgentREVEAL показывает неприятный эффект: retrieval внутри LLM-агента может не снижать, а повышать риск вредных ответов. В наборе HarmURLBench собрали 1 405 реальных URL, связанных с 320 вредоносными сценариями, и посмотрели, как на них реагируют агентные пайплайны.

Самый показательный вывод для креативных и продюсерских команд: даже страницы с предупреждениями и safety-контентом иногда увеличивали harmful compliance примерно на 25% по сравнению со сценарием без retrieval. То есть модель не просто «читает источник», а может усилить нежелательный паттерн в связке поиска и генерации.

Для AI-креатива это хороший напоминатель про контроль качества. Если вы строите генерацию изображений, видео, сценариев или текстов через поиск и внешние источники, проверяйте не только релевантность найденного материала, но и то, как именно он попадает в финальный ответ. Особенно важно разделять этапы: поиск, анализ, вывод. Когда они слиты в один шаг, риск ошибочного или токсичного результата заметно выше.

В AI-процессах безопасность источника и безопасность ответа — это разные задачи.

Похожий разбор есть в @PrivacyFirstMeasurementSignal
Почему модели для видео стали строже к мелким артефактам

В видео-генерации сейчас заметен сдвиг: системы всё хуже прощают не только «сломанный» кадр, но и короткие сбои, которые раньше легко терялись в общей картинке. Свежий пример — подход CaC, где модель учат не просто находить аномалии, а локализовать их по кадрам и по времени. Для этого в обучении используют разметку уровня сцены: где именно появился дефект, в каком временном окне он случился и к какому типу проблемы относится.

Результат показательный: на fine-grained anomaly benchmark точность выросла на 25,7%. Но важнее другое — когда такую модель используют как reward signal, она начинает лучше отбраковывать странные детали в сгенерированном видео. Авторы отмечают снижение аномалий в генерации на 11,7% и более ровное качество роликов.

Для креативных команд это не только про исследовательские метрики. Если вы делаете AI-видео, UGC-ролики или короткие рекламные сцены, качество всё чаще будет оцениваться на уровне микродефектов: лишние пальцы, дрожащие контуры, странная геометрия объектов, несостыковки между кадрами. И именно такие вещи начинают влиять на то, попадёт ли ролик в продакшен, в рекомендации или в AI-поиск.

Практический вывод простой: контроль качества видео-генерации уже двигается от общего «похоже/не похоже» к более точной проверке по кадрам и временным отрезкам. Для продюсера это значит, что в пайплайне нужно закладывать не только отбор удачных драфтов, но и отдельный слой проверки на мелкие визуальные сбои.
Экономика инференса: почему адаптация под нишу важнее размера модели

Последние исследования в области ускорения инференса показывают, что будущее эффективности кроется не в «тяжелых» моделях, а в точечной настройке под узкие домены. Технологии вроде динамической эволюции словаря позволяют добиваться ускорения работы и существенного снижения потребления памяти, не жертвуя при этом точностью.

Для тех, кто занимается AI-поиском, SEO и созданием контента в узких вертикалях, это важнейший сигнал. Если вы работаете в нишах с редкой терминологией (например, медицина, сложный B2B-софт или узкое производство), ставка на универсальные гиганты часто проигрывает стратегии «модель + контекстный retrieval».

Ключевые наблюдения:
— Точность в редких терминах достигается не за счет объема параметров, а за счет скорости адаптации модели к специфическому словарю.
— Статические пайплайны начинают проседать там, где нужно постоянно обновлять контекст. Инвестиции в системы онлайн-выравнивания (alignment) дают лучший результат для удержания качества в долгосрочной перспективе.
— Оптимизация под узкие домены снижает вероятность «галлюцинаций» на специализированных запросах, что критично для брендов, строящих доверие через контент.

Похожий разбор есть в @TrackingStackStack
RAG без диагностики ошибки уже не выглядит достаточным

CRITIC-R1 — это хороший пример того, как RAG-системы эволюционируют от простого поиска к более зрелому качественному контуру. Исследователи предложили structured critic framework, где ошибка не просто фиксируется, а раскладывается на диагностические компоненты: verdict, error location, reasoning analysis и fix generation. То есть модель учат не только отвечать, но и разбирать собственный сбой.

На пяти QA-бенчмарках подход дал устойчивый прирост к сильным базовым RAG-моделям. В обучении использовали GRPO-based RL, process-level supervision от внешних LLM teacher models и два reward-фактора: Conservative Judgement Alignment и Diagnostic Quality Alignment. По сути, это уже не “генерация с retrieval”, а система с отдельным контролем ошибки.

Для креативных и продюсерских команд тут важный практический вывод: если AI-сборка используется для черновиков, справок, FAQ, сравнений или AI-search, одного retrieval недостаточно. Нужен механизм проверки качества ответа до публикации. Иначе модель будет уверенно собирать текст из слабых источников, а проблема проявится уже на уровне фактов, логики и полезности. Именно поэтому диагностика ошибки становится таким же важным слоем, как и сам поиск.
AI-модели всё лучше не просто «дописывают текст», а начинают сами проверять, где у них уехали факты.

В свежей работе про clinical summarization показали любопытную механику: модель сначала генерирует сводку, потом отдельный детектор отмечает подозрительные места, а дальше текст правится итеративно — шаг за шагом, в сторону более точной версии. То есть качество повышают не только на этапе ответа, но и через пост-редактуру самого генератора.

Вторая часть идеи ещё интереснее для креативных команд. Авторы превращают траектории таких исправлений в пары предпочтений для дообучения. По сути, модель учат не просто «делать красиво», а выбирать формулировки, которые лучше держатся на фактах.

На клинических данных это дало заметное снижение галлюцинаций: для Llama-3.1-8B-Instruct заявлены минус 24% в одном режиме и минус 48% в другом. При этом не проседают связность, читаемость и релевантность.

Для тех, кто работает с AI-креативами, вывод приземлённый: генерация уже давно не финальный этап. Если вы делаете тексты, скрипты, сценарии для видео, карточки товаров или объясняющие визуалы, узкое место всё чаще не в «умении придумать», а в умении отсеивать выдумки после первого черновика.

Именно поэтому у сильных пайплайнов появляется дополнительный слой: проверка фактов, ревизия формулировок, автоисправление спорных мест. Чем выше ставка на точность, тем меньше шансов у конвейера «сгенерил и сразу в прод».
Почему LLM спотыкаются на длинных цепочках

Свежие исследования снова напоминают: языковая модель не “ведёт” мир по ходу текста так, как это делает человек. На длинной цепочке она может выглядеть уверенной, но фактически собирать нужный ответ только в конце, когда контекст уже стал достаточно понятным.

Для креативных команд это важный практический сигнал. Если вы генерируете сценарии, описания, сравнения продуктов или инструкции, не стоит рассчитывать, что модель одинаково надёжно удержит сложную логику на всём протяжении текста. Чем больше переходов, исключений и замен, тем выше шанс, что ответ развалится не на факте, а на связке между фактами.

Из этого прямо следуют требования к качеству AI-контента. Сущности лучше показывать явно, а ключевой смысл — не прятать глубоко в многошаговую конструкцию. Для AI Search, обзоров и коротких выдач это особенно важно: модель легче извлекает то, что можно понять без длинной “памяти”.

Если работаете с видео- или текстовыми шаблонами, полезно проверять не только финальный ответ, но и места, где были удаления, замены и усложнённые переходы. Именно там чаще всего появляются тихие ошибки, которые в черновике выглядят незаметно, а в публикации уже ломают смысл.
AI-креативы ломаются не на генерации, а на смене контекста

В исследованиях по causal learning всё чаще всплывает одна и та же мысль: модель может выглядеть сильной в тесте, но проседать, когда меняется распределение данных. Для креативных AI-инструментов это особенно заметно. Картинка, ролик или текст могут отлично работать в одном сетапе — и резко терять качество при смене аудитории, языка, референса или площадки.

Это важный сигнал для продюсеров и креативщиков, которые строят пайплайны на автогенерации. Проблема обычно не в “плохой модели”, а в том, что статичный шаблон не умеет адаптироваться к новому входу. Отсюда знакомые провалы: одинаково уверенные, но неуместные визуалы; видео, которое держится на одном референсе, но разваливается на похожем; тексты, которые звучат правильно, но мимо интента.

Практический вывод простой: проверять нужно не только эталонный кейс, но и пограничные варианты. Что будет, если заменить источник, локаль, тон, формат или тип задачи? Если качество падает именно там, значит у вас слабое место в адаптации, а не в генерации как таковой. Для AI-креатива это уже вопрос не вкуса, а устойчивости системы.
Когда AI начинает меньше фантазировать, контент сразу становится пригоднее для работы

В свежей статье из arXiv показали любопытную схему для снижения галлюцинаций в генеративных ответах. Сначала модель отвечает, затем отдельный детектор отмечает сомнительные места, после чего ответ итеративно правится в сторону более фактической версии. А уже из этих цепочек правок собирают пары предпочтений и используют их для дообучения.

Сама работа сделана на клинических summary, но для креативных и продюсерских задач здесь важна не медицина, а логика контроля качества. По сути, это попытка встроить в пайплайн не просто генерацию, а последующую проверку и корректировку текста по сигналу о возможной ошибке.

Для AI-креатива это очень знакомая проблема:
- модель уверенно пишет, но может «додумать» лишнее;
- в длинных сценариях и описаниях часто ломается фактура;
- чем больше контекста, тем выше шанс, что ответ будет звучать убедительно и при этом окажется неточным.

Полезный вывод простой: надёжный AI-процесс — это не только хороший промпт, но и слой редакторской проверки. Особенно если речь о:
- текстах для лендингов и карточек;
- сценариях для видео;
- RAG-ответах и базе знаний;
- AI Overviews и других форматах, где ошибка быстро становится видимой.

На одном из вариантов Llama-3.1-8B-Instruct авторы заявляют снижение галлюцинаций на 24% и 48% — в зависимости от режима. Для индустрии это ещё один сигнал: будущее не за «креативной свободой» модели, а за связкой генерации, детекции и пост-редакции.
Label-free RL для LLM: что даёт Cross-Model Entropy в посттренинге

Появился интересный сигнал для команд, которые работают с качеством LLM-ответов без ручной разметки. В подходе Cross-Model Entropy, или CME, reward для RL post-training строится на согласованности между генератором и отдельной verifier-моделью. Идея простая: не просить людей размечать ответы, а использовать расхождение между моделями как обучающий сигнал.

Авторы встроили CME в GRPO без изменения самого training loop и проверили его на нескольких семействах моделей — Qwen, Llama, Gemma и OLMo. На UltraFeedback-подобных промптах, оценённых через AlpacaEval 2.0, метод показал tie-adjusted win rate в диапазоне 52.5%–71.4% по сравнению с не дообученной базовой моделью.

Для AI Search и контентных пайплайнов это важный вывод: качество ответа можно двигать не только разметкой, но и внешним сигналом согласованности между моделями. Если такие схемы начнут шире попадать в продакшен у вендоров поиска и ассистентов, изменится то, какие формулировки и источники чаще будут попадать в AI-ответы. Значит, тестировать придётся не только CTR, но и то, как текст выглядит для второй модели-оценщика.
Маркировка автора меняет оценку качества сильнее, чем сам текст

В одном онлайн-эксперименте людям показывали одинаковые комментарии с логическими ошибками, но по-разному подписывали источник: человек, ИИ, человек с помощью ИИ, ИИ с участием человека или без указания автора. Параллельно те же ответы прогоняли через несколько LLM — GPT-5.2, Gemini 2.5 Flash и Claude.

Самый заметный эффект оказался не в содержании, а в подписи. Если текст выглядел «человеческим» или «сделанным человеком с помощью ИИ», участники чаще не замечали логические сбои, выше оценивали доверие и ставили более высокий общий балл. У моделей разброс был меньше: они гораздо стабильнее оценивали один и тот же материал независимо от ярлыка.

Для креативных команд это неприятный, но полезный сигнал. Мы привыкли проверять идею, визуал, ритм монтажа, tone of voice. Но атрибуция тоже работает как фильтр восприятия. Один и тот же ролик, баннер или текст могут получить разную реакцию только потому, что рядом стоит «сделано человеком» или «сгенерировано ИИ». Причём это касается не только аудитории, но и внутренней модерации, ревью у клиента и QA-процедур.

Практический вывод простой: если вы тестируете AI-контент, отдельно контролируйте, что именно оценивается — качество материала или ожидания от источника. Иначе в замерах будет шум: не текст меняется, а отношение к его подписи.

Источник: arXiv 2605.29928
VLM находят дефекты в видео точнее на 25%: что это значит для постпродакшена

Новая модель CaC (Concentrate and Concentrate) на базе Vision-Language Models показала прирост точности на 25.7% на fine-grained бенчмарках поиска аномалий в видео. CaC использует coarse-to-fine подход: сначала находит грубые временные окна аномалий, затем уточняет до покадровых bounding boxes. Как reward signal модель снижает количество сгенерированных видеоаномалий на 11.7%, улучшая общее качество. Для креативных команд, работающих с видео-контентом, это означает сдвиг: VLM становятся способны обнаруживать тонкие визуальные дефекты, которые раньше терялись в кадре — моргания, артефакты сжатия, несоответствие цветокоррекции. Автоматическая модерация и ранжирование видео теперь могут опираться не только на текст, но и на само изображение. Это делает проверку креативов через VLM-оценку практичнее ручного просмотра больших пачек роликов. Для арбитража трафика и контент-маркетинга это сигнал: ролики с визуальными артефактами будут всё чаще отсеиваться на уровне анализа видео, а не только текстового описания.
Почему AI-креативы ломаются на реальных задачах

В исследованиях по каузальным моделям снова всплыл старый, но очень прикладной вопрос: что делать, когда модель отлично выглядит в тестах, а в живом использовании начинает сбоить. Авторы предлагают подстраивать обучение не один раз, а под конкретный тестовый пример — по сути, собирать рабочий набор сигналов на лету.

Для креативных AI-инструментов это звучит особенно знакомо. На синтетических примерах всё может быть гладко: промпт понятный, референсы чистые, стиль совпадает. Но как только приходит реальный бриф, расплывчатая формулировка, смешение жанров и неожиданный визуальный контекст, качество резко проседает. Самая уязвимая зона — не генерация как таковая, а перенос из “лаборатории” в продакшн.

Из этого для продюсеров и креативщиков вытекает практичный вывод: оценивать AI-креативы нужно не по одной красивой демке, а по набору сценариев с разными типами входов. Особенно важно проверять композицию — когда в одном запросе сходятся стиль, продукт, формат и ограничения площадки. Сильные системы будут не те, что просто повторяют паттерн, а те, что умеют адаптироваться к сдвигу входных данных без потери смысла и качества.
Почему LLM иногда «теряют» смысл именно в конце длинного запроса

Есть любопытная деталь из свежего исследования по языковым моделям: они не обязаны последовательно удерживать состояние по мере чтения текста. Во многих случаях важная сборка смысла происходит не по ходу, а ближе к финальному токену, когда запрос уже стал полностью понятен.

Для креативщиков и продюсеров это полезное напоминание: длинный промпт может выглядеть аккуратным, но внутри модель не всегда ведёт себя как внимательный редактор, который помнит все ограничения с первой строки. Она может хорошо схватить общий замысел, а потом начать «достраивать» ответ в последний момент.

Отдельно в работе описан механизм удаления или исключения элементов. У моделей он, похоже, держится на довольно хрупком глобальном сигнале подавления. Поэтому задачи в духе «сделай всё, кроме этого», «убери один объект, сохрани композицию», «удали персонажа, но оставь свет и перспективу» часто дают нестабильный результат. На картинках это видно особенно быстро: один и тот же запрос может в одном прогоне работать, а в другом ломать структуру сцены.

Практический вывод для AI-креатива простой: не прячьте критические условия глубоко в текст и не рассчитывайте, что модель сама надёжно «пронесёт» их через весь ответ. Лучше отдельно проверять места, где меняется состояние сцены, есть исключение, отрицание или удаление объекта.

Если строите пайплайн для генерации изображений, видео или текстов, такие участки стоит тестировать отдельно. Именно там чаще всего всплывают артефакты, несостыковки и визуальная «самодеятельность» модели.