Spellbound Visuals
740 subscribers
1.66K photos
320 videos
1 file
172 links
Платные и бесплатные плюшки: https://t.me/tribute/app?startapp=e1kb
Download Telegram
Внимание!
Это 🤓🤓ЗАНУДНЫЙ длинный пост.
Не занудный и не длинный будет ниже со всеми карточками, поехали.

Блок 5. Почему angry дает карикатурное лицо
Если дать модели только один ярлык angry, она пойдет по пути наибольшей вероятности.
Она просто возьмет "среднее арифметическое" (грубое упрощение, конечно – модель семплирует из области высокой вероятности в латентном пространстве, а не буквально усредняет) из огромной зоны злость. А самый частый визуальный паттерн злости в обучающих данных – это гипертрофированный оскал, сильно нахмуренные брови итп. Есть еще preference tuning, но на это забьём пока.

Блок 6. Как детали меняют координаты
Но если мы пишем "сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья", математика меняется.
Эти новые токены-детали жестко сдвигают наши координаты (это тоже упрощённо). Они уводят генерацию из попсовой зоны angry в конкретные, редкие точки латентного пространства, где лежат точные телесные признаки.

Блок 7. Диффузия
Дальше начинается сам процесс рисования – диффузия. Модель берет холст из чистого визуального шума (как помехи на старом телевизоре, помните? Шшшш).
Опираясь на наши точные векторы, она шаг за шагом убирает ("вычитает") этот шум. Это похоже на работу скульптора: он берет глыбу мрамора (шум) и отсекает лишнее, пока не проявится чистая форма (картинка).

Блок 8. А как же Nano Banana Pro (и иже с ней)?
Nano Banana Pro устроена чуть хитрее (хоть она и менее художественная). Перед тем как начать рисовать (диффузию), работает "думающая" языковая модель.
Она может взять ваш короткий промпт, проанализировать его, "загуглить" контекст (получить актуальные данные!) или самостоятельно расписать точные визуальные признаки и освещение. То есть языковая модель работает как ваш персональный режиссер-соавтор перед стартом диффузии.

Блок 9. Главное правило
Нейросеть не читает текст и не чувствует эмоции как человек – она вычисляет вероятности.
❌ Абстрактное слово = усредненный вектор = шаблонное выражение лица.
✅ Описание физики тела и атмосферы = точные координаты в узкой области = кинематографичный и живой кадр.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥32❤‍🔥1
Вернемся к нашим баранам слизериновским!

С легкой иронией наблюдаю за смятением той части аудитории, чей кругозор счастливо избежал глубокого погружения в фанфикшн. Поступают закономерные вопросы: что за шатен с завидной регулярностью материализуется в кадре рядом с Драко.

Как я поняла, перед нами весьма любопытный феномен коллективного бессознательного. Каким-то непостижимым образом Теодор Нотт – персонаж, чье присутствие в каноне стремилось к статистической погрешности, – вдруг обрел колоссальный психологический вес и уверенно прописался в высшем эшелоне слизеринской эстетики.

Господа и дамы, хорошо знакомые с текстами, передаю слово вам. Препарируйте, пожалуйста, этот культурный сдвиг в комментариях. Как именно тихий наблюдатель с задней парты эволюционировал в одну из главных фигур подземелий?
😍6❤‍🔥4🥰31
У меня случайно (ну как случайно, в попытках сделать красивый новый референс) образовался промпт на очень крутую обработку фото: черно-белое или цветное. Для цветного удалите все black and white. И контрастные тени, если нужно.

Use the uploaded image as the identity reference only.

Create a photorealistic cinematic black-and-white portrait of the same person.
Faithfully preserve identity: keep the facial structure, skin texture, eye shape, beard pattern, age appearance, and natural proportions consistent with the reference image.
Do not beautify, de-age, reshape the face, or alter identity.
Do not over-retouch the skin or create artificial eyes, teeth, or beard details.

Style and mood:
intense, elegant, cinematic black-and-white portrait with a serious, confident, introspective presence.
The mood should feel refined, dramatic, and believable.

Lighting:
high-contrast side lighting with strong sculpting across the face, creating deep but realistic shadows.
Preserve detail in the highlights and shadows without losing realism.

Background:
pure black, minimal, empty background with no distractions.

Pose and composition:
close-up portrait, direct or slightly upward gaze, subtle head angle, strong eye focus, natural expression.
Tight framing with the face as the clear focal point.

Quality:
photorealistic, crisp facial detail, realistic skin texture, natural contrast, premium editorial portrait look, not AI-looking.

Negative prompt: plastic skin, altered identity, de-aged face, glamour retouching, distorted facial proportions, fake beard texture, unrealistic eyes, fake teeth, excessive contrast, crushed shadows, AI artifacts, soft blurry face


Это нанабанана 2.
33❤2
Более подробно в предыдущих постах: 1 – 2, 3 – 4, 5 – 9.

Кратко:

1. Нейросеть не понимает текст как человек.
Весь промпт превращается в набор чисел – векторов.

2. Внутри обученной модели есть латентное пространство – это огромная невидимая карта смыслов (что как с чем чаще связано – упрощенно, латентное пространство диффузионной модели это пространство сжатых изображений).
То, что часто встречалось вместе в датасете, лежит там рядом.

3. Когда мы описываем сцену общими словами, модель берёт то, что для неё чаще всего связывалось с этой фразой при обучении.

4. Важны связи между словами, а не суп из запятых.
Когда мы просто бросаем в модель список:
angry, dramatic lighting, 8k, ultra detailed, fog, rain, smoke, bokeh, tears, blood, cinema, volumetric light
– модели сложнее установить контекст, кому и чему принадлежит каждый эффект.

5. Нейросеть не читает смысл фразы: она подбирает наиболее вероятные визуальные паттерны под этот набор чисел. Именно поэтому точность и связность формулировок так важны.

Выводы:
👉 Не стоит надеяться, что нейросеть догадается по смыслу. Ей нужны связи между словами и точные описания.
👉 Один общий признак/ярлык (например, angry) ведёт в широкую, размытую зону, получаем шаблонный результат.
👉 Вместо angry girl лучше:
«девушка в библиотеке, сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья, холодный верхний свет».
👉 Добавляйте не только тело, но и атмосферу, свет, расстояния и прочее.
👉 Большой гипердетализированный промпт тоже плохо! В старых моделях он обрезается физически. В новых середина теряет вес, а конкурирующие детали начинают мешать друг другу. Лучше работает не "написать всё", а выбрать главное и выстроить это в связный кадр. (Об этом расскажу позже)
👉 Лучше писать фразами и связками:
"девушка у окна, сжатая челюсть, холодный свет сбоку, за стеклом дождь, фон мягкий и размытый"
вместо простого перечисления эффектов через запятую.

❌ Эмоция одним словом → размытая зона латентного пространства → шаблонный результат.
✅ Эмоция через тело + поза + атмосфера → точные координаты → сцена, которую хочется рассматривать.

Для живых эмоций и красивой генерации лучше думать в стиле не какое чувство испытывает герой, а что конкретно видно зрителю в кадре.

Штош, опять много получилось.. 😔
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥522
Распространённая ошибка которую я замечаю: ставить задачу либо слишком абстрактно (нарисуй упражнение по английскому), либо панический микроменеджмент, описывая каждый пиксель.

Представьте, что вы наняли толкового (но такого, знаете, которого потом лучше проверить), но очень педантичного ассистента. Вам не нужно объяснять ему, что такое таблица. Он в целом знает, что делать. Ваша задача – задать ему рамки и структуру.
Вот прям представьте, что вы наговариваете голосове ассистенту, что бы вы ему сказали?

Допустим, мы хотим собрать рабочий лист для взрослых учеников. Тема: жалобная книгу взрослого человека.
Если вы попросите нейронку "нарисуй мне грустного человека с телефоном и добавь упражнение", она выдаст вам абстрактный глянцевый арт, который невозможно использовать в классе.
Секрет в том, чтобы просить не иллюстрацию, а макет. Вы диктуете геометрию страницы и пустые места.

Пример (обратите внимание, я не прописываю весь текст, даю только пару предложений):

Создай рабочий лист A4. Заголовок: 'First World Problems'.
В центре страницы нарисуй стилизованный экран смартфона. На экране нарисуй 5 'пузырей' сообщений (chat bubbles), как будто кто-то отправлял кому-то сообщения в чате.
Напиши текст в пузырях солбщений, оставив длинные пустые линии вместо некоторых слов:
'My life is so hard. Yesterday, I ordered a cappuccino, but the barista made it too _. Then, my internet was so _ that Netflix took 10 seconds to load! I felt absolutely ___.'
И так далее.
Внизу листа сделай рамку 'Complaint Box Words' и впиши туда подходящие драматичные прилагательные вразнобой: (devastated, lukewarm, sluggish, tragic, unacceptable).
Дизайн: современный, чистый, минимализм.


И всё. Одним промптом реально сделать целую страницу – текст, конечно, надо проверять, но это уже большой прогресс и экономит кучу работы!

Еще пару примеров закину в комментарии. 🔣
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤‍🔥32
a cute sleepy chubby frog sitting under a large green leaf holding a wild strawberry, soft warm sunlight, whimsical 2d illustration, watercolor and ink, cottagecore aesthetic, cozy summer mood, light pastel colors

Это GPT2, банана в комментариях, всем хороших выходных 💕
Please open Telegram to view this post
VIEW IN TELEGRAM
🥰4❤‍🔥3😍2
Рубрика ✨баловство✨

Этот промпт создает инфографику, где лицо будет показано в окружении подходящих цветов, с подписями подходящего сезона (например, Soft Autumn или Clear Spring) и конкретными названиями оттенков.

Для GPT 2! Кажется, что банана про лучшее анализирует фотку, но gpt лучше рисует инфографику.

Use the uploaded portrait photo as the base image. Perform a professional 12-season personal color analysis based on the person's skin undertone, eye color, and hair color. Preserve the person's exact identity, facial features, and natural lighting.

Create a high-end color analysis board layout directly on the image. In one corner, keep the person's original face. Around or next to it, generate a series of clean, elegant color swatches showing their best seasonal palette.

Automatically generate and overlay modern, highly legible text labels in clean text boxes containing:
1. The assigned color season
2. 3-4 exact color names that best complement them.
3. 2 colors to avoid

Visual language: Premium styling studio aesthetic, soft natural lighting, editorial layout. Keep natural skin texture and do not alter the face. Ensure the generated text is perfectly readable, without typos or messy overlapping.


У Драко глаза тут неправильного цвета, да..

Если кому-то надо сделать, пишите :)
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🥰5❤‍🔥3❤2
Делюсь прочитанным за последний месяц (что-то шедеврально, что-то прекрасно, и только пепельную весну не рекомендую читать), сейчас читаю "В начале было кофе", и вот цитата оттуда:

Например, «сентябрь» и «февраль» когда-то звучали как «септябрь» и «феврарь», ведь это заимствования, восходящие к латинским september (от лат. septem – «семь», т. к. год в Риме начинался с марта и сентябрь был седьмым по счету месяцем) и februarius (лат. «очистительный»: в феврале римляне приносили очистительные жертвы).

Сложно представить, но когда-то «тарелка» была «талеркой» (от средневерхненемецкого talier с тем же значением), «ладонь» – «долонью» (сравните с «дланью»), а «сыворотка» – «сыроваткой» (от слова «сыр»). В этих словах произошла перестановка согласных, связанная, видимо, с удобством произношения, – или, по-научному, метатеза.
❤‍🔥4❤33🤩2