Spellbound Visuals
740 subscribers
1.66K photos
320 videos
1 file
172 links
Платные и бесплатные плюшки: https://t.me/tribute/app?startapp=e1kb
Download Telegram
It was the best of times, it was the worst of times, it was the age of wisdom, it was the age of foolishness, it was the epoch of belief, it was the epoch of incredulity, it was the season of Light, it was the season of Darkness, it was the spring of hope, it was the winter of despair, we had everything before us, we had nothing before us, we were all going direct to Heaven, we were all going direct the other way – in short, the period was so far like the present period, that some of its noisiest authorities insisted on its being received, for good or for evil, in the superlative degree of comparison only.
—
The time was to come, when that wine too would be spilled on the street-stones, and when the stain of it would be red upon many there.
😍444
Всем доброго утра и хорошего настроения! Как у этих двоих после полета.
77
3. Обучение весов (Как нейросеть заучивает штампы)
Чтобы эта гигантская карта смыслов вообще появилась, векторы проходят через слои нейросети. Каждый слой это математический фильтр с весами (числовыми коэффициентами).

Эти веса не берутся из воздуха. Они настраивались месяцами на миллионах картинок. И вот тут кроется главная засада: если сеть миллион раз видела слово angry рядом со стоковыми фотографиями злых лиц, вес этой связи становится просто монументальным. Для нейронки злость становится математически равна злобному карикатурному лицу.

4. Распределение вероятностей
На выходе из этой карты получается новый набор векторов. Он задает распределение вероятностей: какие цвета, формы и детали статистически лучше всего подходят под наш изначальный текст.

И вот тут нужно осознать очень важную вещь: сеть не придумывает сцену и не вкладывает в нее душу. Она просто хладнокровно вычисляет, какие пиксели вероятнее всего должны стоять рядом, исходя из заданных координат.

Если вы пишете дефолтные, общие слова, машина выдаст вам самое усредненное, безопасное и банальное распределение вероятностей. Вы получите ту самую глянцевую, пластиковую картинку, которая кричит меня сгенерировала нейросеть.

Чтобы получить более тонкие эмоции, нужно увести векторы в те зоны латентного пространства, где лежат сложные, противоречивые и неочевидные связи. Именно поэтому мы прописываем напряженную челюсть, описываем атмосферу и просим небрежные мазки кисти. Мы буквально заставляем алгоритм свернуть с протоптанной дороги в темный переулок.
🔥655❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Так, это эстетический акт спасения в виде живой картины после жестокого удара техническими подробностями!
❤432
Любовь к полуросликам окончательно затмила твой разум, Гендальф.. 🤣

Это неудачка!
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣6😁44
Внимание!
Это 🤓🤓ЗАНУДНЫЙ длинный пост.
Не занудный и не длинный будет ниже со всеми карточками, поехали.

Блок 5. Почему angry дает карикатурное лицо
Если дать модели только один ярлык angry, она пойдет по пути наибольшей вероятности.
Она просто возьмет "среднее арифметическое" (грубое упрощение, конечно – модель семплирует из области высокой вероятности в латентном пространстве, а не буквально усредняет) из огромной зоны злость. А самый частый визуальный паттерн злости в обучающих данных – это гипертрофированный оскал, сильно нахмуренные брови итп. Есть еще preference tuning, но на это забьём пока.

Блок 6. Как детали меняют координаты
Но если мы пишем "сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья", математика меняется.
Эти новые токены-детали жестко сдвигают наши координаты (это тоже упрощённо). Они уводят генерацию из попсовой зоны angry в конкретные, редкие точки латентного пространства, где лежат точные телесные признаки.

Блок 7. Диффузия
Дальше начинается сам процесс рисования – диффузия. Модель берет холст из чистого визуального шума (как помехи на старом телевизоре, помните? Шшшш).
Опираясь на наши точные векторы, она шаг за шагом убирает ("вычитает") этот шум. Это похоже на работу скульптора: он берет глыбу мрамора (шум) и отсекает лишнее, пока не проявится чистая форма (картинка).

Блок 8. А как же Nano Banana Pro (и иже с ней)?
Nano Banana Pro устроена чуть хитрее (хоть она и менее художественная). Перед тем как начать рисовать (диффузию), работает "думающая" языковая модель.
Она может взять ваш короткий промпт, проанализировать его, "загуглить" контекст (получить актуальные данные!) или самостоятельно расписать точные визуальные признаки и освещение. То есть языковая модель работает как ваш персональный режиссер-соавтор перед стартом диффузии.

Блок 9. Главное правило
Нейросеть не читает текст и не чувствует эмоции как человек – она вычисляет вероятности.
❌ Абстрактное слово = усредненный вектор = шаблонное выражение лица.
✅ Описание физики тела и атмосферы = точные координаты в узкой области = кинематографичный и живой кадр.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥32❤‍🔥1
Вернемся к нашим баранам слизериновским!

С легкой иронией наблюдаю за смятением той части аудитории, чей кругозор счастливо избежал глубокого погружения в фанфикшн. Поступают закономерные вопросы: что за шатен с завидной регулярностью материализуется в кадре рядом с Драко.

Как я поняла, перед нами весьма любопытный феномен коллективного бессознательного. Каким-то непостижимым образом Теодор Нотт – персонаж, чье присутствие в каноне стремилось к статистической погрешности, – вдруг обрел колоссальный психологический вес и уверенно прописался в высшем эшелоне слизеринской эстетики.

Господа и дамы, хорошо знакомые с текстами, передаю слово вам. Препарируйте, пожалуйста, этот культурный сдвиг в комментариях. Как именно тихий наблюдатель с задней парты эволюционировал в одну из главных фигур подземелий?
😍6❤‍🔥4🥰31
У меня случайно (ну как случайно, в попытках сделать красивый новый референс) образовался промпт на очень крутую обработку фото: черно-белое или цветное. Для цветного удалите все black and white. И контрастные тени, если нужно.

Use the uploaded image as the identity reference only.

Create a photorealistic cinematic black-and-white portrait of the same person.
Faithfully preserve identity: keep the facial structure, skin texture, eye shape, beard pattern, age appearance, and natural proportions consistent with the reference image.
Do not beautify, de-age, reshape the face, or alter identity.
Do not over-retouch the skin or create artificial eyes, teeth, or beard details.

Style and mood:
intense, elegant, cinematic black-and-white portrait with a serious, confident, introspective presence.
The mood should feel refined, dramatic, and believable.

Lighting:
high-contrast side lighting with strong sculpting across the face, creating deep but realistic shadows.
Preserve detail in the highlights and shadows without losing realism.

Background:
pure black, minimal, empty background with no distractions.

Pose and composition:
close-up portrait, direct or slightly upward gaze, subtle head angle, strong eye focus, natural expression.
Tight framing with the face as the clear focal point.

Quality:
photorealistic, crisp facial detail, realistic skin texture, natural contrast, premium editorial portrait look, not AI-looking.

Negative prompt: plastic skin, altered identity, de-aged face, glamour retouching, distorted facial proportions, fake beard texture, unrealistic eyes, fake teeth, excessive contrast, crushed shadows, AI artifacts, soft blurry face


Это нанабанана 2.
33❤2
Более подробно в предыдущих постах: 1 – 2, 3 – 4, 5 – 9.

Кратко:

1. Нейросеть не понимает текст как человек.
Весь промпт превращается в набор чисел – векторов.

2. Внутри обученной модели есть латентное пространство – это огромная невидимая карта смыслов (что как с чем чаще связано – упрощенно, латентное пространство диффузионной модели это пространство сжатых изображений).
То, что часто встречалось вместе в датасете, лежит там рядом.

3. Когда мы описываем сцену общими словами, модель берёт то, что для неё чаще всего связывалось с этой фразой при обучении.

4. Важны связи между словами, а не суп из запятых.
Когда мы просто бросаем в модель список:
angry, dramatic lighting, 8k, ultra detailed, fog, rain, smoke, bokeh, tears, blood, cinema, volumetric light
– модели сложнее установить контекст, кому и чему принадлежит каждый эффект.

5. Нейросеть не читает смысл фразы: она подбирает наиболее вероятные визуальные паттерны под этот набор чисел. Именно поэтому точность и связность формулировок так важны.

Выводы:
👉 Не стоит надеяться, что нейросеть догадается по смыслу. Ей нужны связи между словами и точные описания.
👉 Один общий признак/ярлык (например, angry) ведёт в широкую, размытую зону, получаем шаблонный результат.
👉 Вместо angry girl лучше:
«девушка в библиотеке, сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья, холодный верхний свет».
👉 Добавляйте не только тело, но и атмосферу, свет, расстояния и прочее.
👉 Большой гипердетализированный промпт тоже плохо! В старых моделях он обрезается физически. В новых середина теряет вес, а конкурирующие детали начинают мешать друг другу. Лучше работает не "написать всё", а выбрать главное и выстроить это в связный кадр. (Об этом расскажу позже)
👉 Лучше писать фразами и связками:
"девушка у окна, сжатая челюсть, холодный свет сбоку, за стеклом дождь, фон мягкий и размытый"
вместо простого перечисления эффектов через запятую.

❌ Эмоция одним словом → размытая зона латентного пространства → шаблонный результат.
✅ Эмоция через тело + поза + атмосфера → точные координаты → сцена, которую хочется рассматривать.

Для живых эмоций и красивой генерации лучше думать в стиле не какое чувство испытывает герой, а что конкретно видно зрителю в кадре.

Штош, опять много получилось.. 😔
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥522