3. Обучение весов (Как нейросеть заучивает штампы)
Чтобы эта гигантская карта смыслов вообще появилась, векторы проходят через слои нейросети. Каждый слой это математический фильтр с весами (числовыми коэффициентами).
Эти веса не берутся из воздуха. Они настраивались месяцами на миллионах картинок. И вот тут кроется главная засада: если сеть миллион раз видела слово angry рядом со стоковыми фотографиями злых лиц, вес этой связи становится просто монументальным. Для нейронки злость становится математически равна злобному карикатурному лицу.
4. Распределение вероятностей
На выходе из этой карты получается новый набор векторов. Он задает распределение вероятностей: какие цвета, формы и детали статистически лучше всего подходят под наш изначальный текст.
И вот тут нужно осознать очень важную вещь: сеть не придумывает сцену и не вкладывает в нее душу. Она просто хладнокровно вычисляет, какие пиксели вероятнее всего должны стоять рядом, исходя из заданных координат.
Если вы пишете дефолтные, общие слова, машина выдаст вам самое усредненное, безопасное и банальное распределение вероятностей. Вы получите ту самую глянцевую, пластиковую картинку, которая кричит меня сгенерировала нейросеть.
Чтобы получить более тонкие эмоции, нужно увести векторы в те зоны латентного пространства, где лежат сложные, противоречивые и неочевидные связи. Именно поэтому мы прописываем напряженную челюсть, описываем атмосферу и просим небрежные мазки кисти. Мы буквально заставляем алгоритм свернуть с протоптанной дороги в темный переулок.
Чтобы эта гигантская карта смыслов вообще появилась, векторы проходят через слои нейросети. Каждый слой это математический фильтр с весами (числовыми коэффициентами).
Эти веса не берутся из воздуха. Они настраивались месяцами на миллионах картинок. И вот тут кроется главная засада: если сеть миллион раз видела слово angry рядом со стоковыми фотографиями злых лиц, вес этой связи становится просто монументальным. Для нейронки злость становится математически равна злобному карикатурному лицу.
4. Распределение вероятностей
На выходе из этой карты получается новый набор векторов. Он задает распределение вероятностей: какие цвета, формы и детали статистически лучше всего подходят под наш изначальный текст.
И вот тут нужно осознать очень важную вещь: сеть не придумывает сцену и не вкладывает в нее душу. Она просто хладнокровно вычисляет, какие пиксели вероятнее всего должны стоять рядом, исходя из заданных координат.
Если вы пишете дефолтные, общие слова, машина выдаст вам самое усредненное, безопасное и банальное распределение вероятностей. Вы получите ту самую глянцевую, пластиковую картинку, которая кричит меня сгенерировала нейросеть.
Чтобы получить более тонкие эмоции, нужно увести векторы в те зоны латентного пространства, где лежат сложные, противоречивые и неочевидные связи. Именно поэтому мы прописываем напряженную челюсть, описываем атмосферу и просим небрежные мазки кисти. Мы буквально заставляем алгоритм свернуть с протоптанной дороги в темный переулок.
🔥6 5 5❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Так, это эстетический акт спасения в виде живой картины после жестокого удара техническими подробностями!
❤4 3 2
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣6😁4 4
Внимание!
Это🤓 🤓 ЗАНУДНЫЙ длинный пост.
Не занудный и не длинный будет ниже со всеми карточками, поехали.
Блок 5. Почему angry дает карикатурное лицо
Если дать модели только один ярлык angry, она пойдет по пути наибольшей вероятности.
Она просто возьмет "среднее арифметическое" (грубое упрощение, конечно – модель семплирует из области высокой вероятности в латентном пространстве, а не буквально усредняет) из огромной зоны злость. А самый частый визуальный паттерн злости в обучающих данных – это гипертрофированный оскал, сильно нахмуренные брови итп. Есть еще preference tuning, но на это забьём пока.
Блок 6. Как детали меняют координаты
Но если мы пишем "сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья", математика меняется.
Эти новые токены-детали жестко сдвигают наши координаты (это тоже упрощённо). Они уводят генерацию из попсовой зоны angry в конкретные, редкие точки латентного пространства, где лежат точные телесные признаки.
Блок 7. Диффузия
Дальше начинается сам процесс рисования – диффузия. Модель берет холст из чистого визуального шума (как помехи на старом телевизоре, помните? Шшшш).
Опираясь на наши точные векторы, она шаг за шагом убирает ("вычитает") этот шум. Это похоже на работу скульптора: он берет глыбу мрамора (шум) и отсекает лишнее, пока не проявится чистая форма (картинка).
Блок 8. А как же Nano Banana Pro (и иже с ней)?
Nano Banana Pro устроена чуть хитрее (хоть она и менее художественная). Перед тем как начать рисовать (диффузию), работает "думающая" языковая модель.
Она может взять ваш короткий промпт, проанализировать его, "загуглить" контекст (получить актуальные данные!) или самостоятельно расписать точные визуальные признаки и освещение. То есть языковая модель работает как ваш персональный режиссер-соавтор перед стартом диффузии.
Блок 9. Главное правило
Нейросеть не читает текст и не чувствует эмоции как человек – она вычисляет вероятности.
❌ Абстрактное слово = усредненный вектор = шаблонное выражение лица.
✅ Описание физики тела и атмосферы = точные координаты в узкой области = кинематографичный и живой кадр.
Это
Не занудный и не длинный будет ниже со всеми карточками, поехали.
Блок 5. Почему angry дает карикатурное лицо
Если дать модели только один ярлык angry, она пойдет по пути наибольшей вероятности.
Она просто возьмет "среднее арифметическое" (грубое упрощение, конечно – модель семплирует из области высокой вероятности в латентном пространстве, а не буквально усредняет) из огромной зоны злость. А самый частый визуальный паттерн злости в обучающих данных – это гипертрофированный оскал, сильно нахмуренные брови итп. Есть еще preference tuning, но на это забьём пока.
Блок 6. Как детали меняют координаты
Но если мы пишем "сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья", математика меняется.
Эти новые токены-детали жестко сдвигают наши координаты (это тоже упрощённо). Они уводят генерацию из попсовой зоны angry в конкретные, редкие точки латентного пространства, где лежат точные телесные признаки.
Блок 7. Диффузия
Дальше начинается сам процесс рисования – диффузия. Модель берет холст из чистого визуального шума (как помехи на старом телевизоре, помните? Шшшш).
Опираясь на наши точные векторы, она шаг за шагом убирает ("вычитает") этот шум. Это похоже на работу скульптора: он берет глыбу мрамора (шум) и отсекает лишнее, пока не проявится чистая форма (картинка).
Блок 8. А как же Nano Banana Pro (и иже с ней)?
Nano Banana Pro устроена чуть хитрее (хоть она и менее художественная). Перед тем как начать рисовать (диффузию), работает "думающая" языковая модель.
Она может взять ваш короткий промпт, проанализировать его, "загуглить" контекст (получить актуальные данные!) или самостоятельно расписать точные визуальные признаки и освещение. То есть языковая модель работает как ваш персональный режиссер-соавтор перед стартом диффузии.
Блок 9. Главное правило
Нейросеть не читает текст и не чувствует эмоции как человек – она вычисляет вероятности.
❌ Абстрактное слово = усредненный вектор = шаблонное выражение лица.
✅ Описание физики тела и атмосферы = точные координаты в узкой области = кинематографичный и живой кадр.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3 2❤🔥1
Вернемся к нашим баранам слизериновским!
С легкой иронией наблюдаю за смятением той части аудитории, чей кругозорсчастливо избежал глубокого погружения в фанфикшн. Поступают закономерные вопросы: что за шатен с завидной регулярностью материализуется в кадре рядом с Драко.
Как я поняла, перед нами весьма любопытный феномен коллективного бессознательного. Каким-то непостижимым образом Теодор Нотт – персонаж, чье присутствие в каноне стремилось к статистической погрешности, – вдруг обрел колоссальный психологический вес и уверенно прописался в высшем эшелоне слизеринской эстетики.
Господа и дамы, хорошо знакомые с текстами, передаю слово вам. Препарируйте, пожалуйста, этот культурный сдвиг в комментариях. Как именно тихий наблюдатель с задней парты эволюционировал в одну из главных фигур подземелий?
С легкой иронией наблюдаю за смятением той части аудитории, чей кругозор
Как я поняла, перед нами весьма любопытный феномен коллективного бессознательного. Каким-то непостижимым образом Теодор Нотт – персонаж, чье присутствие в каноне стремилось к статистической погрешности, – вдруг обрел колоссальный психологический вес и уверенно прописался в высшем эшелоне слизеринской эстетики.
Господа и дамы, хорошо знакомые с текстами, передаю слово вам. Препарируйте, пожалуйста, этот культурный сдвиг в комментариях. Как именно тихий наблюдатель с задней парты эволюционировал в одну из главных фигур подземелий?
😍6❤🔥4🥰3 1
У меня случайно (ну как случайно, в попытках сделать красивый новый референс) образовался промпт на очень крутую обработку фото: черно-белое или цветное. Для цветного удалите все black and white. И контрастные тени, если нужно.
Это нанабанана 2.
Use the uploaded image as the identity reference only.Create a photorealistic cinematic black-and-white portrait of the same person.
Faithfully preserve identity: keep the facial structure, skin texture, eye shape, beard pattern, age appearance, and natural proportions consistent with the reference image.
Do not beautify, de-age, reshape the face, or alter identity.
Do not over-retouch the skin or create artificial eyes, teeth, or beard details.
Style and mood:
intense, elegant, cinematic black-and-white portrait with a serious, confident, introspective presence.
The mood should feel refined, dramatic, and believable.
Lighting:
high-contrast side lighting with strong sculpting across the face, creating deep but realistic shadows.
Preserve detail in the highlights and shadows without losing realism.
Background:
pure black, minimal, empty background with no distractions.
Pose and composition:
close-up portrait, direct or slightly upward gaze, subtle head angle, strong eye focus, natural expression.
Tight framing with the face as the clear focal point.
Quality:
photorealistic, crisp facial detail, realistic skin texture, natural contrast, premium editorial portrait look, not AI-looking.
Negative prompt: plastic skin, altered identity, de-aged face, glamour retouching, distorted facial proportions, fake beard texture, unrealistic eyes, fake teeth, excessive contrast, crushed shadows, AI artifacts, soft blurry face
Это нанабанана 2.
Более подробно в предыдущих постах: 1 – 2, 3 – 4, 5 – 9.
Кратко:
1. Нейросеть не понимает текст как человек.
Весь промпт превращается в набор чисел – векторов.
2. Внутри обученной модели есть латентное пространство – это огромная невидимая карта смыслов (что как с чем чаще связано – упрощенно, латентное пространство диффузионной модели это пространство сжатых изображений).
То, что часто встречалось вместе в датасете, лежит там рядом.
3. Когда мы описываем сцену общими словами, модель берёт то, что для неё чаще всего связывалось с этой фразой при обучении.
4. Важны связи между словами, а не суп из запятых.
Когда мы просто бросаем в модель список:
angry, dramatic lighting, 8k, ultra detailed, fog, rain, smoke, bokeh, tears, blood, cinema, volumetric light
– модели сложнее установить контекст, кому и чему принадлежит каждый эффект.
5. Нейросеть не читает смысл фразы: она подбирает наиболее вероятные визуальные паттерны под этот набор чисел. Именно поэтому точность и связность формулировок так важны.
Выводы:
👉 Не стоит надеяться, что нейросеть догадается по смыслу. Ей нужны связи между словами и точные описания.
👉 Один общий признак/ярлык (например, angry) ведёт в широкую, размытую зону, получаем шаблонный результат.
👉 Вместо angry girl лучше:
«девушка в библиотеке, сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья, холодный верхний свет».
👉 Добавляйте не только тело, но и атмосферу, свет, расстояния и прочее.
👉 Большой гипердетализированный промпт тоже плохо! В старых моделях он обрезается физически. В новых середина теряет вес, а конкурирующие детали начинают мешать друг другу. Лучше работает не "написать всё", а выбрать главное и выстроить это в связный кадр. (Об этом расскажу позже)
👉 Лучше писать фразами и связками:
"девушка у окна, сжатая челюсть, холодный свет сбоку, за стеклом дождь, фон мягкий и размытый"
вместо простого перечисления эффектов через запятую.
❌ Эмоция одним словом → размытая зона латентного пространства → шаблонный результат.
✅ Эмоция через тело + поза + атмосфера → точные координаты → сцена, которую хочется рассматривать.
Для живых эмоций и красивой генерации лучше думать в стиле не какое чувство испытывает герой, а что конкретно видно зрителю в кадре.
Штош, опять много получилось..😔
Кратко:
1. Нейросеть не понимает текст как человек.
Весь промпт превращается в набор чисел – векторов.
2. Внутри обученной модели есть латентное пространство – это огромная невидимая карта смыслов (что как с чем чаще связано – упрощенно, латентное пространство диффузионной модели это пространство сжатых изображений).
То, что часто встречалось вместе в датасете, лежит там рядом.
3. Когда мы описываем сцену общими словами, модель берёт то, что для неё чаще всего связывалось с этой фразой при обучении.
4. Важны связи между словами, а не суп из запятых.
Когда мы просто бросаем в модель список:
angry, dramatic lighting, 8k, ultra detailed, fog, rain, smoke, bokeh, tears, blood, cinema, volumetric light
– модели сложнее установить контекст, кому и чему принадлежит каждый эффект.
5. Нейросеть не читает смысл фразы: она подбирает наиболее вероятные визуальные паттерны под этот набор чисел. Именно поэтому точность и связность формулировок так важны.
Выводы:
👉 Не стоит надеяться, что нейросеть догадается по смыслу. Ей нужны связи между словами и точные описания.
👉 Один общий признак/ярлык (например, angry) ведёт в широкую, размытую зону, получаем шаблонный результат.
👉 Вместо angry girl лучше:
«девушка в библиотеке, сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья, холодный верхний свет».
👉 Добавляйте не только тело, но и атмосферу, свет, расстояния и прочее.
👉 Большой гипердетализированный промпт тоже плохо! В старых моделях он обрезается физически. В новых середина теряет вес, а конкурирующие детали начинают мешать друг другу. Лучше работает не "написать всё", а выбрать главное и выстроить это в связный кадр. (Об этом расскажу позже)
👉 Лучше писать фразами и связками:
"девушка у окна, сжатая челюсть, холодный свет сбоку, за стеклом дождь, фон мягкий и размытый"
вместо простого перечисления эффектов через запятую.
❌ Эмоция одним словом → размытая зона латентного пространства → шаблонный результат.
✅ Эмоция через тело + поза + атмосфера → точные координаты → сцена, которую хочется рассматривать.
Для живых эмоций и красивой генерации лучше думать в стиле не какое чувство испытывает герой, а что конкретно видно зрителю в кадре.
Штош, опять много получилось..
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5 2 2
Распространённая ошибка которую я замечаю: ставить задачу либо слишком абстрактно (нарисуй упражнение по английскому), либо панический микроменеджмент, описывая каждый пиксель.
Представьте, что вы наняли толкового (но такого, знаете, которого потом лучше проверить), но очень педантичного ассистента. Вам не нужно объяснять ему, что такое таблица. Он в целом знает, что делать. Ваша задача – задать ему рамки и структуру.
Вот прям представьте, что вы наговариваете голосове ассистенту, что бы вы ему сказали?
Допустим, мы хотим собрать рабочий лист для взрослых учеников. Тема: жалобная книгу взрослого человека.
Если вы попросите нейронку "нарисуй мне грустного человека с телефоном и добавь упражнение", она выдаст вам абстрактный глянцевый арт, который невозможно использовать в классе.
Секрет в том, чтобы просить не иллюстрацию, а макет. Вы диктуете геометрию страницы и пустые места.
Пример (обратите внимание, я не прописываю весь текст, даю только пару предложений):
И всё. Одним промптом реально сделать целую страницу – текст, конечно, надо проверять, но это уже большой прогресс и экономит кучу работы!
Еще пару примеров закину в комментарии.🔣
Представьте, что вы наняли толкового (но такого, знаете, которого потом лучше проверить), но очень педантичного ассистента. Вам не нужно объяснять ему, что такое таблица. Он в целом знает, что делать. Ваша задача – задать ему рамки и структуру.
Вот прям представьте, что вы наговариваете голосове ассистенту, что бы вы ему сказали?
Допустим, мы хотим собрать рабочий лист для взрослых учеников. Тема: жалобная книгу взрослого человека.
Если вы попросите нейронку "нарисуй мне грустного человека с телефоном и добавь упражнение", она выдаст вам абстрактный глянцевый арт, который невозможно использовать в классе.
Секрет в том, чтобы просить не иллюстрацию, а макет. Вы диктуете геометрию страницы и пустые места.
Пример (обратите внимание, я не прописываю весь текст, даю только пару предложений):
Создай рабочий лист A4. Заголовок: 'First World Problems'.
В центре страницы нарисуй стилизованный экран смартфона. На экране нарисуй 5 'пузырей' сообщений (chat bubbles), как будто кто-то отправлял кому-то сообщения в чате.
Напиши текст в пузырях солбщений, оставив длинные пустые линии вместо некоторых слов:
'My life is so hard. Yesterday, I ordered a cappuccino, but the barista made it too _. Then, my internet was so _ that Netflix took 10 seconds to load! I felt absolutely ___.'
И так далее.
Внизу листа сделай рамку 'Complaint Box Words' и впиши туда подходящие драматичные прилагательные вразнобой: (devastated, lukewarm, sluggish, tragic, unacceptable).
Дизайн: современный, чистый, минимализм.И всё. Одним промптом реально сделать целую страницу – текст, конечно, надо проверять, но это уже большой прогресс и экономит кучу работы!
Еще пару примеров закину в комментарии.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤🔥3 2