Please open Telegram to view this post
VIEW IN TELEGRAM
😁6 2
Посмотрела результаты опроса, чувствую себя примерно так:
— Вы укрываете у себя арты с Малфоем? Нам нужно больше Драко!!
— О, Салазар, с кем я связался...
А на самом деле готовлю пост про то, как рисовать эмоции (реалистичные) с хорошими и плохими примерами.
— Вы укрываете у себя арты с Малфоем? Нам нужно больше Драко!!
— О, Салазар, с кем я связался...
А на самом деле готовлю пост про то, как рисовать эмоции (реалистичные) с хорошими и плохими примерами.
❤3😁2 2
Forwarded from Neural Shit
Обожаю такие социальные эксперименты, просто чистый восторг. Это прям мой любимый жанр.
В твитторе чувак с ником SHL0MS запостил картинку и написал: "Я тут сгенерил нейронкой изображение в стиле Моне. Пожалуйста, опишите как можно подробнее, чем это хуже настоящего Моне".
Нюанс в том, что к твиту он прикрепил настоящую картину Клода Моне.
Естественно, в реплаи моментально набежали искусствоведы, борцы с ИИ и прочие ценители высокого, которые на серьёзных щщах начали разносить "бездушную нейромазню" на атомы.
В комментах и квотретвитах просто праздник какой-то:
...и ещё много-много-много критики.
Идеальная иллюстрация того, как работает предвзятость. Кожаные готовы найти отсутствие души, плохие мазки и пластиковый графон даже в признанном мировом шедевре, если им предварительно сказать, что это нарисовал не человек.
Это что, получается, что мясные мешки галлюцинируют и выдумывают факты ничуть не хуже, чем LLM-ки?
причаститься к срачу, а то и поучаствовать, можно тут
В твитторе чувак с ником SHL0MS запостил картинку и написал: "Я тут сгенерил нейронкой изображение в стиле Моне. Пожалуйста, опишите как можно подробнее, чем это хуже настоящего Моне".
Нюанс в том, что к твиту он прикрепил настоящую картину Клода Моне.
Естественно, в реплаи моментально набежали искусствоведы, борцы с ИИ и прочие ценители высокого, которые на серьёзных щщах начали разносить "бездушную нейромазню" на атомы.
В комментах и квотретвитах просто праздник какой-то:
"Выглядит как работа первокурсника художки, нет никакой связности элементов"
"Сразу видно, что ИИ не понимает, как работают отражения в воде"
"Слишком плоско, нет глубины"
"Отсутствует композиция, взгляд ни за что не цепляется"
"Бездушная подделка"
"Сразу видно, что это рисовал не человек"
...и ещё много-много-много критики.
Идеальная иллюстрация того, как работает предвзятость. Кожаные готовы найти отсутствие души, плохие мазки и пластиковый графон даже в признанном мировом шедевре, если им предварительно сказать, что это нарисовал не человек.
Это что, получается, что мясные мешки галлюцинируют и выдумывают факты ничуть не хуже, чем LLM-ки?
причаститься к срачу, а то и поучаствовать, можно тут
😁3 3
Я заманила вас сюда эстетикой, благородным маслом и красивыми лицами (ну или вы сами знаете кем чем). И теперь, когда вы окончательно расслабились и потеряли бдительность, ее время пришло.
МАТЕМАТИКА. Зловещий смех.
Шучу. Почти. Но перед тем как мы начнем обсуждать реалистичные эмоции и тонкую психологию в промптах, нам придется ненадолго спуститься в подвал и посмотреть, как эта бездушная машина на самом деле мыслит.
Спойлер: никакой магии там нет. Только холодная математика.
1. Как текст умирает и становится геометрией
Пора избавиться от иллюзий. Нейросеть не понимает букв и совершенно не ценит вашу литературную поэзию. Мы пишем ей простую сцену: «злая девушка в библиотеке».
Для алгоритма это не образ, а сырье. Сначала его языковая часть режет фразу на куски (токены). Затем каждый токен превращается в длинный ряд чисел (вектор). На этом этапе человеческие слова исчезают окончательно. Остаются только математические координаты.
2. Карта смыслов (Латентное пространство)
Куда ведут эти координаты? В латентное пространство. Звучит как термин из квантовой физики, но по сути это просто гигантская, многомерная карта смыслов.
Запомните главное: там не лежат готовые картинки в папочках. Там живут только скрытые связи между понятиями. Логика машины прямолинейна: вещи, которые при обучении часто мелькали в одном контексте, на этой карте селятся по соседству.
В реальности эта карта и веса настраиваются один раз на этапе обучения, а потом используются для генерации.
Именно поэтому вектор слова angry уводит алгоритм в огромную и предсказуемую зону, до краев набитую сжатыми кулаками, красными щеками и той самой невыносимой театральной драмой, с которой мы пытаемся бороться 😅
Понимание устройства нейронки хорошо помогает. Когда вы пишете промпт, вы не сочиняете текст. Вы буквально прокладываете маршрут по математической карте.
Ну что, едем дальше или срочно нужен красивый арт для утешения?
МАТЕМАТИКА. Зловещий смех.
Шучу. Почти. Но перед тем как мы начнем обсуждать реалистичные эмоции и тонкую психологию в промптах, нам придется ненадолго спуститься в подвал и посмотреть, как эта бездушная машина на самом деле мыслит.
Спойлер: никакой магии там нет. Только холодная математика.
1. Как текст умирает и становится геометрией
Пора избавиться от иллюзий. Нейросеть не понимает букв и совершенно не ценит вашу литературную поэзию. Мы пишем ей простую сцену: «злая девушка в библиотеке».
Для алгоритма это не образ, а сырье. Сначала его языковая часть режет фразу на куски (токены). Затем каждый токен превращается в длинный ряд чисел (вектор). На этом этапе человеческие слова исчезают окончательно. Остаются только математические координаты.
2. Карта смыслов (Латентное пространство)
Куда ведут эти координаты? В латентное пространство. Звучит как термин из квантовой физики, но по сути это просто гигантская, многомерная карта смыслов.
Запомните главное: там не лежат готовые картинки в папочках. Там живут только скрытые связи между понятиями. Логика машины прямолинейна: вещи, которые при обучении часто мелькали в одном контексте, на этой карте селятся по соседству.
В реальности эта карта и веса настраиваются один раз на этапе обучения, а потом используются для генерации.
Именно поэтому вектор слова angry уводит алгоритм в огромную и предсказуемую зону, до краев набитую сжатыми кулаками, красными щеками и той самой невыносимой театральной драмой, с которой мы пытаемся бороться 😅
Понимание устройства нейронки хорошо помогает. Когда вы пишете промпт, вы не сочиняете текст. Вы буквально прокладываете маршрут по математической карте.
Ну что, едем дальше или срочно нужен красивый арт для утешения?
🔥5 3❤2
Инфографику сделала в GPT2 одним промтом для одной картинки (да, я дописывала кусочек на русском 😅):
Block 1 of a vertical educational infographic in Russian about how AI turns text into images, title text: «Текст становится математикой», show a person typing the prompt «Злая девушка в библиотеке» on a laptop, рядом схематичный модуль AI с маленьким дисплеем, от текста отходят маленькие прямоугольники с подписями «Злая», «девушка», «в», «библиотеке» как токены, дальше простая диаграмма: эти токены превращаются в столбики или точки с числами как векторы, без сложных формул и кода, light background, soft colors, minimalistic editorial illustration, vertical infographic in Russian, clean layout, big legible Russian text, lots of white space, simple icons, consistent design across all blocks❤🔥2 1
У нас тут в телеге есть ИИ редактор, который меняет стиль текста по одному клику.
Сделала 4 стиля для факультетов и ещё один бонусный для Луны.
Давайте посмотрим
как работает! Нужно написать сообщение от 140 знаков или около того, появится кнопочка Ai справа от окна редактирования текста.
Для проверки напишите мне какая у вас сегодня погода или что вкусного было на завтрак или ужин.
А потом примените стиль своего факультета:
🏳️ Слизерин
🏳️ Когтевран
🏳️ Пуффендуй
🏳️ Гриффиндор
Бонус: Луна Лавгуд
Попробуем угадать у кого какой :)
Сделала 4 стиля для факультетов и ещё один бонусный для Луны.
Давайте посмотрим
как работает! Нужно написать сообщение от 140 знаков или около того, появится кнопочка Ai справа от окна редактирования текста.
Для проверки напишите мне какая у вас сегодня погода или что вкусного было на завтрак или ужин.
А потом примените стиль своего факультета:
Бонус: Луна Лавгуд
Попробуем угадать у кого какой :)
Please open Telegram to view this post
VIEW IN TELEGRAM
It was the best of times, it was the worst of times, it was the age of wisdom, it was the age of foolishness, it was the epoch of belief, it was the epoch of incredulity, it was the season of Light, it was the season of Darkness, it was the spring of hope, it was the winter of despair, we had everything before us, we had nothing before us, we were all going direct to Heaven, we were all going direct the other way – in short, the period was so far like the present period, that some of its noisiest authorities insisted on its being received, for good or for evil, in the superlative degree of comparison only.
—
The time was to come, when that wine too would be spilled on the street-stones, and when the stain of it would be red upon many there.
😍4 4 4
3. Обучение весов (Как нейросеть заучивает штампы)
Чтобы эта гигантская карта смыслов вообще появилась, векторы проходят через слои нейросети. Каждый слой это математический фильтр с весами (числовыми коэффициентами).
Эти веса не берутся из воздуха. Они настраивались месяцами на миллионах картинок. И вот тут кроется главная засада: если сеть миллион раз видела слово angry рядом со стоковыми фотографиями злых лиц, вес этой связи становится просто монументальным. Для нейронки злость становится математически равна злобному карикатурному лицу.
4. Распределение вероятностей
На выходе из этой карты получается новый набор векторов. Он задает распределение вероятностей: какие цвета, формы и детали статистически лучше всего подходят под наш изначальный текст.
И вот тут нужно осознать очень важную вещь: сеть не придумывает сцену и не вкладывает в нее душу. Она просто хладнокровно вычисляет, какие пиксели вероятнее всего должны стоять рядом, исходя из заданных координат.
Если вы пишете дефолтные, общие слова, машина выдаст вам самое усредненное, безопасное и банальное распределение вероятностей. Вы получите ту самую глянцевую, пластиковую картинку, которая кричит меня сгенерировала нейросеть.
Чтобы получить более тонкие эмоции, нужно увести векторы в те зоны латентного пространства, где лежат сложные, противоречивые и неочевидные связи. Именно поэтому мы прописываем напряженную челюсть, описываем атмосферу и просим небрежные мазки кисти. Мы буквально заставляем алгоритм свернуть с протоптанной дороги в темный переулок.
Чтобы эта гигантская карта смыслов вообще появилась, векторы проходят через слои нейросети. Каждый слой это математический фильтр с весами (числовыми коэффициентами).
Эти веса не берутся из воздуха. Они настраивались месяцами на миллионах картинок. И вот тут кроется главная засада: если сеть миллион раз видела слово angry рядом со стоковыми фотографиями злых лиц, вес этой связи становится просто монументальным. Для нейронки злость становится математически равна злобному карикатурному лицу.
4. Распределение вероятностей
На выходе из этой карты получается новый набор векторов. Он задает распределение вероятностей: какие цвета, формы и детали статистически лучше всего подходят под наш изначальный текст.
И вот тут нужно осознать очень важную вещь: сеть не придумывает сцену и не вкладывает в нее душу. Она просто хладнокровно вычисляет, какие пиксели вероятнее всего должны стоять рядом, исходя из заданных координат.
Если вы пишете дефолтные, общие слова, машина выдаст вам самое усредненное, безопасное и банальное распределение вероятностей. Вы получите ту самую глянцевую, пластиковую картинку, которая кричит меня сгенерировала нейросеть.
Чтобы получить более тонкие эмоции, нужно увести векторы в те зоны латентного пространства, где лежат сложные, противоречивые и неочевидные связи. Именно поэтому мы прописываем напряженную челюсть, описываем атмосферу и просим небрежные мазки кисти. Мы буквально заставляем алгоритм свернуть с протоптанной дороги в темный переулок.
🔥6 5 5❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Так, это эстетический акт спасения в виде живой картины после жестокого удара техническими подробностями!
❤4 3 2
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣6😁4 4
Внимание!
Это🤓 🤓 ЗАНУДНЫЙ длинный пост.
Не занудный и не длинный будет ниже со всеми карточками, поехали.
Блок 5. Почему angry дает карикатурное лицо
Если дать модели только один ярлык angry, она пойдет по пути наибольшей вероятности.
Она просто возьмет "среднее арифметическое" (грубое упрощение, конечно – модель семплирует из области высокой вероятности в латентном пространстве, а не буквально усредняет) из огромной зоны злость. А самый частый визуальный паттерн злости в обучающих данных – это гипертрофированный оскал, сильно нахмуренные брови итп. Есть еще preference tuning, но на это забьём пока.
Блок 6. Как детали меняют координаты
Но если мы пишем "сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья", математика меняется.
Эти новые токены-детали жестко сдвигают наши координаты (это тоже упрощённо). Они уводят генерацию из попсовой зоны angry в конкретные, редкие точки латентного пространства, где лежат точные телесные признаки.
Блок 7. Диффузия
Дальше начинается сам процесс рисования – диффузия. Модель берет холст из чистого визуального шума (как помехи на старом телевизоре, помните? Шшшш).
Опираясь на наши точные векторы, она шаг за шагом убирает ("вычитает") этот шум. Это похоже на работу скульптора: он берет глыбу мрамора (шум) и отсекает лишнее, пока не проявится чистая форма (картинка).
Блок 8. А как же Nano Banana Pro (и иже с ней)?
Nano Banana Pro устроена чуть хитрее (хоть она и менее художественная). Перед тем как начать рисовать (диффузию), работает "думающая" языковая модель.
Она может взять ваш короткий промпт, проанализировать его, "загуглить" контекст (получить актуальные данные!) или самостоятельно расписать точные визуальные признаки и освещение. То есть языковая модель работает как ваш персональный режиссер-соавтор перед стартом диффузии.
Блок 9. Главное правило
Нейросеть не читает текст и не чувствует эмоции как человек – она вычисляет вероятности.
❌ Абстрактное слово = усредненный вектор = шаблонное выражение лица.
✅ Описание физики тела и атмосферы = точные координаты в узкой области = кинематографичный и живой кадр.
Это
Не занудный и не длинный будет ниже со всеми карточками, поехали.
Блок 5. Почему angry дает карикатурное лицо
Если дать модели только один ярлык angry, она пойдет по пути наибольшей вероятности.
Она просто возьмет "среднее арифметическое" (грубое упрощение, конечно – модель семплирует из области высокой вероятности в латентном пространстве, а не буквально усредняет) из огромной зоны злость. А самый частый визуальный паттерн злости в обучающих данных – это гипертрофированный оскал, сильно нахмуренные брови итп. Есть еще preference tuning, но на это забьём пока.
Блок 6. Как детали меняют координаты
Но если мы пишем "сжатая челюсть, слегка нахмуренные брови, неподвижные плечи, взгляд исподлобья", математика меняется.
Эти новые токены-детали жестко сдвигают наши координаты (это тоже упрощённо). Они уводят генерацию из попсовой зоны angry в конкретные, редкие точки латентного пространства, где лежат точные телесные признаки.
Блок 7. Диффузия
Дальше начинается сам процесс рисования – диффузия. Модель берет холст из чистого визуального шума (как помехи на старом телевизоре, помните? Шшшш).
Опираясь на наши точные векторы, она шаг за шагом убирает ("вычитает") этот шум. Это похоже на работу скульптора: он берет глыбу мрамора (шум) и отсекает лишнее, пока не проявится чистая форма (картинка).
Блок 8. А как же Nano Banana Pro (и иже с ней)?
Nano Banana Pro устроена чуть хитрее (хоть она и менее художественная). Перед тем как начать рисовать (диффузию), работает "думающая" языковая модель.
Она может взять ваш короткий промпт, проанализировать его, "загуглить" контекст (получить актуальные данные!) или самостоятельно расписать точные визуальные признаки и освещение. То есть языковая модель работает как ваш персональный режиссер-соавтор перед стартом диффузии.
Блок 9. Главное правило
Нейросеть не читает текст и не чувствует эмоции как человек – она вычисляет вероятности.
❌ Абстрактное слово = усредненный вектор = шаблонное выражение лица.
✅ Описание физики тела и атмосферы = точные координаты в узкой области = кинематографичный и живой кадр.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3 2❤🔥1
Вернемся к нашим баранам слизериновским!
С легкой иронией наблюдаю за смятением той части аудитории, чей кругозорсчастливо избежал глубокого погружения в фанфикшн. Поступают закономерные вопросы: что за шатен с завидной регулярностью материализуется в кадре рядом с Драко.
Как я поняла, перед нами весьма любопытный феномен коллективного бессознательного. Каким-то непостижимым образом Теодор Нотт – персонаж, чье присутствие в каноне стремилось к статистической погрешности, – вдруг обрел колоссальный психологический вес и уверенно прописался в высшем эшелоне слизеринской эстетики.
Господа и дамы, хорошо знакомые с текстами, передаю слово вам. Препарируйте, пожалуйста, этот культурный сдвиг в комментариях. Как именно тихий наблюдатель с задней парты эволюционировал в одну из главных фигур подземелий?
С легкой иронией наблюдаю за смятением той части аудитории, чей кругозор
Как я поняла, перед нами весьма любопытный феномен коллективного бессознательного. Каким-то непостижимым образом Теодор Нотт – персонаж, чье присутствие в каноне стремилось к статистической погрешности, – вдруг обрел колоссальный психологический вес и уверенно прописался в высшем эшелоне слизеринской эстетики.
Господа и дамы, хорошо знакомые с текстами, передаю слово вам. Препарируйте, пожалуйста, этот культурный сдвиг в комментариях. Как именно тихий наблюдатель с задней парты эволюционировал в одну из главных фигур подземелий?
😍6❤🔥4🥰3 1