Performance artist
316 subscribers
2.39K photos
172 videos
3 files
195 links
SM studio and art projects.
Download Telegram
❤2😁1🤔1🤨1
Настоящая человеческая статья

Я вместе с @godofhoudini сходил рассказать про генеративные картинки и тексты. Было интересно посмотреть на реакцию людей, которые читали про успехи нейросетей, но мало кто пробовал их в деле. Мы генерили мнение о Владивостоке, описание компании в стиле Пелевина и прикольные картинки с рыбаками.
Наблюдение: взрослая аудитория в новой сложной теме, без одновременной практики с инструментом ловит информационный перегруз через полтора часа. Мне было бы сложно сидеть и слушать про чужие кейсы – и не пробовать что-то сгенерить. Не представляю, как выдерживают мастер-классы длиннее пары часов.

Статья про нас вот тут.

#реальность
👍6🔥2👏2
Прогресс в генерации картинок

Можно легко заметить на примере рук, гитар, рельсов и проводов.

В декабре, с помощью доученных моделей StableDiffusion сообщество решило проблему с количеством пальцев. В феврале появился ControlNet. С ним это стало уже рутинной операцией – благодаря проекции скелета и вкладке Joints.

Midjourney все три месяца отставал. Только в марте появился их пятый движок, где руки получаются почти хорошо при базовой генерации портретов.

Нормальную гитару в руках персонажа мне не удавалось получить до апреля. Даже ControlNet с такой задачей не особо помогает. Главная проблема это пальцы на грифе и струны. Они переплетаются между собой и со всем, что попало в пятно внимания. На картах глубины в ControlNet струн тупо не видно, они слишком тонкие и параллельные.

Но тут я опять купил подписку на Midjourney – и получилось.

#midjourney
🔥4👍2🤔1
А вот так гитары выглядели в декабре. Примеры из Midjourney и StableDiffusion. Это лучшие варианты, в первых двух + Photoshop.

#археология
😁4🤯2🤔1
Отправная точка для экспериментов в генерации

PEZ Dispenser это скрипт, на вход которого вы подаёте картинку или свой старый промпт. На выходе получаете текст, в котором PEZ пытается сохранить начальные данные, но переписать их по-своему.
Диспенсер выдаёт шизофреничные промпты с эмодзи, арабской вязью, многоточиями и т.п.
Этот элемент хаоса/случайности отвечает за творчество. Значение Prompt length – тоже поле для экспериментов. Optimization steps лучше оставить 1000, быстрее работает.

Можно запустить в Google.Colab
Тут вы можете отсматривать все варианты текстов и выбирать себе промпт по вкусу.

По-разному выглядит в разных нейросетках. В Midjourney ругается на отдельные слова, например fag.

Шикарный инструмент для творчества, снимает проблему «чистого листа» и «чего бы сгенерить». Однозначно в закладки.

Пример: на входе нецке из SDXL и результат PEZ в Midjourney.

Промпт:
snake holistic thoughtful raven oregon ball lmfa👽bwogorilla nangbuddha statues meditation unsplash gamescom

#полезное
#midjourney
👍3
Удобный CLIP в Midjourney

Позволяет извлекать из картинки-референса 4 варианта её текстового описания. Запускается командой
/describe

Работает просто. После запуска команды ты грузишь свою картинку по клику, через 15 секунд получаешь результат. Обычно он неидеальный, но его текст можно поправить в отдельном окне. Удобно.

Сегодня с помощью этой функции я за 5 минут сгенерил шапку для пресс-волла. В основе рандомная картинка с образцом корейской живописи из поиска Гугла.

В галерее пример выдачи, референс и готовый результат.

#midjourney
👍6👏1
Audio
BARK это хороший text2voice

Полгода я не выкладывал звуковых нейронок – и примерно с декабря перестал за ними следить. Пришла пора наверстать. Тем более такие полезные штуки выходят.

Вот например Барк.

Опенсорс проект, переводит текст в голос. Понятно, что на английском работает лучше всего, но фишка в том, что он мультиязычный. Даже на русском можно получить приемлемые результаты.

Есть простенькое управление эмоциями и паузами в тексте, есть разделение на мужской и женский голос. В базовой версии на HuggingFace есть выбор из списка голосов, максимальная длина ролика 14 секунд. Хватает чтобы попробовать возможности. Также есть Google.Colab, чтобы не стоять в очереди на HuggingFace.

У Bark-а часто получаются аудио с посторонними шумами. Их можно бесплатно убрать вот тут в Adobe Podcast.

В примерах отрывок из моего текста от GPT4 и отрывок из Жванецкого.

#text2audio
👍4👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Навёрстываю видео – GEN-1

Три месяца назад я подавался на бета-тест этой video2video модели, но так и не получил доступ в Дискорде.
Штош, пришлось регаться с другой почты и пробовать на официальном сайте Runway.

И тут нам показывают инструмент будущего для видео генерации и AI-арта. Принцип очень прост – закидываешь свой ролик, загружаешь картинку-референс, настраиваешь силу её влияния на результат, выбираешь подходящее превью и генеришь лучший вариант.

В бесплатной версии длина ролика всего 4 сек, в самой дорогой – 15 сек, но качество 4k и разные плюшки.

В примере готовое видео с моим лицом после осознания перспектив этой технологии.
Картинка реф в комментах.

Попробуйте GEN, такой шаг нельзя пропустить. Скоро у них выйдет вторая, более совершенная версия.

Вот тут:
https://app.runwayml.com/signup

#video2video
👍3
Сходил на эфир радио «КП»

Говорили мы про нейросети и почему всё так быстро меняется. Планировали про искусство, а в итоге обсуждали воздействие на общество.

В процессе я поймал себя на мысли, что людей в ИИ интересуют не столько картинки и тексты, а сам фактор изменения окружающего мира. «ИИ заменит, отнимет творчество, заполнит фейками» – все эти разговоры потому, человек уже готов, но не знает, как быть. И чем дольше идёт хайпогонка с ИИ, тем больше все теряются. Понять прогресс всё сложнее.

Представьте, как долго придётся обучать общество, чтобы ему было комфортно жить в новой реальности.

#реальность
🔥9👏2🤔2
Синематик сцены в стиле Акиры Куросавы

Прорабатываю пайплайн по созданию раскадровок для фильмов.

#midjourney
🔥6👍3🤔2😎1