DS & ML
588 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from эйай ньюз
Сравнение новой супер-пупер модели DALLE-2 и Latent Diffusion в генерации изображений по тексту.

DALLE-2 конечно на голову выше. Но и LD неплохо понимает, что значит, например, стиль Клода Моне или Энди Уорхола. Но кода от OpenAI нет и не будет, поэтому играемся с Latent Diffusion.

С каждым месяцем нейронки генерят все более и более качественные изображения. Скоро дизайнеры действительно без работы останутся.

Спасибо @mlart за картинки и обновленный колаб.
Forwarded from ExMuffin
📝Text2Image 5.0 Latent-Diffusion🎨

Чуть меньше недели назад в сети появился новый генератор картинок по тексту (LD). Он был без преувеличения прекрасен (благодаря новому подходу к диффузии), но лишь до тех пор, пока мир не узрел Dall-E 2. В тот момент все предыдущие генераторы стали меркнуть на фоне детища OpenAI. Но коль поиграться нам не дают, будем довольствоваться тем, что есть. Тем более, при очевидных различиях, я бы не сказал, что они прям колоссальные. Энивей с LD можно получить море фана, а именно за этим многие здесь и собрались. Запросы в колабе принимаются на множестве языков. Чем дополнить я не придумал, но и пройти стороной такое событие не мог.

P.S. Ку, ребят, не теряемся. Да, немного пропал, но честное слово, за 2 месяца ничего особо стоящего просто небыло, поэтому я и не публиковал посты. Канал бросать не планирую, но и вести его по расписанию не хочу. Прошу отнестись с пониманием.

https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/Text2Image_v5.ipynb
This media is not supported in your browser
VIEW IN TELEGRAM
🥑 DALL-E 2 позволяет не только генерировать новые изображение, но и создавать интерполяцию между реальными!

DALL-E 2 сочетает лучшее из двух миров:
▪️Zero-Shot способность генерации изображений практически во всех доменах
▪️И способность интерполяции между изображениями (между векторами их эмбедингов)

На gif'ке — DALL-E 2 вариации между двумя изображениями: логотипом OpenAI и картиной "Изучение цвета квадратов и кругов" Кандинского; путем интерполяции их CLIP эмбедингов, а затем декодирования с помощью диффузионной модели unСLIP (декодер части модели DALL-E 2).

Так что все прелести StyleGAN-интерполяции поставляются в DALL-E 2 "из коробки"
Бот «Сбера» бесплатно преобразует голосовые сообщения в текст

Команда SberDevices разработала телеграм-бот, способный преобразовывать голосовые сообщения в текстовые, сообщается в пресс-релизе SberPress. Бот удобно использовать при невозможности прослушать сообщение или необходимости провести расшифровку аудиозаписи.

Новинка работает на основе собственной технологии «Сбера» SmartSpeech. Чтобы преобразовать звук в текст, нужно отправить голосовое сообщение телеграм-боту @smartspeech_sber_bot. В ответ придет текстовая расшифровка аудиозаписи.

SmartSpeech Bot способен распознать аудиофайлы на русском языке до 20 Мб в кодировках MP3, WAV (8-96 кГц), FLAC и OggOpus. Отправлять сообщения можно боту в личной переписке или подключить его к групповому чату Telegram. Преобразование речи в текст занимает несколько секунд.

Платформа SmartSpeech от SberDevices способна преобразовывать речь в текст и обратно. Она используется в голосовых ассистентах семейства «Салют» и в качестве телефонного помощника при звонке на номер 900.
👍1
Forwarded from [PYTHON:TODAY]
This media is not supported in your browser
VIEW IN TELEGRAM
🚫 No-No-No!

Киберпанк, ты не туда воюешь! 😀😱

#cyberpunk