Forwarded from Open Source
AIlia-models
Коллекция предварительно обученных современных моделей ИИ.
▫️Распознавание действий
▫️Обнаружение аномалий
▫️Обработка звука
▫️Удаление фона
▫️Подсчет толпы
▫️Обнаружение одежды
▫️Оценка глубины
▫️Распознавание лиц
▫️Идентификация лица
▫️Интерполяция кадров
▫️Генеративные состязательные сети
▫️Обнаружение рук
▫️Распознавание руки
▫️Подпись к изображению
▫️Классификация изображений
▫️Обработка естественного языка
и многое многое другое...
https://github.com/axinc-ai/ailia-models
Коллекция предварительно обученных современных моделей ИИ.
▫️Распознавание действий
▫️Обнаружение аномалий
▫️Обработка звука
▫️Удаление фона
▫️Подсчет толпы
▫️Обнаружение одежды
▫️Оценка глубины
▫️Распознавание лиц
▫️Идентификация лица
▫️Интерполяция кадров
▫️Генеративные состязательные сети
▫️Обнаружение рук
▫️Распознавание руки
▫️Подпись к изображению
▫️Классификация изображений
▫️Обработка естественного языка
и многое многое другое...
https://github.com/axinc-ai/ailia-models
Forwarded from Мишин Лернинг
😂 Орнул от самого тупого Тьюринг теста
Тут Денис выложил прикольный тест, который должен показать, насколько ты, подписчик, способен отличить 🤖 генеративку от 👨🎨 не генеративки…
Спойлер, как пройти тест на 100%: если изображение квадратное — DALL•E 2, если соотношение сторон другое, то это не DALL•E 2.
🧠 попробуй и ты) вдруг не наберёшь 100%
Тут Денис выложил прикольный тест, который должен показать, насколько ты, подписчик, способен отличить 🤖 генеративку от 👨🎨 не генеративки…
Спойлер, как пройти тест на 100%: если изображение квадратное — DALL•E 2, если соотношение сторон другое, то это не DALL•E 2.
🧠 попробуй и ты) вдруг не наберёшь 100%
Forwarded from Эксплойт
This media is not supported in your browser
VIEW IN TELEGRAM
Нейросеть заставляет дипфейки петь
Дипфейки заполонили информационное пространство и не всегда используются с благими целями. Однако, в этой, с первого взгляда, сложной теме, остаётся место для полёта фантазии и забавного контента.
Avatarify — приложение, функционирующее на нейронке, которое не просто анимирует фотографию, но и подстраивает мимику лица под слова песни.
Всё, что нужно — загрузить фотографию в приложение и выбрать композицию. Треков довольно много, а помимо них ещё много трендов из Tik-Tok. Также желательно, чтобы для работы использовалось селфи, где видны зубы и человек смотрит прямо в камеру. Скачать с AppStore и Google Play.
@exploitex
Дипфейки заполонили информационное пространство и не всегда используются с благими целями. Однако, в этой, с первого взгляда, сложной теме, остаётся место для полёта фантазии и забавного контента.
Avatarify — приложение, функционирующее на нейронке, которое не просто анимирует фотографию, но и подстраивает мимику лица под слова песни.
Всё, что нужно — загрузить фотографию в приложение и выбрать композицию. Треков довольно много, а помимо них ещё много трендов из Tik-Tok. Также желательно, чтобы для работы использовалось селфи, где видны зубы и человек смотрит прямо в камеру. Скачать с AppStore и Google Play.
@exploitex
Forwarded from Мишин Лернинг
🔥🥑 Новый DALL•E: «Imagen» от Google Brain не уступает DALL•E 2 и GLIDE
Наверное устройство DALL•E 2 знают все ваши друзья и родственники. Но давайте быстро повторим как работает DALL•E 2:
▪️Взяли GLIDE диффузию и зафайнтюнили его на парах [CLIP эмбединг, картинка], заменив текстовый энкодер, и назвали это unCLIP
▪️Теперь можно получать множество вариаций картинки, если прогнать ее через CLIP и обратно через unCLIP. Но как генерить картинку из текста?
▪️Для этого обучили Prior, который переводит эмбединг текста в эмбединг картинки
Что же представляет из себя Imagen?
▫️Imagen это каскад из text conditioned classifier-free guidance диффузий: сначала в 64, потом в 256, а потом в 1024pix
▫️В чем же разница с GLIDE? Подход напоминает скорее предка DALL•E 2 — GLIDE
▫️Разница в том, что они не учат text encoder, а используют замороженный T5-XXL. И это вся разница? Ну концептуально — да!
▫️ Плюс авторы предложили dynamic thresholding sampling и улучшили CNN, создав Efficient U-Net
📄 paper
🤖 project
Наверное устройство DALL•E 2 знают все ваши друзья и родственники. Но давайте быстро повторим как работает DALL•E 2:
▪️Взяли GLIDE диффузию и зафайнтюнили его на парах [CLIP эмбединг, картинка], заменив текстовый энкодер, и назвали это unCLIP
▪️Теперь можно получать множество вариаций картинки, если прогнать ее через CLIP и обратно через unCLIP. Но как генерить картинку из текста?
▪️Для этого обучили Prior, который переводит эмбединг текста в эмбединг картинки
Что же представляет из себя Imagen?
▫️Imagen это каскад из text conditioned classifier-free guidance диффузий: сначала в 64, потом в 256, а потом в 1024pix
▫️В чем же разница с GLIDE? Подход напоминает скорее предка DALL•E 2 — GLIDE
▫️Разница в том, что они не учат text encoder, а используют замороженный T5-XXL. И это вся разница? Ну концептуально — да!
▫️ Плюс авторы предложили dynamic thresholding sampling и улучшили CNN, создав Efficient U-Net
📄 paper
🤖 project
Forwarded from эйай ньюз
🔥Ахтунг! Google разбил DALLE-2, выпустив свою text-2-image дифузионную модель Imagen
Основная идея: Large Pretrained Language Model × Cascaded Diffusion Model. То есть, мощная большая предобученная текстовая модель это залог успеха в генерации фотореалистичных картинок по описанию.
В статье есть куча подробного анализа и сравнений.
https://gweb-research-imagen.appspot.com/
@Artem Gradient
Основная идея: Large Pretrained Language Model × Cascaded Diffusion Model. То есть, мощная большая предобученная текстовая модель это залог успеха в генерации фотореалистичных картинок по описанию.
В статье есть куча подробного анализа и сравнений.
https://gweb-research-imagen.appspot.com/
@Artem Gradient
Forwarded from [PYTHON:TODAY]