Forwarded from Python - Советы, библиотеки, гайды
SReC — нейронная сеть для сжатия изображения без потери качества.
SReC рассматривает сжатие без потерь как проблему сверхвысокого разрешения и применяет нейронные сети для сжатия изображений. SReC может достичь самых современныхq коэффициентов сжатия больших наборов данных с практичным временем выполнения.
* Обучение, сжатие и распаковка полностью поддерживаются и имеют открытый исходный код :0
Фотография сверху - пример сжатия изображения без потери качества(тг съел качество, поэтому я оставил ссылку).
Документация и примеры кода здесь :3
SReC рассматривает сжатие без потерь как проблему сверхвысокого разрешения и применяет нейронные сети для сжатия изображений. SReC может достичь самых современныхq коэффициентов сжатия больших наборов данных с практичным временем выполнения.
* Обучение, сжатие и распаковка полностью поддерживаются и имеют открытый исходный код :0
Фотография сверху - пример сжатия изображения без потери качества(тг съел качество, поэтому я оставил ссылку).
Документация и примеры кода здесь :3
Forwarded from Neural Shit
Иногда (особенно сейчас) надо прекращать думать о хуёвом и давать мозгу расслабиться и отдохнуть.
Лучший способ — это залипнуть в психоделический видос сгенеренный нейронкой. Вот, я вам принёс 40 минут такого залипалова: https://www.youtube.com/watch?v=HxRgAMt4-nw
Лучший способ — это залипнуть в психоделический видос сгенеренный нейронкой. Вот, я вам принёс 40 минут такого залипалова: https://www.youtube.com/watch?v=HxRgAMt4-nw
YouTube
AI Dream 70 - The Most Amazing AI Galaxy Nebula
Hi guys,
For today's video I prepared another long AI generated Galaxy Nebula Trip!
I guess this topic never gets old, and OMG does this animation have some
impressive frames in them! The thumbnail looks amazing, right? lol
The animation took a while to…
For today's video I prepared another long AI generated Galaxy Nebula Trip!
I guess this topic never gets old, and OMG does this animation have some
impressive frames in them! The thumbnail looks amazing, right? lol
The animation took a while to…
Forwarded from Мишин Лернинг
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 WoW! DALL-E 2 для генерации видео! MAKE-A-VIDEO от MetaAI
📄 tl;dr
Ресерчеры из MetaAI обучили диффузионную нейросеть (типа DALL-E 2, Imagen, Стебель) MAKE-A-VIDEO, способную генерировать короткие видео-ролики по текстовому описанию!
А самое крутое то, что для этого им не потребовался датасет, содержащий пары видео - текст!
🚬 Что же за заверь MAKE-A-VIDEO?
Начнем с того, что название MAKE-A-VIDEO, отсылает нас к Make-A-Scene от тех же MetaAI — DALL-E поколения, которая имела кондишн не только в тексте, но и в семантической маске. Название имхо не очень удачное, так как тут ничего подобного нет. НО это DALL-E-like 2-го поколения и, видно, они просто решили двигать свой бренд MAKE-A- ... Ок, их дело.
Основной фишкой этой работы является развитие мысли: "Картинка это видео с одним кадром". Но как это реализовано? И главное, как можно сделать Text-To-Video без Text-To-Video данных?!
Подход напоминает DALL-E 2 —разделяй и властвуй декомпозируй и генерь,с его CLIP_text_emb -> CLIP_image_emb Prior!
Генрация видео Y может быть представлена как композиция Модулей:
🗒 Y = SR(th) ◦ SR(tl) ◦ ↑F ◦ Dt ◦ P ◦ (X_t, C(X_i))
Идея очень простая и изящная давайте прост разберем ее элементы:
0. X_i — картинка, X_t — текст. {X_i, X_t} — пара картинка-текст.
1. C(X_i) — CLIP embedding изображения X_i. N-мерный вектор, содержащий в себе необходимые фичи для описания картинки.
2. P — Prior, диффузионная нейронная сеть, отображающая X_t текстовые CLIP embedding'и в CLIP image embedding'и
Теперь понятно, что имея текст, можно получить | P (X_t) —> C(X_i) | варианты визуальных эмбеддингов возможных изображений.
3. Дальше вступает модуль Dt, который готовит 16 RGB фреймов по 64 × 64 на основе CLIP эмбеддинга первого кадра!
И на этот этапе становится понятно, что не нужны пары текст-видео!
4. Модуль ↑F делает интерполяции между кадрами и SR(th) ◦ SR(tl) делают пространственно-временной апскейл из 64х в 256 и 768
👾 Сайт Проект (тыкать обязательно!)
📄 Paper
🤖 м и ш и н л е р н и н г
Ресерчеры из MetaAI обучили диффузионную нейросеть (типа DALL-E 2, Imagen, Стебель) MAKE-A-VIDEO, способную генерировать короткие видео-ролики по текстовому описанию!
А самое крутое то, что для этого им не потребовался датасет, содержащий пары видео - текст!
Начнем с того, что название MAKE-A-VIDEO, отсылает нас к Make-A-Scene от тех же MetaAI — DALL-E поколения, которая имела кондишн не только в тексте, но и в семантической маске. Название имхо не очень удачное, так как тут ничего подобного нет. НО это DALL-E-like 2-го поколения и, видно, они просто решили двигать свой бренд MAKE-A- ... Ок, их дело.
Основной фишкой этой работы является развитие мысли: "Картинка это видео с одним кадром". Но как это реализовано? И главное, как можно сделать Text-To-Video без Text-To-Video данных?!
Подход напоминает DALL-E 2 —
Генрация видео Y может быть представлена как композиция Модулей:
Идея очень простая и изящная давайте прост разберем ее элементы:
0. X_i — картинка, X_t — текст. {X_i, X_t} — пара картинка-текст.
1. C(X_i) — CLIP embedding изображения X_i. N-мерный вектор, содержащий в себе необходимые фичи для описания картинки.
2. P — Prior, диффузионная нейронная сеть, отображающая X_t текстовые CLIP embedding'и в CLIP image embedding'и
Теперь понятно, что имея текст, можно получить | P (X_t) —> C(X_i) | варианты визуальных эмбеддингов возможных изображений.
3. Дальше вступает модуль Dt, который готовит 16 RGB фреймов по 64 × 64 на основе CLIP эмбеддинга первого кадра!
И на этот этапе становится понятно, что не нужны пары текст-видео!
4. Модуль ↑F делает интерполяции между кадрами и SR(th) ◦ SR(tl) делают пространственно-временной апскейл из 64х в 256 и 768
👾 Сайт Проект (тыкать обязательно!)
📄 Paper
🤖 м и ш и н л е р н и н г
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Мишин Лернинг
This media is not supported in your browser
VIEW IN TELEGRAM
🦚 DreamFusion: Text-to-3D using 2D Diffusion от ?Google
Не успели мы насладиться Text2Video от MetaAI как выходит Text-To-3D диффузия.. Что за день..
🚀 Как работает? Идея супер изящная!
Это градиентный метод, основанный на Loss-функции, такой как DeepDream. По факту происходит оптимизация рандомно инициализированной 3D модельки (a Neural Radiance Field, or NeRF) через градиенты 2D диффузионных генераций.
То есть по факту, проворачивая такой трюк, не нужно иметь 3D данных вообще!
Подробнее:
1) Рандомная фигура рендерится через NERF (плотность, освещение, цвет)
2) Этот изначальный бред (так как это начало) рендерится в 2D проекцию
3) Затем к картинке подмешивают шум, и все это подается на!!! внимание!! ИМАГЕН
4) После чего Имаген предсказывает необходимый денойз
5) Затем из пересказанного денойза вычитается подмешанный шум. и ВУАЛЯ! Дальше все дифференцируемо! Можно пускать градиенты обратно на 3D-модель
А то что у ребят был доступ к IMAGEN мне на 99.9999999% кажется, что это Google. Ну, а так, чем Тьюринг не шутит..
👁 gallery
📄 paper
📇 project
🤖 м и ш и н л е р н и н г
Не успели мы насладиться Text2Video от MetaAI как выходит Text-To-3D диффузия.. Что за день..
🚀 Как работает? Идея супер изящная!
Это градиентный метод, основанный на Loss-функции, такой как DeepDream. По факту происходит оптимизация рандомно инициализированной 3D модельки (a Neural Radiance Field, or NeRF) через градиенты 2D диффузионных генераций.
То есть по факту, проворачивая такой трюк, не нужно иметь 3D данных вообще!
Подробнее:
1) Рандомная фигура рендерится через NERF (плотность, освещение, цвет)
2) Этот изначальный бред (так как это начало) рендерится в 2D проекцию
3) Затем к картинке подмешивают шум, и все это подается на!!! внимание!! ИМАГЕН
4) После чего Имаген предсказывает необходимый денойз
5) Затем из пересказанного денойза вычитается подмешанный шум. и ВУАЛЯ! Дальше все дифференцируемо! Можно пускать градиенты обратно на 3D-модель
А то что у ребят был доступ к IMAGEN мне на 99.9999999% кажется, что это Google. Ну, а так, чем Тьюринг не шутит..
👁 gallery
📄 paper
📇 project
🤖 м и ш и н л е р н и н г
Forwarded from Мишин Лернинг
☠️ Colab — Все!
Все мы любили колаб. Но увы, ничто не вечно под луной. И теперь можно купить или 100 или 500 compute units, что в переводе на бытовой означает, что колаб сдулся.
🪦 Царство небесное, вечн Йисгадал вэйискадаш шмэй рабо..
🤖 м и ш и н л е р н и н г
Все мы любили колаб. Но увы, ничто не вечно под луной. И теперь можно купить или 100 или 500 compute units, что в переводе на бытовой означает, что колаб сдулся.
🤖 м и ш и н л е р н и н г
Forwarded from эйай ньюз
Вот вам блог-постик c объяснением Variational Lower Bound или Evidence Lower Bound (ELBO). Никогда не поздно поднимать базу #fundamentals, да и на
ML собесах пригодится.
❱❱ Ссылка
@ai_newz
ML собесах пригодится.
❱❱ Ссылка
@ai_newz
Forwarded from GitHub Community
DeepFaceDrawing – нейросеть, которая позволяет создавать реалистичные изображения лиц из набросков от руки
Метод отрисовки по существу использует входные эскизы в качестве «мягких» ограничений и, таким образом, способен создавать высококачественные изображения лиц даже из грубых и/или неполных эскизов
Данный инструмент прост в использовании даже для тех кто не рисует, сохраняя при этом тонкое управление деталями формы
⤷ Демо
⤷ Ссылка на проект
GitHub | #Python #Interesting
Метод отрисовки по существу использует входные эскизы в качестве «мягких» ограничений и, таким образом, способен создавать высококачественные изображения лиц даже из грубых и/или неполных эскизов
Данный инструмент прост в использовании даже для тех кто не рисует, сохраняя при этом тонкое управление деталями формы
⤷ Демо
⤷ Ссылка на проект
GitHub | #Python #Interesting
Forwarded from Open Source
FADA
Этот инструмент предназначенный для надежного обнаружения лиц не настоящих людей, а сгенерированных ИИ, с сайта https://thispersondoesnotexist.com/
https://github.com/MathisHammel/FADA
Этот инструмент предназначенный для надежного обнаружения лиц не настоящих людей, а сгенерированных ИИ, с сайта https://thispersondoesnotexist.com/
https://github.com/MathisHammel/FADA
Forwarded from [PYTHON:TODAY]
🔥 Полезные библиотеки Python
DALL·E Mini - интересный проект в основе которого лежит модель искусственного интеллекта, которая генерирует изображения по любому вашему запросу.
🕸 Попробовать в режиме реального времени
⚙️ GitHub/Инструкция
#ai #github #soft #python
DALL·E Mini - интересный проект в основе которого лежит модель искусственного интеллекта, которая генерирует изображения по любому вашему запросу.
🕸 Попробовать в режиме реального времени
⚙️ GitHub/Инструкция
#ai #github #soft #python
Forwarded from Мишин Лернинг
❤️🔥 AudioGen: нейросеть для генерации аудио по текстовому описанию
Очень много работы по визуальным диффузам, так что буду краток. Мета сделал то, что все мы ждали!
Как отметил Александр Шульгин,альфа-метилированные триптамины AudioGEN можно рассматривать как триптаминовые гомологи амфетамина аудиальный гомолог визуального DALL-E 1. И действительно, Александр Шульгин тут очень точно подметил!
Дело тут именно в том, что АудиоГена не гомологичен Имагену. Работа ведется не в пространстве пикселей — звуковой волны, и не в пространстве интегрального преобразования (фурье, вейвлет), а в VAE, в данном случае RVQ*
1) Сначала аудио конвертируется при помощи VAE в латент.
2) Затем трансформер авторегрессионно предсказывает дискретные токены RVQ, через кроссаттеншен с текстового энкодинга, которые потом превращаются обратно в звук при помощи RVQ-декодера.
Результаты — WOW, писать можно долго, но это надо слушать.
📯 Примеры слушать обязательно: тут
📰 Пейпер Аудиогены
💻 код / будет тут?
🤖 м и ш и н л е р н и н г
Очень много работы по визуальным диффузам, так что буду краток. Мета сделал то, что все мы ждали!
Как отметил Александр Шульгин,
Дело тут именно в том, что АудиоГена не гомологичен Имагену. Работа ведется не в пространстве пикселей — звуковой волны, и не в пространстве интегрального преобразования (фурье, вейвлет), а в VAE, в данном случае RVQ*
1) Сначала аудио конвертируется при помощи VAE в латент.
2) Затем трансформер авторегрессионно предсказывает дискретные токены RVQ, через кроссаттеншен с текстового энкодинга, которые потом превращаются обратно в звук при помощи RVQ-декодера.
Результаты — WOW, писать можно долго, но это надо слушать.
📯 Примеры слушать обязательно: тут
📰 Пейпер Аудиогены
💻 код / будет тут?
🤖 м и ш и н л е р н и н г
Forwarded from Библиотека разведчика | Osint | Книги | Курсы
Telegram
Основы визуализации данных
Визуализация — это ключ к пониманию данных. Научим упаковывать данные в понятные и наглядные графики — так, чтобы в них разобрался каждый. Познакомитесь с разными инструментов: Excel, Google Data Studio, Tableau, Power BI, D3.js, Datawrapper
Forwarded from Код.ру
👀 Чем опасны нейросети? //
«Код Дурова» съездил в Хакасию, увидел воочию Саяно-Шушенскую ГЭС и обсудил с главным технологическим экспертом «Лаборатории Касперского» риски, которые несёт в себе машинное обучение в руках киберпреступников.
@d_code
«Код Дурова» съездил в Хакасию, увидел воочию Саяно-Шушенскую ГЭС и обсудил с главным технологическим экспертом «Лаборатории Касперского» риски, которые несёт в себе машинное обучение в руках киберпреступников.
@d_code
Код Дурова
Какие угрозы несут нейросети в руках злоумышленников?
DALL-E, Midjourney и подобные им приходят в каждый дом. Чем это грозит нам сегодня и в будущем?
Forwarded from запуск завтра
Open AI опубликовала крупнейшую нейросеть распознавания речи, обученную на 680 тысячах часов аудио, назвали Whisper — шепот.
Сеть понимает множество языков кроме английского, включая русский.
Качество распознавания сравнимо с сервисами от Google, Amazon, Microsoft и Yandex. При этом сервисы распознавания речи от корпораций стоят по 2 доллара за минуту распознавания, а тут можно скачать и пользоваться этой штукой бесплатно и без подключения к интернету.
Открыта и бесплатна для скачивания не только конечная сеть, но и «развесовка», то есть модель можно тюнить и использовать как составную часть более сложных алгоритмов. Не открыты только 680 тысяч часов аудио, которые использовали для обучения модели.
Пара примеров есть на странице проекта; распознать любые файлы и даже свою речь с микрофона можно попробовать онлайн в неофициальном google colab блокноте (очень классный инструмент!).
—
Кстати, если у вас айфон — рекомендую обновить iOS и попробовать встроенное распознавание речи. Новая версия iOS внесла одно маленькое изменение — теперь редактирование текста клавиатурой не прерывает процесс распознавания. Можно набрать текст голосом, исправить ошибку пальцами и продолжить набор голосом. Я теперь пишу большинство сообщений на айфоне именно так — гораздо быстрее и легче, чем печатать пальцами.
Интересно, что мы как раз начинаем исследовательский проект для Чайки — встроим распознавание речи в медицинскую информационную систему, чтобы врачи могли заполнять карточки пациентов голосом и тратили на это меньше времени.
Будущее уже совсем близко.
Сеть понимает множество языков кроме английского, включая русский.
Качество распознавания сравнимо с сервисами от Google, Amazon, Microsoft и Yandex. При этом сервисы распознавания речи от корпораций стоят по 2 доллара за минуту распознавания, а тут можно скачать и пользоваться этой штукой бесплатно и без подключения к интернету.
Открыта и бесплатна для скачивания не только конечная сеть, но и «развесовка», то есть модель можно тюнить и использовать как составную часть более сложных алгоритмов. Не открыты только 680 тысяч часов аудио, которые использовали для обучения модели.
Пара примеров есть на странице проекта; распознать любые файлы и даже свою речь с микрофона можно попробовать онлайн в неофициальном google colab блокноте (очень классный инструмент!).
—
Кстати, если у вас айфон — рекомендую обновить iOS и попробовать встроенное распознавание речи. Новая версия iOS внесла одно маленькое изменение — теперь редактирование текста клавиатурой не прерывает процесс распознавания. Можно набрать текст голосом, исправить ошибку пальцами и продолжить набор голосом. Я теперь пишу большинство сообщений на айфоне именно так — гораздо быстрее и легче, чем печатать пальцами.
Интересно, что мы как раз начинаем исследовательский проект для Чайки — встроим распознавание речи в медицинскую информационную систему, чтобы врачи могли заполнять карточки пациентов голосом и тратили на это меньше времени.
Будущее уже совсем близко.
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Диффузию применяют для решения все более разных проблем.
Тут ресерчеры генерируют motion последовательности по текстовым запросам с помощью диффузионной модели. Аниматорам на заметку.
Статья Motion Diffusion Model сейчас на ревью на ICLR 2023.
@ai_newz
Тут ресерчеры генерируют motion последовательности по текстовым запросам с помощью диффузионной модели. Аниматорам на заметку.
Статья Motion Diffusion Model сейчас на ревью на ICLR 2023.
@ai_newz
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
3DiM: Novel View Synthesis with Diffusion Models
А тут Гугл ресерч охренел и сделал синтез 3д моделей (точнее рендеринг новых вью) по одной картинке. И конечно же с помощью диффузии! Это просто алхимия какая-то! Вот так вот, забудьте все свои Гани и делайте денойзинг 😁.
❱❱ Сайт проекта открывать обязательно
@ai_newz
А тут Гугл ресерч охренел и сделал синтез 3д моделей (точнее рендеринг новых вью) по одной картинке. И конечно же с помощью диффузии! Это просто алхимия какая-то! Вот так вот, забудьте все свои Гани и делайте денойзинг 😁.
❱❱ Сайт проекта открывать обязательно
@ai_newz
Forwarded from Python - Советы, библиотеки, гайды
Face-classification — утилита, которая предоставляет обнаружение лиц.
Face-classification предоставляет обнаружение лиц в реальном времени и классификация эмоций/пола с использованием наборов данных fer2013/IMDB с моделью keras CNN и openCV.
Точность теста на гендерную классификацию IMDB: 96%.
Точность теста классификации эмоций fer2013: 66%.
Проект находится здесь :3
Face-classification предоставляет обнаружение лиц в реальном времени и классификация эмоций/пола с использованием наборов данных fer2013/IMDB с моделью keras CNN и openCV.
Точность теста на гендерную классификацию IMDB: 96%.
Точность теста классификации эмоций fer2013: 66%.
Проект находится здесь :3
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Не так давно репостил сюда Make-A-Video от MetaAI, которая умеет уже не картинки делать из текста, а целые гифки, и вот разработчики показали один из примеров, как нейронка генерирует персонажей.
Чтож, будущее многих индустрий скоро поменяется 🌚
Автор
Чтож, будущее многих индустрий скоро поменяется 🌚
Автор