Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Не так давно репостил сюда Make-A-Video от MetaAI, которая умеет уже не картинки делать из текста, а целые гифки, и вот разработчики показали один из примеров, как нейронка генерирует персонажей.
Чтож, будущее многих индустрий скоро поменяется 🌚
Автор
Чтож, будущее многих индустрий скоро поменяется 🌚
Автор
Forwarded from Мишин Лернинг
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 IMAGEN VIDEO — Диффузии уже не остановить!
tl;dr
Помните Make-A-Video от MetaAI? Так вот — забудьте! Команда Google Brain только что создало лучшее Text-to-Video решение!
Если вкратце, то это имагеновый гомолог далишного Make-A-Video 🤖
Ну, а если чуть подробнее:
— Text Prompt подается в T5 энкодер
— Затем Base Model (5.6B ❤️) диффузит 16 кадров 40x24 pix в скромных 3 fps
— Затем темпоральный апсемплер TSR (1.7B) делает 32 кадра 40x24pix уже в 6 fps
— И пространственный апскейлер SSR-1 (1.4B) готовит предыдущие 32 кадра в разрешении 80x48 pix, и сразу второй SSR-2 (1.2B) делает 320x192
— Затем следуют еще два стейджа временного и один каскад пространственного суперреза и в итоге мы получаем 128 кадров в разрешении 1280x768 в 24fps
Основной фишкой такого подхода является Video U-Net — архитектура видео-юнет, пространственные операции которого выполняются независимо по кадрам с общими параметрами (батч х время, высота, ширина, каналы), тогда как временные операции работают уже по всему 5-ти мерному тензору (батч, время, высота, ширина, каналы).
Сделаю потом более подробный пост, а пока рекомендую всем посмотреть результаты на сайте проекта!
🚀 Imagen Video
📄 paper
🤖 м и ш и н л е р н и н г
tl;dr
Помните Make-A-Video от MetaAI? Так вот — забудьте! Команда Google Brain только что создало лучшее Text-to-Video решение!
Если вкратце, то это имагеновый гомолог далишного Make-A-Video 🤖
Ну, а если чуть подробнее:
— Text Prompt подается в T5 энкодер
— Затем Base Model (5.6B ❤️) диффузит 16 кадров 40x24 pix в скромных 3 fps
— Затем темпоральный апсемплер TSR (1.7B) делает 32 кадра 40x24pix уже в 6 fps
— И пространственный апскейлер SSR-1 (1.4B) готовит предыдущие 32 кадра в разрешении 80x48 pix, и сразу второй SSR-2 (1.2B) делает 320x192
— Затем следуют еще два стейджа временного и один каскад пространственного суперреза и в итоге мы получаем 128 кадров в разрешении 1280x768 в 24fps
Основной фишкой такого подхода является Video U-Net — архитектура видео-юнет, пространственные операции которого выполняются независимо по кадрам с общими параметрами (батч х время, высота, ширина, каналы), тогда как временные операции работают уже по всему 5-ти мерному тензору (батч, время, высота, ширина, каналы).
Сделаю потом более подробный пост, а пока рекомендую всем посмотреть результаты на сайте проекта!
🚀 Imagen Video
📄 paper
🤖 м и ш и н л е р н и н г
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Imagen Video
[Google Brain]
Ответ Гугла на Make-a-Video от Меты не заставил себя долго ждать. Результаты кайфовые. Но и супервижена эта модель потребовала больше. Make-a-scene использовала неразмеченные видео для обучения, а вот для Image Video индусам пришлось попотеть, размечая видео текстовыми описаниями.
В подробности архитектуры вдаваться смысла нет, это нужно читать в статье. Скажу только, что там сначала из текстового эмбеддинга энкодера T5 получается 16 фреймов в разрешении 48×24 с 3 fps, а затем это апскейлится целой серией диффузионных моделей в итоговое видео из 128 фреймов 1280×768 и 24 fps.
То есть на выходе – 5.4 сек видео в высоком разрешении!
Ваши ставки господа: когда мы будем генерировать ролики в диффузионном тиктоке по заказу? "Девочка танцует в стиле техно. Сделай чтобы было красиво. Пожалуйста."
❱❱ Сайт проекта
@ai_newz
[Google Brain]
Ответ Гугла на Make-a-Video от Меты не заставил себя долго ждать. Результаты кайфовые. Но и супервижена эта модель потребовала больше. Make-a-scene использовала неразмеченные видео для обучения, а вот для Image Video индусам пришлось попотеть, размечая видео текстовыми описаниями.
В подробности архитектуры вдаваться смысла нет, это нужно читать в статье. Скажу только, что там сначала из текстового эмбеддинга энкодера T5 получается 16 фреймов в разрешении 48×24 с 3 fps, а затем это апскейлится целой серией диффузионных моделей в итоговое видео из 128 фреймов 1280×768 и 24 fps.
То есть на выходе – 5.4 сек видео в высоком разрешении!
Ваши ставки господа: когда мы будем генерировать ролики в диффузионном тиктоке по заказу? "Девочка танцует в стиле техно. Сделай чтобы было красиво. Пожалуйста."
❱❱ Сайт проекта
@ai_newz
Forwarded from Denis Sexy IT 🤖
И задача колоризации чб картинок тоже решена – вот тут можно бесплатно красить:
https://palette.fm/
Качество невероятное
https://palette.fm/
Качество невероятное
Forwarded from эйай ньюз
Диффузия оптимизирует нейронки
А вот тут вышла статья, где с помощью диффузионной модели заменяют традиционные оптимизаторы типа SGD или ADAM.
На вход поступают текущие веса оптимизируемой нейронки, текущий лосс, желаемый лосс, и параметр шага диффузии. А диффузионная модель предсказывает новые веса нейросети. Ускорение по сравнению с традиционной оптимизацией в ≈1000 раз.
@ai_newz
А вот тут вышла статья, где с помощью диффузионной модели заменяют традиционные оптимизаторы типа SGD или ADAM.
На вход поступают текущие веса оптимизируемой нейронки, текущий лосс, желаемый лосс, и параметр шага диффузии. А диффузионная модель предсказывает новые веса нейросети. Ускорение по сравнению с традиционной оптимизацией в ≈1000 раз.
@ai_newz
Telegram
DL in NLP
Learning to Learn with Generative Models of Neural Network Checkpoints
Peebles, Radosavovic, et al. [Berkeley]
Статья: arxiv.org/abs/2209.12892
Код: github.com/wpeebles/G.pt
Блог: тык
Помните про парадигму learning to learn и всякие оптимитзаторы на основе…
Peebles, Radosavovic, et al. [Berkeley]
Статья: arxiv.org/abs/2209.12892
Код: github.com/wpeebles/G.pt
Блог: тык
Помните про парадигму learning to learn и всякие оптимитзаторы на основе…
Forwarded from [404] — программирование
«Машинное обучение с использованием Python. Сборник рецептов» – Крис Элбон
Книга содержит около 200 рецептов решения практических задач машинного обучения, таких как загрузка и обработка текстовых или числовых данных, отбор модели, уменьшение размерности и многие другие. Рассмотрена работа с языком Python и его библиотеками, в том числе pandas и scikit-learn.
Решения всех задач сопровождаются подробными объяснениями. Каждый рецепт содержит работающий программный код, который можно вставлять, объединять и адаптировать, создавая собственное приложение.
Скачать книгу
#книга #python
Книга содержит около 200 рецептов решения практических задач машинного обучения, таких как загрузка и обработка текстовых или числовых данных, отбор модели, уменьшение размерности и многие другие. Рассмотрена работа с языком Python и его библиотеками, в том числе pandas и scikit-learn.
Решения всех задач сопровождаются подробными объяснениями. Каждый рецепт содержит работающий программный код, который можно вставлять, объединять и адаптировать, создавая собственное приложение.
Скачать книгу
#книга #python
Forwarded from Эксплойт
Media is too big
VIEW IN TELEGRAM
Поражает воображение: нейросеть Midjourney нарисовала клип на песню Thriller Майкла Джексона.
Получился крутой анимированный хоррор: дементоры на барабанах, скелеты с костяными трубами и медведи-упыри. Любопытно, что нейросеть довольно точно изобразила самого певца, основываясь лишь на тексте его песни.
Самое то в преддверии Хэллоуина.
@exploitex
Получился крутой анимированный хоррор: дементоры на барабанах, скелеты с костяными трубами и медведи-упыри. Любопытно, что нейросеть довольно точно изобразила самого певца, основываясь лишь на тексте его песни.
Самое то в преддверии Хэллоуина.
@exploitex
Forwarded from [PYTHON:TODAY]
🔥 Знакомство с Python
Год: 2023
#books #python #russian
Вместо скучного перечисления возможностей языка авторы рассказывают, как сочетать разные структурные элементы Python, чтобы сразу создавать скрипты и приложения.Авторы: Дэн Бейдер, Дэвид Эймос Джоанна Яблонски, Флетчер Хейслер
Книга построена по принципу 80/20: большую часть полезной информации можно усвоить, изучив несколько критически важных концепций. Освоив самые популярные команды и приемы, вы сразу сосредоточитесь на решении реальных повседневных задач.
Год: 2023
#books #python #russian
Forwarded from Open Source
This media is not supported in your browser
VIEW IN TELEGRAM
MDM: Human Motion Diffusion Model
Нейросетевая модель реалистичных движений человека — это святой Грааль компьютерной анимации.
☝🏻Позволяет Text-to-motion — задача создания движения с учетом входной текстовой подсказки.
(видео выше генерация текстовой подсказки «Человек пинается»)
Для проведения экспериментов можно использовать как готовые модели, так и провести тренировку моделей самостоятельно при помощи предлагаемых скриптов, используя коллекцию трёхмерных изображений человека HumanML3D.
https://github.com/GuyTevet/motion-diffusion-model
Объяснение с примерами: https://guytevet.github.io/mdm-page/
@open_source_friend
Нейросетевая модель реалистичных движений человека — это святой Грааль компьютерной анимации.
☝🏻Позволяет Text-to-motion — задача создания движения с учетом входной текстовой подсказки.
(видео выше генерация текстовой подсказки «Человек пинается»)
Для проведения экспериментов можно использовать как готовые модели, так и провести тренировку моделей самостоятельно при помощи предлагаемых скриптов, используя коллекцию трёхмерных изображений человека HumanML3D.
https://github.com/GuyTevet/motion-diffusion-model
Объяснение с примерами: https://guytevet.github.io/mdm-page/
@open_source_friend
Forwarded from CMD — полезные сервисы для жизни и работы
MyAnima AI Companion — робот для заботы
Чат-бот-собеседник для переписок и психологической поддержки. Да, примерно как Replica AI, аналог. Здесь, как пишут пользователи, уделено особое внимание романтической составляющей общения — но включается этот режим только в платной версии.
Разработчики говорят, что цель этого сервиса — помочь одиноким и пожилым людям. Еще это вроде бы должно помогать тем, кто находится в депрессии (правда, еще неизвестно, как осознание разговора с программой скажется на состоянии лол).
#бесплатный #нейронки
Чат-бот-собеседник для переписок и психологической поддержки. Да, примерно как Replica AI, аналог. Здесь, как пишут пользователи, уделено особое внимание романтической составляющей общения — но включается этот режим только в платной версии.
Разработчики говорят, что цель этого сервиса — помочь одиноким и пожилым людям. Еще это вроде бы должно помогать тем, кто находится в депрессии (правда, еще неизвестно, как осознание разговора с программой скажется на состоянии лол).
#бесплатный #нейронки