DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from ЗаТелеком 🌐
Очень страшное видео:

https://youtu.be/xAXvfVTgqr0

Что там происходит: исследовательская группа из университета Беркли разработала новый алгоритм, основанный на обучении с подкреплением (RL - reinforcement learning), для обучения роботов без моделирования или демонстрации.

На видео робот-собака за чуть больше чем час научается ходить. Причем, делает это из положения «на спине». Сначала она учится просто двигать лапками, потом переворачиваться, потом ходит. Через 70 минут она уже не просто ходит, но и умудряется противостоять тычкам.

Теперь становится страшно? А что если это будет огромный человекоподобный робот с руками-бензопилами?
👎1
👾 А у нас NextGen Text2Image: Retrieval-Augmented Diffusion Models от CompVis

Я не мог писать об этом раньше, но теперь все выложили. Хотя написать очень и очень хотелось..

Идея лежала на поверхности: DALL•E 2 💦 RETRO = ❤️

Подробнее разберём на примере:
> Нужно сгенерировать «Мадагаскарская руконожка на скейтборде». Я вот не помню как она выглядит)

❕DALL•E 1/2, Imagen принимали текст, и на основе него генерировали изображения. А что если имеет возможность подглядывать в реальную базу данных?

❗️Для этого нам поможет CLIP и kNN: Ищем в датасете ближайшие изображения и подаём их (или их эмбеддинги) в качестве кондишн для генерации.

Новый LDM, натренированный в таком режиме, что можно использовать:
> Unconditional генерацию
> Class и Retrieval кондишн

То есть: Сожно использовать только текстовое описание, а можно и помочь сети, похожими реальными примерами (найдя похожие картинки, из которых можно взять что-то, как с референсов)

Ну не круто ли?

📰
paper
🔬 Code

@Mishin Learning
Forwarded from GitHub Community
​​translatepy – универсальная библиотека и CLI, написанная на Python, для перевода, транслитерации, проверки орфографии, озвучивания текста в речь и поиск слов в словарях

Библиотека использует разные лазейки в чужих API для того чтобы бесплатно делать запросы, соответственно не требуются API ключи для работы сервисов перевода

⤷ Ссылка на проект

GitHub | #Python #Translation
Forwarded from Кладовка Pavlu
​Делаем DeepFake видео

1. DeepFaceLive — софт для замены лица в режиме реального времени для потоковой передачи на ПК или видеозвонков. От создателей популярной библиотеки DeepFaceLab. Прилагаю неплохую инструкцию.

2. Round DeepFake — записываем Deep Fake "кружочки" в Telegram. Больше побаловаться.

3. DeepFakes Web — платный сайт, где можно сделать видео за 2$.

4. FaceSwap — похож на DeepFaceLab, но предоставляет больше возможностей, лучшую документацию и лучшую онлайн-поддержку. И да, он также доступен на Mac и Linux

Определяем DeepFake на видео:

1. https://deepware.ai/ — бесплатный сервис для проверки видео на подлинность. Также доступно в Google Play.

2. DFSpot-Deepfake-Recognition — нейросетевая модель, которая определяет, является ли входное видео/изображение реальным или Deepfake.

#софт #приватность
Forwarded from Open Source
​​TableNet

TableNet — модель глубокого обучения для обнаружения таблиц и извлечения табличных данных из отсканированных изображений документов и их фотографий.

https://github.com/jainammm/TableNet

Мануалы: https://asagar60.medium.com/tablenet-deep-learning-model-for-end-to-end-table-detection-and-tabular-data-extraction-from-a49ac4cbffd4
Forwarded from Python Academy
​Хитрости Data Science

При обучении нейросетей (например, детекции объектов или распознаванию лиц) часто необходимо проверить фотографию, посмотреть, правильно ли расположил разные классы объектов по папкам.

И если для просмотра можно использовать привычный matplotlib, то «прочитать» фото часто удобно через opencv. И тут нюанс: библиотека opencv использует цветовую модель BGR, а matplotlib — всем привычную RGB. Поэтому загружать картинки через opencv, но отображать через matplotlib – это путь к криповым картинкам.

Решение простое: чтобы получить нормальную картинку, используйте обратный порядок в массиве вашей картинки, например, через суши-оператор с шагом -1.

Умение работать с большими данными может пригодится не только в науке и бизнесе, но и повседневной жизни. Приходите на мастер-класс по Python в Data Science для начинающих 30 июля, чтобы освоить базовый синтаксис языка, разобрать теорию, начать решать задачи и задать свои вопросы ментору.

📍 Мероприятие проходит в кампусе в Москве. Еще больше событий школы и информации о профессиях в IT можно найти в телеграме Elbrus Bootcamp.

*обучение на курсе Data Science проходит очно в кампусе в Москве
Машинное обучение: основы, алгоритмы и практика применения + код

Авторы:
Джереми Уатт, Реза Борхани, Аггелос Катсаггелос
Год: 2022

#books #ml #russian
Forwarded from [PYTHON:TODAY]
🔥 Полезные библиотеки Python

SAM
- утилита для трансформации возраста с использованием модели регрессии. Позволяет моделировать детальную трансформацию возраста, используя одно входное изображение лица.

⚙️ GitHub/Инструкция

💾 Больше интересных проектов

#python #soft #github
Midjourney — нейронка генерит крутые арты

Достойный конкурент знаменитой нейросети Dall-E, которая обрабатывает любые запросы и выдает визуализацию. Тут все то же самое, только результат, по мнению многих пользователей, куда более изящный: хотя Midjourney, возможно, похуже улавливает отдельные детали запроса, но арты получаются шикарные. Настолько, что можно брать и ставить заставкой на рабочий стол.

Запущена бета-версия, зайти и воспользоваться ею можно через дискорд — единственная заминка может возникнуть разве что на этом этапе. Впрочем, полюбоваться на работу нейронки можно проще: просто загуглите или поищите в твиттере по хештегу — он уже наводнен крутыми артами.

#бесплатный #нейронки
Forwarded from эйай ньюз
Архитектура OWL-ViT и минимальный код для запуска инференса модели с предобученыии весами.

📋Документация: https://huggingface.co/docs/transformers/model_doc/owlvit

@ai_newz
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
OWL-ViT by GoogleAI

Давно не говорили о детекции, друзья.

Гугел сделал уверенный шаг в сторону open-vocabulary detection. Это когда у модели нет набора фиксированных классов, но она умеет реагировать на текстовые запросы. Вы вводите в промпт названия нужных объектов, и модель их находит. Попробовать демку можно на хагинфейсе.

По сути, это предобученный CLIP, где к картиночному энкодеру присобачили голову для предсказания координат баундинг боксов. То есть для каждому токена, полученного из картинки, мы предсказываем координаты и эмбеддинг. Далее этот эмбеддинг сравнивает с эмбеддингом заданного имени класса, и мы получаем similarity для класса. Дополнительные головы файнтюнятся лоссом в стиле DETR. Все подробности в статье.

Внизу схема архитектуры и минимальный код для инференса.

@ai_newz
Forwarded from Habr For Dev
#python #javascript

Языковая модель GPT-3 умеет объяснять код — рассказываем, как это можно использовать

Рейтинг: 45

Читать
🧙‍♂️ Blizzard, увольняйте ваших иллюстраторов

Stable Diffusion разрывает DALL•E 2! Такого арта я ещё нигде не видел! Мне кажется, что время когда, нейронными сетями можно делать полноценные иллюстрации настало.

Представляю:
Коллекцию генеративного арта «Blizzard WarCraft». Более 50 артов, сгенерированных нейронной сетью.

Иллюстраторам уже стоит начинать бояться..

🫵
Коллекция Blizzard WarCraft