DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from AbstractDL
This media is not supported in your browser
VIEW IN TELEGRAM
GPT + RL = Decision Making

Это гениально! Ребята из гугла показали, как с помощью RL можно научить GPT-2 управлять виртуальным агентом и решать сложные задачи: на видео он выполняет команду «найди и положи две вилки в холодильник».

Идея очень простая: действия агента, его цель и наблюдения кодируются в виде слов, координаты объектов эмбеддятся с помощью MLP и прибавляются к эмбеддингам соответсвующих токенов. Всё это прогоняется через GPT-2 и на основе её аутпутов уже другая сеть предсказывает следующее действие. Обучается всё это на 20k примеров решений VirtualHome при помощи RL и Imitation Learning.

P.S. Есть ещё пара работ про RL + GPT, о которых я писал тут и тут.

Статья, блог, GitHub
Forwarded from Эксплойт
​Нейросеть объединяет фотографии

Сегодня вы можете прикоснуться к искусству (и даже стать его частью), даже не умея рисовать ровный круг. Проект из сегодняшнего обзора позволяет буквально объединить две фотографии, взяв от каждой самое важное.

На ostagram.me вы можете взять, например, фотографию себя и работу Ван Гога, и получить шедевр, который далеко не каждый художник сможет воссоздать.

Результаты получаются разные: порой красивые, порой нелепые и смешные. Попробовать явно стоит, однако обработка в бесплатной версии может занять некоторое время.

Сайт преобразовался в своего рода соц.сеть, где пользователи выкладывают свои результаты и фотографии, из которых они произошли.

#нейросети
🚀 OpenAI выкатил в открытый доступ веса самого топового CLIP

Прошло и года (13 месяцев) и OpenAI выложил веса RN50x64 и ViT-L/14

Загрузить самый топовый ViT-L14 можно, заменив ваш ViT-B/16 в одной строке:

model, preprocess = clip.load('ViT-L/14', device)

p.s.: Наткнулся случайно, когда ставил очередной эксперимент выходного дня, и после того как написал clip.load('RN-50', device) вместо 'RN50' в ошибке увидел в списке доступных моделей 'ViT-L/14'. Полезная ошибка вышла.

Всем хороших выходных, и да здравствует Zero-Shot!

👉 https://github.com/openai/CLIP
Обучать модели на больших корпусах неразмеченных текстов – круто, но иногда хочется напрямую загружать в них структурированные знания. Есть базы знаний типа wikidata или conceptnet, состоящие из объектов и отношений между ними. Каждый элемент базы – тройка (объект1, отношение, объект2), типа ("Elizabeth II", "Queen Of", "UK"). Многие из этих баз формально мультиязычные, но по факту большая часть содержательных триплетов в них – на английском. Но и для других языков есть, что вытащить.

На днях я взял conceptnet5, отфильтровал те триплеты, которые отвечают за семантику и для которых есть русские синонимы, и подставил туда эти синонимы. Вот блокнот, где я это делал. Получился такой файлик на 150 мегабайт довольно шумных триплетов с русскоязычными аргументами, всего около 500К триплетов, но из них почти половина - синонимичные.

Триплеты вышли примерно такие:
- "нормальный" связано с "производная функции"
- "бес" связано с "демонология"
- "beretta ar 70" – это один из "автомат"
- "лёгкий сон" связано с "сон"
- "досаждать" синоним "чума"

Результатом я не очень доволен (половина смысла похерилась из-за ошибок перевода или в целом шумной разметки), но зато это было достаточно легко и быстро. Думаю, если вложить в это дело побольше любви и времени, может получиться вполне адекватная база знаний.

А какими базами знаний, поддерживающими русский язык, пользовались вы?
Forwarded from эйай ньюз
Ускорение диффузионных моделей 🔥

Еее! Вышла статья, которая ускоряет генерацию картинок с помощью диффузионных моделей моделей в 20 раз!

Ускорение достигается за счёт нового взгляда на диффузионные модели – предлагается смотреть на них как на дифференциальные уравнения, а диффуры мы умеем довольно быстро решать численными методами!

Дисклеймер: в статья красивая, но сложная математика!

Уже есть колаб с ускоренной диффузией. 16 примеров выше я сгенерил на Nvidia T4 за 5 минут (100 итерации). Запрос "Doggy, oil on canvas".
Forwarded from Метаверсище и ИИще (Sergey Tsyptsyn)
This media is not supported in your browser
VIEW IN TELEGRAM
Ох ничего себе, посмотрите какой класс!
Motion designer Денис Кочегаров использует Disco Diffusion для вот такой вот анимации.
Смотрится просто ошеломительно.
Тот случай, когда хочется выпить за художника-постановщика и концептера вместе взятых.
Кожаные никогда так не нарисуют.
Я залипаю все утро.

Ссылки на автора:
https://www.instagram.com/stokerdemien/
https://www.behance.net/vjdemien
Forwarded from Ты в тренде или уходи
​🧠 Уроки по нейронным сетям

Нейронные сети — это то, что подбирает нам рекомендации в ленте, управляет автомобилем и даже помогает при написании кода.

В этом плейлисте из 7 небольших уроков на практике показывается, как нейросети устроены изнутри. Вот так, пока кто-то боится восстания роботов, другие этих роботов создают.

Перейти к просмотру

#нейросети
Forwarded from Ты в тренде или уходи
​🗯 Полезные структуры данных — [9:40]

Существует целая куча популярных структур данных, которые могут ускорить ваше приложение.

Деревья, двухсвязанные списки, фильтр Блума, кольцевой буфер — все эти структуры и их применения как раз и описаны в этом видео в довольно кратком виде.

Перейти к просмотру

#видео
Forwarded from Ты в тренде или уходи
​🧠 Как нейросети генерируют изображения — [13:42]

У нейросетей очень много направлений, но генерация изображений — это, пожалуй, самое востребованное и перспективное направление среди всех остальных.

Из этого видео вы во всех подробностях узнаете, какие есть архитектуры построения модели для создания изображений, чем они отличаются друг от друга и увидите всё на понятных практиктических примерах.

Перейти к просмотру

#нейросети
Forwarded from Код.ру
😇 Под защитой нейросетей //

В «Одноклассниках» запустился центр безопасности сообщений. Продвинутая нейросеть будет автоматически блокировать от незнакомцев фотографии интимного характера и спам в личных сообщениях.

@d_code
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
В стелс бета режиме выкатили нашу новую фото-колоризацию которую писали примерно полгода – своя архитектура, свои модели, все свое.

🔥 Очень горжусь командой – мы как компания продолжаем бросать вызов статусу-кво в обработке архивных материалов, и я неимоверно этим горжусь.

Поиграться можете тут:
https://neural.love/images

Модель будем улучшать, так что я буду переодически писать про новые обновления.

Поиграться можете сами:
5 фоток запроцессить можно бесплатно, и 100 за раз на платном аккаунте. Доступна не только колоризация, но и увеличение разрешения (для старых или современных картинок), удаление повреждений, добавления четкости лицам.

Ну и напомню, что мы не собираем маркетинговые куки и не спамим если не подписаться самому на рассылку, так что играйтесь спокойно.
Forwarded from тоже моушн
Media is too big
VIEW IN TELEGRAM
исследователи из гугла на днях выложили алгоритм frame interpolation. он умеет делать что то типа оживших фото из гарри поттера - гифку из набора картинок. так вот он неожиданно хорошо показал себя при замедлении анимаций сделанных в VQGAN+CLIP, pytti или Disco Diffusion. собрал это дело в колаб!

frame interpolation on github
demo video on youtube
colab notebook
Forwarded from Технологии | Нейросети | Боты
Vintage style Pix2PixHD

Сделайте лицо таким, чтобы оно выглядело более "винтажным".

https://huggingface.co/spaces/Norod78/VintageStyle

Улучшить результат
https://t.me/deeppaintbot
Forwarded from [PYTHON:TODAY]
🔥 Полезные библиотеки Python

Real-Time Voice Cloning -
потрясающий проект. По сути, может «выучить» чей-то голос по 5-секундной записи речи, а затем использовать "выученный" голос, чтобы говорить что угодно.

⚙️ GitHub/Инструкция

💾 Больше интересных проектов

#python #github
Forwarded from Big Data Science
😜Neural networks for selfies on Google Pixel 6: accurate alpha matting in portrait mode
Matting an image is the process of extracting a precise alpha mask that separates the foreground and background objects of an image. This is not only necessary for professional designers when designing advertising photos, but has also become a popular entertainment for smartphone users. Send friends a selfie with the Eiffel Tower in the background while in a room with a grandmother's carpet? Easy with Google Pixel 6: a convolutional neural network from a sequence of encoder-decoder blocks to gradually evaluate high-quality alpha matting will preserve all the details, including fine hairs.
The input RGB image is combined with a coarse alpha matte (generated with a low resolution people segmenter) which is passed as input to the network. The new Portrait Matting model uses the MobileNetV3 backbone and a shallow decoder with few layers to first predict the low resolution advanced alpha mask. Then a shallow codec and a series of residual blocks are applied to process the high resolution image and the refined alpha mask from the previous step. The shallow codec relies more on lower level functions than the previous MobileNetV3 backbone, focusing on high resolution structural functions to predict the final transparency values for each pixel. This way the model can refine the original foreground alpha mask and accurately extract very fine details. This neural network architecture works effectively on Pixel 6 using Tensorflow Lite. The ML model also uses a variety of training datasets that cover a wide range of skin tones and hairstyles.
https://ai.googleblog.com/2022/01/accurate-alpha-matting-for-portrait.html
Forwarded from Библиотека программиста
​❓ Что такое F-score и для чего он используется?

Не понимаю, с помощью каких методов мы оцениваем качество предсказаний модели. Слышал, что в этом случае может помочь F-score, но какая идея стоит за этой метрикой? Ждем ваши комментарии на сайте.

https://proglib.io/sh/oDRUpOb0mK
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
CLIPasso: AI Создает скетчи по картинкам

В этой статье комбинируется дифференциальный рендеринг и CLIP. И, конечно, никакой это не настоящий AI 😅

Вот как это работает:
По картинке предсказываются приблизительные параметры линий, составляющих карандашный набросок. Затем параметрическое представление линий растеризуется и кормится в CLIP для вычисления похожести наброска с оригинальным изображением. Ошибка пропихивается назад до параметров линий и они итеративно обновляются, увеличивая совпадение со входной картинкой.

>> Папира >> Страница проекта
AI Image Transformer — нейронка стилизует картинки

Инструмент для карикатуризации и стилизации изображений — в том числе в духе картин Пикассо, Ван Гога, Айвазовского и так далее. Просто выбираете нужный формат для конвертации и загружаете картинку.

Единственная проблема — время обработки: чем больше исходное изображение — тем дольше ждать (может затянуться на несколько минут). Зато на выходе получаете сразу несколько картинок с разной степенью обработки — остается выбрать нужную. Бесплатно, без регистрации.

#бесплатный #нейронки