DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
FastPhotoStyle – инструмент на основе нейронной сети позволяющая объединять изображения в нечто новое.

Детали алгоритма, лежащего в основе кода, задокументированы в статье arxiv.

При наличии фотографии содержимого и фотографии стиля код может передать стиль фотографии стиля фотографии содержимого.

Проект находится здесь :3
This media is not supported in your browser
VIEW IN TELEGRAM
✨ Вышел StableDiffusion — Разбираем подробно что нас ждет дальше и что это такое!

📇 Начнем с новостей:

StableDiffusion
вышел в Stage I: ресерчеры смогут получить доступ к модели уже сегодня! Для этого веса нужно будет запросить. Но не стоит расстраиваться.

Публичный релиз состоится в ближайшее время, как только будут завершены последние этапы подготовки модели к "публичной жизни". А еще сегодня ожидается последняя волна инвайтов на закрытое бета тестирование в котором уже приняли участие 10,000 юзеров, генерируя около 1,7M изображений за сутки.

🌬 Что такое StableDiffusion?

StableDiffusion
— это диффузионный Text2Image (как и DALL-E 2) и очень удачный гибрид Latent Diffusion и Imagen:

> Latent Diffusion (LDM) позволяет в производить диффузию на в пространстве пикселей, а в латенщине. Вместо разрешения 64х64 — выходит сразу 512, благодаря Encoder-Decoder подходу. Если короче: деталей больше, а вычислений меньше.

> От LDM StableDiffusion отличает тот факт, что интформация от текста течет с frozen LM (а именно CLIP), как в случае с T5 в Imagen. SD это модуляр, состоящий из 3х модулей:
1. Frozen CLIP Text Tower (как LM)
2. U-Net (из diffusion beat gan )
3. VQ decoder из 64х64х4 в 512х512х3

> Оказалось что CLIP вектора куда лучше шарят изображения и они выходят прям очень-очень крутыми (все же клип учился на изображениях и LM косвенно тоже)! И хотя понимание отношений объектов (кто слева, кто справа, и тд) чуть лучше и T5, но качество картинки у CLIP лучше на порядок!

Модель сделали ребята из StabilityAI и CompVis, обучая SD 0.8B на супер компьютере Ezra-1 AI UltraCluster, состоящим из 4,000 A100, используя для трейна 2B пар изображение-текст из датасета LAION 5B, файнтюня модель на LAION-Aesthetics (сабсете).

✨ Для генерации нативного 512x512 изобрадения хватит 10 GB VRAM. Так что все от 2080ti до 3090ti кажется хорошим вариантом для дома! Ну и в Colab модель конечно же тоже влезет, даже в бесплатный!

📇 Blog Post
💻 Code StableDiffusion
👁 Веса Модели model card

🤖 Мишин Лернинг ✖️ Н е й р о э с т е т и к а
🧲 Бэкбоны на трансформерах уже Detectron 2 от Facebook AI Research

Трансформеры (ViT, Swin) для задач компьютерного зрения уже стали новой нормой. Вот и претрененные бэкбоны для Mask R-CNN и Cascade Mask R-CNN завезли!

Я по-прежнему считаю, что ViT — одна из самых гениальных архитектур современности! Вы просто посмотрите на эти метрики:

📣 ViTDet — ViT-H Cascade (multiscale) 53.1 в задаче Instance Segmentation on COCO без обучения на дополнительных данных!

Новость взял у
эйай ньюз

📑 Paper: Exploring Plain Vision Transformer Backbones for Object Detection

🗃 ViTDetот Facebook AI Research (код и веса моделей)
Forwarded from эйай ньюз
Опачки! Яндекс запустил потоковый перевод трансляций в своем Браузере в открытую бету.

Ранее Яндекс писал о своей технологии перевода обычных YouTube-видео, и уже тогда перевод и озвучка трансляций заявлялись как следующий шаг – круто, что от идеи до открытой беты прошло меньше года. Только задумайтесь: уже доступен автоматический голосовой перевод в реальном времени! Интересно, куда инженерная мысль полетит дальше.

В отличие от уже загруженного целиком видео, где нейросеть получает сразу весь текст и может оперативно его обработать и озвучить, трансляции нужно переводить в режиме реального времени – примерно так, как работают синхронные переводчики. В итоге команда браузера разработала новую архитектуру перевода, за него отвечают аж 5 нейросетей:

1. Одна нейросеть распознает аудиодорожку и превращает её в текст.
2. Вторая нейросеть по биометрии понимает пол спикера.
3. Третья нарезает текст на предложения — расставляет знаки препинания и выделяет из текста части, содержащие законченную мысль. Это помогает делать правильную интонацию при озвучке и переводить быстро, близко к режиму синхронного перевода
4. Четвертая нейросеть переводит полученные куски текста с исходного языка на русский,
5. A пятая синтезирует речь на русском языке

Конечно, происходит это все равно с задержкой, пока она составляет от 30 до 50 секунд. В будущем команда планирует работать над ее уменьшением.

Чтобы протестить бету, нужно через Яндекс браузер на компьютере, например, эту трансляцию, которая идет постоянно. Технология сейчас работает для перевода стримов не на всех YouTube-каналах. Далее планируют добавлять новые языки и расширять список доступных для перевода трансляций.
Forwarded from эйай ньюз
🔥Stable Diffusion - топовая генеративная модель, да еще с открытым кодом (выкуси OpenAI)

Мои одногруппники по PhD из научной лабы CompVis выкатили обновленную версию Latent Diffusion Model (LDM), которую назвали Stable Diffusion.

Это модель, которую можно использовать для создания и изменения изображений на основе текстовых запросов. В этой версии они по аналогии с Imagen, вместо BERT-like языкового энкодера используют фиксированный предварительно обученный текстовый энкодер CLIP ViT-L/14. Сама диффузионная модель обучена на огромном датасете LAION-2B на 256 вдеокартах A100 примерно в течение месяца.

Результаты же этой модели на уровне с DALLE-2, если не лучше! А требует она в разы меньше ресурсов для инференса. Когда веса появятся в общем доступе (пока только по запросу), то можно будет её довольно быстро гонять даже в бесплатном коллабе.

❱❱ https://github.com/CompVis/stable-diffusion
pyspellchecker — инструмент для чистой проверки орфографии.

Он(pyspellchecker) использует алгоритм расстояния Левенштейна для поиска перестановок в пределах расстояния редактирования 2 от исходного слова. Затем он сравнивает все перестановки (вставки, удаления, замены и транспозиции) с известными словами в списке частоты слов. Те слова, которые чаще всего встречаются в частотном списке, с большей вероятностью являются правильными результатами.

Сверху - простой пример использования pyspellchecker'a.

pyspellchecker поддерживает несколько языков, включая английский, испанский, немецкий, французский, русский и португальский.

Ставится командой ⚙ pip install pyspellchecker
Документация и примеры кода здесь :3
Пошаговый_план_развития_в_Data_Science.pdf
2 MB
Как войти в сферу работы с данными и стать Data Scientist: пошаговый план.
Это просто пошаговый гайд вы узнаете, как войти в сферу работы с данными и выбрать роль в Data Science. Понятно тут все поверхностно описано.
Курс сам всего 13 видео и дополнительный материал. (курс очень простой) вы изучите базовые понятия аналитики и Data Science научитесь пользоваться Excel, SQL, Power BI, Google Data Studio для работы с данными и напишете первый код на языке Python.


<вот сам курс>

P.S смотрите и другие курсы по хешткгу 👉 #cours Поверьте благодаря собранным тут обучающим курсам литературе это возможно и легко причем в короткие сроки.

Библиотека разведчика
Forwarded from GitHub Community
​DW-GAN – Фреймворк для взлома CAPTCHA в даркнете

Способен преодолеть 94,4% защитных механизмов в «темной сети»

⤷ Ссылка на проект

GitHub | #Interesting #Captcha #GAN
📚 Deep Learning — John D.Kelleher

Автор объясняет
, что глубокое обучение позволяет принимать решения на основе данных, выявляя и извлекая шаблоны из больших наборов данных.

📁 Скачать/Download 👇
Forwarded from Habr For Dev
#open-data-science #ods

Data Science Pet Projects. FAQ

Рейтинг: 30

Читать
Forwarded from Habr For Dev
#python #neural-networks

#1 Нейронные сети для начинающих. Решение задачи классификации Ирисов Фишера

На хабре было множество публикаций по данной теме, но все они говорят о разных вещах. Решил собрать всё в одну кучку и рассказать людям. Это первая статья серии введения в нейронные сети, «Нейронные сети для начинающих». Здесь и далее мы постараемся разобраться с таким понятием — как нейронные сети, что они вообще из себя представляют и как с ними «подружиться», на практике решая простые задачи.

Рейтинг: 33

Читать
Forwarded from AI для Всех
Андрей Карпати (ex Tesla AI) выложил новую лекцию

«!!!! Итак, я записал (новую!) 2h25m лекцию "The spelled-out intro to neural networks and backpropagation: building micrograd".
Это кульминация примерно 8 лет навязчивых мыслей о том, как лучше объяснить нейронные сети и обратное распространение.

Если вы знаете Python, смутно помните, как проходили производные в средней школе, посмотрите это видео и к концу не поймете обратное распространение и суть нейронных сетей, тогда я съем ботинок :D»

Смотреть
Forwarded from Neural Shit
Там Stable Diffusion открыли публичную бету 🌚

Го тестить: https://beta.dreamstudio.ai

А на следующей неделе обещают выложить веса модельки в паблик (хоть они уже и гуляют по всему интернету и те, кому они нужны были, уже давным давно их пользуют во всю)
Forwarded from Neural Shit
Ну и немножко картиночек оттуда:

1)Сталин в Cyberpunk 2077
2)Путин в гостях у My Little Pony
3)Шрек в нацистской Германии
4)Эйнштейн делает селфи на айфон
5)Эйнштейн и VR
6)Эйнштейн учит Сталина играть панк-рок