DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
🧙‍♂️ Blizzard, увольняйте ваших иллюстраторов

Stable Diffusion разрывает DALL•E 2! Такого арта я ещё нигде не видел! Мне кажется, что время когда, нейронными сетями можно делать полноценные иллюстрации настало.

Представляю:
Коллекцию генеративного арта «Blizzard WarCraft». Более 50 артов, сгенерированных нейронной сетью.

Иллюстраторам уже стоит начинать бояться..

🫵
Коллекция Blizzard WarCraft
Forwarded from Denis Sexy IT 🤖
Media is too big
VIEW IN TELEGRAM
Современные проблемы требуют современных навыков – если вам позвонили с видео, и вы думаете, что вам звонит не настоящий Николас Кейдж человек, а дипфейк – то просто попросите его повернуть голову боком, как на видео – тут маска и слетит.

Тут целый блог пост почему это происходит, но самое главное я пересказал.

Если вы думаете, что технология таких дипфейк-звонков сложная и вы вряд ли встретите, то на самом деле нет – еще пару лет назад звонил коллегам по слаку ради фана, облачаясь в их же лицо, сейчас это еще проще стало ¯\_(ツ)_/¯

@Denis
Forwarded from Neural Shit
И в чём он не прав?

Обновил чуть-чуть нейронку для бота, который генерит мудрости с волками.

Понажимать, как и раньше можно тут: @neural_wise_wolf_bot
Forwarded from Python Academy
Находим опечатки в тексте

Полезный пакет spellchecker позволяет находить опечатки в тексте и даже дает возможные варианты исправлений.

Под капотом модуль использует алгоритм расстояния Левенштейна. А сам код основан на статье, написанной в блоге Питера Норвига. Короче, реализация интересная, советую поизучать.

Но даже если не вникать в подробности, то пакет использовать крайне легко. Примеры использования класса SpellChecker и его методов correction и candidates показаны на картинке.

Пакет поддерживает 6 языков, включая русский. Но за подробностями отправляю вас читать документацию.

#spellchecker
​​Чтобы раскрыть Deepfake видеозвонок, попросите звонящего повернуться боком🤔

Всего за несколько лет дипфейки продвинулись от способности накладывать лица на изображения до полной замены лица в режиме реального времени, что привело к увеличению количества дипфейков, используемых в онлайн-мошенничестве и киберпреступности.

🔻В июне ФБР предупредило о мошенниках, использующих технологию дипфейка во время удаленных собеседований.

🔻По данным стартапа Sensity AI, занимающегося борьбой с онлайн-мошенничеством, дипфейковые видео также использовались для обмана программного обеспечения для распознавания лиц в реальном времени.

🔻Европейский союз принял законы, налагающие штрафы на компании, которые не в состоянии в достаточной мере бороться с дипфейками.

🔻Китай также разработал законы о дипфейках, которые угрожают юридическим наказанием за неправомерное использование технологии, а также требуют предоставления разрешения на любое законное использование дипфейков.

Все это открывают новую эру интернет-неуверенности, что ваш онлайн-собеседник на самом деле настоящий.

☝🏻Однако, новые исследования компании Metaphysic.ai обнаружили у большинства популярных Deepfake-программ один и тот же недостаток: 90-градусный поворот головы в сторону делает очевидным, что человек на экране не тот, кем он казался.

Не имея возможности видеть достаточное количество контрольных точек, программное обеспечение просто не знает, как спроецировать свое фальшивое лицо.

«До тех пор, пока мы не узнаем, что дипфейкеры не нашли способ обойти этот недостаток, хорошей идеей будет придерживаться политики — попросить человека на другом конце видеозвонка показать вам его лицо сбоку» — отмечают исследователи.😉
FastPhotoStyle – инструмент на основе нейронной сети позволяющая объединять изображения в нечто новое.

Детали алгоритма, лежащего в основе кода, задокументированы в статье arxiv.

При наличии фотографии содержимого и фотографии стиля код может передать стиль фотографии стиля фотографии содержимого.

Проект находится здесь :3
This media is not supported in your browser
VIEW IN TELEGRAM
✨ Вышел StableDiffusion — Разбираем подробно что нас ждет дальше и что это такое!

📇 Начнем с новостей:

StableDiffusion
вышел в Stage I: ресерчеры смогут получить доступ к модели уже сегодня! Для этого веса нужно будет запросить. Но не стоит расстраиваться.

Публичный релиз состоится в ближайшее время, как только будут завершены последние этапы подготовки модели к "публичной жизни". А еще сегодня ожидается последняя волна инвайтов на закрытое бета тестирование в котором уже приняли участие 10,000 юзеров, генерируя около 1,7M изображений за сутки.

🌬 Что такое StableDiffusion?

StableDiffusion
— это диффузионный Text2Image (как и DALL-E 2) и очень удачный гибрид Latent Diffusion и Imagen:

> Latent Diffusion (LDM) позволяет в производить диффузию на в пространстве пикселей, а в латенщине. Вместо разрешения 64х64 — выходит сразу 512, благодаря Encoder-Decoder подходу. Если короче: деталей больше, а вычислений меньше.

> От LDM StableDiffusion отличает тот факт, что интформация от текста течет с frozen LM (а именно CLIP), как в случае с T5 в Imagen. SD это модуляр, состоящий из 3х модулей:
1. Frozen CLIP Text Tower (как LM)
2. U-Net (из diffusion beat gan )
3. VQ decoder из 64х64х4 в 512х512х3

> Оказалось что CLIP вектора куда лучше шарят изображения и они выходят прям очень-очень крутыми (все же клип учился на изображениях и LM косвенно тоже)! И хотя понимание отношений объектов (кто слева, кто справа, и тд) чуть лучше и T5, но качество картинки у CLIP лучше на порядок!

Модель сделали ребята из StabilityAI и CompVis, обучая SD 0.8B на супер компьютере Ezra-1 AI UltraCluster, состоящим из 4,000 A100, используя для трейна 2B пар изображение-текст из датасета LAION 5B, файнтюня модель на LAION-Aesthetics (сабсете).

✨ Для генерации нативного 512x512 изобрадения хватит 10 GB VRAM. Так что все от 2080ti до 3090ti кажется хорошим вариантом для дома! Ну и в Colab модель конечно же тоже влезет, даже в бесплатный!

📇 Blog Post
💻 Code StableDiffusion
👁 Веса Модели model card

🤖 Мишин Лернинг ✖️ Н е й р о э с т е т и к а
🧲 Бэкбоны на трансформерах уже Detectron 2 от Facebook AI Research

Трансформеры (ViT, Swin) для задач компьютерного зрения уже стали новой нормой. Вот и претрененные бэкбоны для Mask R-CNN и Cascade Mask R-CNN завезли!

Я по-прежнему считаю, что ViT — одна из самых гениальных архитектур современности! Вы просто посмотрите на эти метрики:

📣 ViTDet — ViT-H Cascade (multiscale) 53.1 в задаче Instance Segmentation on COCO без обучения на дополнительных данных!

Новость взял у
эйай ньюз

📑 Paper: Exploring Plain Vision Transformer Backbones for Object Detection

🗃 ViTDetот Facebook AI Research (код и веса моделей)
Forwarded from эйай ньюз
Опачки! Яндекс запустил потоковый перевод трансляций в своем Браузере в открытую бету.

Ранее Яндекс писал о своей технологии перевода обычных YouTube-видео, и уже тогда перевод и озвучка трансляций заявлялись как следующий шаг – круто, что от идеи до открытой беты прошло меньше года. Только задумайтесь: уже доступен автоматический голосовой перевод в реальном времени! Интересно, куда инженерная мысль полетит дальше.

В отличие от уже загруженного целиком видео, где нейросеть получает сразу весь текст и может оперативно его обработать и озвучить, трансляции нужно переводить в режиме реального времени – примерно так, как работают синхронные переводчики. В итоге команда браузера разработала новую архитектуру перевода, за него отвечают аж 5 нейросетей:

1. Одна нейросеть распознает аудиодорожку и превращает её в текст.
2. Вторая нейросеть по биометрии понимает пол спикера.
3. Третья нарезает текст на предложения — расставляет знаки препинания и выделяет из текста части, содержащие законченную мысль. Это помогает делать правильную интонацию при озвучке и переводить быстро, близко к режиму синхронного перевода
4. Четвертая нейросеть переводит полученные куски текста с исходного языка на русский,
5. A пятая синтезирует речь на русском языке

Конечно, происходит это все равно с задержкой, пока она составляет от 30 до 50 секунд. В будущем команда планирует работать над ее уменьшением.

Чтобы протестить бету, нужно через Яндекс браузер на компьютере, например, эту трансляцию, которая идет постоянно. Технология сейчас работает для перевода стримов не на всех YouTube-каналах. Далее планируют добавлять новые языки и расширять список доступных для перевода трансляций.
Forwarded from эйай ньюз
🔥Stable Diffusion - топовая генеративная модель, да еще с открытым кодом (выкуси OpenAI)

Мои одногруппники по PhD из научной лабы CompVis выкатили обновленную версию Latent Diffusion Model (LDM), которую назвали Stable Diffusion.

Это модель, которую можно использовать для создания и изменения изображений на основе текстовых запросов. В этой версии они по аналогии с Imagen, вместо BERT-like языкового энкодера используют фиксированный предварительно обученный текстовый энкодер CLIP ViT-L/14. Сама диффузионная модель обучена на огромном датасете LAION-2B на 256 вдеокартах A100 примерно в течение месяца.

Результаты же этой модели на уровне с DALLE-2, если не лучше! А требует она в разы меньше ресурсов для инференса. Когда веса появятся в общем доступе (пока только по запросу), то можно будет её довольно быстро гонять даже в бесплатном коллабе.

❱❱ https://github.com/CompVis/stable-diffusion
pyspellchecker — инструмент для чистой проверки орфографии.

Он(pyspellchecker) использует алгоритм расстояния Левенштейна для поиска перестановок в пределах расстояния редактирования 2 от исходного слова. Затем он сравнивает все перестановки (вставки, удаления, замены и транспозиции) с известными словами в списке частоты слов. Те слова, которые чаще всего встречаются в частотном списке, с большей вероятностью являются правильными результатами.

Сверху - простой пример использования pyspellchecker'a.

pyspellchecker поддерживает несколько языков, включая английский, испанский, немецкий, французский, русский и португальский.

Ставится командой ⚙ pip install pyspellchecker
Документация и примеры кода здесь :3
Пошаговый_план_развития_в_Data_Science.pdf
2 MB
Как войти в сферу работы с данными и стать Data Scientist: пошаговый план.
Это просто пошаговый гайд вы узнаете, как войти в сферу работы с данными и выбрать роль в Data Science. Понятно тут все поверхностно описано.
Курс сам всего 13 видео и дополнительный материал. (курс очень простой) вы изучите базовые понятия аналитики и Data Science научитесь пользоваться Excel, SQL, Power BI, Google Data Studio для работы с данными и напишете первый код на языке Python.


<вот сам курс>

P.S смотрите и другие курсы по хешткгу 👉 #cours Поверьте благодаря собранным тут обучающим курсам литературе это возможно и легко причем в короткие сроки.

Библиотека разведчика
Forwarded from GitHub Community
​DW-GAN – Фреймворк для взлома CAPTCHA в даркнете

Способен преодолеть 94,4% защитных механизмов в «темной сети»

⤷ Ссылка на проект

GitHub | #Interesting #Captcha #GAN
📚 Deep Learning — John D.Kelleher

Автор объясняет
, что глубокое обучение позволяет принимать решения на основе данных, выявляя и извлекая шаблоны из больших наборов данных.

📁 Скачать/Download 👇
Forwarded from Habr For Dev
#open-data-science #ods

Data Science Pet Projects. FAQ

Рейтинг: 30

Читать