DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from эйай ньюз
Архитектура OWL-ViT и минимальный код для запуска инференса модели с предобученыии весами.

📋Документация: https://huggingface.co/docs/transformers/model_doc/owlvit

@ai_newz
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
OWL-ViT by GoogleAI

Давно не говорили о детекции, друзья.

Гугел сделал уверенный шаг в сторону open-vocabulary detection. Это когда у модели нет набора фиксированных классов, но она умеет реагировать на текстовые запросы. Вы вводите в промпт названия нужных объектов, и модель их находит. Попробовать демку можно на хагинфейсе.

По сути, это предобученный CLIP, где к картиночному энкодеру присобачили голову для предсказания координат баундинг боксов. То есть для каждому токена, полученного из картинки, мы предсказываем координаты и эмбеддинг. Далее этот эмбеддинг сравнивает с эмбеддингом заданного имени класса, и мы получаем similarity для класса. Дополнительные головы файнтюнятся лоссом в стиле DETR. Все подробности в статье.

Внизу схема архитектуры и минимальный код для инференса.

@ai_newz
Forwarded from Habr For Dev
#python #javascript

Языковая модель GPT-3 умеет объяснять код — рассказываем, как это можно использовать

Рейтинг: 45

Читать
🧙‍♂️ Blizzard, увольняйте ваших иллюстраторов

Stable Diffusion разрывает DALL•E 2! Такого арта я ещё нигде не видел! Мне кажется, что время когда, нейронными сетями можно делать полноценные иллюстрации настало.

Представляю:
Коллекцию генеративного арта «Blizzard WarCraft». Более 50 артов, сгенерированных нейронной сетью.

Иллюстраторам уже стоит начинать бояться..

🫵
Коллекция Blizzard WarCraft
Forwarded from Denis Sexy IT 🤖
Media is too big
VIEW IN TELEGRAM
Современные проблемы требуют современных навыков – если вам позвонили с видео, и вы думаете, что вам звонит не настоящий Николас Кейдж человек, а дипфейк – то просто попросите его повернуть голову боком, как на видео – тут маска и слетит.

Тут целый блог пост почему это происходит, но самое главное я пересказал.

Если вы думаете, что технология таких дипфейк-звонков сложная и вы вряд ли встретите, то на самом деле нет – еще пару лет назад звонил коллегам по слаку ради фана, облачаясь в их же лицо, сейчас это еще проще стало ¯\_(ツ)_/¯

@Denis
Forwarded from Neural Shit
И в чём он не прав?

Обновил чуть-чуть нейронку для бота, который генерит мудрости с волками.

Понажимать, как и раньше можно тут: @neural_wise_wolf_bot
Forwarded from Python Academy
Находим опечатки в тексте

Полезный пакет spellchecker позволяет находить опечатки в тексте и даже дает возможные варианты исправлений.

Под капотом модуль использует алгоритм расстояния Левенштейна. А сам код основан на статье, написанной в блоге Питера Норвига. Короче, реализация интересная, советую поизучать.

Но даже если не вникать в подробности, то пакет использовать крайне легко. Примеры использования класса SpellChecker и его методов correction и candidates показаны на картинке.

Пакет поддерживает 6 языков, включая русский. Но за подробностями отправляю вас читать документацию.

#spellchecker
​​Чтобы раскрыть Deepfake видеозвонок, попросите звонящего повернуться боком🤔

Всего за несколько лет дипфейки продвинулись от способности накладывать лица на изображения до полной замены лица в режиме реального времени, что привело к увеличению количества дипфейков, используемых в онлайн-мошенничестве и киберпреступности.

🔻В июне ФБР предупредило о мошенниках, использующих технологию дипфейка во время удаленных собеседований.

🔻По данным стартапа Sensity AI, занимающегося борьбой с онлайн-мошенничеством, дипфейковые видео также использовались для обмана программного обеспечения для распознавания лиц в реальном времени.

🔻Европейский союз принял законы, налагающие штрафы на компании, которые не в состоянии в достаточной мере бороться с дипфейками.

🔻Китай также разработал законы о дипфейках, которые угрожают юридическим наказанием за неправомерное использование технологии, а также требуют предоставления разрешения на любое законное использование дипфейков.

Все это открывают новую эру интернет-неуверенности, что ваш онлайн-собеседник на самом деле настоящий.

☝🏻Однако, новые исследования компании Metaphysic.ai обнаружили у большинства популярных Deepfake-программ один и тот же недостаток: 90-градусный поворот головы в сторону делает очевидным, что человек на экране не тот, кем он казался.

Не имея возможности видеть достаточное количество контрольных точек, программное обеспечение просто не знает, как спроецировать свое фальшивое лицо.

«До тех пор, пока мы не узнаем, что дипфейкеры не нашли способ обойти этот недостаток, хорошей идеей будет придерживаться политики — попросить человека на другом конце видеозвонка показать вам его лицо сбоку» — отмечают исследователи.😉
FastPhotoStyle – инструмент на основе нейронной сети позволяющая объединять изображения в нечто новое.

Детали алгоритма, лежащего в основе кода, задокументированы в статье arxiv.

При наличии фотографии содержимого и фотографии стиля код может передать стиль фотографии стиля фотографии содержимого.

Проект находится здесь :3
This media is not supported in your browser
VIEW IN TELEGRAM
✨ Вышел StableDiffusion — Разбираем подробно что нас ждет дальше и что это такое!

📇 Начнем с новостей:

StableDiffusion
вышел в Stage I: ресерчеры смогут получить доступ к модели уже сегодня! Для этого веса нужно будет запросить. Но не стоит расстраиваться.

Публичный релиз состоится в ближайшее время, как только будут завершены последние этапы подготовки модели к "публичной жизни". А еще сегодня ожидается последняя волна инвайтов на закрытое бета тестирование в котором уже приняли участие 10,000 юзеров, генерируя около 1,7M изображений за сутки.

🌬 Что такое StableDiffusion?

StableDiffusion
— это диффузионный Text2Image (как и DALL-E 2) и очень удачный гибрид Latent Diffusion и Imagen:

> Latent Diffusion (LDM) позволяет в производить диффузию на в пространстве пикселей, а в латенщине. Вместо разрешения 64х64 — выходит сразу 512, благодаря Encoder-Decoder подходу. Если короче: деталей больше, а вычислений меньше.

> От LDM StableDiffusion отличает тот факт, что интформация от текста течет с frozen LM (а именно CLIP), как в случае с T5 в Imagen. SD это модуляр, состоящий из 3х модулей:
1. Frozen CLIP Text Tower (как LM)
2. U-Net (из diffusion beat gan )
3. VQ decoder из 64х64х4 в 512х512х3

> Оказалось что CLIP вектора куда лучше шарят изображения и они выходят прям очень-очень крутыми (все же клип учился на изображениях и LM косвенно тоже)! И хотя понимание отношений объектов (кто слева, кто справа, и тд) чуть лучше и T5, но качество картинки у CLIP лучше на порядок!

Модель сделали ребята из StabilityAI и CompVis, обучая SD 0.8B на супер компьютере Ezra-1 AI UltraCluster, состоящим из 4,000 A100, используя для трейна 2B пар изображение-текст из датасета LAION 5B, файнтюня модель на LAION-Aesthetics (сабсете).

✨ Для генерации нативного 512x512 изобрадения хватит 10 GB VRAM. Так что все от 2080ti до 3090ti кажется хорошим вариантом для дома! Ну и в Colab модель конечно же тоже влезет, даже в бесплатный!

📇 Blog Post
💻 Code StableDiffusion
👁 Веса Модели model card

🤖 Мишин Лернинг ✖️ Н е й р о э с т е т и к а
🧲 Бэкбоны на трансформерах уже Detectron 2 от Facebook AI Research

Трансформеры (ViT, Swin) для задач компьютерного зрения уже стали новой нормой. Вот и претрененные бэкбоны для Mask R-CNN и Cascade Mask R-CNN завезли!

Я по-прежнему считаю, что ViT — одна из самых гениальных архитектур современности! Вы просто посмотрите на эти метрики:

📣 ViTDet — ViT-H Cascade (multiscale) 53.1 в задаче Instance Segmentation on COCO без обучения на дополнительных данных!

Новость взял у
эйай ньюз

📑 Paper: Exploring Plain Vision Transformer Backbones for Object Detection

🗃 ViTDetот Facebook AI Research (код и веса моделей)