DS & ML
588 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
🏆 CoCa: Contrastive Captioners или гибрид CLIP+SimVLM бьет SOTA на ImageNet

Сразу спойлер: "CoCa одна из важнейших сетей 2022 года, наряду с DALL-E 2"

Начнем с результатов:
▪️86.3% Zero-Shot ImageNet Top-1 (CLIP 76.2%)
▪️90.6% Linear Probe ImageNet Top-1 (CLIP 85.4%)
▪️91.0% Fine-Tune ImageNet Top-1 (Model soups, ViT-G/14 90.94%)

CoCa рвет не только в Zero-Shot всем известный CLIP, но и все "эти" ModelSoup'ы, CoAtNet'ы и DaViT'ы в классическом ImageNet Top-1. Оговорюсь, что при этом визуальная башня CoCa — ViT!

В чем фишка CoCa?

🎓 GPT-like съедает текст, а ViT съедает изображение. Выход class-token'ов ViT и GPT-like обучаются как CLIP. Затем еще половина, поздние слои GPT-like через кросс-аттеншн забирают инфу с токенов изображения и пытаются предсказать текстовое описание!

По сути CoCa — обобщение предыдущих подходов: от классических классификаторов до CLIP'ов, SimVLM'ов и BLIP'ов.

📇 Paper
🗄 Arxiv
💻 Code (спасибо, lucidrains)
🥑 Avocado Armchair Collection | DALL•E 2

Главный символ нейросети DALL•E — это кресло авокадо. Еще с первой версии повелось тестировать качество генерации этим текстовым запросом. Но DALL•E 2 действительно создает невероятные концепты.

Уверен что генеративный дизайн станет важным направлением дизайна 20-30х годов нашего века.
🏆 CoCA — новая SOTA на первом месте! Papers With Code обновили свою "рейтинговую таблцу" по ImageNet-1k

Я был в восторге в CLIP и Image Captioning претрейнов (e.g.: SimVLM), восхищался изящностью ViT, верил в направление гибридного обучения, начатого в BLIP.

Но при всем этом, сказать, что я не удивлен первому месту, это ничего не сказать. Казалось, что такой дженерал претрейн должен выстрелить рано или поздно. И это произошло.

91% точности на ImageNet — новый рубеж! И хотя мой друг сказал, что ImageNet — новый MNIST, мы все в восторге от Zero-Shot возможностей CoCa — 86.3%, это невероятно.

p.s.: Посмотрите, какой путь прошло цивильное человечество за каких-то 11 лет! Skyrim'у тоже 11ый год.

👾 Ретроспектива ImageNet Top1:
50% — SIFT+FVs (2011)
63% — AlexNet (2012)
64% — ZFNet (2013)
74% — VGG (2014)
78% — ResNet (2015)
81% — ResNeXt (2016)
82% — NASNET (2017)
85% — ResNeXt 32x48d (2018)
87% — EfficientNet (2019)
90% — EfficientNet L2 (2020)
90.5% — ViT-G (2021)
91% — CoCa / ViT (2022)

✨ ImageNet SOTA
Forwarded from Denis Sexy IT 🤖
Вот вам на ночь очередной синтез от Dalle 2 по запросу: «Ранние дизайны iPhone от Леонардо да Винчи»

Всегда меня впечатляет как нейронки комбинируют что-то, что в не могло существовать в целом✨

Тут прошлая подборка, а тут пост про да Винчи, потому что я видимо уже на все темы нашитпостил
Forwarded from GitHub Community
​​​DFSpot – Нейро-сетевая модель, которая определяет, является ли входное видео/изображение реальным или дипфейком

⤷ Ссылка на Google Colab

GitHub | #Python #Interesting #Video #Neural #Network
🦩Нейросеть Flamingo на собесе по Deep Learning

Недавно общался с GPT-3 175B по поводу Deep Learning. Задавал вопросы, которые обычно возникали, когда я собесил на DL позицию. Ответами я был удивлен. Все было очень хорошо. Но можно и возразить, мол «GPT-3 съела большой кусок интернета. Что ей ваш Deep Learning?»

Но вот на днях увидел как Flamingo 🦩 от DeepMind справляется с visual question-answering по fully-connected нейронке. И тут уже не скажешь, что Flamingo просто выплевывает заученные ответы про эти ваши SwiGLU активации и пр. Тут хоть вопрос и простой, но требует понимания того, что на картинке. Да еще и инференс-флоу в режиме диалога, браво!

📑 Flamingo DeepMind 2022 PDF
🗄 Arxiv
💻 Code / lucidrains
Forwarded from Denis Sexy IT 🤖
Очередная подборка генераций от нейронки Dalle 2 – в этот раз только медведи, потому что медведи классные 💙🐻

Прошлая подборка тут