DS & ML
588 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
🦌🎄☃️ Обновление RuDOLPH: Гипер-Модального GPT/DALL-E-like Трансформера со способностями CLIP

Вышли новые веса быстрого 350M GPT-3 RuDOLPH. Экспериментальная модель является GPT-платформой для решения множества задач в zero-shot:
- Генерации и изменения изображений
- Описания изображений
- Ранжирования и классификации

Благодаря претрейну и маленькому весу, модель легко файнтюнить под свои задачи. Автор канала любовь, смерть и голуби трансформеры уже зафайнтюнил RuDOLPH для определения бжу по фото.

RuDOLPH в режиме DALL-E + сортировка в режиме CLIP:
▪️ "Фотография красивой девушки"
▪️ "Девушка в пальто" + 1/2 свкрху от предыдущей генерации
▪️ "Старинный собор"
▪️ "Современный собор" + 1/2 свкрху от предыдущей генерации
▪️ "Дорога в закат"
▪️ "Озеро" + 1/2 свкрху от предыдущей генерации
▪️ "Серый рыжий кот"
▪️ "Кресло в форме авокадо"

RuDOLPH в режиме Image Captioning:
▪️ Реальное изображение + "На картинке "

🚀 Скорость: 336 картинок за 5 мин + 2 мин "проявка" из 128х128 в 1024х1024

🔮 Colab
Forwarded from эйай ньюз
Normalizing Flows - что это?

Если грубо, то Normalizing Flow - это такая модель, которая с помощью серии обратимых трансформаций переводит одно распределение в другое. При этом такой маппинг полностью обратим и работает в обе стороны. Таким образом можно получить маппинг из нормального распределения в любое другое сложное распространение.

Если вы когда-нибудь хотели разобраться по-лучше в том, что такое Normalizing Flows, то вот вам хорошая подборка ресурсов про них.
Forwarded from AbstractDL
Grokking: оверфиттинг это ещё не конец (by OpenAI)

Все мы знаем, что если обучающих данных мало, то модель скорее всего заоверфиттится, запомнив весь датасет. Но оказалось, что если в этот момент не останавливать обучение и продолжать его даже при нулевой ошибке на трейне, то через какое-то время нейронка всё-таки научится обобщать.

У OpenAI таким образом удалось обучить небольшой трансформер решать уравнения, которые он никогда не видел! Грубо говоря, модель смогла заполнить пропущенные слоты в таблице умножения. При этом такая супер-обобщающая способность наступала гораздо позднее оверфиттинга, когда большинство из нас уже выкинули бы модель в помойку.

Похоже, что самую важную роль в этом эффекте играет weight decay, благодаря которому модель в конце-концов переходит от простого запоминания обучающих примеров к аналитическому решению задачи. Из интересных наблюдений — при визуализации эмбеддингов видны математические структуры, помогающие находить ответы.

Статья, видео
Forwarded from Russian OSINT
Группа исследователей из Аризоны создала инструмент для решения CAPTCHA на основе машинного обучения. По утверждению разрабов, механизм способен выдать 94,4% успешных случаев прохождения капчи в даркнете из 100% возможных.

"DW-GAN significantly outperformed the state-of-the-art benchmark methods on all datasets, achieving over 94.4% success rate on a carefully collected real-world dark web dataset"

CAPTCHA в дарке используется практически везде, так как onion-сайтам необходимо держать оборону от постоянных DDoS-атак конкурентов и ботов . В случае с DW-GAN, технология позволяет удалить "шум" с фотографии, а также выделить отдельно цифры и буквы.

Если кто-то затестит DW-GAN и поделится наблюдениями обхода капчи @russian_osint_bot, буду признателен фидбеку! Теория здорово, но на практике всё может оказаться иначе.

https://github.com/johnnyzn/DW-GAN
Forwarded from [PYTHON:TODAY]
🔥 Глубокое обучение с подкреплением. Теория и практика на языке Python

Эта книга — введение в глубокое обучение с подкреплением, уникально комбинирующее теорию и практику.

Авторы: Лаура Грессер, Ван Лун Кенг
Год: 2022

#books #python #ml #dl #русский
This media is not supported in your browser
VIEW IN TELEGRAM
👩‍🎓🧪👨‍🎤 Библиотека MMGeneration — все что нужно для обучения работы с GAN и не только в одном месте!

MMGeneration — это мощный PyTortch инструментарий для генеративных моделей от создателей MMDetection.

MMDetection подходит для обучения: Unconditional GANs, Internal GANs и даже Image Translation Models

MMDetection сожержит огромный инструментарий для манипуляции: GAN interpolation, GAN projection и GAN manipulations

MMGeneration включает в себя
🎨 Unconditional GANs:
✅ DCGAN (ICLR'2016)
✅ WGAN-GP (NIPS'2017)
✅ LSGAN (ICCV'2017)
✅ GGAN (arXiv'2017)
✅ PGGAN (ICLR'2018)
✅ StyleGANV1 (CVPR'2019)
✅ StyleGANV2 (CVPR'2020)
✅ Positional Encoding in GANs (CVPR'2021)

🐍 Conditional GANs:
✅ SNGAN (ICLR'2018)
✅ Projection GAN (ICLR'2018)
✅ SAGAN (ICML'2019)
✅ BIGGAN/BIGGAN-DEEP (ICLR'2019)

🎭 Image2Image Translation:
✅ Pix2Pix (CVPR'2017)
✅ CycleGAN (ICCV'2017)

🛫 Internal Learning:
✅ SinGAN (ICCV'2019)

🌬 Denoising Diffusion:
✅ Improved DDPM (arXiv'2021)

#всохраненки
Forwarded from Denis Sexy IT 🤖
​🔥 Запипили апскейл картинок на GAN-стероидах

Продолжаем добавлять на neural.love новые сервисы — в этот раз выкатили работу с фотографиями, да и любыми картинками включая эти ваши мемы в интернете. На видео реальный пример.

Какие фичи есть уже сейчас:
— Можете бесплатно улучшить 5 картинок
— Можно увеличить разрешение изображения в 2 или 4 раза
— Можно клево убрать артефакты от компрессии jpeg файлов
— Можно нейронкой улучшить четкость лиц
— Можно поправить цветовые проблемы старых фотографий (розовый цвет который появляется от химических реакций на старых фоточках)
— Можно удалить повреждение пленки — аля царапины (оно же удаляет иногда детали фоточек, поэтому по умолчанию мы наверное все же выключим это)
— И отдельная платная фича, можно запроцессить 100 фоточек сразу

Еще мы почти дотренировали нашу новую модельку для колоризации, ее тоже добавим в ближайшем апдейте о котором я напишу отдельно.

👉 Играться тут

Если соберетесь приобрести подписку и поддержать наш стартаперский быт — то вот промокод на 10% скидку на первый месяц подписки:
LETSIMPROVE

P.S. Кстати, написали на английском статью о том как работает Upscale простым языком, если интересно — то велкам.

P.P.S. Кстати, напомню, что по нашей продуктовой политике мы не собираем никаких маркетинговых кук, ваши заказы хранятся на шифрованном хранилище, и процессят все только роботы. Так что можете спокойно играться, никто из нас не будет потом таргетировать рекламу на половину интернета 🤍
Forwarded from эйай ньюз
Ресерчеры из Meta AI масштабировали разреженные языковые модели до 1.1 триллиона параметров. Причем сделали это эффективно и показали, что они требует в 4 раза меньше ресурсов чем сравнимые по точности плотные (dense) модели.

Подробнее в статье Efficient Large Scale Language Modeling with Mixtures of Experts.
❗️ConvNeXt действительно офигенная работа, но диаграмму нужно поправить.

Помните ConvNeXt, который показывает, что прошлое поколение еще может гордиться своими свертками.

Так вот, по мнению (твит) Lucas Beyer Fig.1 нуждается в небольшой поправке. Ребята и FAIR сравнивают aug/reg SWIN+ConvNeXt с оригинальным (ванильным) ViT. Google Research Brain Team исправили это в How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers.

Имхо, вполне было бы логично сравнивать SWIN и ConvNeXt модели с сильными аугментациями и регуляризацими с таким же по сути уже не "ванильным" ViT.

Пейпер ConvNeXt достаточно крут еще и с точки зрения того, как стоит проводить бенчмарк анализ влияния разных методов и идей. Стоит сказать, что подобный подход применим и к трансформерам: SWIN-V2 и How to train you ViT показали, что небольшие изменения в операциях и в регуляризациях + аугментациях дают значимый буст. Пока рано сдаваться, Трансформеры. Ждем ViT-2.

С наилучшими пожеланиями, Мишин Лернинг!
Forwarded from ExMuffin
This media is not supported in your browser
VIEW IN TELEGRAM
💃 HomeStylist v.1.0 🕺

Сегодня выкатили нейросеть, которая может не только менять позу, но и переодевать человека на фотографии. Код есть, а Колаба небыло. Я исправил это недоразумение. Сделал его удобным на столько, на сколько это вообще возможно, ибо чтобы завести эту нейросеть пришлось клонировать еще парочку, но оно того стоило. Качество синтезированного изображения на высоте. Разрешение, конечно, 512 по большей стороне, но те, кому нужно, прогонят дополнительно через какой-нибудь апскейлер.

https://colab.research.google.com/github/tg-bomze/collection-of-notebooks/blob/master/HomeStylist.ipynb
Forwarded from эйай ньюз
Ресерчеры из Meta AI масштабировали разреженные языковые модели до 1.1 триллиона параметров. Причем сделали это эффективно и показали, что они требует в 4 раза меньше ресурсов чем сравнимые по точности плотные (dense) модели.

Подробнее в статье Efficient Large Scale Language Modeling with Mixtures of Experts.
Forwarded from Big Data Science
🍏Bayesian statistics with PyMC3: brief overview
Frequency statistics rely on long-term event rates (data points) to calculate the desired variable. The Bayesian method can also work without a lot of events, even with a single data point. Frequency analysis gives a point estimate, while Bayesian analysis gives a distribution that can be interpreted as the confidence that the mean of the distribution is a good estimate for the variable. However, there is an uncertainty in the form of the standard deviation.
The Bayesian approach is useful in ML problems where estimates and validity are important. For example, today it could rain with a 60% chance.” The main formula underlying the Bayesian approach is Bayes' theorem, which allows you to calculate the posterior probability P(A|B ) of event A depending on event B.
• P(B|A) is called the probability that if event A happened, how likely is event B to happen?
• P(A) – probability of event A, a prior (initial) assumption about the variable of interest.
• P(B) is the probability of event B (evidence), which is usually difficult to calculate when estimating the posterior probability.
You can quickly calculate the Bayesian probability using the PyMC3 Python library https://docs.pymc.io/en/v3/. It allows you to write models using an intuitive syntax to describe the data generation process. PyMC3 allows you to tune an ML model with gradient-based MCMC algorithms like NUTS, with ADVI for fast approximate inference, including a mini-batch ADVI for scaling to large datasets, or with Gaussian processes to build Bayesian non-parametric models. PyMC3 includes a complete set of predefined statistical distributions that can be used as the building blocks of a Bayesian model.
This probabilistic programming package for Python allows users to fit Bayesian models using various numerical methods, most notably Markov Chain Monte Carlo (MCMC) and Variational Inference (VI). Instead of providing a basic model specification and fitting functions, PyMC3 includes functions for summarizing output and diagnosing the model.
PyMC3 aims to make Bayesian modeling as simple and painless as possible by allowing users to focus on their scientific problem rather than the methods used to solve it. The package uses Theano as a computational backend to quickly evaluate an expression, compute the gradient automatically, and perform computations on the GPU.
PyMC3 also has built-in support for modeling Gaussian processes, allowing you to generalize models and build graphs. There's model validation and convergence detection, custom stepwise methods, and unusual probability distributions. Bayesian models obtained using PyMC3 can be embedded in larger programs, and the results can be analyzed using any Python tools.
https://medium.com/@akashkadel94/bayesian-statistics-overview-and-your-first-bayesian-linear-regression-model-ba566676c5a7
Forwarded from эйай ньюз
Сбер выложил в открытый доступ увеличенные версии ruCLIP — моделей, которые умеют вычислять «смысловую» близость любого изображения и текста на русском языке. С помощью этих моделей можно классификации новые изображение из ранее невиданых классов без обучения (zero-shot). ruCLIP модели даже превосходят в качестве оригинальной английский CLIP от OpenAI вместе с русско-английским переводчиком на большинстве тестовых датасетов.

Все модельки обучались на 240 млн пар изображение-текст на русском языке на внутреннем датасете от Сбера.

>> Код и веса моделей есть на гитхабе.
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Explaining in Style: Training a GAN to explain a classifier in StyleSpace
Google Research

Статейка, где ученые прикрутили к StyleGAN2 классификатор и заставляют StyleGAN2 генерить картинки в зависимости от заданных лейблов (тогда как оригинальный StyleGAN2 генерит картинки из случайных классов). По факту сделали conditional генерацию (что не ново само по себе, но для StyleGAN2 такого пока никто не публиковал).

Кроме того, авторы представили метод, который автоматиччески находит размерности в стилевом векторе W, которые отвечают за признаки присущие объектам определенного класса. То есть теперь можно подвигать ползунок и поменять фото кота так, чтобы он стал больше похож на собаку.

>> Код >> Сайт проекта
Forwarded from эйай ньюз
Архитектура метода из статьи выше. Классификатор С предобучен заранее и его выходы (logits) конкатенируются к вектору W и скармливаются в энкодер.
Го тестить на что способна почти SOTA сверточная сеть в эпозу визуальных трансформеров.

Потестил на генерации DALL-E. Ну неплохо, но сгенерить такое, имхо, круче, чем классифицировать.

🤗 ConvNeXt Demo