DS & ML
588 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from [PYTHON:TODAY]
🔥 Обработка естественного языка с TensorFlow

Научите компьютер разговаривать, используя
библиотеки глубокого обучения на языке Python

Автор: Ганегедара Т.
Год: 2020

#books #python #ml #русский
👨‍🎨 Что такое Image Inpainting и с чем его едят? Разбираем на примере RePaint, GLIDE, RuDOLPH.

Inpainting решает проблему удаления объекта или достраивания окружения изображения внутри произвольных масок по контексту.

Качество подходов зависит от кондишена масок, от скорости inpainting'а и от возможности использования текста в качестве дополнительного кондишена.

По скорости:
- Быстрые, e.g.: GAN'ы, работающие за один forward (условно оne stage)
▪️LaMa, Deep Fill v2

- Медленные, e.g.: Diffusion и DALL-E-like, работающие за 384-1280 forward'ов.
▪️RePaint, GLIDE, DALL-E

По использованию текста:
- Text Condition or Text guided,
e.g.: GLIDE
- Image Context Only: диффьюжн RePaint

По зоне image кондишена:
-
Condition Invariant Inpainting: кондишн берется из любой доступной точки вне маски. e.g.:
▪️ GLIDE: Classifier-Free Diffusion файнтюн под задачу Inpainting.
За минуту GLIDE делает один inpainting в разрешении 64х64, потом из коробки можно сделать диффьюз-апскейл в 256х256.
📇 GLIDE 🔮 GLIDE Colab

- Fixed Condition Inpainting: кондишн берется из фиксированных областей. В DALL-E-like поздние токены имеют кондишн в ранних, независимо от выбора кривой, заполняющая пространство, e.g.:
▪️ RuDOLPH: DALL-E, со способностями CLIP, решающий в zero-shot задачу Text Condition Image Inpainting. Из-за fixed condition природы, RuDOLPH лучше справляется с нижней частью изображения (пример).
За минуту GLIDE делает более 100 inpainting'ов в разрешении 128х128, потом из коробки можно диффьюз-декодить понравившиеся варианты в 256х256 и проапскейлить в 1024х1024.
📇 RuDOLPH 🔮 RuDOLPH Colab

Вывод:
- Если нужны быстрые подходы, которые не нужно настраивать текстом, то советую взять LaMa. Если же нужно качество, и готовы жертвовать временем, то ждите кода RePaint
- Если нужна текстовая настройка для Inpainting, например "олень в синей новогодней шапке", то советую обратить внимание на GLIDE Diffusion или на RuDOLPH в режиме DALL-E.

#разбираем_собираем #всохраненки
👨‍🎨 RePaint: Inpainting using Denoising Diffusion Probabilistic Models

Free-form inpainting — это задача заполнения изображения в областях, заданных произвольной бинарной маской. В RePaint это решается чисто через image condition (без текста).

К сожалению, при обучении, большинство существующих подходов тренят на определенных распределениях масок, что ограничивает их возможности генерализации для реальных типов масок.

RePaint использует под капотом Denoising Diffusion Probabilistic Model (DDPM), и что ожидаемо, такая диффьюзия в Inpainting задаче обходит авторегрессию и gan'ы.

📇 Paper 💻 Code (будет тут)
Forwarded from Big Data Science
LaMDA: Safe, Grounded, and High-Quality Dialog Model from Google AI
LaMDA
is created by fine-tuning a family of dialogue-specific Transformer-based neural language models with model parameters up to 137B and training the models to use external knowledge sources. LaMDA has three key goals:
• Quality, which is measured in terms of Sensibleness, Specificity, and Interestingness. These indicators are evaluated by people. Reasonableness indicates the presence of meaning in the context of the dialogue, for example, the absence of absurd answers from the ML-model and contradictions with earlier answers. Specificity indicates whether the system's response is specific to the context of the previous dialog. Interestingness measures the emotional reaction of the interlocutor to the answers of the ML model.
• Safety so that the model's responses do not contain offensive and dangerous statements.
• Groundedness - modern language models often generate statements that seem plausible, but in fact contradict the true facts in external sources. Groundedness is defined as the percentage of responses with statements about the outside world that can be verified by reputable external sources. A related metric, Informativeness, is defined as the percentage of responses with information about the outside world that can be confirmed by known sources.
LaMDA models undergo two-stage training: pre-training and fine-tuning. The first stage was performed on a data set of 1.56 thousand words from publicly available dialogue data and public web documents. After tokenizing the data set of 2.81T tokens, the model was trained to predict each next token in the sentence, given the previous ones. The pretrained LaMDA model has also been widely used for NLP research at Google, including program synthesis, zero-shot learning, and more.
In the fine-tuning phase, LaMDA is trained to combine generative tasks to generate natural language responses in given contexts and classification tasks to determine the safety and quality of the model. This results in a single multitasking model: the LaMDA generator is trained to predict the next token in the dialogue dataset, and the classifiers are trained to predict the security and response quality scores in context using annotated data.
The test results showed that LaMDA significantly outperforms the pre-trained model in every dimension and at every scale. Quality metrics improve as the number of model parameters increases, with or without fine-tuning. Safety is not improved by scaling the model alone, but compensated for by fine-tuning. Groundedness improves as the size of the model grows, due to the ability to remember unusual knowledge. And fine-tuning allows the model to access external sources and effectively transfer part of the burden of remembering knowledge to them. By fine-tuning, the human-level quality gap can be reduced, although the performance of the model remains below human-level in terms of safety and Groundedness.
https://ai.googleblog.com/2022/01/lamda-towards-safe-grounded-and-high.html
Forwarded from Big Data Science [RU]
сравнение метрик LAMDA с человеческими оценками
neurolab - это крутая и очень простая в использовании Python библиотека для работы с нейронными сетями.
В отличии от таких гигантов, как Tensorflow/Keras или PyTorch, neurolab предлагает простой и доступный API для работы с нейросетями.

Например, на скриншоте выше приведен код решения типичной проблемы XOR (чуть видоизмененный).
При помощи простейшего перцептрона.

Ставится командой pip install neurolab
Документация и примеры кода здесь.
Машинное обучение для бизнеса и маркетинга

Автор:
Илья Кацов
Год: 2019

#books #ml #русский
Forwarded from Big Data Science
👀Upscaling video games with NVIDIA's DLDSR
DLDSR (Deep Learning Dynamic Super Resolution)
is a video game image enhancement technology that uses a multilayer neural network that requires fewer pixels. The 2.25X DLDSR is comparable in quality to the 4X resolution of previous generation DSR technology. At the same time, DLDSR performance is much higher thanks to the tensor cores of RTX video cards, which accelerate neural networks several times. You can try DLDSR on your gaming computer by updating your video card driver and setting the desired settings.
https://www.rockpapershotgun.com/nvidias-deep-learning-dynamic-super-resolution-tech-is-out-now-heres-how-to-enable-it
Forwarded from эйай ньюз
​​Молодцы ребята! Офигенный прогресс по сохранению деталей в задачи ресторации старых портретов. Особенно мне нравится автопортрет ван Гога. А у Достоевского, кажется, сетка сделала бороду менее широкой.
Forwarded from DL in NLP (Vlad Lialin)
Давно не было подборки новостей и интересных блогпостов

1. Text and Code Embeddings in the OpenAI API — теперь можно доставать эмбеддинги текстов через OpenAI API. Эти эмбеддинги сильно обходят SentenceBERT, GPT-3, хорошо работают в нестандартных доменах, например астрономии и вообще взяли кучу SOTA. Подробнее в статье Text and Code Embeddings by Contrastive Pre-Training, сделаем её обзор в ближайшие дни.
1. ε, A Nuisance No More — пост о том, что eps нужен не только для устранения численых ошибок. Например в ADAM высокие eps делают оптимизатор чуть-чуть больше похожим на SGD, что может быть полезно, когда моменты плохо описывают поверхность лосса. В BatchNorm/LayerNorm высокие eps выполняют роль сглаживания компонент вектора. На практике иногда такие высокие значения eps как 1e-3 или даже 1e-1 могут сильно помогать оптимизации и зачастую тюнинг eps полезен.
1. On the Difficulty of Extrapolation with NN Scaling — мы все слышали про scaling laws, однако на практике мало кто умеет их готовить. Просто от увеличения модели в 2 раза, вы можете не получить ожидаемого улучшения качества, тк scaling laws вообще говоря требуют адаптации batch size, lr, других гиперпараметров и в общем случае, размера датасета. Блогпост обсуждает случаи, когда люди слишком сильно надеятся на scaling laws и забывают про эти важные детали.
Forwarded from эйай ньюз
ShiftViT: An Extremely Simple Alternative to Attention Mechanism

Мелкософт говорит, что селф-атеншен больше не нужен в задачах зрения. Предлагают вместо него просто каналы случайно подвигать в плоскости картинки.

Судя по всему, это должно работать быстрее. По результатам точность на Imagenet почти как у трансформеров, чуть-чуть ниже.

Статья | Код
Forwarded from ExMuffin
🧔Обновленная модель генератора HD портретов 👩‍🦳

Недавно мы в neural.love выкатили новый генератор лиц по исходному изображению, который был анонсирован в одном из предыдущих постов. Точность значительно возросла, в сравнении со старой моделью, однако немного просела скорость. Теперь на вычисление тратится чуть больше времени, но оно того стоит. По окончанию работы можно будет либо сравнить изменения, двигая шторкой, либо просто забрать результат, который придет на email. Протестировать можно по ссылке ниже:

https://neural.love/portraits