DS & ML
589 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from эйай ньюз
DeepMind выкатил новую visual-language модель.

Flamingo 🦩 – универсальная модель для языка и картинок, которая может быстро адаптировать свое поведение, учитывая всего несколько новых примеров. Одна модель умеет решать сразу много разных визуально-текстовых задач. Из коробки она также способна к богатому визуальному диалогу (см. пример на видео).

На днях ещё разберусь с подробностями.

https://www.deepmind.com/blog/tackling-multiple-tasks-with-a-single-visual-language-model

@Artem
Forwarded from Denis Sexy IT 🤖
И вот вам очередная подборка свежих генераций Dalle 2 ✨
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
🇨🇳Китайцы подвезли дипфейки на стеройдах

Все мы видели дипфейки, где подменяются лица. Эта статья пошла дальше, тут меняют все голову целиком. Чудеса китайской инженерии и 300 лоссов делают свою дело 🤓.

По сравнению с обычным "face swap"-ом, новый метод лучше переносит личность с целевой фотографии на видео, сохраняя прическу, брови, и другие атрибуты. Осталось только немного улучшить покадровую стабильность - контуры головы немного дёргабтся. Кода пока нет, но обещают скоро залить.

❱❱ Few-Shot Head Swapping in the Wild
Forwarded from GitHub Community
​Mousai – Shazam, но с открытым исходным кодом и для GNU/Linux

Просто нажмите кнопку прослушивания и подождите несколько секунд – он почти со стопроцентной вероятностью вернет название и исполнителя этой песни!

GitHub | #Linux #Interesting
Forwarded from GitHub Community
​Ai-expert-roadmap – Путеводитель по изучению ИИ в 2021(2) году

В данном репозитории
вы найдете набор диаграмм, демонстрирующих пути, по которым вы можете пойти, и технологии, которые вы хотели бы изучить, чтобы стать специалистом по анализу данных, машинному обучению или экспертом по ai.

Цель таких «путеводителей» - дать вам представление об теме в целом и помочь вам, если вы запутались в том, чему учиться дальше, и не поощрять вас выбирать то, что модно и в тренде. Вы должны понять, почему один инструмент лучше подходит для одних случаев, чем другой, и т.д.

Интерактивную версию со ссылками на каждый маркер из списка можно найти по адресу i.am.ai/roadmap

GitHub | #Roadmap #AI #Interesting
Forwarded from эйай ньюз
🔥Meta AI публикует код и веса языковой модели с 175B параметров, сравнимой с GPT-3

(!) Беспрецедентный случай. Это будет самая большая модель с предобученными весами в публичном доступе.

Мои коллеги из Meta AI скоро зарелизят библиотеку Open OPT, которая включает набор предварительно обученных трансформеров (от 125M до 175B параметров), которые работают сравнимо с GPT-3 на 14 языковых бенчмарках. При этом авторы улучшили эффективность тренировки, что позволило сократить количество требуемых ресурсов. Это всего лишь какие-то 992 видеокарты A100 с 80GB VRAM. Круто, что цикл тренировки OPT-175B оставляет в 7 раз меньше углеродного следа (75 тонн CO2) за время обучения, чем GPT-3 (500 тонн).

В библиотеке будет код со всеми трюками для обучения всех моделей, а также предобученные веса. Правда веса самой большой модели OPT-175B можно будет скачать только по запросу и с research-only лицензией.

❱❱ OPT: Open Pre-trained Transformer Language Models
❱❱❱ Код на GitHub (скоро будет)
Forwarded from DL in NLP (Vlad Lialin)
Подробнее о тренировке OPT — огромной языковой модели с 175B параметров от Meta AI

Чем глубже погружаешься в методы тренировки больших моделей, тем больше понимаешь насколько там боли. С одной стороны у тебя может быть 1000 GPU, но как заставить их работать вместе и что делать когда модель начинает расходиться?

Для обучения OPT использовали коктейль из
1. MegatronDeepSpeed — эффективный tensor parallel
1. NVIDIA Apex — mixed precision
1. Fairscale — fully-sharded data parallel и элистичность тренировки, т.е. чтобы когда умирала какая-то GPU вся тренировка не останавливалась

Модель максимально близка к GPT3. Та же максимальная длина в 2048 токенов, тот же токенизатор от GPT2, ReLU. Pre-norm или post-norm в статье на написано, но предполагаю что pre-norm. Использовали обычный fp16 для весов модели, а ADAM был в fp32.

Данные это смесь данных RoBERTa (BookCorpus, Stories, CCNews), часть The Pile, и PushShift.io Reddit. Дедуплицировали документы с помощью Min-hashLSH, сказали что в The Pile очень много дубликатов. В конце-концов получилось 180B токенов.

Самое весёлое: процесс тренировки. Тренировали самую большую модель 2 месяца, её приходилось вручную перезапускать 35 раз. Автоматически она перезапустилась ещё 70. То есть в среднем чаще чем раз в день с тренировкой что-то происходило. При ручном перезапуске делали диагностику hardware и выключали сломанные ноды. Когда лосс начинал резко расти, модель откатывали до последнего чекпоинта и уменьшали LR. Кроме этого в начале тренировки использовали очень маленький gradient clipping в 0.3.

Вот когда я разчувствовался при чтении статьи это на секции где авторы описывают что во время тренировки они пытались менять оптимизатор в ADAMW на SGD (не помогло, вернули обратно), ресетить скейлинг лосса (это когда мы лосс умножаем на некоторое число, чтобы подсчёт градиентов был более численно стабильным, важно для fp16) и даже менять версию Megatron. У кого-то были напряжённые недели.

Кажется 2022 запомнится демократизацией доступа к большим моделям, что может привести к куче ноывых интересных статей как эти модели применять на практике и какие у них есть косяки. Stay tuned.
🔓🧠 Код OPT (175B GPT-3 от Meta AI) доступен

Доступен код тренировки, инференса и сами веса моделей.

• Веса моделей OPT-125M, OPT-350M, OPT-1.3B, OPT-2.7B, OPT-6.7B, OPT-13B, OPT-30B уже доступны для скачивания (семь моделей для скачивания, ссылку привОз)
• Веса 66B модели будут доступны в ближайшее время.
• Запросить доступ к 175B можно по этой ссылке
🔬🔥 Google Research опенсорснули свой research code base! Big Vision: ViT, LiT, MLP-Mixer, ставь свои эксперименты!

Вот слова Александра Колесникова (автора ViT, MLP-Mixer, etc., очень рекомендую его твиттер 🔥):

«Big Vision репозиторий — дом ViT, LiT, MLP-Mixer и прочих крупный AI проектов. Раньше мы публиковали код только для finetune, теперь же — полную базу, которая может работать на всем от 1 gpu до 2048 TPU!»

Это
действительно круто, и это даёт невероятные возможность для ресерч комьюнити: вот контент и планы на будущее!

Обратите внимание, что, несмотря на то, что Big Vision ориентирован на TPU, кодовая база в целом поддерживает обучение на CPU и GPU (и несколькими GPU) благодаря JAX!

👉 Big Vision 🔬
Forwarded from эйай ньюз
Open Pre-trained Transformers от Meta AI уже на гитхабе 🤟

Веса до 30 миллиардов параметров можно скачать прямо сейчас. Модель на 66B скоро подъедет. А веса OPT-175B можно запросить через форму.

Го играться!