Forwarded from Мишин Лернинг
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google AI Blog | Google Research: Themes from 2021 and Beyond
📣 TL;DR Summarization of Google Research's works and achievements in 2021
Вышел крутой блокпост, где выделено пять различных трендов, для каждого из которых приведены исследования (в основном с 2021 года), а так же сделан прогноз того, что мы, вероятно, увидим в ближайшие пару лет.
Тренды:
· 1. Более функциональные модели машинного обучения общего назначения
· 2. Постоянное повышение эффективности машинного обучения
· 3. Повышение пользы машинного обучения для личности и общества
· 4. Растущие влияние машинного обучения в науке и здравоохранении
· 5. Более глубокое понимание глубокого обучения
📇 Blog Post | Google Research: Themes from 2021 and Beyond
p.s.: Скажем Chan Kha Vu, спасибо за ссылку, поставим 👍
📣 TL;DR Summarization of Google Research's works and achievements in 2021
Вышел крутой блокпост, где выделено пять различных трендов, для каждого из которых приведены исследования (в основном с 2021 года), а так же сделан прогноз того, что мы, вероятно, увидим в ближайшие пару лет.
Тренды:
· 1. Более функциональные модели машинного обучения общего назначения
· 2. Постоянное повышение эффективности машинного обучения
· 3. Повышение пользы машинного обучения для личности и общества
· 4. Растущие влияние машинного обучения в науке и здравоохранении
· 5. Более глубокое понимание глубокого обучения
📇 Blog Post | Google Research: Themes from 2021 and Beyond
p.s.: Скажем Chan Kha Vu, спасибо за ссылку, поставим 👍
Forwarded from Big Data Science
🚀Accelerating Big Data Analytics: Expedia Group Case Study with Apache Druid and DataSketches
When analyzing big data, problematic queries often arise that do not scale, since they require enormous computational resources and time to obtain accurate results. For example, counting individual items, quantiles, most frequent items, table joins in SQL queries, matrix calculations and graph analysis. If the approximate results for such calculations are acceptable, there are special streaming algorithms or sketches that run several orders of magnitude faster with acceptable errors. The sketches helped Yahoo successfully reduce processing time from days or hours to minutes or seconds. One such tool is the open-source library Apache DataSketches.
It is used by the large travel company Expedia Group to speed up time series analysis in Apache Druid, where table joins are limited, requiring a single dataset to be put into memory. DataSketches supports set operations, including join, intersection, and difference, with little loss in precision. This is useful when looking for and booking tickets. With DataSketches, each dataset can be queried independently of Druid to get the desired object for each dataset for preliminary and then final calculation. Since Druid did not initially support merging DataSketches objects, Expedia Group engineers had to write their own Java code. Moreover, the DataSketches object takes up very little memory space, despite the large size of the set. As a result, Apache Druid, a column-based DBMS for quickly receiving huge amounts of event data and submitting queries with low latency, became even faster.
https://datasketches.apache.org/
https://medium.com/expedia-group-tech/fast-approximate-counting-using-druid-and-datasketch-f5f163131acd
When analyzing big data, problematic queries often arise that do not scale, since they require enormous computational resources and time to obtain accurate results. For example, counting individual items, quantiles, most frequent items, table joins in SQL queries, matrix calculations and graph analysis. If the approximate results for such calculations are acceptable, there are special streaming algorithms or sketches that run several orders of magnitude faster with acceptable errors. The sketches helped Yahoo successfully reduce processing time from days or hours to minutes or seconds. One such tool is the open-source library Apache DataSketches.
It is used by the large travel company Expedia Group to speed up time series analysis in Apache Druid, where table joins are limited, requiring a single dataset to be put into memory. DataSketches supports set operations, including join, intersection, and difference, with little loss in precision. This is useful when looking for and booking tickets. With DataSketches, each dataset can be queried independently of Druid to get the desired object for each dataset for preliminary and then final calculation. Since Druid did not initially support merging DataSketches objects, Expedia Group engineers had to write their own Java code. Moreover, the DataSketches object takes up very little memory space, despite the large size of the set. As a result, Apache Druid, a column-based DBMS for quickly receiving huge amounts of event data and submitting queries with low latency, became even faster.
https://datasketches.apache.org/
https://medium.com/expedia-group-tech/fast-approximate-counting-using-druid-and-datasketch-f5f163131acd
datasketches.apache.org
DataSketches |
Forwarded from Мишин Лернинг
🦌🎄☃️ Обновление RuDOLPH: Гипер-Модального GPT/DALL-E-like Трансформера со способностями CLIP
Вышли новые веса быстрого 350M GPT-3 RuDOLPH. Экспериментальная модель является GPT-платформой для решения множества задач в zero-shot:
- Генерации и изменения изображений
- Описания изображений
- Ранжирования и классификации
Благодаря претрейну и маленькому весу, модель легко файнтюнить под свои задачи. Автор канала любовь, смерть иголуби трансформеры уже зафайнтюнил RuDOLPH для определения бжу по фото.
RuDOLPH в режиме DALL-E + сортировка в режиме CLIP:
▪️ "Фотография красивой девушки"
▪️ "Девушка в пальто" + 1/2 свкрху от предыдущей генерации
▪️ "Старинный собор"
▪️ "Современный собор" + 1/2 свкрху от предыдущей генерации
▪️ "Дорога в закат"
▪️ "Озеро" + 1/2 свкрху от предыдущей генерации
▪️ "Серый рыжий кот"
▪️ "Кресло в форме авокадо"
RuDOLPH в режиме Image Captioning:
▪️ Реальное изображение + "На картинке "
🚀 Скорость: 336 картинок за 5 мин + 2 мин "проявка" из 128х128 в 1024х1024
🔮 Colab
Вышли новые веса быстрого 350M GPT-3 RuDOLPH. Экспериментальная модель является GPT-платформой для решения множества задач в zero-shot:
- Генерации и изменения изображений
- Описания изображений
- Ранжирования и классификации
Благодаря претрейну и маленькому весу, модель легко файнтюнить под свои задачи. Автор канала любовь, смерть и
RuDOLPH в режиме DALL-E + сортировка в режиме CLIP:
▪️ "Фотография красивой девушки"
▪️ "Девушка в пальто" + 1/2 свкрху от предыдущей генерации
▪️ "Старинный собор"
▪️ "Современный собор" + 1/2 свкрху от предыдущей генерации
▪️ "Дорога в закат"
▪️ "Озеро" + 1/2 свкрху от предыдущей генерации
▪️ "Серый рыжий кот"
▪️ "Кресло в форме авокадо"
RuDOLPH в режиме Image Captioning:
▪️ Реальное изображение + "На картинке "
🚀 Скорость: 336 картинок за 5 мин + 2 мин "проявка" из 128х128 в 1024х1024
🔮 Colab
Forwarded from эйай ньюз
Normalizing Flows - что это?
Если грубо, то Normalizing Flow - это такая модель, которая с помощью серии обратимых трансформаций переводит одно распределение в другое. При этом такой маппинг полностью обратим и работает в обе стороны. Таким образом можно получить маппинг из нормального распределения в любое другое сложное распространение.
Если вы когда-нибудь хотели разобраться по-лучше в том, что такое Normalizing Flows, то вот вам хорошая подборка ресурсов про них.
Если грубо, то Normalizing Flow - это такая модель, которая с помощью серии обратимых трансформаций переводит одно распределение в другое. При этом такой маппинг полностью обратим и работает в обе стороны. Таким образом можно получить маппинг из нормального распределения в любое другое сложное распространение.
Если вы когда-нибудь хотели разобраться по-лучше в том, что такое Normalizing Flows, то вот вам хорошая подборка ресурсов про них.
Forwarded from AbstractDL
Grokking: оверфиттинг это ещё не конец (by OpenAI)
Все мы знаем, что если обучающих данных мало, то модель скорее всего заоверфиттится, запомнив весь датасет. Но оказалось, что если в этот момент не останавливать обучение и продолжать его даже при нулевой ошибке на трейне, то через какое-то время нейронка всё-таки научится обобщать.
У OpenAI таким образом удалось обучить небольшой трансформер решать уравнения, которые он никогда не видел! Грубо говоря, модель смогла заполнить пропущенные слоты в таблице умножения. При этом такая супер-обобщающая способность наступала гораздо позднее оверфиттинга, когда большинство из нас уже выкинули бы модель в помойку.
Похоже, что самую важную роль в этом эффекте играет weight decay, благодаря которому модель в конце-концов переходит от простого запоминания обучающих примеров к аналитическому решению задачи. Из интересных наблюдений — при визуализации эмбеддингов видны математические структуры, помогающие находить ответы.
Статья, видео
Все мы знаем, что если обучающих данных мало, то модель скорее всего заоверфиттится, запомнив весь датасет. Но оказалось, что если в этот момент не останавливать обучение и продолжать его даже при нулевой ошибке на трейне, то через какое-то время нейронка всё-таки научится обобщать.
У OpenAI таким образом удалось обучить небольшой трансформер решать уравнения, которые он никогда не видел! Грубо говоря, модель смогла заполнить пропущенные слоты в таблице умножения. При этом такая супер-обобщающая способность наступала гораздо позднее оверфиттинга, когда большинство из нас уже выкинули бы модель в помойку.
Похоже, что самую важную роль в этом эффекте играет weight decay, благодаря которому модель в конце-концов переходит от простого запоминания обучающих примеров к аналитическому решению задачи. Из интересных наблюдений — при визуализации эмбеддингов видны математические структуры, помогающие находить ответы.
Статья, видео
Forwarded from Russian OSINT
Группа исследователей из Аризоны создала инструмент для решения CAPTCHA на основе машинного обучения. По утверждению разрабов, механизм способен выдать 94,4% успешных случаев прохождения капчи в даркнете из 100% возможных.
"DW-GAN significantly outperformed the state-of-the-art benchmark methods on all datasets, achieving over 94.4% success rate on a carefully collected real-world dark web dataset"
CAPTCHA в дарке используется практически везде, так как onion-сайтам необходимо держать оборону от постоянных DDoS-атак конкурентов и ботов . В случае с DW-GAN, технология позволяет удалить "шум" с фотографии, а также выделить отдельно цифры и буквы.
Если кто-то затестит DW-GAN и поделится наблюдениями обхода капчи @russian_osint_bot, буду признателен фидбеку! Теория здорово, но на практике всё может оказаться иначе.
https://github.com/johnnyzn/DW-GAN
"DW-GAN significantly outperformed the state-of-the-art benchmark methods on all datasets, achieving over 94.4% success rate on a carefully collected real-world dark web dataset"
CAPTCHA в дарке используется практически везде, так как onion-сайтам необходимо держать оборону от постоянных DDoS-атак конкурентов и ботов . В случае с DW-GAN, технология позволяет удалить "шум" с фотографии, а также выделить отдельно цифры и буквы.
Если кто-то затестит DW-GAN и поделится наблюдениями обхода капчи @russian_osint_bot, буду признателен фидбеку! Теория здорово, но на практике всё может оказаться иначе.
https://github.com/johnnyzn/DW-GAN
Forwarded from [PYTHON:TODAY]
Forwarded from Мишин Лернинг
This media is not supported in your browser
VIEW IN TELEGRAM
👩🎓🧪👨🎤 Библиотека MMGeneration — все что нужно для обучения работы с GAN и не только в одном месте!
MMGeneration — это мощный PyTortch инструментарий для генеративных моделей от создателей MMDetection.
MMDetection подходит для обучения: Unconditional GANs, Internal GANs и даже Image Translation Models
MMDetection сожержит огромный инструментарий для манипуляции: GAN interpolation, GAN projection и GAN manipulations
MMGeneration включает в себя
🎨 Unconditional GANs:
✅ DCGAN (ICLR'2016)
✅ WGAN-GP (NIPS'2017)
✅ LSGAN (ICCV'2017)
✅ GGAN (arXiv'2017)
✅ PGGAN (ICLR'2018)
✅ StyleGANV1 (CVPR'2019)
✅ StyleGANV2 (CVPR'2020)
✅ Positional Encoding in GANs (CVPR'2021)
🐍 Conditional GANs:
✅ SNGAN (ICLR'2018)
✅ Projection GAN (ICLR'2018)
✅ SAGAN (ICML'2019)
✅ BIGGAN/BIGGAN-DEEP (ICLR'2019)
🎭 Image2Image Translation:
✅ Pix2Pix (CVPR'2017)
✅ CycleGAN (ICCV'2017)
🛫 Internal Learning:
✅ SinGAN (ICCV'2019)
🌬 Denoising Diffusion:
✅ Improved DDPM (arXiv'2021)
#всохраненки
MMGeneration — это мощный PyTortch инструментарий для генеративных моделей от создателей MMDetection.
MMDetection подходит для обучения: Unconditional GANs, Internal GANs и даже Image Translation Models
MMDetection сожержит огромный инструментарий для манипуляции: GAN interpolation, GAN projection и GAN manipulations
MMGeneration включает в себя
🎨 Unconditional GANs:
✅ DCGAN (ICLR'2016)
✅ WGAN-GP (NIPS'2017)
✅ LSGAN (ICCV'2017)
✅ GGAN (arXiv'2017)
✅ PGGAN (ICLR'2018)
✅ StyleGANV1 (CVPR'2019)
✅ StyleGANV2 (CVPR'2020)
✅ Positional Encoding in GANs (CVPR'2021)
🐍 Conditional GANs:
✅ SNGAN (ICLR'2018)
✅ Projection GAN (ICLR'2018)
✅ SAGAN (ICML'2019)
✅ BIGGAN/BIGGAN-DEEP (ICLR'2019)
🎭 Image2Image Translation:
✅ Pix2Pix (CVPR'2017)
✅ CycleGAN (ICCV'2017)
🛫 Internal Learning:
✅ SinGAN (ICCV'2019)
🌬 Denoising Diffusion:
✅ Improved DDPM (arXiv'2021)
#всохраненки
Forwarded from Denis Sexy IT 🤖
🔥 Запипили апскейл картинок на GAN-стероидах
Продолжаем добавлять на neural.love новые сервисы — в этот раз выкатили работу с фотографиями, да и любыми картинками включая эти ваши мемы в интернете. На видео реальный пример.
Какие фичи есть уже сейчас:
— Можете бесплатно улучшить 5 картинок
— Можно увеличить разрешение изображения в 2 или 4 раза
— Можно клево убрать артефакты от компрессии jpeg файлов
— Можно нейронкой улучшить четкость лиц
— Можно поправить цветовые проблемы старых фотографий (розовый цвет который появляется от химических реакций на старых фоточках)
— Можно удалить повреждение пленки — аля царапины (оно же удаляет иногда детали фоточек, поэтому по умолчанию мы наверное все же выключим это)
— И отдельная платная фича, можно запроцессить 100 фоточек сразу
Еще мы почти дотренировали нашу новую модельку для колоризации, ее тоже добавим в ближайшем апдейте о котором я напишу отдельно.
👉 Играться тут
Если соберетесь приобрести подписку и поддержать наш стартаперский быт — то вот промокод на 10% скидку на первый месяц подписки:
P.S. Кстати, написали на английском статью о том как работает Upscale простым языком, если интересно — то велкам.
P.P.S. Кстати, напомню, что по нашей продуктовой политике мы не собираем никаких маркетинговых кук, ваши заказы хранятся на шифрованном хранилище, и процессят все только роботы. Так что можете спокойно играться, никто из нас не будет потом таргетировать рекламу на половину интернета 🤍
Продолжаем добавлять на neural.love новые сервисы — в этот раз выкатили работу с фотографиями, да и любыми картинками включая эти ваши мемы в интернете. На видео реальный пример.
Какие фичи есть уже сейчас:
— Можете бесплатно улучшить 5 картинок
— Можно увеличить разрешение изображения в 2 или 4 раза
— Можно клево убрать артефакты от компрессии jpeg файлов
— Можно нейронкой улучшить четкость лиц
— Можно поправить цветовые проблемы старых фотографий (розовый цвет который появляется от химических реакций на старых фоточках)
— Можно удалить повреждение пленки — аля царапины (оно же удаляет иногда детали фоточек, поэтому по умолчанию мы наверное все же выключим это)
— И отдельная платная фича, можно запроцессить 100 фоточек сразу
Еще мы почти дотренировали нашу новую модельку для колоризации, ее тоже добавим в ближайшем апдейте о котором я напишу отдельно.
👉 Играться тут
Если соберетесь приобрести подписку и поддержать наш стартаперский быт — то вот промокод на 10% скидку на первый месяц подписки:
LETSIMPROVEP.S. Кстати, написали на английском статью о том как работает Upscale простым языком, если интересно — то велкам.
P.P.S. Кстати, напомню, что по нашей продуктовой политике мы не собираем никаких маркетинговых кук, ваши заказы хранятся на шифрованном хранилище, и процессят все только роботы. Так что можете спокойно играться, никто из нас не будет потом таргетировать рекламу на половину интернета 🤍
Forwarded from эйай ньюз
Ресерчеры из Meta AI масштабировали разреженные языковые модели до 1.1 триллиона параметров. Причем сделали это эффективно и показали, что они требует в 4 раза меньше ресурсов чем сравнимые по точности плотные (dense) модели.
Подробнее в статье Efficient Large Scale Language Modeling with Mixtures of Experts.
Подробнее в статье Efficient Large Scale Language Modeling with Mixtures of Experts.