DS & ML
588 subscribers
1.17K photos
238 videos
240 files
1.41K links
Download Telegram
Forwarded from Big Data Science
💥Top 5 Data Engineering Trends in 2022: Astronomer Research
Astronomer, which commercializes and promotes the popular batch automation tool for working with data, Apache AirFlow, conducted a series of interviews with experts in the field of data engineering to identify the most pressing trends in the IT field.
• Data lineage, Data provenance and Data Quality
• Decentralization of data across different contexts and teams, but within a single consistent infrastructure with centralization of resources
• Consolidation of data tools, including orchestration of processing pipelines
• Data Mesh, eliminating silos between processing teams through the connection of used platforms
• mutual integration of DataOps, MLOps, AIOps for more efficient and faster use of consistent data and tools for seamless work with them.
https://www.astronomer.io/blog/top-data-management-trends-2022
Forwarded from Технологии | Нейросети | Боты
This media is not supported in your browser
VIEW IN TELEGRAM
NeROIC: Neural Rendering of Objects from Online Image Collections
project page: https://formyfamily.github.io/NeROIC/
Я уже 16 месяцев занимаюсь задачей text style transfer, но до сих пор не очень-то понимаю, что это вообще такое — стиль текста. И не я один: даже профессиональные лингвисты не очень могут определить стиль, а те, кто могут, часто друг с другом несогласны. Поэтому NLPшники, которые занимаются переносом стиля, на лингвистику часто вообще забивают. Статья From Theories on Styles to their Transfer in Text: Bridging the Gap with a Hierarchical Survey (https://arxiv.org/abs/2110.15871) пытается это исправить.

Задумка этого 40-страничного обзора очень простая: сделать каталог большинства известных науке текстовых стилей и для каждого стиля собрать в кучку работы с лингвистическим анализом этого стиля, с доступными для него датасетами, и с алгоритмами для переноса этого стиля. В этой статье определение стиля тоже не даётся, зато её авторы показывают, какие стили вообще бывают, и что для них уже сделано. Спойлер: для большинства стилей – не очень много, но для некоторых – больше, чем вы думали.
🧙‍♂️ A ConvNet for the 2020s: Пока трансформеры выиграли битву, но не войну

📰 Ресерчеры из FAIR и Berkeley спроектировали ConvNeXts, проанализировав пределы чисто-Сверточных Сетей в эпоху Трансформеров. (Костя, Спасибо за новость!)

Двадцатые года второго тысячелетия начались с доминации трансформеров в задачах компьютерного зрения! Да, здравствует ViT, прощай ResNet! И Трансформеры быстро вытеснили Сверточные Сети. С другой стороны, ванильный ViT сталкивается с трудностями при применении к таким задачам, как детекция и сегментация. Иерархические трансформеры (Swin) сделали Трансформеры не просто сверх-жизнеспособными, а универсальной основой современного машинного зрения. Но своей силе SWIN больше обязан механизму внимания, нежели inductive bias, предложенному в SWIN.

Ресерчеры постепенно модернизировали ResNet в сторону ViT, и создали семейство ConvNeXt, достигнув 87,8% ImageNet Top-1, обойдя Swin на детекции COCO и сегментации ADE20K, сохраняя простоту и эффективность стандартных ConvNet.

📑 paper 💻 git
Forwarded from Технологии | Нейросети | Боты
Узнаём калорийность блюда по фото.

Под капотом RuDOLHP точно настроенный для задачи image2text для прогнозирования калорийности пищи.

• RuDOLHP подробнее

• По
пробовать
Forwarded from эйай ньюз
ConvNeXt: Конволюционная сеть нового поколения наносит удар по Трансформерам

Очень хорошая работа от FAIR и BAIR (Беркли), показывающая, что при правильном сочетании методов ConvNets лучше, чем Трансформеры для зрения.
Нужно только сделать сверточную сетку по-жирнее.

Вот несколько основных трюков: более крупные кернелы, layer norm, жирный слой внутри Res-блоков, ....
Итого, получаем 87,1% топ-1 точности на ImageNet-1k, что бьет все трансформеры.

Конечно, это не значит, что про трансформеры можно забыть. Они очень даже полезны в других задачах. Например, для end-to-end детекции учень удачна архитектуры DETR, где первые слои содержат конволюции, а затем следуют self-attention блоки, которые смотрят на все фото целиком, и могут детектировать множество объектов, не зависимо от их порядка, за один прогон.

>> Код и веса есть на гитхабе >> Статья
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google AI Blog | Google Research: Themes from 2021 and Beyond

📣 TL;DR Summarization of Google Research's works and achievements in 2021

Вышел крутой блокпост, где выделено пять различных трендов, для каждого из которых приведены исследования (в основном с 2021 года), а так же сделан прогноз того, что мы, вероятно, увидим в ближайшие пару лет.

Тренды:
· 1. Более функциональные модели машинного обучения общего назначения
· 2. Постоянное повышение эффективности машинного обучения
· 3. Повышение пользы машинного обучения для личности и общества
· 4. Растущие влияние машинного обучения в науке и здравоохранении
· 5. Более глубокое понимание глубокого обучения

📇 Blog Post | Google Research: Themes from 2021 and Beyond

p.s.: Скажем Chan Kha Vu, спасибо за ссылку, поставим 👍
Forwarded from Big Data Science
🚀Accelerating Big Data Analytics: Expedia Group Case Study with Apache Druid and DataSketches
When analyzing big data, problematic queries often arise that do not scale, since they require enormous computational resources and time to obtain accurate results. For example, counting individual items, quantiles, most frequent items, table joins in SQL queries, matrix calculations and graph analysis. If the approximate results for such calculations are acceptable, there are special streaming algorithms or sketches that run several orders of magnitude faster with acceptable errors. The sketches helped Yahoo successfully reduce processing time from days or hours to minutes or seconds. One such tool is the open-source library Apache DataSketches.
It is used by the large travel company Expedia Group to speed up time series analysis in Apache Druid, where table joins are limited, requiring a single dataset to be put into memory. DataSketches supports set operations, including join, intersection, and difference, with little loss in precision. This is useful when looking for and booking tickets. With DataSketches, each dataset can be queried independently of Druid to get the desired object for each dataset for preliminary and then final calculation. Since Druid did not initially support merging DataSketches objects, Expedia Group engineers had to write their own Java code. Moreover, the DataSketches object takes up very little memory space, despite the large size of the set. As a result, Apache Druid, a column-based DBMS for quickly receiving huge amounts of event data and submitting queries with low latency, became even faster.
https://datasketches.apache.org/
https://medium.com/expedia-group-tech/fast-approximate-counting-using-druid-and-datasketch-f5f163131acd
🦌🎄☃️ Обновление RuDOLPH: Гипер-Модального GPT/DALL-E-like Трансформера со способностями CLIP

Вышли новые веса быстрого 350M GPT-3 RuDOLPH. Экспериментальная модель является GPT-платформой для решения множества задач в zero-shot:
- Генерации и изменения изображений
- Описания изображений
- Ранжирования и классификации

Благодаря претрейну и маленькому весу, модель легко файнтюнить под свои задачи. Автор канала любовь, смерть и голуби трансформеры уже зафайнтюнил RuDOLPH для определения бжу по фото.

RuDOLPH в режиме DALL-E + сортировка в режиме CLIP:
▪️ "Фотография красивой девушки"
▪️ "Девушка в пальто" + 1/2 свкрху от предыдущей генерации
▪️ "Старинный собор"
▪️ "Современный собор" + 1/2 свкрху от предыдущей генерации
▪️ "Дорога в закат"
▪️ "Озеро" + 1/2 свкрху от предыдущей генерации
▪️ "Серый рыжий кот"
▪️ "Кресло в форме авокадо"

RuDOLPH в режиме Image Captioning:
▪️ Реальное изображение + "На картинке "

🚀 Скорость: 336 картинок за 5 мин + 2 мин "проявка" из 128х128 в 1024х1024

🔮 Colab
Forwarded from эйай ньюз
Normalizing Flows - что это?

Если грубо, то Normalizing Flow - это такая модель, которая с помощью серии обратимых трансформаций переводит одно распределение в другое. При этом такой маппинг полностью обратим и работает в обе стороны. Таким образом можно получить маппинг из нормального распределения в любое другое сложное распространение.

Если вы когда-нибудь хотели разобраться по-лучше в том, что такое Normalizing Flows, то вот вам хорошая подборка ресурсов про них.
Forwarded from AbstractDL
Grokking: оверфиттинг это ещё не конец (by OpenAI)

Все мы знаем, что если обучающих данных мало, то модель скорее всего заоверфиттится, запомнив весь датасет. Но оказалось, что если в этот момент не останавливать обучение и продолжать его даже при нулевой ошибке на трейне, то через какое-то время нейронка всё-таки научится обобщать.

У OpenAI таким образом удалось обучить небольшой трансформер решать уравнения, которые он никогда не видел! Грубо говоря, модель смогла заполнить пропущенные слоты в таблице умножения. При этом такая супер-обобщающая способность наступала гораздо позднее оверфиттинга, когда большинство из нас уже выкинули бы модель в помойку.

Похоже, что самую важную роль в этом эффекте играет weight decay, благодаря которому модель в конце-концов переходит от простого запоминания обучающих примеров к аналитическому решению задачи. Из интересных наблюдений — при визуализации эмбеддингов видны математические структуры, помогающие находить ответы.

Статья, видео