Big Data Science [RU]
1.62K subscribers
78 photos
9 videos
543 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏https://t.me/bdscience — Big Data Science channel (english version)
💼https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
👆🏻Что такое AUC - ROC Curve и почему это так важно для оценки качества ML-модели?
Это площадь под кривой ошибок (ROC-кривой) используется как метрика оценки качества алгоритмов классификации. Ее значение лежит в диапазоне [0, 1].
Кривая AUC - ROC измеряет эффективность классификации при различных пороговых значениях. ROC - это кривая вероятности, а AUC - степень или мера разделимости, которая говорит о том, насколько ML-модель способна различать классы. Чем выше AUC, тем лучше модель. Например, при AUC близкой к 1, ML-модель будет хорошо отличать больных пациентов от здоровых. Плохая модель имеет AUC около 0, что означает худший показатель разделимости, что означает, что объекты разных классов будут классифицированы неверно. Если AUC равен 0,5, то модель вообще не может выделять классы.
Чувствительность и специфичность обратно пропорциональны друг другу: увеличивая чувствительность, мы уменьшает специфичность, и наоборот. Снижая порог, мы получаем больше положительных значений, что увеличивает чувствительность и уменьшает специфичность. Наоборот, увеличив порог, получим больше отрицательных значений и более высокую специфичность с низкой чувствительностью.
В мультиклассовой модели можно построить N кривых AUC ROC для N числовых классов, используя методологию One vs ALL. Так, например, если у вас есть три класса с именами X, Y и Z, у вас будет один ROC для X, классифицированный по Y и Z, другой ROC для Y, классифицированный по X и Z, и третий для Z, классифицированный по Y и X.
https://towardsdatascience.com/understanding-auc-roc-curve-68b2303cc9c5
☀️В последний месяц лета 2021 успеваем насладиться солнцем, новыми знакомствами и интересными DS-событиями:
10 августа, 16:00 МСК Online-митап от Яндекса «Как контролировать расходы на облако» - учимся расходовать cloud-бюджеты более эффективно. Бесплатная регистрация https://cloud.yandex.ru/events/411
12-13 августа - всероссийский форум «Цифровая эволюция», г. Калуга, Инновационный культурный центр, ул. Октябрьская, 17а https://digitalregion.ru/
19 августа, 11:00 МСК - Онлайн-эфир "Цифровая трансформация малого и среднего бизнеса в российских регионах". Бесплатная регистрация https://events.vedomosti.ru/events/spb_zifrovizavizacia_msb
21-22 августа, Москва - первый офлайн-хакатон по развитию CRM-системы нового поколения от компании Т1 Консалтинг с призовым фондом 500 000 рублей https://crmhack.ru/
26-27 августа, Москва - восьмой форум «Цифровое предприятие» от группы «Просперити Медиа» и портала CFO-Russia.ru. Роботизация бизнес-процессов, единая модель данных на базе AI и другие практические кейсы от 25 спикеров из разных отраслей экономики. https://www.cfo-russia.ru/meropriyatiya/digen/
🚗Роботы Яндекса доставят еду американским студентам
6 июля 2021 года Яндекс заключил соглашение о сотрудничестве с американским сервисом доставки еды Grubhub, чтобы доставлять еду в студенческие кампусы США с помощью Роверов. Эти разработанные в Яндексе автономные роботы-курьеры созданы на основе технологий беспилотных автомобилей и могут работать в любую погоду 24/7. Роверы ездят по тротуарам, а дороги пересекают по пешеходным переходам. С начала 2021 года в России роботы привезли тысячи заказов Яндекс.Еда и Яндекс.Лавка. А с апреля они доставляют заказы из ресторанов в американском городе Энн-Арбор в штате Мичиган. https://yandex.ru/company/press_releases/2021/07-06-2021
Яндекс открывает регистрацию на чемпионат по программированию Yandex Cup! Призовой фонд вырос в два раза и в этом году составит 6,2 млн рублей.

Участникам предложат задания по бэкенд и фронтенд-разработке, машинному обучению, мобильной разработке, аналитике и спортивному программированию.

Попробовать свои силы могут специалисты старше 18 лет из стран СНГ, трек по спортивному программированию открыт для разработчиков со всего мира. Все участники попадут на радары рекрутеров Яндекса, а разработчики, занявшие первые три места в каждом направлении, смогут пройти собеседование в Яндекс по упрощенной схеме.

Регистрация на чемпионат продлится до 3 октября: https://clck.ru/WXVoD

Присоединяйтесь!
✈️2-ой релиз TF-Ranking от Google AI
В декабре 2018 года Google AI представил TF-Ranking – open-source библиотеку на основе TensorFlow для разработки масштабируемых нейронных моделей ранжирования (LTR, learning-to-rank), которые помогают получить упорядоченный список элементов в ответ на пользовательский запрос. В отличие от стандартных моделей классификации, которые классифицируют по одному элементу за раз, LTR-модели получают полный список элементов в качестве входных данных и ищут порядок, который максимизирует полезность всего списка. Больше всего эти LTR-модели распространены в поисковых и рекомендательных системах, но TF-Ranking также применяется в электронной коммерции, построении умных пространств и городов.
В мае 2021 года Google AI выпустил второй релиз TF-Ranking, который обеспечивает полную поддержку встроенного построения LTR-моделей с использованием Keras, высокоуровневого API TensorFlow 2. Модель ранжирования Keras имеет новый дизайн workflow, в т.ч. гибкий ModelBuilder и DatasetBuilder для настройки обучающей выборки, а также конвейер для обучения модели. Также эта версия TF-Ranking поддерживает RaggedTensors, обучающую библиотеку Orbit и еще множество улучшений.
А благодаря углубленному изучению возможностей библиотеки TF-Ranking, команда Google AI создала модель Data Augmented Self-Attentive Latent Cross (DASALC), которая комбинирует преобразование фичей нейросетей с обогащением данных, ансамблевыми методами и ранжированием потерь. DASALC позволяет устранить недостатки LTR-моделей и деревьев решений с градиентным бустингом, сохранив достоинства этих методов.
https://ai.googleblog.com/2021/07/advances-in-tf-ranking.html
https://research.google/pubs/pub50030/
🏸Что такое мульти-задачное машинное обучение?
Обычно одна ML-модель решает одну задачу, например, классификация изображений или синтез текста. Это называется однозадачное обучение (STL, single-task learning). Но некоторые модели позволяют делать несколько видов прогнозов на одной выборке, например, классификация изображений и семантическая сегментация. Это уже многозадачное обучение (MTL, Multi-task learning). Основными плюсами MTL являются следующие:
меньший объем обучающей выборки для каждой из отдельных задач за счет укрупнения общего набора данных;
улучшенное обобщение модели – информация из связанных задач повышает способность модели извлекать полезные данные из датасета и снижает переобучение;
сокращение длительности обучения – вместо того, чтобы тратить время на обучение множества моделей для решения нескольких задач, обучается единая модель;
снижение требований к аппаратным ресурсами - ML-модели имеют много параметров, которые необходимо хранить в оперативной памяти. Поэтому для устройств с ограниченной вычислительной мощностью, IoT, лучше иметь одну MTL с некоторыми общими параметрами, а не несколько STL-моделей, которые выполняют ряд связанных задач.
Обратной стороной этих достоинств является снижение производительности. Во время MTL-обучения задачи могут конкурировать друг с другом. Например, когда сегментация экземпляра (сегментирование отдельной маски для каждого отдельного объекта в изображении) обучается вместе с семантической сегментацией (классификация объектов на уровне пикселей), последняя задача часто доминирует, если не использовать механизм балансировки задач.
Кроме того, функция потерь MTL сложнее в результате суммирования отдельных потерь, что затрудняет оптимизацию. Здесь возникает так называемый эффект отрицательной передачи при выполнении нескольких задач и отдельные STL-модели могут работать лучше единой MTL.
В перспективе многозадачное машинное обучение отлично подходит для обработки естественного языка и медицинских исследований, однако сегодняшняя реализация этого подхода еще не полностью покрывает его текущие недостатки.
https://thegradient.pub/how-to-do-multi-task-learning-intelligently/
⚡️ Ситимобил запускает митапы о применении Data Science в городских и геосервисах, логистике и технологиях умных городов - Citymobil Data Meetup.
Первый митап состоится 12 августа в 18:00, онлайн.
Звездный состав спикеров с очень интересными темами:
🚕 Артём Солоухин (Product Owner Surge Pricing в Ситимобил) поделится своими знаниями о «Switchback-экспериментах и сетевом эффекте»
🏢 Андрей Критилин (Руководитель центра моделирования ЦИАН) расскажет о «Работе с географически неоднородными данными в моделях онлайн-оценки»
🚖 Фёдор Лаврентьев (Head of Internal Efficiency в Yandex Go) выступит с докладом «Границы Москвы: эволюция географии в отчетности Яндекс Такси»
После докладов будет дискуссия со спикерами в которой смогут принять участия слушатели.
Ведущий мероприятия – Алексей Чернобровов.
❗️Регистрация по ссылке: https://citymobil.timepad.ru/event/1730682/
🔥В 2 раза больше денег от Яндекса: увеличение призового фонда чемпионата по программированию Yandex Cup 2021
Получите свою часть из 6,2 млн рублей, решив реальные задачи одного из 6 треков:
• фронтенд-разработка
• бэкенд-разработка
• мобильная разработка
• аналитика
• машинное обучение
• спортивное программирование.
В этом году ML-трек состоит из четырех направлений:
• анализ текстов на естественном языке
• компьютерное зрение
• распознавание речи
• рекомендательные системы.
Можно выбрать одно направление или участвовать во всех сразу с 20 сентября по 20 октября. Победителей будет четверо, каждый получит 300 000 рублей. Регистрация на чемпионат уже открыта: подайте заявку до 3 октября. С 20 по 26 сентября пройдет пробный тур для знакомства с форматом задач и системой проверки, а с 27 сентября по 3 октября вас ждут реальные соревнования. Финал чемпионата состоится 16 октября.
https://yandex.ru/cup/
🙌🏻Apache Superset – открытый фреймворк для BI и DS-анализа
Став проектом Apache в 2017 году, Superset является мощным BI-инструментом визуализации больших данных, который позволяет пользователям быстро и легко создавать дэшборды, используя простой код, бесплатный конструктор визуализаций и самый продвинутый редактор SQL. Для корпоративного использования особенно важна поддержка разных backend’ов аутентификации (OpenID, LDAP, OAuth, REMOTE_USER) и интеграция со многими СУБД на основе SQL через библиотеку SQLAlchemy. Superset основан на Python, поэтому для его использования рекомендуется сначала установить дистрибутив Anaconda, включающий набор нужных DS-библиотек. Преимущества Apache Superset уже оценили Airbnb, Netflix, Twitter, Yahoo! и множество других компаний, включив его в свои DS-проекты. https://superset.apache.org/
Big Data Science [RU] pinned «⚡️ Ситимобил запускает митапы о применении Data Science в городских и геосервисах, логистике и технологиях умных городов - Citymobil Data Meetup. Первый митап состоится 12 августа в 18:00, онлайн. Звездный состав спикеров с очень интересными темами: 🚕 Артём…»
🎯ТОП-3 доклада с международной конференции по Learning Representations 2021: краткий обзор от Zeta Alpha
С помощью собственного навигатора по исследованиям ИИ-компания Zeta Alpha составила выжимку из более 800 докладов ICLR 2021, с учетом цитирования и популярности авторов.
1. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale (Алексей Досовицкий, Лукас Бейер, Александр Колесников, Дирк Вайссенборн, Сяохуа Чжай и др.). Трансформеры, применяемые непосредственно к фрагментам изображений и предварительно обученные на больших датасетах, хорошо работают при классификации изображений и могут превзойти лучшие CNN на больших изображениях. https://openreview.net/forum?id=YicbFdNTTy
2. Rethinking Attention with Performers (Кшиштоф Чоромански, Валерий Лихошерстов, Дэвид Дохан, Синю Сонг, Андреа Гейн, Тамас Сарлос, Питер Хокинс, Джаред Дэвис и др.). Performers, линейные трансформеры с полным рангом и вниманием с помощью методов доказуемой аппроксимации случайных признаков, эффективно работают, не полагаясь на разреженность или низкий ранг. Авторы предлагают матричную декомпозицию механизма самовнимания на матрицы ниже, которые имеют комбинированную сложность, линейную относительно. длина последовательности L: O (Ld²log (d)) вместо O (L²d). https://openreview.net/forum?id=Ua6zuk0WRH
3. PMI-Masking: Principled masking of correlated spans (Йоав Левин и др.). Совместное маскирование коррелированных токенов значительно ускоряет и улучшает предварительное обучение BERT. Вместо случайного маскирования токенов авторы идентифицируют - используя только статистику корпуса - диапазоны токенов, которые сильно коррелированы. Для этого они расширяют точечную взаимную информацию между парами токенов до промежутков произвольной длины и показывают, как обучение BERT с этой целью обучается более эффективно, чем альтернативы, такие как равномерное маскирование, маскирование всего слова, случайное маскирование диапазона и т.д. Эта стратегия работает, не позволяя моделям предсказывать замаскированные слова, а заставляя ее использовать очень мелкие корреляции слов, которые часто появляются рядом друг с другом, чтобы повысить степень изучения более глубоких корреляции в естественном языке. https://openreview.net/forum?id=3Aoft6NWFej
Полный обзор ICLR от Zeta Alpha смотрите здесь: https://www.zeta-alpha.com/post/iclr-2021-10-papers-you-shouldn-t-miss
Reminder!
Сегодня! 12 августа в 18:00 будет проходить первый митап из серии Citymobil Data Meet-up!
Будем говорить про логистику, городские данные и технологии умных городов, обсудим роль геоданных и проблемы, которые с ними возникают.
Присоединяйтесь к нам, будем разбираться вместе))
Выступают:
- Артем Солоухин (Ситимобил)
- Андрей Критилин (ЦИАН)
- Фёдор Лаврентьев (Яндекс Go)
Не забудьте подготовить вопросы спикерам, после докладов будем общаться и у вас будет возможность их задать 🙂
Ссылка: https://tulu.la/chat/city-mobil-00002d/meetup-0002fv
Как настроить гиперпараметры для надежного повышения точности ML-модели: подробный guide
ML-модель и ее предварительная обработка индивидуальны для каждого проекта: гиперпараметры зависят от обрабатываемых данных. Например, в алгоритме логистической регрессии есть разные гиперпараметры (solver, C, penalty), разные комбинации которых дают различные результаты. Аналогично, существуют настраиваемые параметры для машины опорных векторов: gamma, C. Эти гиперпараметры алгоритмов доступны на сайте бесплатной Python-библиотеки Sklearn. Однако, часто разработчику приходится создавать собственные решения, не полагаясь на готовые рекомендации, чтобы разработать ML-модель с высокой точностью, которая зависит от наилучшего сочетания гиперпараметров. Читайте в статье про тестирование различных комбинаций Grid-поиска с библиотекой Sklearn и без нее, проверка результатов кросс-валидацией и выводы насчет эффективности утилизации ресурсов ЦП. https://towardsdatascience.com/evaluating-all-possible-combinations-of-hyperparameter
✍🏻SoundStream новый нейронный аудиокодек от Google AI
SoundStream эффективно сжимает речь, музыку и звук с битрейтами, которые обычно используются кодеками обработки для речи. SoundStream опирается на модельную архитектуру, состоящую из сверточной сети кодировщика/декодера и квантователя остаточного вектора, которые обучаются совместно. Благодаря обучению со структурированным отключением на слоях квантователя, одна модель может работать с переменными битрейтами от 3 до 18 кбит/с. Это сравнимо с качеством моделей, обученными с фиксированными битрейтами. Также модель поддерживает реализацию с низкой задержкой и потоковом выводом в режиме реального времени на процессоре смартфона.
Нейросеть состоит из кодировщика, декодера и квантователя. Кодер преобразует входной аудиопоток в кодированный сигнал, который сжимается с помощью квантователя, а затем преобразуется обратно в аудио с помощью декодера. После обучения кодер и декодер можно запускать на разных клиентах для эффективной передачи высококачественного звука по сети. Оценить результаты работы SoundStream и подробнее узнать, как решается проблема квантования кодовых векторов можно здесь: https://ai.googleblog.com/2021/08/soundstream-end-to-end-neural-audio.html
✈️Новый алгоритм управления дронами от MIT
Аэрокосмические инженеры MIT разработали алгоритм, который помогает дронам находить самый быстрый маршрут бесперебойного прохождения препятствий. Это объединяет моделирование полета беспилотника через виртуальную полосу препятствий с данными экспериментов реального дрона, пролетающего по тому же маршруту в физическом пространстве.
Исследования показали, что дрон, обученный по новому алгоритму, пролетел через простую полосу препятствий на 20% быстрее. При этом в некоторых случаях направленный на глобальную, а не локальную оптимизацию, алгоритм замедлял полет дрона, чтобы пройти сложный поворот или сэкономить энергию. Это помогло в конечном итоге обогнать соперников.
https://news.mit.edu/2021/drones-speed-route-system-0810
🚀Компания ATF Media (https://t.me/atflife ) решила сделать визионерский проект в помощь всем разработчикам продуктов на ИИ.

Запускается международный каталог продуктов, реализованных на искусственном интеллекте TopAI.me
Каталог будет рассылаться в более чем 25000 крупнейших компаний, правительствам стран, венчурным фондам.
В каталоге представлены решения из разных сфер разработки искусственного интеллекта.
Если вы являетесь разработчиками в сфере ИИ, наш каталог будет полезен вам для поиска инвесторов и интересных сотрудничеств.
Если вы являетесь инвестором и в поиске проектов, то наш каталог будет полезен вам для поиска новых инструментов для инвестирования и внедрения.

Отбор проектов по модерации.
P.S. Регистрация на TopAI занимает 20 секунд.
🏸FastMoE - распределенная обучающая система Mixture-of-Expert (MoE)
Система на PyTorch с общими ускорителями предоставляет иерархический интерфейс для гибкого проектирования ML-моделей и простой адаптации к таким приложениям как Transformer-XL и Megatron-LM. В отличие от прямой реализации закрытых PyTorch-моделей MoE от Google, скорость обучения в FastMoE сильно оптимизирована благодаря сложным высокопроизводительным навыкам ускорения. Система поддерживает размещение разных экспертов на нескольких графических процессорах на нескольких узлах, позволяя линейно увеличивать количество экспертов по отношению к количеству графических процессоров.
https://github.com/laekov/fastmoe
https://arxiv.org/abs/2103.13262
🔥Не только GPT-3: что такое GPT-J-6B
Мощный NLP-алгоритм GPT-3 от OpenAI не является open-source проектом. Поэтому другие компании предлагают свои альтернативные решения. Наиболее интересным сейчас из них считается GPT-J от EleutherAI с 6 миллиардами параметров. Разработчики обещают, что GPT-J обеспечит более гибкий и быстрый вывод, чем аналоги Tensorflow + TPU при выполнении различных задач нисходящей потоковой передачи.
Описание на официальном сайте EleutherAI https://6b.eleuther.ai/
Ноутбук в Google Colab https://colab.research.google.com/github/kingoflolz/mesh-transformer-jax/blob/master/colab_demo.ipynb
Код на Github https://github.com/kingoflolz/mesh-transformer-jax/#gpt-j-6b
Подробное описание на сайте одного из разработчиков https://arankomatsuzaki.wordpress.com/2021/06/04/gpt-j/
Интересное тестирование в пользовательских кейсах https://minimaxir.com/2021/06/gpt-j-6b/
🌸Новости из MIT: новый вероятностный язык программирования на базе ИИ
Он может беспристрастно оценивать «справедливость» ИИ-алгоритмов точнее и быстрее существующих альтернатив. Этот язык сумм-произведений (SPPL, Sum-Product Probabilistic Language) представляет собой систему вероятностного программирования - новой области на пересечении языков программирования и ИИ, которая упрощает разработку AI-решений с помощью вероятностных моделей и объяснений наблюдаемых данных.
SPPL предлагает улучшенную гибкость и надежность благодаря выразительности языка, его точной и простой семантике, а также скорости и надежности механизма точного символьного вывода. Это позволяет избежать ошибок, ограничиваясь тщательно разработанным классом ИИ-моделей, включая классификаторы дерева решений. SPPL работает путем компиляции вероятностных программ в специализированную структуру данных, называемую «выражением суммы-произведения». Однако, этот подход не может анализировать нейросети, хотя и работает быстрее других подобных решений. SPPL реализован на Python и доступен с открытым исходным кодом.
https://news.mit.edu/2021/exact-symbolic-artificial-intelligence-faster-better-assessment-ai-fairness-0809
https://github.com/probcomp/sppl
👻Что такое AIOps и чем это отличается от MLOps
MLOps -
это междисциплинарный подход к управлению методами машинного обучения как автономными продуктами с собственным жизненным циклом, с фокусом на разработке, масштабировании и применении ML-алгоритмов в работе на постоянной основе.
MLOps направлен на преодоление разрыва между созданием ML-моделей и их сопровождением, а AIOps фокусируется на автоматизации управления инцидентами и интеллектуальном анализе первопричин.
Решения AIOps используют все данные отслеживания и отчетности, а также журналы для обнаружения событий и применения машинного обучения и глубокого обучения для уведомления ИТ-операций о любых проблемах или сбоях.
Цель AIOps - повысить эффективность ИТ-операций за счет автоматизации диагностики событий и использования машинного обучения для точного определения первопричин. Эти средства защиты предоставляют техническим командам высококачественные данные, которые легко понять, проанализировав искажения, полученные с помощью технологий мониторинга, и уменьшив количество ложных срабатываний, позволяя им выполнять функцию при принятии решения. AIOps выходит за рамки предотвращения простоев и включает в себя сдерживание затрат, безопасность и соблюдение политик с помощью ИИ для улучшения ИТ-операций.
MLOps помогает командам выбрать, какие инструменты, методологии и документация помогут их ML-моделям выйти в production, а AIOps – помогает командам автоматизировать жизненные циклы своих технологий.
Наибольший эффект дает совместное использование MLOps и AIOps.
https://ai.plainenglish.io/whats-the-difference-between-aiops-and-mlops-15316cfa803d
👆🏻BYOL - Bootstrap Your Own Latent
BYOL – новый подход к самостоятельному обучению представлению изображений с 2-мя нейросетями, которые взаимодействуют и учатся друг у друга. Онлайн-сеть учится на основе представления, сделанного целевой сетью на одном и том же изображении с различными дополнениями. Базовая архитектура BYOL - это существующая ResNet50 или другие подобные архитектуры. Вход x дополняется до t и t ’, которые передаются через онлайн и целевую сеть отдельно.
Разница между онлайн и целевой сетями в том, что первая имеет MLP-архитектуру с двумя полностью связанными слоями, а также Relu и batchnorm между ними. Представление онлайн-сети учится на представлении, создаваемом целевой сетью. Онлайн-сеть обновляется функцией потерь регрессии, цели которой задаются целевой сетью. А параметры целевой модели обновляются экспоненциальной скользящего среднего онлайн-сети, позволяя обрабатывать больше информации и избежать коллапса решений.
Производительность BYOL соответствует сравнению с архитектурой контролируемого обучения SOTA. Есть небольшое снижение производительности при использовании только случайного кадрирования в качестве увеличения изображения, но BYOL показывает лучшие результаты, чем SimCLR, итеративно обучаясь на предыдущих версиях своих выходных данных без использования отрицательных пар с протоколом линейного классификатора. Однако, пока BYOL-подходе еще не применим к задачам обработки текста, видео, аудио.
https://www.youtube.com/watch?v=YPfUiOMYOEE
https://ai.plainenglish.io/byol-bootstrap-your-own-latent-dacee62a3dc8
https://arxiv.org/abs/2006.07733
https://arxiv.org/abs/2010.10241
https://github.com/lucidrains/byol-pytorch