Big Data Science [RU]
1.62K subscribers
78 photos
9 videos
543 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏https://t.me/bdscience — Big Data Science channel (english version)
💼https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
Channel created
☀️Февраль 2021 богат на множество DS-событий, из которых мы отобрали для вас самые интересные. Выбирайте онлайн или офлайн-митап, конференцию, хакатон и участвуйте!💥
• 03-05.02.21 - OpenTalks.AI – ведущая независимая открытая ИИ-конференция в России. Лучшие российские докладчики со всех топовых международных конференций по ML/DL на одной площадке. 3 дня, 4 трека: Natural Language Processing, Computer vision, Predictive analytics, Reinforcement learning & AGI. Москва https://opentalks.ai/
• 03-05.02.21 - кейс-баттл Youngtech в рамках форума Effie TECH по технологиям в маркетинге для студентов последних курсов любого ВУЗа, которые хотят построить карьеру в сфере технологий, инноваций и big data. Решаем реальные бизнес-кейсы партнеров форума онлайн http://youngtech.tilda.ws/
• 03.02.21 в 19:00 МСК - Data Denormalization - онлайн-митап от Health Samurai, разработчика web и mobile решений для здравоохранения (облачные системы для клиник, электронные медкарты, аналитика медицинских данных, телемедицина). Поговорим, что такое денормализация данных, зачем это нужно и как оно реализуется. Ссылка в Zoom & Youtube-трансляцию придет после регистрации https://health-samurai.timepad.ru/event/1537686/
• 04.02.21 в 17:00 МСК - Вебинар "Разворачиваем приложение на Apache Spark в Kubernetes. Пошаговый рецепт" от Mail.ru Cloud Solutions. Все DevOps-шаги, от развертывания Kubernetes-кластера в облаке MCS до сборки Docker-образа со Spark-приложением. https://events.webinar.ru/mcs/spark
• 10.02.21 – 01.04.21 – серия открытых вебинаров от Intel CV Academy по компьютерному зрению, глубокому обучению и оптимизации производительности алгоритмов https://jsc-intel.timepad.ru/event/1446273
• 11.02.21 в 16:00 МСК – вебинар «Новое в Yandex DataSphere для ML-разработки» - узнайте, как как получить доступ к режиму Early Access Version, попробовать новые функции, использовать индикацию загрузки памяти и CPU, TensorBoard и новые фоновые операции https://cloud.yandex.ru/events/301
• 12.02.21 в 11:00 МСК – Forum.Digital Telecom 2021 - отраслевой цифровой онлайн-форум при участии государства, бизнеса и стартапов для глобальной перезагрузки и пересмотра трендов цифровизации сферы телекоммуникаций https://forum.digital/telecom
• 17-18.02.21 в 10:00 МСК - DIGITAL OIL&GAS Online Conf: Цифровая трансформация нефтегазового сектора. Практические кейсы нефтегазовых лидеров из России, СНГ, Европы и Азии про применение перспективных решений для нефтегазовой отрасли на основе технологий IIoT, ИИ, Big Data и предиктивной аналитики, цифровых двойников, 3D, AR|VR, робототехники, дронов и пр. технологий https://smartgopro.com/digitaloilgas/
• 18.02.21 в 09:30 МСК – Конференция «Качество Данных» для руководителей и DS-специалистов пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
• 25.02.21 в 09:00 МСК – «Ликбез по использованию данных» - единственная в России конференция по вопросам эффективного использования данных от компании OSP (Открытые системы) пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
Channel photo updated
💐В марте 2021 нас ждут интересные события: митапы, конференции, хакатоны и другие познавательные мероприятия для DS-любителей и профессионалов, большинство из которых пройдет онлайн и абсолютно бесплатно по предварительной регистрации. Выбирайте свой ивент и участвуйте!
02 марта - Cloud Day от Яндекса для сферы образования: узнайте, как технологии Yandex.Cloud помогают образовательным учреждениям решать задачи цифровой трансформации. Особенно выделим доклад Алёны Дробышевской «Сервисы Yandex.Cloud для ML-разработчиков» о Yandex DataSphere, который объединяет наиболее востребованные инструменты и динамически масштабируемые ресурсы для анализа данных, разработки и эксплуатации моделей машинного обучения. Начало в 20:00 по МСК онлайн https://cloud.yandex.ru/events/304
06 марта - День открытых данных от Ассоциации участников рынка данных в рамках международной инициативы International Open Data Day: лекции, дискуссии, мастер-классы и вручение премии Moscow Dataviz Awards за проекты на основе открытых данных. Начало в 11:00 по МСК онлайн https://opendataday.ru/msk
18-19 марта – финал профессионального конкурса "ПРОФ-IT.Инновация" по новым решениям в области цифровизации, которые могут быть использованы в государственном и муниципальном управлении, способствуют достижению цифровой зрелости ключевых отраслей экономики и социальной сферы. Начало в 10:00 по МСК онлайн http://digit.d-russia.ru/
19 марта – онлайн-митап от Яндекс.Дзен по стратегиям ценообразования, рекомендательным методам и алгоритмам: примеры и бизнес-кейсы, а также квест с призами. Начало в 19:30 по МСК онлайн https://events.yandex.ru/events/zen-meetup/19-03-2021
25 марта – ежегодный Форум BIG DATA: data-driven бизнес-проекты, глубокая аналитика как инструмент принятия решений, практическое применения прорывных алгоритмов искусственного интеллекта. Вас ждет встреча с топ-менеджерами цифровой трансформации и ведущими DS/ML-экспертами из госуправления и коммерческих компаний. Москва, EVENT-холл ИнфоПространство (1-й Зачатьевский пер., д. 4) и онлайн-трансляция https://www.osp.ru/lp/bigdata2021
30-31 марта - Data Fusion - международная конференция и финал соревнования по синергии межотраслевых данных и качественно новым модельным подходам к их монетизации и объединению. Ведущие игроки бизнеса и научного сообщества обсудят последние DS-решения, которые позволяют обеспечить новый уровень персонализации общения с клиентом. Начало в 15:00 по МСК онлайн https://data-fusion.ru/conference/
🌷Третий – не лишний: к LightGBM и XGBoost присоединился еще один ML-алгоритм вероятностного прогнозирования - Natural Gradient Boosting (NGBoost). Выпущенный в 2019 году, NGBoost состоит из трех абстрактных модулей: базового обучающегося, параметрического распределения вероятностей и оценочных правил. Все три компонента рассматриваются как гиперпараметры, выбранные заранее перед обучением. NGBoost упрощает вероятностную регрессию с помощью гибких древовидных моделей и позволяет проводить вероятностную классификацию, возвращая вероятности по каждому классу. Например, логистическая регрессия возвращает вероятности классов в качестве выходных данных. Эксперименты с несколькими наборами данных регрессии доказали, что NGBoost обеспечивает конкурентоспособные прогностические характеристики как оценок неопределенности, так и традиционных показателей. С другой стороны, его время вычисления намного больше, чем у других двух алгоритмов, и нет некоторых полезных опций, например, отсутствует ранний останов, отображение промежуточных результатов, гибкость выбора базового обучающегося параметра, установка случайного начального состояния. Несмотря на то, что пока можно работать лишь с деревом решений и регрессией Риджа, этот ML-алгоритм вероятностного прогнозирования показывает весьма достойные результаты в сравнении с другими популярными градиентными методами.
Подробнее о том, как работает NGBoost, читайте здесь:
http://www.51anomaly.org/pdf/NGBOOST.pdf
https://medium.com/@ODSC/using-the-ngboost-algorithm-8d337b753c58
https://towardsdatascience.com/ngboost-explained-comparison-to-lightgbm-and-xgboost-fda510903e53
https://www.groundai.com/project/ngboost-natural-gradient-boosting-for-probabilistic-prediction/1
🔥19 марта прошел Яндекс Дзен-митап: алгоритмы и рекомендации. Для тех, кто не смог, по той или иной причине, посмотреть это классное онлайн-мероприятие, оставляем ссылку на видео — https://youtu.be/VDhwkOi5Yvo.

Программа митапа была довольно насыщенная и состояла из следующих тем:
— «Aquarius: рекомендации с ограничениями в Яндекс.Дзен» Борис Шарчилев, Яндекс.Дзен
— «Как многорукие бандиты главную страницу оптимизировали» Турал Гурбанов, ivi
​— «Многорукие бандиты в динамическом ценообразовании» Алексей Чернобровов, Консультант по data science

Приятного просмотра, и ставьте пальцы вверх!;)
🌻Весна в самом разгаре, пора просыпаться от зимней спячки, учиться новому и заводить еще больше друзей в Data Science – встречаемся онлайн и офлайн на митапах, конференциях, форумах и прочих познавательных мероприятиях для DS-любителей и профессионалов. Выбирайте апрельское событие по вкусу и участвуйте!
3 апреля в 15:00 МСК - День открытых дверей знаменитой Школы анализа данных Яндекса-2021: узнайте о программе, процессе отбора, различиях между направлениями обучения и совместных программах с ВУЗами https://events.yandex.ru/events/den-otkrytyh-dverej-sh-ad
8-9 апреля — международная практическая онлайн-конференция по продвинутой продуктовой аналитике Aha! от команды Матемаркетинга – 30 лекций и дискуссий и 10 мастер-классов https://aha.matemarketing.ru/
15 апреля – конференция «Большие данные и аналитика 2021» от CNews – 14 докладов от CDO, ТОП-менеджеров цифровой трансформации и ведущих Data Scientist’ов из банков, страховых компаний, телекома, ритейла и других бизнесов https://events.cnews.ru/events/bolshie_dannye_i_analitika_2021.shtml
16 апреля в 19:00 МСК – онлайн-митап от Яндекса «Большая дата» для аналитиков, дата-сайентистов и ML-специалистов: 3 тематических доклада и дискуссии по интересам https://events.yandex.ru/events/bolshaya-data/16-04-2020/
22 апреля – 9-я межотраслевая конференция ScoringDay 2021 о современных технологиях продвинутого анализа данных для развития компаний-лидеров на финансовом рынке. Ключевая тема конференции – «Data Science: выйти в топ» https://scorconf.ru/
22-23 апреля в 10:00 МСК - конференция о технологиях в ритейле - Retail TECH, новое мероприятие, которое стартовало в 2020 году, чтобы объединить участников рынка ритейла для обсуждения технологий и инноваций. https://retailtech.ru/konferencziya/
24 апреля в 10:00 МСК – онлайн-конференция Data Science fwdays’21 - 300 минут докладов, диалогов, дискуссий экспертов, а также знакомства, новые технологии, инструкции, а также контент о Data Science буднях https://fwdays.com/en/event/data-science-fwdays-2021
27–29 апреля в 10:00 МСК - XX Юбилейный Customer Contacts World Forum – доклады и мастер-классы от экспертов, визиты в действующие контактные центры крупнейших российских компаний, вечерние networking-мероприятия и выставка прикладных решений по клиентской аналитике, цифровизации, автоматизации и роботизации сервисных бизнес-процессов с помощью AI, ML, Big Data и DS https://ccwf.ru/
28 апреля в 10:00 МСК - конференция «Big Data и BI Day 2021» от TAdviser для руководителей, бизнес-аналитиков, разработчиков аналитических решений, специалистов по технологиям Big Data и Data Science https://www.tadviser.ru/index.php/Конференция:Конференция_Big_Data_и_BI_Day_2021
👍🏻Будьте здоровы с DCNN!
В течение многих лет врачи полагались на визуальный осмотр для выявления подозрительных пигментных поражений (SPL), которые могут указывать на рак кожи. Выявление SPL на ранней стадии помогает оперативно выявить меланомы и значительно снизить стоимость лечения. Но быстро найти SPL и определить их важность не так-то просто из-за большого объема пигментных поражений. Исследователи из MIT разработали новый ИИ-конвейер на глубоких сверточных нейросетях (DCNN, deep convolutional neural networks) и реализовали его для анализа SPL через камеру обычного смартфона. Система автоматически обнаруживает, извлекает и анализирует все пигментные поражения кожи, наблюдаемые на широкоугольном фотоснимке. Предварительно обученные ML-модели DCNN определяют подозрительность отдельных пигментных образований и маркируют их: нужен дальнейший осмотр - желтым, требуется направление к дерматологу - красным. Извлеченные признаки используются для последующей оценки пигментных поражений и отображения результатов в виде тепловой карты. Напомним, DCNN – это алгоритмы глубокого обучения, которые используются для классификации изображений с последующей их кластеризацией, например, при поиске по фотографиям.
https://news.mit.edu/2021/artificial-intelligence-tool-can-help-detect-melanoma-0402
🏂Как повысить качество производства продукции на 25% с помощью ИИ: опыт Fujitsu
Японский технологический гигант разработал AI-систему, которая выявляет отклонения во внешнем виде продукции, чтобы определить производственные проблемы еще до того, как материалы будут потрачены впустую.
ML-модель, обученная на смоделированных изображениях продуктов с отклонениями, способна обнаруживать различные проблемы. Например, изношенная резьба, дефектный рисунок проводки на разноцветных коврах или электронных деталях с разной формой проводов. ML-алгоритм получил высокую оценку качества: показатель AUROC составляет более 98%. Технология была протестирована на заводе Fujitsu в Нагано, который производит электронное оборудование. В результате трудозатраты на проверку качества печатных плат были уменьшены на ¼ от первоначального количества человеко-часов.
https://artificialintelligence-news.com/2021/03/29/fujitsu-develops-ai-product-abnormalities-manufacturing/
🤠В январе 2021 года Open.AI представила новую ML-модель, нейронную сеть под названием DALL·E, которая создает изображения из текстовых подписей к понятиям естественного языка. Она имеет 12 миллиардов параметров и основана на GPT-3. DALL·E обучен генерировать изображения из текстовых описаний, используя набор данных из пар текст-изображение. Сеть может создавать антропоморфизированные версии животных и предметов, комбинировать несвязанные концепции правдоподобными способами, отображать тексты и применять преобразования к существующим изображениям.
Как и GPT-3, DALL·E - это языковая модель-трансформер: она получает текст и изображение в виде единого потока данных, содержащего до 1280 токенов, и обучается с максимальной вероятностью генерировать все токены один за другим. Токен - это любой символ из дискретного словаря, например, каждая английская буква - это токен из 26-буквенного алфавита. В словарном запасе DALL·E есть символы текстовых и графических концепций. В частности, каждая подпись изображения представлена с использованием максимум 256 токенов, закодированных с помощью BPE, с размером словаря 16384, а изображение представлено с использованием 1024 токенов из словаря размером 8192.
Во время обучения изображения предварительно обрабатываются до разрешения 256x256. Подобно VQVAE, каждое изображение сжимается до сетки 32x32 дискретных скрытых кодов с использованием дискретного предварительно обученного VAE. Это обеспечивает масштабирование до больших размеров словаря и позволяет DALL·E генерировать изображение с нуля и регенерировать любую прямоугольную область существующего изображения до нижнего правого угла в соответствии с текстовой подсказкой.
https://openai.com/blog/dall-e/
Оффер от Яндекса за выходные!
С 24 по 25 апреля пройдёт Weekend Offer для аналитиков — онлайн-встреча Яндекса, на которой можно пройти собеседования и получить оффер за выходные!
Чтобы попасть на Weekend Offer, необходимо решить 2-5 задач на платформе Яндекс.Контест. 24 апреля пройдут две часовые секции с кодом, а 25 апреля — часовые финалы с командами, на которых ваш потенциальный руководитель расскажет о сервисе, вашей роли и, возможно, даст ещё одну задачу. При взаимном интересе вы тем же вечером получите оффер.
Подробности и регистрация: https://clck.ru/UAzfb 
🙈Pandas – отличная Python-библиотека для анализа данных, которой должен владеть каждый Data Scientist. Однако, у этого инструмента нет многопроцессорной поддержки и он довольно медленно работает с большими наборами данных. Поэтому для быстрой обработки действительно больших массивов информации следует выбирать Vaex и Dask.
👍🏻Dask https://dask.org/ - библиотека анализа данных на базе Pandas с параллельными вычислениями и масштабируемой производительностью. Кроме Pandas, она также интегрирована с библиотеками Numpy и Scikit-learn, упрощая переключение между ними за счет API-интерфейсов на Python и структур данных.
👍🏻Vaex https://vaex.io/docs/index.html - высокопроизводительная Python-библиотека для отложенных вычислений с «ленивыми» датафреймами, аналогичных Pandas, а также визуализации и агрегирования Big Data. Она позволяет вычислять базовую статистику по миллиарду строк в секунду, но, в отличие от Dask, не полностью интегрирована с другими библиотеками.
🤜🏻 З простых Python-функции для работы с пропусками в датасете для ML
fillna() - функция из пакета Pandas для заполнения нулевых (NA/NaN) значений в данных. Она возвращает объект, в котором заполнены нулевые и отсутствующие значения: Series.fillna (значение = None, method = None, axis = None, inplace = False, ** kwargs)
dropna() - функция для удаления нулевых значений из данных разными способами. Она анализирует и удаляет строки/столбцы, в которых есть отсутствующие или неопределенные значения (NaN). Значение параметра axis указывает, со строками или столбцами нужно работать: 0 – удаление строк с пропущенными значениями, а axis=1 удалит столбцы с пропусками. DataFrame.dropna (axis = 0, how = ’any’, thresh = None, subset = None, inplace = False)
interpolate() – функция для заполнения отсутствующих значений/NaN с использованием разных методов интерполяции. DataFrame.interpolate(method=’linear’, axis=0, limit=None, inplace=False, limit_direction=’forward’, limit_area=None, downcast=None, **kwargs)
🙌🏻6 типов RNN для моделирования последовательных данных
Зачем моделировать последовательные данные и почему это не так-то просто. Решаем задачу с помощью рекуррентных нейросетей: много математики и наглядных иллюстраций, а также подробный пример реализации RNN в Keras / Tensorflow и Python.
https://neptune.ai/blog/recurrent-neural-network-guide
🥁Как понять и разработать ИИ путем поиска и выделения репрезентативных сценариев: инструмент Bayes-TrEx от исследований MIT
Одной точности ML-результатов недостаточно, чтобы уверенно использовать их в любой области. Фокус только на этом показателе может привести к опасным упущениям. Модель может совершать ошибки с высокой степенью уверенности, сталкиваясь с чем-то ранее невидимым, например, когда беспилотный автомобиль видит новый дорожный знак. Чтобы улучшить взаимодействие человека и ИИ, группа исследователей из Лаборатории компьютерных наук и искусственного интеллекта Массачусетского технологического института создала новый инструмент под названием Bayes-TrEx, который позволяет разработчикам и пользователям повысить прозрачность своих AI-моделей. Это делается за счет поиска конкретных примеров, которые приводят к определенному поведению. В методе используется байесовский апостериорный вывод, широко используемый математический аппарат для рассуждения о неопределенности модели.
В ходе экспериментов метод Bayes-TrEx тестировался на нескольких наборов данных, позволив обнаружить новые идеи, которые ранее не учитывались стандартными оценками, сосредоточенными исключительно на точности прогнозов. Bayes-TrEx можно применять в медицинской диагностике, системах автономного вождения, робототехнике и пр. Метод поможет разрешить новые проблемные ситуации заранее и позволит разработчикам исправить любые нежелательные результаты до того, как случатся потенциальные трагедии или впустую потратятся ресурсы.
https://news.mit.edu/2021/more-transparency-understanding-machine-behaviors-bayes-trex-0322
🥁Как удалить дубли в датасете при работе с Apache Spark?
Используйте следующие методы API-интерфейсов фреймворка:
distinct() ¬- самый простой и часто использующийся способ убрать из датафрейма идентичные повторяющиеся строки
dropDuplicates() – в отличие от distinct(), который не принимает аргументов вообще, в аргументах dropDuplicates() можно указать подмножество столбцов для удаления повторяющихся записей. Поэтому dropDuplicates(Seq <String> colNames) больше подходит, когда нужно обработать только некоторые столбцы из исходного набора данных.
reduceByKey() – возвращает новый RDD - распределенный набор данных из пар «ключ-значение» (K, V), в котором все значения для одного ключа объединяются в кортеж - ключ и результат выполнения функции reduce для всех значений, связанных с этим ключом. Этот метод удаления дублей ограничен размером Scala-кортежа, который содержит от 2 до 22 элементов. Поэтому reduceByKey() не стоит использовать, когда в ключах или значениях Spark RDD более 22 столбцов.
collect_set() - функция из API-интерфейса Spark SQL собирает и возвращает набор уникальных элементов. Она не является детерминированной, т.к. порядок результатов зависит от порядка строк, который может измениться после перемешивания, и представляет собой не «настоящую» дедупликацию. По сути, collect_set() – это сворачивание записей путем выполнения groupBy() и сбора уникальных значений для столбца, относящегося к каждой группе.
написать собственную оконную функцию, чтобы обойти ограничение размера кортежей Scala. Например, разделить RDD по столбцам, отсортировать их и отфильтровать нужные значения.
Методы удаления дубликатов в Apache Spark
Что такое Graph Transformer и как работает эта NN-модель
Нейронные сети на основе трансформаторов в NLP-задачах позволяют обойти ограничения рекуррентных нейронных сетей (RNN), вызванные последовательной обработкой. Сопоставляя слова в предложении и комбинируя полученную информацию, они могут генерировать абстрактные представления его признаков. Обучение на графах с графическими нейронными сетями (GNN) из нескольких параметризованных слоях стало мощным инструментом глубокого обучения. Каждый слой GNN берет граф с функциями узлов и ребер, строя абстрактные представления их признаков на основе доступной явной структуры связности (структуры графа). Сгенерированные таким образом признаки затем передаются на следующие уровни, чтобы спрогнозировать целевую фичу. Обобщение нейронных сетей-трансформеров до графов позволяет обучаться на графах и наборах данных с произвольной структурой, а не только на последовательных преобразователях NLP.
https://www.topbots.com/graph-transformer/
🎯Новое поколение AI-приложений с открытым API для продвинутой аналитики, от семантического поиска, обобщения и анализа тональности до генерации и перевода контента с GPT-3.
С момента первого коммерческого релиза OpenAI API от GPT-3 более 300 приложений используют его в различных категориях и отраслях, от производительности и образования до творчества и игр. Читайте 3 истории успеха https://openai.com/blog/gpt-3-apps/ и попробуйте сам продукт для своих DS-задач https://beta.openai.com/