Big Data Science [RU]
1.62K subscribers
78 photos
9 videos
543 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏https://t.me/bdscience — Big Data Science channel (english version)
💼https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
☀️Февраль 2021 богат на множество DS-событий, из которых мы отобрали для вас самые интересные. Выбирайте онлайн или офлайн-митап, конференцию, хакатон и участвуйте!💥
• 03-05.02.21 - OpenTalks.AI – ведущая независимая открытая ИИ-конференция в России. Лучшие российские докладчики со всех топовых международных конференций по ML/DL на одной площадке. 3 дня, 4 трека: Natural Language Processing, Computer vision, Predictive analytics, Reinforcement learning & AGI. Москва https://opentalks.ai/
• 03-05.02.21 - кейс-баттл Youngtech в рамках форума Effie TECH по технологиям в маркетинге для студентов последних курсов любого ВУЗа, которые хотят построить карьеру в сфере технологий, инноваций и big data. Решаем реальные бизнес-кейсы партнеров форума онлайн http://youngtech.tilda.ws/
• 03.02.21 в 19:00 МСК - Data Denormalization - онлайн-митап от Health Samurai, разработчика web и mobile решений для здравоохранения (облачные системы для клиник, электронные медкарты, аналитика медицинских данных, телемедицина). Поговорим, что такое денормализация данных, зачем это нужно и как оно реализуется. Ссылка в Zoom & Youtube-трансляцию придет после регистрации https://health-samurai.timepad.ru/event/1537686/
• 04.02.21 в 17:00 МСК - Вебинар "Разворачиваем приложение на Apache Spark в Kubernetes. Пошаговый рецепт" от Mail.ru Cloud Solutions. Все DevOps-шаги, от развертывания Kubernetes-кластера в облаке MCS до сборки Docker-образа со Spark-приложением. https://events.webinar.ru/mcs/spark
• 10.02.21 – 01.04.21 – серия открытых вебинаров от Intel CV Academy по компьютерному зрению, глубокому обучению и оптимизации производительности алгоритмов https://jsc-intel.timepad.ru/event/1446273
• 11.02.21 в 16:00 МСК – вебинар «Новое в Yandex DataSphere для ML-разработки» - узнайте, как как получить доступ к режиму Early Access Version, попробовать новые функции, использовать индикацию загрузки памяти и CPU, TensorBoard и новые фоновые операции https://cloud.yandex.ru/events/301
• 12.02.21 в 11:00 МСК – Forum.Digital Telecom 2021 - отраслевой цифровой онлайн-форум при участии государства, бизнеса и стартапов для глобальной перезагрузки и пересмотра трендов цифровизации сферы телекоммуникаций https://forum.digital/telecom
• 17-18.02.21 в 10:00 МСК - DIGITAL OIL&GAS Online Conf: Цифровая трансформация нефтегазового сектора. Практические кейсы нефтегазовых лидеров из России, СНГ, Европы и Азии про применение перспективных решений для нефтегазовой отрасли на основе технологий IIoT, ИИ, Big Data и предиктивной аналитики, цифровых двойников, 3D, AR|VR, робототехники, дронов и пр. технологий https://smartgopro.com/digitaloilgas/
• 18.02.21 в 09:30 МСК – Конференция «Качество Данных» для руководителей и DS-специалистов пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
• 25.02.21 в 09:00 МСК – «Ликбез по использованию данных» - единственная в России конференция по вопросам эффективного использования данных от компании OSP (Открытые системы) пройдет в Москве офлайн https://www.osp.ru/lp/dataquality2021
Channel photo updated
💐В марте 2021 нас ждут интересные события: митапы, конференции, хакатоны и другие познавательные мероприятия для DS-любителей и профессионалов, большинство из которых пройдет онлайн и абсолютно бесплатно по предварительной регистрации. Выбирайте свой ивент и участвуйте!
02 марта - Cloud Day от Яндекса для сферы образования: узнайте, как технологии Yandex.Cloud помогают образовательным учреждениям решать задачи цифровой трансформации. Особенно выделим доклад Алёны Дробышевской «Сервисы Yandex.Cloud для ML-разработчиков» о Yandex DataSphere, который объединяет наиболее востребованные инструменты и динамически масштабируемые ресурсы для анализа данных, разработки и эксплуатации моделей машинного обучения. Начало в 20:00 по МСК онлайн https://cloud.yandex.ru/events/304
06 марта - День открытых данных от Ассоциации участников рынка данных в рамках международной инициативы International Open Data Day: лекции, дискуссии, мастер-классы и вручение премии Moscow Dataviz Awards за проекты на основе открытых данных. Начало в 11:00 по МСК онлайн https://opendataday.ru/msk
18-19 марта – финал профессионального конкурса "ПРОФ-IT.Инновация" по новым решениям в области цифровизации, которые могут быть использованы в государственном и муниципальном управлении, способствуют достижению цифровой зрелости ключевых отраслей экономики и социальной сферы. Начало в 10:00 по МСК онлайн http://digit.d-russia.ru/
19 марта – онлайн-митап от Яндекс.Дзен по стратегиям ценообразования, рекомендательным методам и алгоритмам: примеры и бизнес-кейсы, а также квест с призами. Начало в 19:30 по МСК онлайн https://events.yandex.ru/events/zen-meetup/19-03-2021
25 марта – ежегодный Форум BIG DATA: data-driven бизнес-проекты, глубокая аналитика как инструмент принятия решений, практическое применения прорывных алгоритмов искусственного интеллекта. Вас ждет встреча с топ-менеджерами цифровой трансформации и ведущими DS/ML-экспертами из госуправления и коммерческих компаний. Москва, EVENT-холл ИнфоПространство (1-й Зачатьевский пер., д. 4) и онлайн-трансляция https://www.osp.ru/lp/bigdata2021
30-31 марта - Data Fusion - международная конференция и финал соревнования по синергии межотраслевых данных и качественно новым модельным подходам к их монетизации и объединению. Ведущие игроки бизнеса и научного сообщества обсудят последние DS-решения, которые позволяют обеспечить новый уровень персонализации общения с клиентом. Начало в 15:00 по МСК онлайн https://data-fusion.ru/conference/
🌷Третий – не лишний: к LightGBM и XGBoost присоединился еще один ML-алгоритм вероятностного прогнозирования - Natural Gradient Boosting (NGBoost). Выпущенный в 2019 году, NGBoost состоит из трех абстрактных модулей: базового обучающегося, параметрического распределения вероятностей и оценочных правил. Все три компонента рассматриваются как гиперпараметры, выбранные заранее перед обучением. NGBoost упрощает вероятностную регрессию с помощью гибких древовидных моделей и позволяет проводить вероятностную классификацию, возвращая вероятности по каждому классу. Например, логистическая регрессия возвращает вероятности классов в качестве выходных данных. Эксперименты с несколькими наборами данных регрессии доказали, что NGBoost обеспечивает конкурентоспособные прогностические характеристики как оценок неопределенности, так и традиционных показателей. С другой стороны, его время вычисления намного больше, чем у других двух алгоритмов, и нет некоторых полезных опций, например, отсутствует ранний останов, отображение промежуточных результатов, гибкость выбора базового обучающегося параметра, установка случайного начального состояния. Несмотря на то, что пока можно работать лишь с деревом решений и регрессией Риджа, этот ML-алгоритм вероятностного прогнозирования показывает весьма достойные результаты в сравнении с другими популярными градиентными методами.
Подробнее о том, как работает NGBoost, читайте здесь:
http://www.51anomaly.org/pdf/NGBOOST.pdf
https://medium.com/@ODSC/using-the-ngboost-algorithm-8d337b753c58
https://towardsdatascience.com/ngboost-explained-comparison-to-lightgbm-and-xgboost-fda510903e53
https://www.groundai.com/project/ngboost-natural-gradient-boosting-for-probabilistic-prediction/1
🔥19 марта прошел Яндекс Дзен-митап: алгоритмы и рекомендации. Для тех, кто не смог, по той или иной причине, посмотреть это классное онлайн-мероприятие, оставляем ссылку на видео — https://youtu.be/VDhwkOi5Yvo.

Программа митапа была довольно насыщенная и состояла из следующих тем:
— «Aquarius: рекомендации с ограничениями в Яндекс.Дзен» Борис Шарчилев, Яндекс.Дзен
— «Как многорукие бандиты главную страницу оптимизировали» Турал Гурбанов, ivi
​— «Многорукие бандиты в динамическом ценообразовании» Алексей Чернобровов, Консультант по data science

Приятного просмотра, и ставьте пальцы вверх!;)
🌻Весна в самом разгаре, пора просыпаться от зимней спячки, учиться новому и заводить еще больше друзей в Data Science – встречаемся онлайн и офлайн на митапах, конференциях, форумах и прочих познавательных мероприятиях для DS-любителей и профессионалов. Выбирайте апрельское событие по вкусу и участвуйте!
3 апреля в 15:00 МСК - День открытых дверей знаменитой Школы анализа данных Яндекса-2021: узнайте о программе, процессе отбора, различиях между направлениями обучения и совместных программах с ВУЗами https://events.yandex.ru/events/den-otkrytyh-dverej-sh-ad
8-9 апреля — международная практическая онлайн-конференция по продвинутой продуктовой аналитике Aha! от команды Матемаркетинга – 30 лекций и дискуссий и 10 мастер-классов https://aha.matemarketing.ru/
15 апреля – конференция «Большие данные и аналитика 2021» от CNews – 14 докладов от CDO, ТОП-менеджеров цифровой трансформации и ведущих Data Scientist’ов из банков, страховых компаний, телекома, ритейла и других бизнесов https://events.cnews.ru/events/bolshie_dannye_i_analitika_2021.shtml
16 апреля в 19:00 МСК – онлайн-митап от Яндекса «Большая дата» для аналитиков, дата-сайентистов и ML-специалистов: 3 тематических доклада и дискуссии по интересам https://events.yandex.ru/events/bolshaya-data/16-04-2020/
22 апреля – 9-я межотраслевая конференция ScoringDay 2021 о современных технологиях продвинутого анализа данных для развития компаний-лидеров на финансовом рынке. Ключевая тема конференции – «Data Science: выйти в топ» https://scorconf.ru/
22-23 апреля в 10:00 МСК - конференция о технологиях в ритейле - Retail TECH, новое мероприятие, которое стартовало в 2020 году, чтобы объединить участников рынка ритейла для обсуждения технологий и инноваций. https://retailtech.ru/konferencziya/
24 апреля в 10:00 МСК – онлайн-конференция Data Science fwdays’21 - 300 минут докладов, диалогов, дискуссий экспертов, а также знакомства, новые технологии, инструкции, а также контент о Data Science буднях https://fwdays.com/en/event/data-science-fwdays-2021
27–29 апреля в 10:00 МСК - XX Юбилейный Customer Contacts World Forum – доклады и мастер-классы от экспертов, визиты в действующие контактные центры крупнейших российских компаний, вечерние networking-мероприятия и выставка прикладных решений по клиентской аналитике, цифровизации, автоматизации и роботизации сервисных бизнес-процессов с помощью AI, ML, Big Data и DS https://ccwf.ru/
28 апреля в 10:00 МСК - конференция «Big Data и BI Day 2021» от TAdviser для руководителей, бизнес-аналитиков, разработчиков аналитических решений, специалистов по технологиям Big Data и Data Science https://www.tadviser.ru/index.php/Конференция:Конференция_Big_Data_и_BI_Day_2021
👍🏻Будьте здоровы с DCNN!
В течение многих лет врачи полагались на визуальный осмотр для выявления подозрительных пигментных поражений (SPL), которые могут указывать на рак кожи. Выявление SPL на ранней стадии помогает оперативно выявить меланомы и значительно снизить стоимость лечения. Но быстро найти SPL и определить их важность не так-то просто из-за большого объема пигментных поражений. Исследователи из MIT разработали новый ИИ-конвейер на глубоких сверточных нейросетях (DCNN, deep convolutional neural networks) и реализовали его для анализа SPL через камеру обычного смартфона. Система автоматически обнаруживает, извлекает и анализирует все пигментные поражения кожи, наблюдаемые на широкоугольном фотоснимке. Предварительно обученные ML-модели DCNN определяют подозрительность отдельных пигментных образований и маркируют их: нужен дальнейший осмотр - желтым, требуется направление к дерматологу - красным. Извлеченные признаки используются для последующей оценки пигментных поражений и отображения результатов в виде тепловой карты. Напомним, DCNN – это алгоритмы глубокого обучения, которые используются для классификации изображений с последующей их кластеризацией, например, при поиске по фотографиям.
https://news.mit.edu/2021/artificial-intelligence-tool-can-help-detect-melanoma-0402
🏂Как повысить качество производства продукции на 25% с помощью ИИ: опыт Fujitsu
Японский технологический гигант разработал AI-систему, которая выявляет отклонения во внешнем виде продукции, чтобы определить производственные проблемы еще до того, как материалы будут потрачены впустую.
ML-модель, обученная на смоделированных изображениях продуктов с отклонениями, способна обнаруживать различные проблемы. Например, изношенная резьба, дефектный рисунок проводки на разноцветных коврах или электронных деталях с разной формой проводов. ML-алгоритм получил высокую оценку качества: показатель AUROC составляет более 98%. Технология была протестирована на заводе Fujitsu в Нагано, который производит электронное оборудование. В результате трудозатраты на проверку качества печатных плат были уменьшены на ¼ от первоначального количества человеко-часов.
https://artificialintelligence-news.com/2021/03/29/fujitsu-develops-ai-product-abnormalities-manufacturing/
🤠В январе 2021 года Open.AI представила новую ML-модель, нейронную сеть под названием DALL·E, которая создает изображения из текстовых подписей к понятиям естественного языка. Она имеет 12 миллиардов параметров и основана на GPT-3. DALL·E обучен генерировать изображения из текстовых описаний, используя набор данных из пар текст-изображение. Сеть может создавать антропоморфизированные версии животных и предметов, комбинировать несвязанные концепции правдоподобными способами, отображать тексты и применять преобразования к существующим изображениям.
Как и GPT-3, DALL·E - это языковая модель-трансформер: она получает текст и изображение в виде единого потока данных, содержащего до 1280 токенов, и обучается с максимальной вероятностью генерировать все токены один за другим. Токен - это любой символ из дискретного словаря, например, каждая английская буква - это токен из 26-буквенного алфавита. В словарном запасе DALL·E есть символы текстовых и графических концепций. В частности, каждая подпись изображения представлена с использованием максимум 256 токенов, закодированных с помощью BPE, с размером словаря 16384, а изображение представлено с использованием 1024 токенов из словаря размером 8192.
Во время обучения изображения предварительно обрабатываются до разрешения 256x256. Подобно VQVAE, каждое изображение сжимается до сетки 32x32 дискретных скрытых кодов с использованием дискретного предварительно обученного VAE. Это обеспечивает масштабирование до больших размеров словаря и позволяет DALL·E генерировать изображение с нуля и регенерировать любую прямоугольную область существующего изображения до нижнего правого угла в соответствии с текстовой подсказкой.
https://openai.com/blog/dall-e/
Оффер от Яндекса за выходные!
С 24 по 25 апреля пройдёт Weekend Offer для аналитиков — онлайн-встреча Яндекса, на которой можно пройти собеседования и получить оффер за выходные!
Чтобы попасть на Weekend Offer, необходимо решить 2-5 задач на платформе Яндекс.Контест. 24 апреля пройдут две часовые секции с кодом, а 25 апреля — часовые финалы с командами, на которых ваш потенциальный руководитель расскажет о сервисе, вашей роли и, возможно, даст ещё одну задачу. При взаимном интересе вы тем же вечером получите оффер.
Подробности и регистрация: https://clck.ru/UAzfb 
🙈Pandas – отличная Python-библиотека для анализа данных, которой должен владеть каждый Data Scientist. Однако, у этого инструмента нет многопроцессорной поддержки и он довольно медленно работает с большими наборами данных. Поэтому для быстрой обработки действительно больших массивов информации следует выбирать Vaex и Dask.
👍🏻Dask https://dask.org/ - библиотека анализа данных на базе Pandas с параллельными вычислениями и масштабируемой производительностью. Кроме Pandas, она также интегрирована с библиотеками Numpy и Scikit-learn, упрощая переключение между ними за счет API-интерфейсов на Python и структур данных.
👍🏻Vaex https://vaex.io/docs/index.html - высокопроизводительная Python-библиотека для отложенных вычислений с «ленивыми» датафреймами, аналогичных Pandas, а также визуализации и агрегирования Big Data. Она позволяет вычислять базовую статистику по миллиарду строк в секунду, но, в отличие от Dask, не полностью интегрирована с другими библиотеками.
🤜🏻 З простых Python-функции для работы с пропусками в датасете для ML
fillna() - функция из пакета Pandas для заполнения нулевых (NA/NaN) значений в данных. Она возвращает объект, в котором заполнены нулевые и отсутствующие значения: Series.fillna (значение = None, method = None, axis = None, inplace = False, ** kwargs)
dropna() - функция для удаления нулевых значений из данных разными способами. Она анализирует и удаляет строки/столбцы, в которых есть отсутствующие или неопределенные значения (NaN). Значение параметра axis указывает, со строками или столбцами нужно работать: 0 – удаление строк с пропущенными значениями, а axis=1 удалит столбцы с пропусками. DataFrame.dropna (axis = 0, how = ’any’, thresh = None, subset = None, inplace = False)
interpolate() – функция для заполнения отсутствующих значений/NaN с использованием разных методов интерполяции. DataFrame.interpolate(method=’linear’, axis=0, limit=None, inplace=False, limit_direction=’forward’, limit_area=None, downcast=None, **kwargs)
🙌🏻6 типов RNN для моделирования последовательных данных
Зачем моделировать последовательные данные и почему это не так-то просто. Решаем задачу с помощью рекуррентных нейросетей: много математики и наглядных иллюстраций, а также подробный пример реализации RNN в Keras / Tensorflow и Python.
https://neptune.ai/blog/recurrent-neural-network-guide
🥁Как понять и разработать ИИ путем поиска и выделения репрезентативных сценариев: инструмент Bayes-TrEx от исследований MIT
Одной точности ML-результатов недостаточно, чтобы уверенно использовать их в любой области. Фокус только на этом показателе может привести к опасным упущениям. Модель может совершать ошибки с высокой степенью уверенности, сталкиваясь с чем-то ранее невидимым, например, когда беспилотный автомобиль видит новый дорожный знак. Чтобы улучшить взаимодействие человека и ИИ, группа исследователей из Лаборатории компьютерных наук и искусственного интеллекта Массачусетского технологического института создала новый инструмент под названием Bayes-TrEx, который позволяет разработчикам и пользователям повысить прозрачность своих AI-моделей. Это делается за счет поиска конкретных примеров, которые приводят к определенному поведению. В методе используется байесовский апостериорный вывод, широко используемый математический аппарат для рассуждения о неопределенности модели.
В ходе экспериментов метод Bayes-TrEx тестировался на нескольких наборов данных, позволив обнаружить новые идеи, которые ранее не учитывались стандартными оценками, сосредоточенными исключительно на точности прогнозов. Bayes-TrEx можно применять в медицинской диагностике, системах автономного вождения, робототехнике и пр. Метод поможет разрешить новые проблемные ситуации заранее и позволит разработчикам исправить любые нежелательные результаты до того, как случатся потенциальные трагедии или впустую потратятся ресурсы.
https://news.mit.edu/2021/more-transparency-understanding-machine-behaviors-bayes-trex-0322
🥁Как удалить дубли в датасете при работе с Apache Spark?
Используйте следующие методы API-интерфейсов фреймворка:
distinct() ¬- самый простой и часто использующийся способ убрать из датафрейма идентичные повторяющиеся строки
dropDuplicates() – в отличие от distinct(), который не принимает аргументов вообще, в аргументах dropDuplicates() можно указать подмножество столбцов для удаления повторяющихся записей. Поэтому dropDuplicates(Seq <String> colNames) больше подходит, когда нужно обработать только некоторые столбцы из исходного набора данных.
reduceByKey() – возвращает новый RDD - распределенный набор данных из пар «ключ-значение» (K, V), в котором все значения для одного ключа объединяются в кортеж - ключ и результат выполнения функции reduce для всех значений, связанных с этим ключом. Этот метод удаления дублей ограничен размером Scala-кортежа, который содержит от 2 до 22 элементов. Поэтому reduceByKey() не стоит использовать, когда в ключах или значениях Spark RDD более 22 столбцов.
collect_set() - функция из API-интерфейса Spark SQL собирает и возвращает набор уникальных элементов. Она не является детерминированной, т.к. порядок результатов зависит от порядка строк, который может измениться после перемешивания, и представляет собой не «настоящую» дедупликацию. По сути, collect_set() – это сворачивание записей путем выполнения groupBy() и сбора уникальных значений для столбца, относящегося к каждой группе.
написать собственную оконную функцию, чтобы обойти ограничение размера кортежей Scala. Например, разделить RDD по столбцам, отсортировать их и отфильтровать нужные значения.
Методы удаления дубликатов в Apache Spark
Что такое Graph Transformer и как работает эта NN-модель
Нейронные сети на основе трансформаторов в NLP-задачах позволяют обойти ограничения рекуррентных нейронных сетей (RNN), вызванные последовательной обработкой. Сопоставляя слова в предложении и комбинируя полученную информацию, они могут генерировать абстрактные представления его признаков. Обучение на графах с графическими нейронными сетями (GNN) из нескольких параметризованных слоях стало мощным инструментом глубокого обучения. Каждый слой GNN берет граф с функциями узлов и ребер, строя абстрактные представления их признаков на основе доступной явной структуры связности (структуры графа). Сгенерированные таким образом признаки затем передаются на следующие уровни, чтобы спрогнозировать целевую фичу. Обобщение нейронных сетей-трансформеров до графов позволяет обучаться на графах и наборах данных с произвольной структурой, а не только на последовательных преобразователях NLP.
https://www.topbots.com/graph-transformer/
🎯Новое поколение AI-приложений с открытым API для продвинутой аналитики, от семантического поиска, обобщения и анализа тональности до генерации и перевода контента с GPT-3.
С момента первого коммерческого релиза OpenAI API от GPT-3 более 300 приложений используют его в различных категориях и отраслях, от производительности и образования до творчества и игр. Читайте 3 истории успеха https://openai.com/blog/gpt-3-apps/ и попробуйте сам продукт для своих DS-задач https://beta.openai.com/
🌺Мир, труд, МАЙ! В последний весенний месяц 2021 года нас ждут интересные онлайн и офлайн митапы, конференции, форумы и прочие познавательные мероприятия для DS-любителей и профессионалов. Увидимся на новых DS-встречах!
13 мая -
Цифровой четверг Х5 – Открытая дискуссия экспертов из НИУ ВШЭ, X5, Сибур, HeadHunter и других компаний о проблемах и задачах развития цифрового интеллекта для бизнеса и людей. https://x5-retail-group-event.timepad.ru/event/1615219/
14-21 мая - первый совместный хакатон от ВТБ и Магнит - регистрация до 12 мая. Выбирайте свой вариант из 17 бизнес-проектов и вместе с разработчиками, UI/UX-дизайнерами, маркетологами и аналитиками создайте рабочий прототип, чтобы 21 мая в самом центре Москвы представить его топ-менеджерам двух крупных корпораций. Победителей ждет призовой фонд 1 000 000 рублей. https://vtbxmgnt.ru/
17-18 мая HighLoad++ - Крупнейшая IT-конференция в России и Европе – онлайн трансляция из главного зала московского Крокус-Экспо, где для всех участников спикеры из Ozon, ВК, Mail.ru Group, Яндекса, Лаборатории Касперского и других крупных корпораций и интересных ИТ-компаний поделятся своим опытом построения высконагруженных систем для Data Science и не только https://www.highload.ru/spring/2021
25 мая – онлайн-конференция CNews "Интернет вещей 2021: тренды, проекты, результаты". Спикеры из S7, Сибур, МТС и пр. расскажут об интересных кейсах и трендах развития IoT/M2M-рынка https://events.cnews.ru/events/internet_veschei_2021__trendy__proekty__rezultaty.shtml
29-30 мая 2021 - CodeFest 11. Новая надежда, Новосибирск, Экспоцентр. Билеты офлайн уже закончились, но можно смотреть онлайн-трансляцию интересных докладов от разработчиков, product- и project-менеджеров, а также тим/тех-лидов из Яндекса, Тинькоф, 2ГИС, Самоката, DeepPavlov, ВК, EPAM и десятка других ИТ-компаний https://11.codefest.ru/
🤦🏼‍♀️Слишком много данных? Маркируйте их метаданные и разделите на 3 категории: технические (логические и физические), операционные (статистика происхождения и профилирования данных) и метаданные команды от Data Scientist’ов и аналитиков.
Чтобы лучше понять каждый набор данных, задайте следующие вопросы:
1. Что логически представляют данные? Что означают атрибуты? Это источник истины или получен из другого набора данных?
2. Какова схема данных? Кто этим управляет? Как это было преобразовано?
3. Когда он последний раз обновлялся? Данные многоуровневые? Где предыдущие версии? Можно ли доверять этим данным? Насколько надежно качество данных?
4. Кто и/или какая команда является владельцем? Кто пользователи?
5. Какие механизмы запросов используются для доступа к данным? Версии наборов данных?
6. Где находятся данные? Где это тиражируется и в каком формате?
7. Как физически представлены данные и можно ли получить к ним доступ?
8. Существуют ли аналогичные наборы данных с общим похожим или идентичным содержанием как в целом, так и для отдельных столбцов?
Когда у вас есть ответы на эти вопросы по всем наборам данных, можно создать службу каталога метаданных, которая является важным строительным блоком платформ Data Lake / Data Mesh / Data Lakehouse. Эта служба обычно собирает метаданные после того, как наборы данных были созданы или обновлены различными конвейерами, не мешая владельцам или пользователям наборов данных.
https://medium.com/wrong-ml/why-is-understanding-datasets-hard-in-the-real-world-6eec47cafaa1
👻Мягкотелые роботы с DL-нейросетями от исследователей MIT
Обычные роботы, жесткие и металлические, подходят не для всех задач, поэтому ученые давно работают над созданием гибких и мягких роботов, которые смогут безопасно взаимодействовать с людьми и легко проникать в ограниченные пространства. Но для этого роботу необходимо знать местонахождение всех частей своего тела, которое может изменяться в любой конфигурации.
Благодаря ограниченному диапазону движений за счет заданного набора суставов и конечностей жесткие роботы отлично управляемы с помощью алгоритмов, управляющих картированием и планированием их движения. Проблема мягких роботов в том, что пространство их деформаций и движений практически бесконечно. Разумеется, можно определять положение робота с помощью видеокамеры и просто передавать эту информацию в программу управления. Но здесь появляются зависимость от внешнего устройства (камеры). Поэтому, чтобы определить оптимальное количество датчиков и места их наиболее эффективного размещения на самом роботе, исследователи MIT разработали новую архитектуру нейросети. ML-алгоритм глубокого обучения оптимизирует размещение датчиков, обучаясь на данных о деформации разных участков тела робота в процессе его движения при выполнении прикладных задач, например, захват предметов.
Примечательно, что этот ML-алгоритм показал лучшие результаты в тестовой симуляции по сравнению с экспертными прогнозами робототехников на роботах с сенсорным экраном и сенсорным управлением.
https://news.mit.edu/2021/sensor-soft-robots-placement-0322