💯ТОП-7 мартовских ивентов в Data Science
2 марта - ML Party Yerevan • Ереван, Армения https://events.yandex.ru/events/ml-party-02-03-2023/?from=tgdatagym
6-7 марта - OpenTalks.AI • Ереван, Армения https://opentalks.ai/
16 марта - КОНФЕРЕНЦИЯ ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ 2023 • Online https://events.cnews.ru/events/iskusstvennyi_intellekt_2023.shtml
21-23 марта - XXII Международный Customer Contacts World Forum • Москва, Россия https://ccwf.ru/
22 марта - Big Data и BI Day 2023 • Москва, Россия https://www.tadviser.ru/a/701611
29 марта - IV Специализированная конференция «Передовые Технологии Автоматизации. ПТА - Казань 2023» • Казань, Россия https://www.pta-expo.ru/kazan/
29 марта - IT RETAIL DAY 2023 • Москва, Россия https://www.tadviser.ru/a/701605
2 марта - ML Party Yerevan • Ереван, Армения https://events.yandex.ru/events/ml-party-02-03-2023/?from=tgdatagym
6-7 марта - OpenTalks.AI • Ереван, Армения https://opentalks.ai/
16 марта - КОНФЕРЕНЦИЯ ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ 2023 • Online https://events.cnews.ru/events/iskusstvennyi_intellekt_2023.shtml
21-23 марта - XXII Международный Customer Contacts World Forum • Москва, Россия https://ccwf.ru/
22 марта - Big Data и BI Day 2023 • Москва, Россия https://www.tadviser.ru/a/701611
29 марта - IV Специализированная конференция «Передовые Технологии Автоматизации. ПТА - Казань 2023» • Казань, Россия https://www.pta-expo.ru/kazan/
29 марта - IT RETAIL DAY 2023 • Москва, Россия https://www.tadviser.ru/a/701605
ML Party Yerevan
ML Party — регулярные встречи о самых разных применениях машинного обучения в IT. Приглашаем вас принять участие в первой ML Party в 2023 году, которая пройдет в гибридном формате — встретимся офлайн в Ереване (Армения) и онлайн на YouTube.
👍1
💥Топ источников различных датасетов для визуализации данных
FiveThirtyEight — это журналистский сайт, который делает наборы данных из своих статей общедоступными. Данный источник предоставляет исследовательские данные, подходящие для визуализации, и включает в себя такие наборы, как безопасность авиакомпаний, прогнозы выборов и историю погоды в США. Наборы легко доступны для поиска, и сайт постоянно обновляется.
Earth Data - предлагает исследователям различные датасеты в формате открытого доступа. Информация поступает из репозиториев данных NASA, и пользователи могут исследовать все, от климатических данных до конкретных регионов, таких как океаны, до экологических проблем, таких как лесные пожары. На сайте также есть учебные пособия и вебинары, а также статьи. Богатые данные предлагают визуализацию окружающей среды, а также содержат данные от научных партнеров.
The GDELT Project - глобальный набор данных о событиях в глобальном масштабе. Данный источник предлагает одно из крупнейших хранилищ данных для человеческой цивилизации. Исследователи могут исследовать людей, места, темы, организации и другие типы предметов. Данные бесплатны, и пользователи также могут загружать наборы данных RAW для уникальных вариантов использования. Сайт также предлагает множество инструментов для пользователей с меньшим опытом создания собственных визуализаций.
Singapore Public Data - данные, которые правительство Сингапура доступными для различных исследований. Пользователи могут осуществлять поиск по теме с помощью панели навигации или самостоятельно вводить условия поиска. Наборы данных охватывают такие темы, как окружающая среда, образование, инфраструктура и транспорт.
FiveThirtyEight — это журналистский сайт, который делает наборы данных из своих статей общедоступными. Данный источник предоставляет исследовательские данные, подходящие для визуализации, и включает в себя такие наборы, как безопасность авиакомпаний, прогнозы выборов и историю погоды в США. Наборы легко доступны для поиска, и сайт постоянно обновляется.
Earth Data - предлагает исследователям различные датасеты в формате открытого доступа. Информация поступает из репозиториев данных NASA, и пользователи могут исследовать все, от климатических данных до конкретных регионов, таких как океаны, до экологических проблем, таких как лесные пожары. На сайте также есть учебные пособия и вебинары, а также статьи. Богатые данные предлагают визуализацию окружающей среды, а также содержат данные от научных партнеров.
The GDELT Project - глобальный набор данных о событиях в глобальном масштабе. Данный источник предлагает одно из крупнейших хранилищ данных для человеческой цивилизации. Исследователи могут исследовать людей, места, темы, организации и другие типы предметов. Данные бесплатны, и пользователи также могут загружать наборы данных RAW для уникальных вариантов использования. Сайт также предлагает множество инструментов для пользователей с меньшим опытом создания собственных визуализаций.
Singapore Public Data - данные, которые правительство Сингапура доступными для различных исследований. Пользователи могут осуществлять поиск по теме с помощью панели навигации или самостоятельно вводить условия поиска. Наборы данных охватывают такие темы, как окружающая среда, образование, инфраструктура и транспорт.
FiveThirtyEight
Our Data
We’re sharing the data and code behind some of our articles and graphics.
👍1🤔1
Forwarded from Алексей Чернобровов
В продолжение предыдущего поста об отличиях senior аналитика от junior.👨💻
Одно из самых важных качеств senior’а - умение отличать важную задачу от неважной и отвечать на вопросы, которые не заданы в задаче.
Обычно аналитики загружены большим количеством задач, а времени на их решение не так много⏳️. Поэтому необходимо правильно разделять первостепенное и второстепенное.
Так вот, когда аналитикам приходит очередное задание, junior сразу берётся его делать, а senior пытается понять его ценность, нужно ли вообще уделять этому время.🤷
Грубо говоря, хороший аналитик пытается понять ценность задачи и делает в итоге только те действия, которые необходимы бизнесу (часто переформулируя задачу), минимизируя трудозатраты.
А очень хороший аналитик внедряет аналитическую культуру, создает такую обстановку в команде, что менеджер не приходит с запросом посчитать что-либо, а может самостоятельно находить нужные цифры на основе той инфраструктуры и тех отчетов, которые были ранее созданы аналитиками.🔝 Как правило, в таких командах аналитик решает сложные бизнес задачи, помогает в принятии решений.
Давайте рассмотрим на примере.
Запрос от менеджера: "Что будет, если мы сделаем бесплатную доставку, при условии, что в заказе будет один из товаров из выбранной категории? (список категорий прилагается) Сколько мы потеряем денег на субсидировании доставок?"
❗️Важный нюанс, что в выбранной категории есть очень дешевые товары за 10 рублей, например.
Junior аналитик сразу пошел бы считать, сколько стоили все доставки, где содержался один товар из выбранной категории, нашел все заказы из этой категории, посчитал совокупную цифру, сказав, какая была в прошлом месяце, и радостно бы рапортовал об этом заказчику. Потом нашел у себя ошибку в SQL, потому что нужен не один товар, а хотя бы один. :) Исправил, снова прислал цифру. Менеджер бы стал делать какие-то вывод на основе этого.
Senior сразу бы понял нюанс этой задачи, так как если пользователи знают о категории товаров, при добавлении которых в корзину доставка станет бесплатной, то они начнут докидывать самый дешевый товар из категории постоянно, и практически на всех заказах мы будем субсидировать доставку. И для оценки не нужно делать сложных запросов, а можно за 5 минут грубо оценить эту цифру.💡
Условно в первом случае аналитик потратил на это несколько часов и не помог бизнесу, хотя формально сделал все правильно. А senior решил задачу за 5 минут, потому что понял суть вопроса.😊
Одно из самых важных качеств senior’а - умение отличать важную задачу от неважной и отвечать на вопросы, которые не заданы в задаче.
Обычно аналитики загружены большим количеством задач, а времени на их решение не так много⏳️. Поэтому необходимо правильно разделять первостепенное и второстепенное.
Так вот, когда аналитикам приходит очередное задание, junior сразу берётся его делать, а senior пытается понять его ценность, нужно ли вообще уделять этому время.🤷
Грубо говоря, хороший аналитик пытается понять ценность задачи и делает в итоге только те действия, которые необходимы бизнесу (часто переформулируя задачу), минимизируя трудозатраты.
А очень хороший аналитик внедряет аналитическую культуру, создает такую обстановку в команде, что менеджер не приходит с запросом посчитать что-либо, а может самостоятельно находить нужные цифры на основе той инфраструктуры и тех отчетов, которые были ранее созданы аналитиками.🔝 Как правило, в таких командах аналитик решает сложные бизнес задачи, помогает в принятии решений.
Давайте рассмотрим на примере.
Запрос от менеджера: "Что будет, если мы сделаем бесплатную доставку, при условии, что в заказе будет один из товаров из выбранной категории? (список категорий прилагается) Сколько мы потеряем денег на субсидировании доставок?"
❗️Важный нюанс, что в выбранной категории есть очень дешевые товары за 10 рублей, например.
Junior аналитик сразу пошел бы считать, сколько стоили все доставки, где содержался один товар из выбранной категории, нашел все заказы из этой категории, посчитал совокупную цифру, сказав, какая была в прошлом месяце, и радостно бы рапортовал об этом заказчику. Потом нашел у себя ошибку в SQL, потому что нужен не один товар, а хотя бы один. :) Исправил, снова прислал цифру. Менеджер бы стал делать какие-то вывод на основе этого.
Senior сразу бы понял нюанс этой задачи, так как если пользователи знают о категории товаров, при добавлении которых в корзину доставка станет бесплатной, то они начнут докидывать самый дешевый товар из категории постоянно, и практически на всех заказах мы будем субсидировать доставку. И для оценки не нужно делать сложных запросов, а можно за 5 минут грубо оценить эту цифру.💡
Условно в первом случае аналитик потратил на это несколько часов и не помог бизнесу, хотя формально сделал все правильно. А senior решил задачу за 5 минут, потому что понял суть вопроса.😊
👍2
📈📉📊Python-библиотеки для визуализации данных о которых вы возможно не слышали, но которые вам могут быть очень полезны
Bokeh – это интерактивная библиотека визуализации для современных веб-браузеров. Она обеспечивает элегантное, лаконичное построение универсальной графики и обеспечивает высокопроизводительную интерактивность при работе с большими или потоковыми наборами данных.
Geoplotlib – это библиотека языка Python, которая позволяет пользователю разрабатывать карты и наносить на карту географические данные. Данная библиотека используется для рисования различных типов карт, таких как тепловые карты, точечные карты плотности, а также различные картографические диаграммы.
Folium — это библиотека визуализации данных в Python, которая помогает разработчику визуализировать гео-пространственные данные
VisPy – это высокопроизводительная интерактивная библиотека визуализации 2D /3D данных. Данная библиотека использует вычислительную мощность современных графических процессоров (GPU) через библиотеку OpenGL для отображения очень больших наборов данных
Pygal - библиотека языка Python, которая используется для визуализации данных. Данная библиотека также разрабатывает интерактивные графики, которые затем можно внедрить в веб-браузер
Bokeh – это интерактивная библиотека визуализации для современных веб-браузеров. Она обеспечивает элегантное, лаконичное построение универсальной графики и обеспечивает высокопроизводительную интерактивность при работе с большими или потоковыми наборами данных.
Geoplotlib – это библиотека языка Python, которая позволяет пользователю разрабатывать карты и наносить на карту географические данные. Данная библиотека используется для рисования различных типов карт, таких как тепловые карты, точечные карты плотности, а также различные картографические диаграммы.
Folium — это библиотека визуализации данных в Python, которая помогает разработчику визуализировать гео-пространственные данные
VisPy – это высокопроизводительная интерактивная библиотека визуализации 2D /3D данных. Данная библиотека использует вычислительную мощность современных графических процессоров (GPU) через библиотеку OpenGL для отображения очень больших наборов данных
Pygal - библиотека языка Python, которая используется для визуализации данных. Данная библиотека также разрабатывает интерактивные графики, которые затем можно внедрить в веб-браузер
Bokeh
Bokeh documentation
Bokeh is a Python library for creating interactive visualizations for modern web browsers. It helps you build beautiful graphics, ranging from simple plots to complex dashboards with streaming data...
👍3
📝Как улучшить датасеты медицинских снимков: 4 небольших совета
Получение правильных данных в нужном объёме - перед тем, как заказывать массивы данных медицинских снимков, руководителям проектов нужно скоординироваться с командами машинного обучения, data science и клинических исследователей. Это поможет преодолеть сложности получения «плохих» данных или того, что командам аннотаторов придётся фильтровать тысячи нерелевантных или низкокачественных изображений и видео при аннотировании данных обучения, что влияет на потраченные деньги и время.
Предоставление командам аннотаторов инструментов на основе AI - аннотирование медицинских снимков для моделей машинного обучения требует точности, эффективности, высокого уровня качества и безопасности. Благодаря инструментам аннотирования изображений на основе AI медицинские аннотаторы и специалисты могут экономить часы работы и генерировать более точно размеченные медицинские снимки
Обеспечение простоты передачи данных - клинические данные должны доставляться и передаваться в формате, который легко парсить, аннотировать, портировать, а после аннотирования быстро и эффективно передавать в модель ML.
Преодоление сложностей хранения и передачи - данные медицинских снимков часто состоят из сотен или тысяч терабайтов, которые нельзя просто так отправить по почте. Руководителям проектов нужно обеспечить сквозную безопасность и эффективность покупки или извлечения, очистки, хранения и передачи медицинских данных
Получение правильных данных в нужном объёме - перед тем, как заказывать массивы данных медицинских снимков, руководителям проектов нужно скоординироваться с командами машинного обучения, data science и клинических исследователей. Это поможет преодолеть сложности получения «плохих» данных или того, что командам аннотаторов придётся фильтровать тысячи нерелевантных или низкокачественных изображений и видео при аннотировании данных обучения, что влияет на потраченные деньги и время.
Предоставление командам аннотаторов инструментов на основе AI - аннотирование медицинских снимков для моделей машинного обучения требует точности, эффективности, высокого уровня качества и безопасности. Благодаря инструментам аннотирования изображений на основе AI медицинские аннотаторы и специалисты могут экономить часы работы и генерировать более точно размеченные медицинские снимки
Обеспечение простоты передачи данных - клинические данные должны доставляться и передаваться в формате, который легко парсить, аннотировать, портировать, а после аннотирования быстро и эффективно передавать в модель ML.
Преодоление сложностей хранения и передачи - данные медицинских снимков часто состоят из сотен или тысяч терабайтов, которые нельзя просто так отправить по почте. Руководителям проектов нужно обеспечить сквозную безопасность и эффективность покупки или извлечения, очистки, хранения и передачи медицинских данных
👍2
🤼♂️Hive vs Impala: весьма достойные противники
Hive и Impala - это технологии, которые используются для анализа больших данных. В этом посте мы рассмотрим преимущества и недостатки обеих технологий и сравним их между собой.
Hive - это инструмент для анализа данных, который основан на языке запросов HiveQL. Hive позволяет пользователям обращаться к данным в Hadoop Distributed File System (HDFS) с помощью SQL-подобных запросов. Однако, из-за того, что Hive использует архитектуру MapReduce, он может не быть настолько быстрым, как многие другие инструменты для анализа данных.
Impala является интерактивным инструментом для анализа данных, который предназначен для использования в Hadoop-среде. Impala работает с помощью SQL-запросов и может обрабатывать данные в реальном времени. Это означает, что пользователи могут быстро получать результаты запросов без задержек.
Какие же преимущества и недостатки у Hive и Impala?
Преимущества Hive:
• Hive достаточно легко масштабируется и может обрабатывать огромные объемы данных;
• Поддержка пользовательских функций: Hive позволяет пользователям создавать свои собственные функции и агрегатные функции на языке программирования Java, что позволяет пользователю расширять функциональность Hive и создавать свои индивидуальные решения для обработки данных.
Недостатки Hive:
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Преимущества Impala:
• Быстрая обработка запросов: Impala предоставляет высокую производительность при обработке запросов благодаря тому, что использует MPP-архитектуру и распределенные данные в памяти. Это позволяет аналитикам и разработчикам быстро получать результаты запросов без задержек.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Недостатки Impala:
• Ограниченная масштабируемость: Impala не обрабатывает такие большие объемы данных, как Hive, и может столкнуться с ограничениями масштабируемости при работе с большими данными. Impala может потребовать больше ресурсов для работы, чем Hive.
• Высокие требования к ресурсам: Impala потребляет больше ресурсов, чем Hive, из-за использования распределенных данных в памяти. Это может привести к необходимости использования более мощных серверов для обеспечения производительности.
Конечный выбор между Hive и Impala зависит от конкретной ситуации и требований пользователя. Если вы работаете с большими объемами данных и нуждаетесь в простой и доступной для всех SQL-подобной среде, то Hive может быть лучшим выбором. С другой стороны, если вам нужна быстрая обработка данных и поддержка сложных запросов, то Impala может быть предпочтительнее.
Hive и Impala - это технологии, которые используются для анализа больших данных. В этом посте мы рассмотрим преимущества и недостатки обеих технологий и сравним их между собой.
Hive - это инструмент для анализа данных, который основан на языке запросов HiveQL. Hive позволяет пользователям обращаться к данным в Hadoop Distributed File System (HDFS) с помощью SQL-подобных запросов. Однако, из-за того, что Hive использует архитектуру MapReduce, он может не быть настолько быстрым, как многие другие инструменты для анализа данных.
Impala является интерактивным инструментом для анализа данных, который предназначен для использования в Hadoop-среде. Impala работает с помощью SQL-запросов и может обрабатывать данные в реальном времени. Это означает, что пользователи могут быстро получать результаты запросов без задержек.
Какие же преимущества и недостатки у Hive и Impala?
Преимущества Hive:
• Hive достаточно легко масштабируется и может обрабатывать огромные объемы данных;
• Поддержка пользовательских функций: Hive позволяет пользователям создавать свои собственные функции и агрегатные функции на языке программирования Java, что позволяет пользователю расширять функциональность Hive и создавать свои индивидуальные решения для обработки данных.
Недостатки Hive:
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Преимущества Impala:
• Быстрая обработка запросов: Impala предоставляет высокую производительность при обработке запросов благодаря тому, что использует MPP-архитектуру и распределенные данные в памяти. Это позволяет аналитикам и разработчикам быстро получать результаты запросов без задержек.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Недостатки Impala:
• Ограниченная масштабируемость: Impala не обрабатывает такие большие объемы данных, как Hive, и может столкнуться с ограничениями масштабируемости при работе с большими данными. Impala может потребовать больше ресурсов для работы, чем Hive.
• Высокие требования к ресурсам: Impala потребляет больше ресурсов, чем Hive, из-за использования распределенных данных в памяти. Это может привести к необходимости использования более мощных серверов для обеспечения производительности.
Конечный выбор между Hive и Impala зависит от конкретной ситуации и требований пользователя. Если вы работаете с большими объемами данных и нуждаетесь в простой и доступной для всех SQL-подобной среде, то Hive может быть лучшим выбором. С другой стороны, если вам нужна быстрая обработка данных и поддержка сложных запросов, то Impala может быть предпочтительнее.
👍3
⛑⛑⛑Медицинские данные: что нужно учитывать при работе с информацией здравоохранения
Основная проблема данных здравоохранения заключается в их уязвимости. Они содержат конфиденциальную информацию, защищённую Health Insurance Portability and Accountability Act (HIPAA), и не могут использоваться без явно выраженного согласия. В сфере медицины чувствительные подробности называются защищаемой информацией о здоровье (protected health information, PHI). Вот несколько факторов, которые следует учитывать при работе с медицинскими наборами данных:
Protected Health Information (PHI) содержится в различных медицинских документах: электронных письмах, клинических заметках, результатах тестов или сканах КТ. Хотя диагнозы или медицинские предписания сами по себе не считаются чувствительной информацией, они становятся предметом HIPAA, когда сопоставляются с так называемыми идентификаторами: именами, датами, контактами, номерами социального страхования или счетов, фотографиями лиц или другими элементами, при помощи которых можно находить или идентифицировать конкретного пациента, а также связываться с ним.
Анонимизация медицинских данных и удаление из них персональной информации. Прежде чем использовать медицинские данные для исследовательских или деловых целей, необходимо избавиться от идентификаторов личности и даже от их частей (например, инициалов). Существует два способа это сделать — анонимизация и удаление личной информации. Анонимизация — это безвозвратное устранение всех чувствительных данных. Удаление персональной информации (de-identification) только шифрует личные сведения и скрывает их в отдельных датасетах. Позже идентификаторы можно повторно связать с информацией о здоровье. Вторая методика требует больше усилий, чем первая. Как бы то ни было, в обоих случаях потребность соответствия требованиям нормативов добавляет ещё один этап к подготовке датасетов для машинного обучения.
Разметка медицинских данных. Какие угодно неструктурированные данные (тексты, изображения или аудиофайлы) для обучения моделей машинного обучения требуют разметки или аннотирования. Это процесс добавления к блокам данных описательных элементов (меток или тэгов), чтобы машина могла понимать, что находится в изображении или тексте. При работе с данными здравоохранения разметку должны выполнять медицинские специалисты. Почасовая стоимость их услуг гораздо выше, чем у аннотаторов, не имеющих знаний в предметной области. Это создаёт ещё один барьер перед генерацией качественных медицинских датасетов.
Подводя итог, хочется отметить, что подготовка медицинских данных для машинного обучения обычно требует больше денег и времени, чем в среднем в других отраслях из-за строгого регулирования и участия высокооплачиваемых специалистов в предметной области. Следовательно, мы наблюдаем ситуацию, что публичные медицинские датасеты относительно редко встречаются и привлекают серьёзное внимание исследователей, дата-саентистов и компаний, работающих над ИИ-решениями в сфере медицины.
Основная проблема данных здравоохранения заключается в их уязвимости. Они содержат конфиденциальную информацию, защищённую Health Insurance Portability and Accountability Act (HIPAA), и не могут использоваться без явно выраженного согласия. В сфере медицины чувствительные подробности называются защищаемой информацией о здоровье (protected health information, PHI). Вот несколько факторов, которые следует учитывать при работе с медицинскими наборами данных:
Protected Health Information (PHI) содержится в различных медицинских документах: электронных письмах, клинических заметках, результатах тестов или сканах КТ. Хотя диагнозы или медицинские предписания сами по себе не считаются чувствительной информацией, они становятся предметом HIPAA, когда сопоставляются с так называемыми идентификаторами: именами, датами, контактами, номерами социального страхования или счетов, фотографиями лиц или другими элементами, при помощи которых можно находить или идентифицировать конкретного пациента, а также связываться с ним.
Анонимизация медицинских данных и удаление из них персональной информации. Прежде чем использовать медицинские данные для исследовательских или деловых целей, необходимо избавиться от идентификаторов личности и даже от их частей (например, инициалов). Существует два способа это сделать — анонимизация и удаление личной информации. Анонимизация — это безвозвратное устранение всех чувствительных данных. Удаление персональной информации (de-identification) только шифрует личные сведения и скрывает их в отдельных датасетах. Позже идентификаторы можно повторно связать с информацией о здоровье. Вторая методика требует больше усилий, чем первая. Как бы то ни было, в обоих случаях потребность соответствия требованиям нормативов добавляет ещё один этап к подготовке датасетов для машинного обучения.
Разметка медицинских данных. Какие угодно неструктурированные данные (тексты, изображения или аудиофайлы) для обучения моделей машинного обучения требуют разметки или аннотирования. Это процесс добавления к блокам данных описательных элементов (меток или тэгов), чтобы машина могла понимать, что находится в изображении или тексте. При работе с данными здравоохранения разметку должны выполнять медицинские специалисты. Почасовая стоимость их услуг гораздо выше, чем у аннотаторов, не имеющих знаний в предметной области. Это создаёт ещё один барьер перед генерацией качественных медицинских датасетов.
Подводя итог, хочется отметить, что подготовка медицинских данных для машинного обучения обычно требует больше денег и времени, чем в среднем в других отраслях из-за строгого регулирования и участия высокооплачиваемых специалистов в предметной области. Следовательно, мы наблюдаем ситуацию, что публичные медицинские датасеты относительно редко встречаются и привлекают серьёзное внимание исследователей, дата-саентистов и компаний, работающих над ИИ-решениями в сфере медицины.
👍2😁1
📖Топ достаточно полезных книг по визуализации данных
Effective Data Storytelling: How to Drive Change - Книга написана американским консультантом по бизнес-аналитике Брентом Дайксом, подойдет в том числе и читателям без технического бэкграунда. Речь пойдет не столько о визуализации данных, как о том, как через них рассказать историю. В книге Дайкс описывает собственный фреймворк data storytelling — как с помощью трех основных элементов (самих данных, повествования и визуальных эффектов) вычленить закономерности, разработать концепции решений и обосновать их аудитории.
Information Dashboard Design - это практическое руководство, в котором описаны лучшие практики и самые распространенные ошибки при создании дашбордов. Отдельная часть книги посвящена введению в теорию дизайна и визуализации данных.
The Accidental Analyst - интуитивно понятная пошаговая инструкция для решения сложных задач по визуализации данных. В книге описаны семь принципов анализа, которые и определяют порядок действий для работы с данными.
Beautiful Visualization. Looking at Data Through the Eyes of Experts - данная книга рассказывает о процессе визуализации данных на примерах реальных проектов. В ней есть комментарии 24 отраслевых экспертов — от дизайнеров и ученых до художников и статистиков — которые рассказывают о своих методах, подходах и философии визуализации данных.
The Big Book of Dashboards - данная книга представляет собой руководство по созданию дашбордов. Кроме этого, в книге есть целый раздел, посвященный психологическим факторам. Например, как реагировать, если заказчик попросит улучшить ваш дашборд, добавив туда парочку бесполезных диаграмм.
Effective Data Storytelling: How to Drive Change - Книга написана американским консультантом по бизнес-аналитике Брентом Дайксом, подойдет в том числе и читателям без технического бэкграунда. Речь пойдет не столько о визуализации данных, как о том, как через них рассказать историю. В книге Дайкс описывает собственный фреймворк data storytelling — как с помощью трех основных элементов (самих данных, повествования и визуальных эффектов) вычленить закономерности, разработать концепции решений и обосновать их аудитории.
Information Dashboard Design - это практическое руководство, в котором описаны лучшие практики и самые распространенные ошибки при создании дашбордов. Отдельная часть книги посвящена введению в теорию дизайна и визуализации данных.
The Accidental Analyst - интуитивно понятная пошаговая инструкция для решения сложных задач по визуализации данных. В книге описаны семь принципов анализа, которые и определяют порядок действий для работы с данными.
Beautiful Visualization. Looking at Data Through the Eyes of Experts - данная книга рассказывает о процессе визуализации данных на примерах реальных проектов. В ней есть комментарии 24 отраслевых экспертов — от дизайнеров и ученых до художников и статистиков — которые рассказывают о своих методах, подходах и философии визуализации данных.
The Big Book of Dashboards - данная книга представляет собой руководство по созданию дашбордов. Кроме этого, в книге есть целый раздел, посвященный психологическим факторам. Например, как реагировать, если заказчик попросит улучшить ваш дашборд, добавив туда парочку бесполезных диаграмм.
👍2
💥YTsaurus: система для хранения и обработки Big Data Яндекса стала open-source
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;
В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.
В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;
В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.
В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
👍2🔥1
🤔Что такое Data Mesh: суть концепции
Data Mesh - это децентрализованный гибкий подход к работе различных распределенных команд и распространению информации. Data Mesh родился как ответ на господствующие концепции работы с данными в data-driven организациях - Data Warehouse и Data Lake. Их объединяет идея централизованности. Все данные стекаются в некое центральное хранилище, откуда уже их могут забирать для своих целей разные команды. Однако все это нуждается в поддержке командой data-инженеров с особым набором скиллов. Также при при росте количества источников и разнообразия данных становится всё сложнее обеспечивать их бизнес-качество, пайплайны по трансформации становятся всё сложнее.
Дата меш предлагает решать эти и другие проблемы на основе четырёх главных принципов:
1. Domain-oriented ownership - данными владеют доменные команды, а не централизованная Data-команда. Домен - это часть организации, выполняющая определённую бизнес-функцию, например, это могут быть продуктовые домены (маммография, флюорография, КТ органов грудной клетки) или домен по работе с врачами-разметчиками.
2. Data as a product - данные воспринимаются не как статичный датасет, а как динамичный продукт со своими пользователями, метриками качества, бэклогом развития, за которым следит выделенный product-owner.
3. Self-serve data platform. Основная функция дата-платформы в Data Mesh - это устранять лишнюю когнитивную нагрузку. Это позволяет разработчикам в доменных командах (data product developers и data product consumers), которые не являются специалистами по работе с данными, удобно создавать Data-продукты, билдить, деплоить, тестить, обновлять их, получать к ним доступ и использовать в своих целях.
4. Federated computational governance - вместо централизованного управления данными создаётся специальный федеративный орган, состоящий из представителей доменных команд, дата-платформы и экспертов (например, юристов и врачей), который устанавливает глобальные политики в области работы с данными и обсуждает развитие дата-платформы.
Data Mesh - это децентрализованный гибкий подход к работе различных распределенных команд и распространению информации. Data Mesh родился как ответ на господствующие концепции работы с данными в data-driven организациях - Data Warehouse и Data Lake. Их объединяет идея централизованности. Все данные стекаются в некое центральное хранилище, откуда уже их могут забирать для своих целей разные команды. Однако все это нуждается в поддержке командой data-инженеров с особым набором скиллов. Также при при росте количества источников и разнообразия данных становится всё сложнее обеспечивать их бизнес-качество, пайплайны по трансформации становятся всё сложнее.
Дата меш предлагает решать эти и другие проблемы на основе четырёх главных принципов:
1. Domain-oriented ownership - данными владеют доменные команды, а не централизованная Data-команда. Домен - это часть организации, выполняющая определённую бизнес-функцию, например, это могут быть продуктовые домены (маммография, флюорография, КТ органов грудной клетки) или домен по работе с врачами-разметчиками.
2. Data as a product - данные воспринимаются не как статичный датасет, а как динамичный продукт со своими пользователями, метриками качества, бэклогом развития, за которым следит выделенный product-owner.
3. Self-serve data platform. Основная функция дата-платформы в Data Mesh - это устранять лишнюю когнитивную нагрузку. Это позволяет разработчикам в доменных командах (data product developers и data product consumers), которые не являются специалистами по работе с данными, удобно создавать Data-продукты, билдить, деплоить, тестить, обновлять их, получать к ним доступ и использовать в своих целях.
4. Federated computational governance - вместо централизованного управления данными создаётся специальный федеративный орган, состоящий из представителей доменных команд, дата-платформы и экспертов (например, юристов и врачей), который устанавливает глобальные политики в области работы с данными и обсуждает развитие дата-платформы.
👍2
🤓Что такое синтетические данные и зачем их используют?
Синтетические данные — это искусственные данные, имитирующие наблюдения реального мира и используемые для подготовки моделей машинного обучения, когда получение реальных данных невозможно из-за сложности или дороговизны. Синтезированные данные могут использоваться практически для любого проекта, в котором требуется, чтобы компьютерная симуляция прогнозировала или анализировала реальные события. Существует множество причин, по которым бизнес может задуматься об использовании синтетических данных. Вот некоторые из них:
1. Эффективность финансовых и временных затрат. Если нет подходящего датасета, генерация синтетических данных может быть намного дешевле, чем сбор данных событий реального мира. То же самое относится и к временному фактору: синтезирование может занять считанные дни, а для сбора и обработки реальных данных иногда требуются недели, месяцы или даже годы.
2. Исследование редких данных. В некоторых случаях данные редки или их сбор связан с опасностью. Примером редких данных может быть набор необычных случаев мошенничества. Пример опасных реальных данных — это дорожно-транспортные происшествия, на которые должны научиться реагировать беспилотные автомобили. В таком случае их можно заменить синтетическими ДТП.
3. Устранение проблем с конфиденциальностью. При необходимости обработки или передачи сторонним лицам уязвимых данных следует учитывать вопросы конфиденциальности. В отличие от анонимизации, генерация синтетических данных устраняет любые следы идентификации реальных данных, создавая новые валидные датасеты без ущерба конфиденциальности.
4. Простота разметки и контроля. С технической точки зрения, полностью синтетические данные упрощают разметку. Например, если сгенерировано изображение парка, можно легко автоматически присвоить метки деревьям, людям и животным. Вам не придётся нанимать людей для ручной разметки этих объектов. К тому же полностью синтезированные данные легко контролировать и изменять.
Синтетические данные — это искусственные данные, имитирующие наблюдения реального мира и используемые для подготовки моделей машинного обучения, когда получение реальных данных невозможно из-за сложности или дороговизны. Синтезированные данные могут использоваться практически для любого проекта, в котором требуется, чтобы компьютерная симуляция прогнозировала или анализировала реальные события. Существует множество причин, по которым бизнес может задуматься об использовании синтетических данных. Вот некоторые из них:
1. Эффективность финансовых и временных затрат. Если нет подходящего датасета, генерация синтетических данных может быть намного дешевле, чем сбор данных событий реального мира. То же самое относится и к временному фактору: синтезирование может занять считанные дни, а для сбора и обработки реальных данных иногда требуются недели, месяцы или даже годы.
2. Исследование редких данных. В некоторых случаях данные редки или их сбор связан с опасностью. Примером редких данных может быть набор необычных случаев мошенничества. Пример опасных реальных данных — это дорожно-транспортные происшествия, на которые должны научиться реагировать беспилотные автомобили. В таком случае их можно заменить синтетическими ДТП.
3. Устранение проблем с конфиденциальностью. При необходимости обработки или передачи сторонним лицам уязвимых данных следует учитывать вопросы конфиденциальности. В отличие от анонимизации, генерация синтетических данных устраняет любые следы идентификации реальных данных, создавая новые валидные датасеты без ущерба конфиденциальности.
4. Простота разметки и контроля. С технической точки зрения, полностью синтетические данные упрощают разметку. Например, если сгенерировано изображение парка, можно легко автоматически присвоить метки деревьям, людям и животным. Вам не придётся нанимать людей для ручной разметки этих объектов. К тому же полностью синтезированные данные легко контролировать и изменять.
🤔1
🔥ТОП-5 апрельских ивентов в Data Science
6 апреля - Data Day 2023 - Москва, Россия - https://data-day.ru/
11-14 апреля - РНВТ–2023 - Москва, Россия - https://hi-techweek.ru/
13-14 апреля - DATA FUSION - Онлайн - https://data-fusion.ru/
16-17 апреля - Heisenbug 2023 - Москва, Россия - https://heisenbug.ru/
18 апреля - First Russian Data Forum 2023 - Москва, Россия - https://data-forum.ru/
6 апреля - Data Day 2023 - Москва, Россия - https://data-day.ru/
11-14 апреля - РНВТ–2023 - Москва, Россия - https://hi-techweek.ru/
13-14 апреля - DATA FUSION - Онлайн - https://data-fusion.ru/
16-17 апреля - Heisenbug 2023 - Москва, Россия - https://heisenbug.ru/
18 апреля - First Russian Data Forum 2023 - Москва, Россия - https://data-forum.ru/
data-day.ru
Форум Data Day 2027. ИИ + ДАННЫЕ. Как сохранять уверенный курс в динамичной среде
8 июля, Москва
Forwarded from Аналитика больших данных (Very Big Anal)
Поисковик Bing снова популярен, благодаря Chat GPT
Использование технологии от OpenAI поднял ежедневную активность пользователей в Bing в 6 раз, а общая дневная аудитория выросла до 100 000 000.
Вместе с популярностью Bing возрос и интерес к Edge – браузеру от Microsoft.
В течение 20 лет в поисковой системе Bing не производилось никаких серьезных изменений. Это привело к тому, что порядка 40% пользователей сталкивались с одной общей проблемой – ссылки при нажатии просто не работали.
Microsoft решила инвестировать средства в OpenAI – компанию-разработчика ChatGPT – и внедрить технологию ИИ в свою поисковую систему. Это сделало ее первой IT-корпорацией, которая решилась на подобную интеграцию.
Использование технологии от OpenAI поднял ежедневную активность пользователей в Bing в 6 раз, а общая дневная аудитория выросла до 100 000 000.
Вместе с популярностью Bing возрос и интерес к Edge – браузеру от Microsoft.
В течение 20 лет в поисковой системе Bing не производилось никаких серьезных изменений. Это привело к тому, что порядка 40% пользователей сталкивались с одной общей проблемой – ссылки при нажатии просто не работали.
Microsoft решила инвестировать средства в OpenAI – компанию-разработчика ChatGPT – и внедрить технологию ИИ в свою поисковую систему. Это сделало ее первой IT-корпорацией, которая решилась на подобную интеграцию.
Forwarded from Аналитика больших данных (Very Big Anal)
😔Россияне боятся потерять работу из-за развития искусственного интеллекта
По результатам опроса, развития искусственного интеллекта боятся 17% россиян. В качестве аргумента чаще всего упоминается риск потери рабочих мест в результате автоматизации.
При этом 43% россиян не испытывают страха, связанного с развитием искусственного интеллекта. Большинство из них уверены, что нейросети никогда не смогут заменить человека.
Согласно исследованиям, наибольший риск потери работы из-за развития искусственного интеллекта ощущают переводчики, менеджеры по туризму и официанты. Меньше всего эта проблема беспокоит врачей, строителей и учителей.
Отмечается, что всего в опросе сервиса приняли участие 1,6 тыс. представителей экономически активного населения из всех округов страны.
По результатам опроса, развития искусственного интеллекта боятся 17% россиян. В качестве аргумента чаще всего упоминается риск потери рабочих мест в результате автоматизации.
При этом 43% россиян не испытывают страха, связанного с развитием искусственного интеллекта. Большинство из них уверены, что нейросети никогда не смогут заменить человека.
Согласно исследованиям, наибольший риск потери работы из-за развития искусственного интеллекта ощущают переводчики, менеджеры по туризму и официанты. Меньше всего эта проблема беспокоит врачей, строителей и учителей.
Отмечается, что всего в опросе сервиса приняли участие 1,6 тыс. представителей экономически активного населения из всех округов страны.
😎Искать данные и параллельно учить SQL-легко!!!
Census GPT — это инструмент, который позволяет пользователям осуществлять поиск данных о городах, микрорайонах и других географических зонах.
Используя технологию искусственного интеллекта, Census-GPT упорядочил и проанализировал огромные объемы данных для создания супербазы данных. В настоящее время база данных Census-GPT содержит информацию о Соединенных Штатах, где пользователи могут запрашивать данные о населении, уровне преступности, образовании, доходе, возрасте и т.д. Кроме того, Census-GPT может отображать карты США в четкой и лаконичной форме.
На сайте Census GPT пользователи также могут улучшать существующие карты. Результаты данных можно получить вместе с SQL-запросом. Соответственно, можно учить SQL и автоматически проверять себя на реальных примерах.
Census GPT — это инструмент, который позволяет пользователям осуществлять поиск данных о городах, микрорайонах и других географических зонах.
Используя технологию искусственного интеллекта, Census-GPT упорядочил и проанализировал огромные объемы данных для создания супербазы данных. В настоящее время база данных Census-GPT содержит информацию о Соединенных Штатах, где пользователи могут запрашивать данные о населении, уровне преступности, образовании, доходе, возрасте и т.д. Кроме того, Census-GPT может отображать карты США в четкой и лаконичной форме.
На сайте Census GPT пользователи также могут улучшать существующие карты. Результаты данных можно получить вместе с SQL-запросом. Соответственно, можно учить SQL и автоматически проверять себя на реальных примерах.
Censusgpt
Census GPT
Search the census database with natural language
🥰4👍1
📝Подборка источников с медицинскими датасетами
Международная система здравоохранения ежедневно генерирует множество медицинских данных, которые (по крайней мере, теоретически) можно использовать для машинного обучения.
Вот несколько источников с медицинскими наборами данных:
1. The Cancer Imaging Archive (TCIA), финансируемый Национальным институтом онкологии США (NCI) — это место хранения в открытом доступе радиологических и гистопатологических снимков
2. National Covid-19 Chest Imaging Database (NCCID), являющаяся частью AI Lab Государственной службы здравоохранения Великобритании (NHS), содержит рентгенограммы, снимки МРТ и КТ органов грудной клетки пациентов больниц по всей Великобритании. Это один из крупнейших архивов такого типа, вклад в который вносят 27 больниц и фондов.
3. Medicare Provider Catalog собирает официальные данные центров услуг Medicare и Medicaid (CMS). Он охватывает множество различных тем, от качества ухода в разных больницах, центрах реабилитации, хосписах и других учреждениях здравоохранения, до стоимости посещения и информации о врачах и клиницистах. Данные можно просматривать в браузере, скачивать конкретные датасеты в формате CSV или подключать собственные приложения к веб-сайту при помощи API.
4. Older Adults Health Data Collection на Data.gov состоит из 96 датасетов, управляемых федеральным правительством США. Его основное предназначение — сбор информации о здоровье людей старше 60 лет в контексте пандемии Covid-19 и вне его. Среди организаций, занимающихся поддержанием коллекции, Департамент здравоохранения и социального обеспечения США, Департамент по делам ветеранов, центры по контролю и профилактике заболеваний (CDC) и другие. Датасеты можно скачивать в различных форматах: HTML, CSV, XSL, JSON, XML и RDF.
5. The Cancer Genome Atlas (TCGA) — это важнейшая база данных геномики, охватывающая 33 типа заболеваний, в том числе 10 редких.
6. Surveillance, Epidemiology, and End Results (SEER) — самый надёжный источник онкологической статистики в США, предназначенный для снижения доли раковых заболеваний в популяции. Её база данных поддерживается Surveillance Research Program (SRP), которая является частью Division of Cancer Control and Population Sciences (DCCPS) Национального института онкологии.
Международная система здравоохранения ежедневно генерирует множество медицинских данных, которые (по крайней мере, теоретически) можно использовать для машинного обучения.
Вот несколько источников с медицинскими наборами данных:
1. The Cancer Imaging Archive (TCIA), финансируемый Национальным институтом онкологии США (NCI) — это место хранения в открытом доступе радиологических и гистопатологических снимков
2. National Covid-19 Chest Imaging Database (NCCID), являющаяся частью AI Lab Государственной службы здравоохранения Великобритании (NHS), содержит рентгенограммы, снимки МРТ и КТ органов грудной клетки пациентов больниц по всей Великобритании. Это один из крупнейших архивов такого типа, вклад в который вносят 27 больниц и фондов.
3. Medicare Provider Catalog собирает официальные данные центров услуг Medicare и Medicaid (CMS). Он охватывает множество различных тем, от качества ухода в разных больницах, центрах реабилитации, хосписах и других учреждениях здравоохранения, до стоимости посещения и информации о врачах и клиницистах. Данные можно просматривать в браузере, скачивать конкретные датасеты в формате CSV или подключать собственные приложения к веб-сайту при помощи API.
4. Older Adults Health Data Collection на Data.gov состоит из 96 датасетов, управляемых федеральным правительством США. Его основное предназначение — сбор информации о здоровье людей старше 60 лет в контексте пандемии Covid-19 и вне его. Среди организаций, занимающихся поддержанием коллекции, Департамент здравоохранения и социального обеспечения США, Департамент по делам ветеранов, центры по контролю и профилактике заболеваний (CDC) и другие. Датасеты можно скачивать в различных форматах: HTML, CSV, XSL, JSON, XML и RDF.
5. The Cancer Genome Atlas (TCGA) — это важнейшая база данных геномики, охватывающая 33 типа заболеваний, в том числе 10 редких.
6. Surveillance, Epidemiology, and End Results (SEER) — самый надёжный источник онкологической статистики в США, предназначенный для снижения доли раковых заболеваний в популяции. Её база данных поддерживается Surveillance Research Program (SRP), которая является частью Division of Cancer Control and Population Sciences (DCCPS) Национального института онкологии.
www.cancer.gov
The Cancer Genome Atlas Program (TCGA)
The Cancer Genome Atlas (TCGA) is a landmark cancer genomics program that sequenced and molecularly characterized over 11,000 cases of primary cancer samples. Learn more about how the program transformed the cancer research community and beyond.
👍2
😳Подборка Python-библиотек для случайной генерации тестовых данных
Многие любят Python за его удобство в обработке данных. Но иногда бывает, что необходимо написать и проверить алгоритм по определенной тематике, но самих данных по этой тематике мало или вовсе нет в открытом доступе. Для таких целей существуют библиотеки с помощью которых можно генерировать фейковые данные с нужными типами.
Faker - библиотека для генерации различных типов случайной информации. Он также имеет интуитивно понятный API. Существуют также реализации для таких языков, как PHP, Perl и Ruby.
Mimesis - это библиотека для языка Python, которая помогает генерировать данные для различных целей. Библиотека написана с использованием средств, включенных в стандартную библиотеку языка Python, потому не имеет никаких сторонних зависимостей.
Radar - Библиотека для генерации случайных дат и времени
Fake2db - библиотека, которая позволяет генерировать данные напрямую в базе данных (также существуют движки для разных СУБД).
Многие любят Python за его удобство в обработке данных. Но иногда бывает, что необходимо написать и проверить алгоритм по определенной тематике, но самих данных по этой тематике мало или вовсе нет в открытом доступе. Для таких целей существуют библиотеки с помощью которых можно генерировать фейковые данные с нужными типами.
Faker - библиотека для генерации различных типов случайной информации. Он также имеет интуитивно понятный API. Существуют также реализации для таких языков, как PHP, Perl и Ruby.
Mimesis - это библиотека для языка Python, которая помогает генерировать данные для различных целей. Библиотека написана с использованием средств, включенных в стандартную библиотеку языка Python, потому не имеет никаких сторонних зависимостей.
Radar - Библиотека для генерации случайных дат и времени
Fake2db - библиотека, которая позволяет генерировать данные напрямую в базе данных (также существуют движки для разных СУБД).
GitHub
GitHub - joke2k/faker: Faker is a Python package that generates fake data for you.
Faker is a Python package that generates fake data for you. - joke2k/faker
😎🥹Библиотеки для комфортной работы с данными
PyGWalker - упрощает рабочий процесс анализа и визуализации данных в Jupyter Notebook, превращая фрейм данных pandas в пользовательский интерфейс в стиле Tableau для визуального исследования.
SciencePlots - библиотека для создания различных графиков matplotlib для презентаций, исследовательских работ и т.д.
CleverCSV - библиотека, которая устраняет различные ошибки синтаксического анализа при чтении CSV-файлов с помощью Pandas
fastparquet - ускоряет ввод-вывод pandas примерно в 5 раз. fastparquet - это высокопроизводительная реализация формата Parquet на Python, предназначенная для бесперебойной работы с фреймами данных Pandas. Она обеспечивает быструю производительность чтения и записи, эффективное сжатие и поддержку широкого спектра типов данных.
Feather - библиотека, которая предназначена для чтения и записи данных с устройств. Данная библиотека отлично подходит для перевода данных из одного языка в другой. Также она способна достаточно быстро считывать большие массивы данных
Dask - эта библиотека позволяет эффективно организовывать параллельные вычисления. Коллекции больших данных хранятся здесь как параллельные массивы/списки и позволяют работать с ними через Numpy/Pandas
Ibis - обеспечивает доступ между локальным окружение в Python и удаленными хранилищами данных (например, Hadoop)
PyGWalker - упрощает рабочий процесс анализа и визуализации данных в Jupyter Notebook, превращая фрейм данных pandas в пользовательский интерфейс в стиле Tableau для визуального исследования.
SciencePlots - библиотека для создания различных графиков matplotlib для презентаций, исследовательских работ и т.д.
CleverCSV - библиотека, которая устраняет различные ошибки синтаксического анализа при чтении CSV-файлов с помощью Pandas
fastparquet - ускоряет ввод-вывод pandas примерно в 5 раз. fastparquet - это высокопроизводительная реализация формата Parquet на Python, предназначенная для бесперебойной работы с фреймами данных Pandas. Она обеспечивает быструю производительность чтения и записи, эффективное сжатие и поддержку широкого спектра типов данных.
Feather - библиотека, которая предназначена для чтения и записи данных с устройств. Данная библиотека отлично подходит для перевода данных из одного языка в другой. Также она способна достаточно быстро считывать большие массивы данных
Dask - эта библиотека позволяет эффективно организовывать параллельные вычисления. Коллекции больших данных хранятся здесь как параллельные массивы/списки и позволяют работать с ними через Numpy/Pandas
Ibis - обеспечивает доступ между локальным окружение в Python и удаленными хранилищами данных (например, Hadoop)
GitHub
GitHub - Kanaries/pygwalker: PyGWalker: Turn your dataframe into an interactive UI for visual analysis
PyGWalker: Turn your dataframe into an interactive UI for visual analysis - Kanaries/pygwalker
👍6
🧐Что такое наблюдаемость данных: основные принципы
Наблюдаемость данных - это новый уровень в современном стеке технологий обработки данных, обеспечивающий командам по работе с данными их прозрачность и качество. Цель наблюдаемости данных - уменьшить вероятность ошибок в бизнес-решениях из-за некорректной информации в данных.
Наблюдаемость обеспечивается следующими принципами:
Свежесть (Freshness) показывает, насколько актуальны структуры данных.
Распределение (Distribution) сообщает, попадают ли данные в ожидаемый диапазон.
Объем (Volume ) предполагает понимание полноты структур данных и состояния источников данных.
Схема (Schema) позволяет понять, кто и когда вносит изменения в структуры данных.
Происхождение (Lineage) сопоставляет вышестоящие источники и нижележащие приемники данных, помогая определить, где произошли ошибки или сбои.
Подробнее о наблюдаемости данных в источнике: https://habr.com/ru/companies/otus/articles/559320/
Наблюдаемость данных - это новый уровень в современном стеке технологий обработки данных, обеспечивающий командам по работе с данными их прозрачность и качество. Цель наблюдаемости данных - уменьшить вероятность ошибок в бизнес-решениях из-за некорректной информации в данных.
Наблюдаемость обеспечивается следующими принципами:
Свежесть (Freshness) показывает, насколько актуальны структуры данных.
Распределение (Distribution) сообщает, попадают ли данные в ожидаемый диапазон.
Объем (Volume ) предполагает понимание полноты структур данных и состояния источников данных.
Схема (Schema) позволяет понять, кто и когда вносит изменения в структуры данных.
Происхождение (Lineage) сопоставляет вышестоящие источники и нижележащие приемники данных, помогая определить, где произошли ошибки или сбои.
Подробнее о наблюдаемости данных в источнике: https://habr.com/ru/companies/otus/articles/559320/
😩Неопределенность в данных: распространенные баги
Сейчас активно обсуждают «подготовку данных» и «очистку данных», но что отличает высококачественные данные от низкокачественных?
В большинстве систем машинного обучения сегодня применяется контролируемое обучение. Это значит, что данные обучения состоят их пар (input, output), и мы хотим, чтобы система могла получать входные данные и сопоставлять их с выходными. Например, входными данными может быть аудиоклип, а выходными — транскрипция речи. Для создания таких наборов данных необходимо грамотно их размечать. Если в разметке данных присутствует неопределённость, то для достижения высокой точности модели машинного обучения может понадобиться больше данных. Сбор и аннотирование данных могут оказаться некорректными по следующим причинам:
1. Простые ошибки аннотирования. Простейший тип ошибки — это неправильное аннотирование. Аннотатор, уставший от большого количества разметки, случайно помещает пример данных не в тот класс. Хоть это и простая ошибка, она встречается довольно часто, и может иметь огромное отрицательное влияние на производительность системы ИИ.
2. Несоответствия в руководствах по аннотированию. В аннотировании элементов данных часто присутствуют различного вида тонкости. Например, можно представить, что необходимо читать посты в социальных сетях и аннотировать, являются ли они обзорами продуктов. Задача кажется простой, но если начать аннотировать, можно осознать, что «продукт» — это довольно расплывчатое понятие. Нужно ли считать продуктами цифровые медиа, например, подкасты или фильмы? Один специалист может сказать «да», другой «нет», поэтому точность системы ИИ может сильно снижаться.
3. Несбалансированные данные или отсутствующие классы. Способ сбора данных сильно влияет на состав наборов данных, что в свою очередь может повлиять на точность моделей на конкретных классах или подмножествах данных. В большинстве наборов данных из реального мира количество примеров в каждой категории, которые мы хотим классифицировать (баланс классов) может сильно варьироваться. Это может приводить к снижению точности, а также к усугублению проблем баланса и перекосам. Например, система распознавания лиц ИИ Google была печально известна тем, что плохо распознавала лица цветных людей, что в большой степени было результатом использования набора данных с недостаточно разнообразными примерами (среди множества прочих проблем).
Сейчас активно обсуждают «подготовку данных» и «очистку данных», но что отличает высококачественные данные от низкокачественных?
В большинстве систем машинного обучения сегодня применяется контролируемое обучение. Это значит, что данные обучения состоят их пар (input, output), и мы хотим, чтобы система могла получать входные данные и сопоставлять их с выходными. Например, входными данными может быть аудиоклип, а выходными — транскрипция речи. Для создания таких наборов данных необходимо грамотно их размечать. Если в разметке данных присутствует неопределённость, то для достижения высокой точности модели машинного обучения может понадобиться больше данных. Сбор и аннотирование данных могут оказаться некорректными по следующим причинам:
1. Простые ошибки аннотирования. Простейший тип ошибки — это неправильное аннотирование. Аннотатор, уставший от большого количества разметки, случайно помещает пример данных не в тот класс. Хоть это и простая ошибка, она встречается довольно часто, и может иметь огромное отрицательное влияние на производительность системы ИИ.
2. Несоответствия в руководствах по аннотированию. В аннотировании элементов данных часто присутствуют различного вида тонкости. Например, можно представить, что необходимо читать посты в социальных сетях и аннотировать, являются ли они обзорами продуктов. Задача кажется простой, но если начать аннотировать, можно осознать, что «продукт» — это довольно расплывчатое понятие. Нужно ли считать продуктами цифровые медиа, например, подкасты или фильмы? Один специалист может сказать «да», другой «нет», поэтому точность системы ИИ может сильно снижаться.
3. Несбалансированные данные или отсутствующие классы. Способ сбора данных сильно влияет на состав наборов данных, что в свою очередь может повлиять на точность моделей на конкретных классах или подмножествах данных. В большинстве наборов данных из реального мира количество примеров в каждой категории, которые мы хотим классифицировать (баланс классов) может сильно варьироваться. Это может приводить к снижению точности, а также к усугублению проблем баланса и перекосам. Например, система распознавания лиц ИИ Google была печально известна тем, что плохо распознавала лица цветных людей, что в большой степени было результатом использования набора данных с недостаточно разнообразными примерами (среди множества прочих проблем).
👍1🤯1
😳Опубликован датасет для обучения усовершенствованной альтернативы LLaMa
Группа исследователей из различных организаций и университетов (Together, ontocord.ai, ds3lab.inf.ethz.ch, crfm.stanford.edu, hazyresearch.stanford.edu, mila.quebec) работает над созданием open-source альтернативы модели LLaMa и уже опубликовали датасет, релевантный использованному для создания последней. Несвободная, но хорошо сбалансированная LLaMa использовалась в качестве основы для таких проектов как Alpaca, Vicuna и Koala.
Сейчас в открытом доступе опубликован RedPajama – датасет текстов, содержащий более 1,2 трлн токенов. Следующим шагом, по словам разработчиков, будет создание самой модели, что потребует серьёзных вычислительных мощностей.
Группа исследователей из различных организаций и университетов (Together, ontocord.ai, ds3lab.inf.ethz.ch, crfm.stanford.edu, hazyresearch.stanford.edu, mila.quebec) работает над созданием open-source альтернативы модели LLaMa и уже опубликовали датасет, релевантный использованному для создания последней. Несвободная, но хорошо сбалансированная LLaMa использовалась в качестве основы для таких проектов как Alpaca, Vicuna и Koala.
Сейчас в открытом доступе опубликован RedPajama – датасет текстов, содержащий более 1,2 трлн токенов. Следующим шагом, по словам разработчиков, будет создание самой модели, что потребует серьёзных вычислительных мощностей.
GitHub
GitHub - togethercomputer/RedPajama-Data: The RedPajama-Data repository contains code for preparing large datasets for training…
The RedPajama-Data repository contains code for preparing large datasets for training large language models. - togethercomputer/RedPajama-Data
👍3