😎Топ 6 библиотек для анализа временных рядов
Временной ряд — это упорядоченная последовательность точек или признаков, которые измеряются через определенные временные интервалы, и которая представляет характеристику процесса. В наше время существуют такие популярные библиотеки для работы с временными рядами, как:
• Statsmodels - это библиотека с открытым исходным кодом. Построена на основе NumPy и SciPy. Statsmodel позволяет строить и анализировать статистические модели, в том числе также модели временных рядов. Также включает в себя статистические тесты, возможность работы с большими данными и др.
• Sktime - библиотека с открытым исходным кодом для машинного обучения на Python. Она разработана специально для анализа временных рядов. Sktime включает специальные алгоритмы машинного обучения и хорошо подходит для задач прогнозирования и классификации временных рядов.
• tslearn - универсальная библиотека предназначена для анализа временных рядов с помощью языка Python. Она основана на библиотеках scikit-learn, numpy и scipy. Эта библиотека предлагает инструменты для предварительной обработки и извлечения признаков, а также специальные модели для кластеризации, классификации и регрессии.
• Tsfresh - данная библиотека отлично подходит для подготовки данных к классическому табличному виду с целью постановки и решения задач классификации, прогнозирования и пр. С ее помощью можно быстро выделить большое количество признаков временных рядов, а затем отобрать только необходимые.
• Merlion - является библиотекой с открытым исходным кодом. Она предназначена для работы с временными рядами, главным образом — прогнозирования и обнаружения коллективных аномалий. Имеет типовой интерфейс для большинства моделей и наборов данных. Позволяет быстро разработать модель для решения распространенных задач в области временных рядов и тестировать ее на различных наборах данных.
• PyOD (Python Outlier Detection или PyOD) — это Python-библиотека, которая помогает обнаружить в данных точечные аномалии или выбросы. В данной библиотеке реализовано более 30 алгоритмов, начиная с классических алгоритмов типа Isolation Forest и заканчивая недавно представленными в научных статьях методами, типа COPOD и другие. Также PyOD позволяет объединять модели поиска выбросов в ансамбли для повышения качества решения задачи. Библиотека проста и понятна, а примеры в документации подробно рассказывают, как ее можно использовать.
Временной ряд — это упорядоченная последовательность точек или признаков, которые измеряются через определенные временные интервалы, и которая представляет характеристику процесса. В наше время существуют такие популярные библиотеки для работы с временными рядами, как:
• Statsmodels - это библиотека с открытым исходным кодом. Построена на основе NumPy и SciPy. Statsmodel позволяет строить и анализировать статистические модели, в том числе также модели временных рядов. Также включает в себя статистические тесты, возможность работы с большими данными и др.
• Sktime - библиотека с открытым исходным кодом для машинного обучения на Python. Она разработана специально для анализа временных рядов. Sktime включает специальные алгоритмы машинного обучения и хорошо подходит для задач прогнозирования и классификации временных рядов.
• tslearn - универсальная библиотека предназначена для анализа временных рядов с помощью языка Python. Она основана на библиотеках scikit-learn, numpy и scipy. Эта библиотека предлагает инструменты для предварительной обработки и извлечения признаков, а также специальные модели для кластеризации, классификации и регрессии.
• Tsfresh - данная библиотека отлично подходит для подготовки данных к классическому табличному виду с целью постановки и решения задач классификации, прогнозирования и пр. С ее помощью можно быстро выделить большое количество признаков временных рядов, а затем отобрать только необходимые.
• Merlion - является библиотекой с открытым исходным кодом. Она предназначена для работы с временными рядами, главным образом — прогнозирования и обнаружения коллективных аномалий. Имеет типовой интерфейс для большинства моделей и наборов данных. Позволяет быстро разработать модель для решения распространенных задач в области временных рядов и тестировать ее на различных наборах данных.
• PyOD (Python Outlier Detection или PyOD) — это Python-библиотека, которая помогает обнаружить в данных точечные аномалии или выбросы. В данной библиотеке реализовано более 30 алгоритмов, начиная с классических алгоритмов типа Isolation Forest и заканчивая недавно представленными в научных статьях методами, типа COPOD и другие. Также PyOD позволяет объединять модели поиска выбросов в ансамбли для повышения качества решения задачи. Библиотека проста и понятна, а примеры в документации подробно рассказывают, как ее можно использовать.
GitHub
GitHub - statsmodels/statsmodels: Statsmodels: statistical modeling and econometrics in Python
Statsmodels: statistical modeling and econometrics in Python - statsmodels/statsmodels
👍3🔥2
Совет на 2023 год — выучите актуальные DevOps инструменты. DevOps на сегодня являются самыми высокооплачиваемыми и востребованными специалистами в ит-отрасли.
А для того, чтобы научиться за месяцев, а не лет — держите в подписках канал DevOPs. Там на пальцах рассказывают что учить, на что забить и что актуально в 2023 году.
С этим каналом вы пройдете путь от "гугл - что такое Docker" до богатого DevOps специалиста.
Начните свой 2023 год продуктивно — школа DevOps
А для того, чтобы научиться за месяцев, а не лет — держите в подписках канал DevOPs. Там на пальцах рассказывают что учить, на что забить и что актуально в 2023 году.
С этим каналом вы пройдете путь от "гугл - что такое Docker" до богатого DevOps специалиста.
Начните свой 2023 год продуктивно — школа DevOps
🔥2🤔2❤1👍1
💡Топ 6 источников данных для глубокого погружения в Data Science
Chronic disease data. - источник, на котором можно найти данные о различных хронических заболеваниях на территории США.
IMF Data - Международный валютный фонд, который также публикует данные о международных финансах, показателях долгов, валютных резервах, инвестициях и так далее
Financial Times Market Data - здесь содержится информация о финансовых рынках всего мира, которая включает в себя такие показатели, как товары, валюту, индексы цен на акции
ImageNet - это данные изображений для новых алгоритмов, организованные в соответствии с иерархией WordNet, в которой сотни и тысячи изображений представляют каждый узел иерархии
Stanford Dogs Dataset - здесь содержится огромное количество изображений различных пород собак
HotspotQA Dataset - данные с вопросами-ответами, позволяющие создавать системы для ответов на вопросы наиболее понятным способом.
Chronic disease data. - источник, на котором можно найти данные о различных хронических заболеваниях на территории США.
IMF Data - Международный валютный фонд, который также публикует данные о международных финансах, показателях долгов, валютных резервах, инвестициях и так далее
Financial Times Market Data - здесь содержится информация о финансовых рынках всего мира, которая включает в себя такие показатели, как товары, валюту, индексы цен на акции
ImageNet - это данные изображений для новых алгоритмов, организованные в соответствии с иерархией WordNet, в которой сотни и тысячи изображений представляют каждый узел иерархии
Stanford Dogs Dataset - здесь содержится огромное количество изображений различных пород собак
HotspotQA Dataset - данные с вопросами-ответами, позволяющие создавать системы для ответов на вопросы наиболее понятным способом.
🔥2
💥Топ 5 причин использовать Apache Spark для обработки Big Data
Apache Spark – популярный Big Data фреймворк с открытым исходным кодом для обработки больших массивов данных в распределенной среде. Он входит в экосистему проектов Apache Hadoop. Данный фреймворк хорош тем, что имеет в своем арсенале следующие элементы:
• Богатый API - Spark предоставляет разработчику довольно обширный API, что позволяет работать с разными языками программирования, например: Python, R, Scala и Java. Spark также предлагает пользователю абстракцию датафрейма (dataframe), для которых используются объектно-ориентированные методы преобразований, объединения данных, их фильтрации, а также много других полезных возможностей.
• Довольно широкий функционал - Spark обладает широкими функциональными возможностями за счет таких компонентов, как:
1. Spark SQL - модуль, который служит для аналитической обработки данных с помощью SQL-запросов
2. Spark Streaming – модуль, обеспечивающий надстройку для обработки потоковых данных в режиме онлайн
3. MLLib – модуль, предоставляющий набор библиотек машинного обучения в распределенной среде
• Ленивые вычисления - позволяют снизить общий объем вычислений и повысить производительность программы за счет снижений требований к памяти. Данный вид вычислений весьма полезен, так как это позволяет определять сложную структуру преобразований, представленных в виде объектов. Также существует возможность проверить структуру конечного результата, не выполняя какие-либо промежуточные шаги. Еще Spark автоматически проверяет план выполнения запросов или программы на наличие ошибок. Это позволяет быстро отловить баги и отладить их.
• Открытый исходный код - входя в линейку проектов Apache Software Foundation, Спарк продолжает активно развиваться за счет сообщества разработчиков. Также, несмотря на то, что Spark является бесплатным инструментом, у него весьма подробная документация: https://spark.apache.org/documentation.html
• Распределенная обработка данных - Apache Spark предусматривает распределенную обработку данных, включая концепцию распределенных датасетов RDD (resilient distributed dataset) – это распределенная структура данных, которая размещается в оперативной памяти. Каждый такой датасет содержит фрагмент данных, распределенных по узлам кластера. За счет этого он является отказоустойчивым: если раздел теряется в результате сбоя узла, он может быть восстановлен из исходных источников. Таким образом, Spark сам раскидывает код по всем узлам кластера, разбивает его на подзадачи, создает план выполнения и отслеживает успешность выполнения.
Apache Spark – популярный Big Data фреймворк с открытым исходным кодом для обработки больших массивов данных в распределенной среде. Он входит в экосистему проектов Apache Hadoop. Данный фреймворк хорош тем, что имеет в своем арсенале следующие элементы:
• Богатый API - Spark предоставляет разработчику довольно обширный API, что позволяет работать с разными языками программирования, например: Python, R, Scala и Java. Spark также предлагает пользователю абстракцию датафрейма (dataframe), для которых используются объектно-ориентированные методы преобразований, объединения данных, их фильтрации, а также много других полезных возможностей.
• Довольно широкий функционал - Spark обладает широкими функциональными возможностями за счет таких компонентов, как:
1. Spark SQL - модуль, который служит для аналитической обработки данных с помощью SQL-запросов
2. Spark Streaming – модуль, обеспечивающий надстройку для обработки потоковых данных в режиме онлайн
3. MLLib – модуль, предоставляющий набор библиотек машинного обучения в распределенной среде
• Ленивые вычисления - позволяют снизить общий объем вычислений и повысить производительность программы за счет снижений требований к памяти. Данный вид вычислений весьма полезен, так как это позволяет определять сложную структуру преобразований, представленных в виде объектов. Также существует возможность проверить структуру конечного результата, не выполняя какие-либо промежуточные шаги. Еще Spark автоматически проверяет план выполнения запросов или программы на наличие ошибок. Это позволяет быстро отловить баги и отладить их.
• Открытый исходный код - входя в линейку проектов Apache Software Foundation, Спарк продолжает активно развиваться за счет сообщества разработчиков. Также, несмотря на то, что Spark является бесплатным инструментом, у него весьма подробная документация: https://spark.apache.org/documentation.html
• Распределенная обработка данных - Apache Spark предусматривает распределенную обработку данных, включая концепцию распределенных датасетов RDD (resilient distributed dataset) – это распределенная структура данных, которая размещается в оперативной памяти. Каждый такой датасет содержит фрагмент данных, распределенных по узлам кластера. За счет этого он является отказоустойчивым: если раздел теряется в результате сбоя узла, он может быть восстановлен из исходных источников. Таким образом, Spark сам раскидывает код по всем узлам кластера, разбивает его на подзадачи, создает план выполнения и отслеживает успешность выполнения.
👍4❤1🔥1
😎Что такое Pandas и чем же он так хорош?
Pandas — это Python-библиотека для обработки и анализа структурированных данных, её название происходит от «panel data» («панельные данные»). Панельными данными называют информацию, полученную в результате исследований и структурированную в виде таблиц. Для работы с такими массивами данных в Python создана библиотека Pandas.
В основе данной библиотеки лежит DataFrame – структура данных табличного типа. Любое табличное представление данных, например, электронные таблицы или базы данных, можно использовать как DataFrame. Объект DataFrame составлен из объектов типа Series — одномерных массивов, которые объединены под одним названием и типом данных. Series можно рассматривать как столбец таблицы. Pandas имеет в свое арсенале такие преимущества, как:
Простое управление беспорядочными данными в упорядоченной форме - в датафреймах предусмотрены индексы, обеспечивающий легкий доступ к любому элементу
Гибкое изменение форм: добавление, удаление, присоединение новых или старых данных.
Интеллектуальное индексирование, которое предусматривает манипулирование и управление столбцами и строками.
Быстрое слияние и объединение наборов данных за счет их индексации, например, два и более объектов Series в один DataFrame.
Поддержка иерархического индексирования - возможность объединения столбцов под общей категорией (MultiIndex).
Открытый доступ - Pandas является opensource-библиотекой, то есть ее исходный код находится в открытом доступе
Подробная документация - у Pandas есть свой официальный сайт, на котором располагается подробная документация с пояснениями. Подробнее можно узнать по следующей ссылке: https://pandas.pydata.org/docs/
Pandas — это Python-библиотека для обработки и анализа структурированных данных, её название происходит от «panel data» («панельные данные»). Панельными данными называют информацию, полученную в результате исследований и структурированную в виде таблиц. Для работы с такими массивами данных в Python создана библиотека Pandas.
В основе данной библиотеки лежит DataFrame – структура данных табличного типа. Любое табличное представление данных, например, электронные таблицы или базы данных, можно использовать как DataFrame. Объект DataFrame составлен из объектов типа Series — одномерных массивов, которые объединены под одним названием и типом данных. Series можно рассматривать как столбец таблицы. Pandas имеет в свое арсенале такие преимущества, как:
Простое управление беспорядочными данными в упорядоченной форме - в датафреймах предусмотрены индексы, обеспечивающий легкий доступ к любому элементу
Гибкое изменение форм: добавление, удаление, присоединение новых или старых данных.
Интеллектуальное индексирование, которое предусматривает манипулирование и управление столбцами и строками.
Быстрое слияние и объединение наборов данных за счет их индексации, например, два и более объектов Series в один DataFrame.
Поддержка иерархического индексирования - возможность объединения столбцов под общей категорией (MultiIndex).
Открытый доступ - Pandas является opensource-библиотекой, то есть ее исходный код находится в открытом доступе
Подробная документация - у Pandas есть свой официальный сайт, на котором располагается подробная документация с пояснениями. Подробнее можно узнать по следующей ссылке: https://pandas.pydata.org/docs/
👍3
😳Как изменился рынок Data Science за последнее время?
Data Science является одной из самых перспективных и быстрорастущих отраслей не только в России, но и в мире. Причем, данные изменения затронули самые различные отрасли:
Медицина. Британский стартап Babylon Health предложил новый подход к здравоохранению. В наше время ланное решение компании использует не только алгоритмы ИИ для анализа состояния пациента, но опыт и рекомендации реальных врачей. Это помогает выбрать оптимальный подход к диагностике проблем и заботе о здоровье. Сервис ориентирован на выявление потенциальных рисков, с которыми может столкнуться пациент. Российская разработка проекта «Цельс» производит анализ флюорографии, томографии и КТ при помощи алгоритмов ИИ. Данное решение помогает увеличить показатели выявляемости онкологических заболеваний и снизить стоимость затрат на медицинские услуги. Точность диагностики — 93–95%, к сегодняшнему дню компанией проведено и обработано около 20 млн исследований.
Телеком. Операторы связи также модернизируют оборудование и применяют новый подход при работе с данными. К примеру, компания «Tele2», как и многие международные компании, начала использование кластера Hadoop, увеличив тем самым емкость платформы почти на 40% и разделила пространство на два отдельных сегмента. В одном из них реализуются проекты, связанные с обработкой данных, в другом — Data Science. Благодаря подобной конфигурации увеличивается вычислительная мощность системы, что позволяет решать высоконагруженные задачи.
Банковская сфера. Цифровая трансформация — одно из главных направлений развития банковского сектора в наше время. Здесь уже давно используют современные технологии, обрабатывают огромные массивы данных, внедряют инновации и предлагают пользователям индивидуальные предложения. Например, Сингапурский банк UOB активно применяет алгоритмы ИИ для создания более персонализированного сервиса. Искусственный интеллект анализирует расходы клиента и на основе полученной информации формирует уникальные предложения для клиентов.
Data Science является одной из самых перспективных и быстрорастущих отраслей не только в России, но и в мире. Причем, данные изменения затронули самые различные отрасли:
Медицина. Британский стартап Babylon Health предложил новый подход к здравоохранению. В наше время ланное решение компании использует не только алгоритмы ИИ для анализа состояния пациента, но опыт и рекомендации реальных врачей. Это помогает выбрать оптимальный подход к диагностике проблем и заботе о здоровье. Сервис ориентирован на выявление потенциальных рисков, с которыми может столкнуться пациент. Российская разработка проекта «Цельс» производит анализ флюорографии, томографии и КТ при помощи алгоритмов ИИ. Данное решение помогает увеличить показатели выявляемости онкологических заболеваний и снизить стоимость затрат на медицинские услуги. Точность диагностики — 93–95%, к сегодняшнему дню компанией проведено и обработано около 20 млн исследований.
Телеком. Операторы связи также модернизируют оборудование и применяют новый подход при работе с данными. К примеру, компания «Tele2», как и многие международные компании, начала использование кластера Hadoop, увеличив тем самым емкость платформы почти на 40% и разделила пространство на два отдельных сегмента. В одном из них реализуются проекты, связанные с обработкой данных, в другом — Data Science. Благодаря подобной конфигурации увеличивается вычислительная мощность системы, что позволяет решать высоконагруженные задачи.
Банковская сфера. Цифровая трансформация — одно из главных направлений развития банковского сектора в наше время. Здесь уже давно используют современные технологии, обрабатывают огромные массивы данных, внедряют инновации и предлагают пользователям индивидуальные предложения. Например, Сингапурский банк UOB активно применяет алгоритмы ИИ для создания более персонализированного сервиса. Искусственный интеллект анализирует расходы клиента и на основе полученной информации формирует уникальные предложения для клиентов.
eMed UK
About Us | eMed UK
Babylon is a value-based care platform. We deliver digital-first, high-quality healthcare AI-powered technology developed by the world's leading providers.
🔥Обрабатываем данные с помощью Elastic Stack
Elastic Stack — обширная экосистема компонентов, которые служат для поиска и обработки больших данных. Данная экосистема является распределенной системой на основе JSON, которая сочетает в себе функции NoSQL-базы данных. Работу Elastic Stack обеспечивают такие компоненты, как:
• Elasticsearch - это большое, быстрое и хорошо масштабируемое нереляционное хранилище данных, которое стало отличным инструментом для поиска и аналитики журналов благодаря мощности, простоте, документам JSON без схем, поддержке разных языков и геолокации. Система может быстро обрабатывать большие объемы журналов, индексировать системные логи по мере поступления и выполнять запросы к ним в режиме реального времени. Выполнение операций в Elasticsearch, таких как чтение или запись данных, обычно занимает менее секунды, что позволяет использовать его в таких примерах, где необходимо реагировать почти в режиме реального времени, например, для мониторинга приложений и обнаружения каких-либо аномалий.
• Longstash - данная утилита помогает централизовать данные, связанные с событиями, такие как сведения из файлов регистрации (логов), разные показатели (метрики) или любые другие данные в любом формате. Она может выполнить обработку данных до того, как сформировать нужную вам выборку. Это ключевой компонент Elastic Stack, который используется для сбора и обработки ваших контейнеров данных. Logstash считается компонентом на стороне сервера. Его основная цель — выполнение сбора данных из обширного количества источников ввода в масштабируемом виде, а также обработатка информации и отправка ее по месту назначения. По умолчанию преобразованная информация поступает в Elasticsearch, также существует возможность выбрать один из многих других вариантов вывода. Архитектура Logstash основана на плагинах и легко расширяется. Поддерживаются три вида плагинов: ввода, фильтрации и вывода.
• Kibana - это инструмент для визуализации в Elastic Stack, который помогает наглядно представить данные в Elasticsearch. В Kibana предлагается множество вариантов визуализаций, таких как гистограмма, карта, линейные графики, временные ряды и др. Kibana позволяет создавать визуализации буквально парой щелчков кнопкой мыши и исследовать свои данные в интерактивном виде. Кроме того, есть возможность создавать красивые панели управления, состоящие из различных визуализаций, делиться ими, а также получать высококачественные отчеты.
• Beats - это платформа доставки данных с открытым исходным кодом, дополняющая Logstash. В отличие от Logstash, работающей на серверной стороне, Beats располагается на стороне клиента. В основе данной платформы лежит библиотека libbeat, которая предоставляет API для передачи данных от источника, настройки ввода и реализации сбора данных. Beats устанавливается на устройства, которые не являются частью серверных компонентов, таких как Elasticsearch, Logstash или Kibana. Они размещаются на не кластерных узлах, которые также иногда называют пограничными узлами.
Загрузить элементы Elastic Stack можно по следующей ссылке: https://www.elastic.co/elastic-stack/
Elastic Stack — обширная экосистема компонентов, которые служат для поиска и обработки больших данных. Данная экосистема является распределенной системой на основе JSON, которая сочетает в себе функции NoSQL-базы данных. Работу Elastic Stack обеспечивают такие компоненты, как:
• Elasticsearch - это большое, быстрое и хорошо масштабируемое нереляционное хранилище данных, которое стало отличным инструментом для поиска и аналитики журналов благодаря мощности, простоте, документам JSON без схем, поддержке разных языков и геолокации. Система может быстро обрабатывать большие объемы журналов, индексировать системные логи по мере поступления и выполнять запросы к ним в режиме реального времени. Выполнение операций в Elasticsearch, таких как чтение или запись данных, обычно занимает менее секунды, что позволяет использовать его в таких примерах, где необходимо реагировать почти в режиме реального времени, например, для мониторинга приложений и обнаружения каких-либо аномалий.
• Longstash - данная утилита помогает централизовать данные, связанные с событиями, такие как сведения из файлов регистрации (логов), разные показатели (метрики) или любые другие данные в любом формате. Она может выполнить обработку данных до того, как сформировать нужную вам выборку. Это ключевой компонент Elastic Stack, который используется для сбора и обработки ваших контейнеров данных. Logstash считается компонентом на стороне сервера. Его основная цель — выполнение сбора данных из обширного количества источников ввода в масштабируемом виде, а также обработатка информации и отправка ее по месту назначения. По умолчанию преобразованная информация поступает в Elasticsearch, также существует возможность выбрать один из многих других вариантов вывода. Архитектура Logstash основана на плагинах и легко расширяется. Поддерживаются три вида плагинов: ввода, фильтрации и вывода.
• Kibana - это инструмент для визуализации в Elastic Stack, который помогает наглядно представить данные в Elasticsearch. В Kibana предлагается множество вариантов визуализаций, таких как гистограмма, карта, линейные графики, временные ряды и др. Kibana позволяет создавать визуализации буквально парой щелчков кнопкой мыши и исследовать свои данные в интерактивном виде. Кроме того, есть возможность создавать красивые панели управления, состоящие из различных визуализаций, делиться ими, а также получать высококачественные отчеты.
• Beats - это платформа доставки данных с открытым исходным кодом, дополняющая Logstash. В отличие от Logstash, работающей на серверной стороне, Beats располагается на стороне клиента. В основе данной платформы лежит библиотека libbeat, которая предоставляет API для передачи данных от источника, настройки ввода и реализации сбора данных. Beats устанавливается на устройства, которые не являются частью серверных компонентов, таких как Elasticsearch, Logstash или Kibana. Они размещаются на не кластерных узлах, которые также иногда называют пограничными узлами.
Загрузить элементы Elastic Stack можно по следующей ссылке: https://www.elastic.co/elastic-stack/
Elastic
Elastic Stack: (ELK) Elasticsearch, Kibana & Logstash
Reliably and securely take data from any source, in any format, then search, analyze, and visualize it in real time.
👍2
👑Работаем с графами в Python с помощью NetWorkX
NetWorkX — библиотека, которая предназначена для создания, изучения и манипуляции графами и иными сетевыми структурами. Данная бибилиотека является бесплатной, распространяемой по лицензии BSD. NetworkX используется для обучения теории графов, а также научных исследований и решения прикладных задач, в которых она применяется. NetWorkX имеет ряд сильных преимуществ, среди которых:
Высокая производительность - NetworkX способна свободно оперировать крупными сетевыми системами, содержащими до 10 миллионов вершин и 100 миллионов ребер между ними. Это особенно полезно при анализе Big Data — например, выгрузки из социальных сетей, объединяющих миллионы пользователей.
Простота использования - так как библиотека NetworkX написана на языке Python, работа с ней не составляет особого труда как для профессиональных программистов, так и для любителей. А модули визуализации графов обеспечивают наглядность полученного результата, который можно корректировать в режиме реального времени. Для того, чтобы создать полноценный граф, необходимо всего 4 строчки кода (одна из них - это просто импорт😁):
import networkx as nx
G=nx.Graph()
G.add_edge(1,2) # # значение по умолчанию для дуги задаётся = 1
G.add_edge(2,3,weight=0.9) # # задаётся значение атрибута
Эффективность - из-за того, что библиотека реализована на низкоуровневой структуре данных языка программирования Python, обеспечивается эффективное расходование аппаратных и программных ресурсов компьютера. Это увеличивает возможности по масштабированию графов, а также уменьшает зависимость от особенностей аппаратной платформы и операционной системы.
Постоянная поддержка - для NetworkX разработана подробная документация, описывающая функционал и ограничения библиотеки. Репозитории постоянно обновляются. В них собраны готовые типовые решения для программистов, заметно облегчающие работу.
Открытый исходный код - пользователь получает большие возможности по настройке и расширению функционала библиотеки, ее адаптации под конкретные задачи. При желании пользователь сам может разработать дополнительное ПО для работы с этой библиотекой.
NetWorkX — библиотека, которая предназначена для создания, изучения и манипуляции графами и иными сетевыми структурами. Данная бибилиотека является бесплатной, распространяемой по лицензии BSD. NetworkX используется для обучения теории графов, а также научных исследований и решения прикладных задач, в которых она применяется. NetWorkX имеет ряд сильных преимуществ, среди которых:
Высокая производительность - NetworkX способна свободно оперировать крупными сетевыми системами, содержащими до 10 миллионов вершин и 100 миллионов ребер между ними. Это особенно полезно при анализе Big Data — например, выгрузки из социальных сетей, объединяющих миллионы пользователей.
Простота использования - так как библиотека NetworkX написана на языке Python, работа с ней не составляет особого труда как для профессиональных программистов, так и для любителей. А модули визуализации графов обеспечивают наглядность полученного результата, который можно корректировать в режиме реального времени. Для того, чтобы создать полноценный граф, необходимо всего 4 строчки кода (одна из них - это просто импорт😁):
import networkx as nx
G=nx.Graph()
G.add_edge(1,2) # # значение по умолчанию для дуги задаётся = 1
G.add_edge(2,3,weight=0.9) # # задаётся значение атрибута
Эффективность - из-за того, что библиотека реализована на низкоуровневой структуре данных языка программирования Python, обеспечивается эффективное расходование аппаратных и программных ресурсов компьютера. Это увеличивает возможности по масштабированию графов, а также уменьшает зависимость от особенностей аппаратной платформы и операционной системы.
Постоянная поддержка - для NetworkX разработана подробная документация, описывающая функционал и ограничения библиотеки. Репозитории постоянно обновляются. В них собраны готовые типовые решения для программистов, заметно облегчающие работу.
Открытый исходный код - пользователь получает большие возможности по настройке и расширению функционала библиотеки, ее адаптации под конкретные задачи. При желании пользователь сам может разработать дополнительное ПО для работы с этой библиотекой.
👍3
⛑Топ 7 DS-стартапов в медицине за 2022 год
SWORD Health – сервис для физиотерапии и реабилитации, включающий в себя ряд носимых устройств, которые способны считывать физиологические показатели, сигнализирующие о болевых ощущениях, что позволяет анализировать большие массивы данных и предлагать более эффективное лечение, а также корректировать движения для устранения боли
Cala Health - сервис, предлагающий на данный момент единственное рецептурное неинвазивное средство для лечения эссенциального тремора, основанное на данных измеряемых колебаний с помощью носимых устройств, которые на основе этого также способны осуществлять индивидуальную стимуляцию периферических нервов
AppliedVR – это платформа для лечения хронических болей посредством создания библиотеки с данными, которые влияют на болевые ощущения, что позволяет проводить иммерсивную терапию через VR
Digital Diagnostics – первый автономный ИИ, одобренный федеральной организацией FDA (Food and Drug Administration), основанный на данных изображений сетчатки глаза для диагностики глазных заболеваний, вызванных диабетом, без участия врача
Iterative Health – продукт, представляющий собой сервис для автоматизации процессов проведения и анализа результатов данных эндоскопии. Данная технология основана на интерпретации данных эндоскопических изображений, помогая тем самым врачам лучше оценивать пациентов с потенциальными желудочно-кишечными проблемами
Viz.ai – сервис для интеллектуальной координации и оказания медицинской помощи в радиологии. Данная платформа предназначена для анализа данных КТ-сканов мозга с целью нахождения закупорки в нем крупных сосудов. Все полученные результаты система транслирует специалисту в сфере нервно-сосудистых заболеваний с целью обеспечения терапевтического вмешательства на раннем этапе. Такие результаты система получает буквально за несколько минут, обеспечивая этим быстрое реагирование
Unlearn -стартап, который предлагает платформу для ускорения клинических испытаний с помощью искусственного интеллекта, цифровых двойников и различных статистических методов. Данный серсис сервис способен предлагает обработку исторических наборов данных клинических испытаний от пациентов для создания моделей машинного обучения «для конкретных заболеваний», которые, в свою очередь, можно было бы использовать для создания цифровых двойников с соответствующими виртуальными медицинскими записями.
SWORD Health – сервис для физиотерапии и реабилитации, включающий в себя ряд носимых устройств, которые способны считывать физиологические показатели, сигнализирующие о болевых ощущениях, что позволяет анализировать большие массивы данных и предлагать более эффективное лечение, а также корректировать движения для устранения боли
Cala Health - сервис, предлагающий на данный момент единственное рецептурное неинвазивное средство для лечения эссенциального тремора, основанное на данных измеряемых колебаний с помощью носимых устройств, которые на основе этого также способны осуществлять индивидуальную стимуляцию периферических нервов
AppliedVR – это платформа для лечения хронических болей посредством создания библиотеки с данными, которые влияют на болевые ощущения, что позволяет проводить иммерсивную терапию через VR
Digital Diagnostics – первый автономный ИИ, одобренный федеральной организацией FDA (Food and Drug Administration), основанный на данных изображений сетчатки глаза для диагностики глазных заболеваний, вызванных диабетом, без участия врача
Iterative Health – продукт, представляющий собой сервис для автоматизации процессов проведения и анализа результатов данных эндоскопии. Данная технология основана на интерпретации данных эндоскопических изображений, помогая тем самым врачам лучше оценивать пациентов с потенциальными желудочно-кишечными проблемами
Viz.ai – сервис для интеллектуальной координации и оказания медицинской помощи в радиологии. Данная платформа предназначена для анализа данных КТ-сканов мозга с целью нахождения закупорки в нем крупных сосудов. Все полученные результаты система транслирует специалисту в сфере нервно-сосудистых заболеваний с целью обеспечения терапевтического вмешательства на раннем этапе. Такие результаты система получает буквально за несколько минут, обеспечивая этим быстрое реагирование
Unlearn -стартап, который предлагает платформу для ускорения клинических испытаний с помощью искусственного интеллекта, цифровых двойников и различных статистических методов. Данный серсис сервис способен предлагает обработку исторических наборов данных клинических испытаний от пациентов для создания моделей машинного обучения «для конкретных заболеваний», которые, в свою очередь, можно было бы использовать для создания цифровых двойников с соответствующими виртуальными медицинскими записями.
Sword
Whole-Person AI Care for pain, prevention & more | Sword
Sword delivers AI Care with clinical oversight to prevent pain, support recovery, and promote whole-body health. Trusted by employers and health plans.
👍1
📚Топ книг по Data Science на сегодняшний день
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Наука о данных для экономики и финансов - в данной книге рассматривается наука о данных, включая машинное обучение, анализ социальных сетей, веб аналитика, анализ временных рядов и другое применительно к сфере экономики и финансов.
Использование науки о данных в здравоохранении - в данной книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Понимание статистики и экспериментального дизайна - книга предоставляет основы, необходимые для правильного понимания, интерпретации статистики. В данной книге - ключевые концепции, а также обсуждается вопрос, почему эксперименты часто не воспроизводятся.
Создание data science команд - в книге рассматриваются навыки, перспективы, инструменты, процессы, необходимые для роста команд
Математика для машинного обучения - в данной книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Наука о данных для экономики и финансов - в данной книге рассматривается наука о данных, включая машинное обучение, анализ социальных сетей, веб аналитика, анализ временных рядов и другое применительно к сфере экономики и финансов.
Использование науки о данных в здравоохранении - в данной книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Понимание статистики и экспериментального дизайна - книга предоставляет основы, необходимые для правильного понимания, интерпретации статистики. В данной книге - ключевые концепции, а также обсуждается вопрос, почему эксперименты часто не воспроизводятся.
Создание data science команд - в книге рассматриваются навыки, перспективы, инструменты, процессы, необходимые для роста команд
Математика для машинного обучения - в данной книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Amazon
Ethics and Data Science
Ethics and Data Science
👍4🔥1
💯ТОП-7 мартовских ивентов в Data Science
2 марта - ML Party Yerevan • Ереван, Армения https://events.yandex.ru/events/ml-party-02-03-2023/?from=tgdatagym
6-7 марта - OpenTalks.AI • Ереван, Армения https://opentalks.ai/
16 марта - КОНФЕРЕНЦИЯ ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ 2023 • Online https://events.cnews.ru/events/iskusstvennyi_intellekt_2023.shtml
21-23 марта - XXII Международный Customer Contacts World Forum • Москва, Россия https://ccwf.ru/
22 марта - Big Data и BI Day 2023 • Москва, Россия https://www.tadviser.ru/a/701611
29 марта - IV Специализированная конференция «Передовые Технологии Автоматизации. ПТА - Казань 2023» • Казань, Россия https://www.pta-expo.ru/kazan/
29 марта - IT RETAIL DAY 2023 • Москва, Россия https://www.tadviser.ru/a/701605
2 марта - ML Party Yerevan • Ереван, Армения https://events.yandex.ru/events/ml-party-02-03-2023/?from=tgdatagym
6-7 марта - OpenTalks.AI • Ереван, Армения https://opentalks.ai/
16 марта - КОНФЕРЕНЦИЯ ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ 2023 • Online https://events.cnews.ru/events/iskusstvennyi_intellekt_2023.shtml
21-23 марта - XXII Международный Customer Contacts World Forum • Москва, Россия https://ccwf.ru/
22 марта - Big Data и BI Day 2023 • Москва, Россия https://www.tadviser.ru/a/701611
29 марта - IV Специализированная конференция «Передовые Технологии Автоматизации. ПТА - Казань 2023» • Казань, Россия https://www.pta-expo.ru/kazan/
29 марта - IT RETAIL DAY 2023 • Москва, Россия https://www.tadviser.ru/a/701605
ML Party Yerevan
ML Party — регулярные встречи о самых разных применениях машинного обучения в IT. Приглашаем вас принять участие в первой ML Party в 2023 году, которая пройдет в гибридном формате — встретимся офлайн в Ереване (Армения) и онлайн на YouTube.
👍1
💥Топ источников различных датасетов для визуализации данных
FiveThirtyEight — это журналистский сайт, который делает наборы данных из своих статей общедоступными. Данный источник предоставляет исследовательские данные, подходящие для визуализации, и включает в себя такие наборы, как безопасность авиакомпаний, прогнозы выборов и историю погоды в США. Наборы легко доступны для поиска, и сайт постоянно обновляется.
Earth Data - предлагает исследователям различные датасеты в формате открытого доступа. Информация поступает из репозиториев данных NASA, и пользователи могут исследовать все, от климатических данных до конкретных регионов, таких как океаны, до экологических проблем, таких как лесные пожары. На сайте также есть учебные пособия и вебинары, а также статьи. Богатые данные предлагают визуализацию окружающей среды, а также содержат данные от научных партнеров.
The GDELT Project - глобальный набор данных о событиях в глобальном масштабе. Данный источник предлагает одно из крупнейших хранилищ данных для человеческой цивилизации. Исследователи могут исследовать людей, места, темы, организации и другие типы предметов. Данные бесплатны, и пользователи также могут загружать наборы данных RAW для уникальных вариантов использования. Сайт также предлагает множество инструментов для пользователей с меньшим опытом создания собственных визуализаций.
Singapore Public Data - данные, которые правительство Сингапура доступными для различных исследований. Пользователи могут осуществлять поиск по теме с помощью панели навигации или самостоятельно вводить условия поиска. Наборы данных охватывают такие темы, как окружающая среда, образование, инфраструктура и транспорт.
FiveThirtyEight — это журналистский сайт, который делает наборы данных из своих статей общедоступными. Данный источник предоставляет исследовательские данные, подходящие для визуализации, и включает в себя такие наборы, как безопасность авиакомпаний, прогнозы выборов и историю погоды в США. Наборы легко доступны для поиска, и сайт постоянно обновляется.
Earth Data - предлагает исследователям различные датасеты в формате открытого доступа. Информация поступает из репозиториев данных NASA, и пользователи могут исследовать все, от климатических данных до конкретных регионов, таких как океаны, до экологических проблем, таких как лесные пожары. На сайте также есть учебные пособия и вебинары, а также статьи. Богатые данные предлагают визуализацию окружающей среды, а также содержат данные от научных партнеров.
The GDELT Project - глобальный набор данных о событиях в глобальном масштабе. Данный источник предлагает одно из крупнейших хранилищ данных для человеческой цивилизации. Исследователи могут исследовать людей, места, темы, организации и другие типы предметов. Данные бесплатны, и пользователи также могут загружать наборы данных RAW для уникальных вариантов использования. Сайт также предлагает множество инструментов для пользователей с меньшим опытом создания собственных визуализаций.
Singapore Public Data - данные, которые правительство Сингапура доступными для различных исследований. Пользователи могут осуществлять поиск по теме с помощью панели навигации или самостоятельно вводить условия поиска. Наборы данных охватывают такие темы, как окружающая среда, образование, инфраструктура и транспорт.
FiveThirtyEight
Our Data
We’re sharing the data and code behind some of our articles and graphics.
👍1🤔1
Forwarded from Алексей Чернобровов
В продолжение предыдущего поста об отличиях senior аналитика от junior.👨💻
Одно из самых важных качеств senior’а - умение отличать важную задачу от неважной и отвечать на вопросы, которые не заданы в задаче.
Обычно аналитики загружены большим количеством задач, а времени на их решение не так много⏳️. Поэтому необходимо правильно разделять первостепенное и второстепенное.
Так вот, когда аналитикам приходит очередное задание, junior сразу берётся его делать, а senior пытается понять его ценность, нужно ли вообще уделять этому время.🤷
Грубо говоря, хороший аналитик пытается понять ценность задачи и делает в итоге только те действия, которые необходимы бизнесу (часто переформулируя задачу), минимизируя трудозатраты.
А очень хороший аналитик внедряет аналитическую культуру, создает такую обстановку в команде, что менеджер не приходит с запросом посчитать что-либо, а может самостоятельно находить нужные цифры на основе той инфраструктуры и тех отчетов, которые были ранее созданы аналитиками.🔝 Как правило, в таких командах аналитик решает сложные бизнес задачи, помогает в принятии решений.
Давайте рассмотрим на примере.
Запрос от менеджера: "Что будет, если мы сделаем бесплатную доставку, при условии, что в заказе будет один из товаров из выбранной категории? (список категорий прилагается) Сколько мы потеряем денег на субсидировании доставок?"
❗️Важный нюанс, что в выбранной категории есть очень дешевые товары за 10 рублей, например.
Junior аналитик сразу пошел бы считать, сколько стоили все доставки, где содержался один товар из выбранной категории, нашел все заказы из этой категории, посчитал совокупную цифру, сказав, какая была в прошлом месяце, и радостно бы рапортовал об этом заказчику. Потом нашел у себя ошибку в SQL, потому что нужен не один товар, а хотя бы один. :) Исправил, снова прислал цифру. Менеджер бы стал делать какие-то вывод на основе этого.
Senior сразу бы понял нюанс этой задачи, так как если пользователи знают о категории товаров, при добавлении которых в корзину доставка станет бесплатной, то они начнут докидывать самый дешевый товар из категории постоянно, и практически на всех заказах мы будем субсидировать доставку. И для оценки не нужно делать сложных запросов, а можно за 5 минут грубо оценить эту цифру.💡
Условно в первом случае аналитик потратил на это несколько часов и не помог бизнесу, хотя формально сделал все правильно. А senior решил задачу за 5 минут, потому что понял суть вопроса.😊
Одно из самых важных качеств senior’а - умение отличать важную задачу от неважной и отвечать на вопросы, которые не заданы в задаче.
Обычно аналитики загружены большим количеством задач, а времени на их решение не так много⏳️. Поэтому необходимо правильно разделять первостепенное и второстепенное.
Так вот, когда аналитикам приходит очередное задание, junior сразу берётся его делать, а senior пытается понять его ценность, нужно ли вообще уделять этому время.🤷
Грубо говоря, хороший аналитик пытается понять ценность задачи и делает в итоге только те действия, которые необходимы бизнесу (часто переформулируя задачу), минимизируя трудозатраты.
А очень хороший аналитик внедряет аналитическую культуру, создает такую обстановку в команде, что менеджер не приходит с запросом посчитать что-либо, а может самостоятельно находить нужные цифры на основе той инфраструктуры и тех отчетов, которые были ранее созданы аналитиками.🔝 Как правило, в таких командах аналитик решает сложные бизнес задачи, помогает в принятии решений.
Давайте рассмотрим на примере.
Запрос от менеджера: "Что будет, если мы сделаем бесплатную доставку, при условии, что в заказе будет один из товаров из выбранной категории? (список категорий прилагается) Сколько мы потеряем денег на субсидировании доставок?"
❗️Важный нюанс, что в выбранной категории есть очень дешевые товары за 10 рублей, например.
Junior аналитик сразу пошел бы считать, сколько стоили все доставки, где содержался один товар из выбранной категории, нашел все заказы из этой категории, посчитал совокупную цифру, сказав, какая была в прошлом месяце, и радостно бы рапортовал об этом заказчику. Потом нашел у себя ошибку в SQL, потому что нужен не один товар, а хотя бы один. :) Исправил, снова прислал цифру. Менеджер бы стал делать какие-то вывод на основе этого.
Senior сразу бы понял нюанс этой задачи, так как если пользователи знают о категории товаров, при добавлении которых в корзину доставка станет бесплатной, то они начнут докидывать самый дешевый товар из категории постоянно, и практически на всех заказах мы будем субсидировать доставку. И для оценки не нужно делать сложных запросов, а можно за 5 минут грубо оценить эту цифру.💡
Условно в первом случае аналитик потратил на это несколько часов и не помог бизнесу, хотя формально сделал все правильно. А senior решил задачу за 5 минут, потому что понял суть вопроса.😊
👍2
📈📉📊Python-библиотеки для визуализации данных о которых вы возможно не слышали, но которые вам могут быть очень полезны
Bokeh – это интерактивная библиотека визуализации для современных веб-браузеров. Она обеспечивает элегантное, лаконичное построение универсальной графики и обеспечивает высокопроизводительную интерактивность при работе с большими или потоковыми наборами данных.
Geoplotlib – это библиотека языка Python, которая позволяет пользователю разрабатывать карты и наносить на карту географические данные. Данная библиотека используется для рисования различных типов карт, таких как тепловые карты, точечные карты плотности, а также различные картографические диаграммы.
Folium — это библиотека визуализации данных в Python, которая помогает разработчику визуализировать гео-пространственные данные
VisPy – это высокопроизводительная интерактивная библиотека визуализации 2D /3D данных. Данная библиотека использует вычислительную мощность современных графических процессоров (GPU) через библиотеку OpenGL для отображения очень больших наборов данных
Pygal - библиотека языка Python, которая используется для визуализации данных. Данная библиотека также разрабатывает интерактивные графики, которые затем можно внедрить в веб-браузер
Bokeh – это интерактивная библиотека визуализации для современных веб-браузеров. Она обеспечивает элегантное, лаконичное построение универсальной графики и обеспечивает высокопроизводительную интерактивность при работе с большими или потоковыми наборами данных.
Geoplotlib – это библиотека языка Python, которая позволяет пользователю разрабатывать карты и наносить на карту географические данные. Данная библиотека используется для рисования различных типов карт, таких как тепловые карты, точечные карты плотности, а также различные картографические диаграммы.
Folium — это библиотека визуализации данных в Python, которая помогает разработчику визуализировать гео-пространственные данные
VisPy – это высокопроизводительная интерактивная библиотека визуализации 2D /3D данных. Данная библиотека использует вычислительную мощность современных графических процессоров (GPU) через библиотеку OpenGL для отображения очень больших наборов данных
Pygal - библиотека языка Python, которая используется для визуализации данных. Данная библиотека также разрабатывает интерактивные графики, которые затем можно внедрить в веб-браузер
Bokeh
Bokeh documentation
Bokeh is a Python library for creating interactive visualizations for modern web browsers. It helps you build beautiful graphics, ranging from simple plots to complex dashboards with streaming data...
👍3
📝Как улучшить датасеты медицинских снимков: 4 небольших совета
Получение правильных данных в нужном объёме - перед тем, как заказывать массивы данных медицинских снимков, руководителям проектов нужно скоординироваться с командами машинного обучения, data science и клинических исследователей. Это поможет преодолеть сложности получения «плохих» данных или того, что командам аннотаторов придётся фильтровать тысячи нерелевантных или низкокачественных изображений и видео при аннотировании данных обучения, что влияет на потраченные деньги и время.
Предоставление командам аннотаторов инструментов на основе AI - аннотирование медицинских снимков для моделей машинного обучения требует точности, эффективности, высокого уровня качества и безопасности. Благодаря инструментам аннотирования изображений на основе AI медицинские аннотаторы и специалисты могут экономить часы работы и генерировать более точно размеченные медицинские снимки
Обеспечение простоты передачи данных - клинические данные должны доставляться и передаваться в формате, который легко парсить, аннотировать, портировать, а после аннотирования быстро и эффективно передавать в модель ML.
Преодоление сложностей хранения и передачи - данные медицинских снимков часто состоят из сотен или тысяч терабайтов, которые нельзя просто так отправить по почте. Руководителям проектов нужно обеспечить сквозную безопасность и эффективность покупки или извлечения, очистки, хранения и передачи медицинских данных
Получение правильных данных в нужном объёме - перед тем, как заказывать массивы данных медицинских снимков, руководителям проектов нужно скоординироваться с командами машинного обучения, data science и клинических исследователей. Это поможет преодолеть сложности получения «плохих» данных или того, что командам аннотаторов придётся фильтровать тысячи нерелевантных или низкокачественных изображений и видео при аннотировании данных обучения, что влияет на потраченные деньги и время.
Предоставление командам аннотаторов инструментов на основе AI - аннотирование медицинских снимков для моделей машинного обучения требует точности, эффективности, высокого уровня качества и безопасности. Благодаря инструментам аннотирования изображений на основе AI медицинские аннотаторы и специалисты могут экономить часы работы и генерировать более точно размеченные медицинские снимки
Обеспечение простоты передачи данных - клинические данные должны доставляться и передаваться в формате, который легко парсить, аннотировать, портировать, а после аннотирования быстро и эффективно передавать в модель ML.
Преодоление сложностей хранения и передачи - данные медицинских снимков часто состоят из сотен или тысяч терабайтов, которые нельзя просто так отправить по почте. Руководителям проектов нужно обеспечить сквозную безопасность и эффективность покупки или извлечения, очистки, хранения и передачи медицинских данных
👍2
🤼♂️Hive vs Impala: весьма достойные противники
Hive и Impala - это технологии, которые используются для анализа больших данных. В этом посте мы рассмотрим преимущества и недостатки обеих технологий и сравним их между собой.
Hive - это инструмент для анализа данных, который основан на языке запросов HiveQL. Hive позволяет пользователям обращаться к данным в Hadoop Distributed File System (HDFS) с помощью SQL-подобных запросов. Однако, из-за того, что Hive использует архитектуру MapReduce, он может не быть настолько быстрым, как многие другие инструменты для анализа данных.
Impala является интерактивным инструментом для анализа данных, который предназначен для использования в Hadoop-среде. Impala работает с помощью SQL-запросов и может обрабатывать данные в реальном времени. Это означает, что пользователи могут быстро получать результаты запросов без задержек.
Какие же преимущества и недостатки у Hive и Impala?
Преимущества Hive:
• Hive достаточно легко масштабируется и может обрабатывать огромные объемы данных;
• Поддержка пользовательских функций: Hive позволяет пользователям создавать свои собственные функции и агрегатные функции на языке программирования Java, что позволяет пользователю расширять функциональность Hive и создавать свои индивидуальные решения для обработки данных.
Недостатки Hive:
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Преимущества Impala:
• Быстрая обработка запросов: Impala предоставляет высокую производительность при обработке запросов благодаря тому, что использует MPP-архитектуру и распределенные данные в памяти. Это позволяет аналитикам и разработчикам быстро получать результаты запросов без задержек.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Недостатки Impala:
• Ограниченная масштабируемость: Impala не обрабатывает такие большие объемы данных, как Hive, и может столкнуться с ограничениями масштабируемости при работе с большими данными. Impala может потребовать больше ресурсов для работы, чем Hive.
• Высокие требования к ресурсам: Impala потребляет больше ресурсов, чем Hive, из-за использования распределенных данных в памяти. Это может привести к необходимости использования более мощных серверов для обеспечения производительности.
Конечный выбор между Hive и Impala зависит от конкретной ситуации и требований пользователя. Если вы работаете с большими объемами данных и нуждаетесь в простой и доступной для всех SQL-подобной среде, то Hive может быть лучшим выбором. С другой стороны, если вам нужна быстрая обработка данных и поддержка сложных запросов, то Impala может быть предпочтительнее.
Hive и Impala - это технологии, которые используются для анализа больших данных. В этом посте мы рассмотрим преимущества и недостатки обеих технологий и сравним их между собой.
Hive - это инструмент для анализа данных, который основан на языке запросов HiveQL. Hive позволяет пользователям обращаться к данным в Hadoop Distributed File System (HDFS) с помощью SQL-подобных запросов. Однако, из-за того, что Hive использует архитектуру MapReduce, он может не быть настолько быстрым, как многие другие инструменты для анализа данных.
Impala является интерактивным инструментом для анализа данных, который предназначен для использования в Hadoop-среде. Impala работает с помощью SQL-запросов и может обрабатывать данные в реальном времени. Это означает, что пользователи могут быстро получать результаты запросов без задержек.
Какие же преимущества и недостатки у Hive и Impala?
Преимущества Hive:
• Hive достаточно легко масштабируется и может обрабатывать огромные объемы данных;
• Поддержка пользовательских функций: Hive позволяет пользователям создавать свои собственные функции и агрегатные функции на языке программирования Java, что позволяет пользователю расширять функциональность Hive и создавать свои индивидуальные решения для обработки данных.
Недостатки Hive:
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Преимущества Impala:
• Быстрая обработка запросов: Impala предоставляет высокую производительность при обработке запросов благодаря тому, что использует MPP-архитектуру и распределенные данные в памяти. Это позволяет аналитикам и разработчикам быстро получать результаты запросов без задержек.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Недостатки Impala:
• Ограниченная масштабируемость: Impala не обрабатывает такие большие объемы данных, как Hive, и может столкнуться с ограничениями масштабируемости при работе с большими данными. Impala может потребовать больше ресурсов для работы, чем Hive.
• Высокие требования к ресурсам: Impala потребляет больше ресурсов, чем Hive, из-за использования распределенных данных в памяти. Это может привести к необходимости использования более мощных серверов для обеспечения производительности.
Конечный выбор между Hive и Impala зависит от конкретной ситуации и требований пользователя. Если вы работаете с большими объемами данных и нуждаетесь в простой и доступной для всех SQL-подобной среде, то Hive может быть лучшим выбором. С другой стороны, если вам нужна быстрая обработка данных и поддержка сложных запросов, то Impala может быть предпочтительнее.
👍3
⛑⛑⛑Медицинские данные: что нужно учитывать при работе с информацией здравоохранения
Основная проблема данных здравоохранения заключается в их уязвимости. Они содержат конфиденциальную информацию, защищённую Health Insurance Portability and Accountability Act (HIPAA), и не могут использоваться без явно выраженного согласия. В сфере медицины чувствительные подробности называются защищаемой информацией о здоровье (protected health information, PHI). Вот несколько факторов, которые следует учитывать при работе с медицинскими наборами данных:
Protected Health Information (PHI) содержится в различных медицинских документах: электронных письмах, клинических заметках, результатах тестов или сканах КТ. Хотя диагнозы или медицинские предписания сами по себе не считаются чувствительной информацией, они становятся предметом HIPAA, когда сопоставляются с так называемыми идентификаторами: именами, датами, контактами, номерами социального страхования или счетов, фотографиями лиц или другими элементами, при помощи которых можно находить или идентифицировать конкретного пациента, а также связываться с ним.
Анонимизация медицинских данных и удаление из них персональной информации. Прежде чем использовать медицинские данные для исследовательских или деловых целей, необходимо избавиться от идентификаторов личности и даже от их частей (например, инициалов). Существует два способа это сделать — анонимизация и удаление личной информации. Анонимизация — это безвозвратное устранение всех чувствительных данных. Удаление персональной информации (de-identification) только шифрует личные сведения и скрывает их в отдельных датасетах. Позже идентификаторы можно повторно связать с информацией о здоровье. Вторая методика требует больше усилий, чем первая. Как бы то ни было, в обоих случаях потребность соответствия требованиям нормативов добавляет ещё один этап к подготовке датасетов для машинного обучения.
Разметка медицинских данных. Какие угодно неструктурированные данные (тексты, изображения или аудиофайлы) для обучения моделей машинного обучения требуют разметки или аннотирования. Это процесс добавления к блокам данных описательных элементов (меток или тэгов), чтобы машина могла понимать, что находится в изображении или тексте. При работе с данными здравоохранения разметку должны выполнять медицинские специалисты. Почасовая стоимость их услуг гораздо выше, чем у аннотаторов, не имеющих знаний в предметной области. Это создаёт ещё один барьер перед генерацией качественных медицинских датасетов.
Подводя итог, хочется отметить, что подготовка медицинских данных для машинного обучения обычно требует больше денег и времени, чем в среднем в других отраслях из-за строгого регулирования и участия высокооплачиваемых специалистов в предметной области. Следовательно, мы наблюдаем ситуацию, что публичные медицинские датасеты относительно редко встречаются и привлекают серьёзное внимание исследователей, дата-саентистов и компаний, работающих над ИИ-решениями в сфере медицины.
Основная проблема данных здравоохранения заключается в их уязвимости. Они содержат конфиденциальную информацию, защищённую Health Insurance Portability and Accountability Act (HIPAA), и не могут использоваться без явно выраженного согласия. В сфере медицины чувствительные подробности называются защищаемой информацией о здоровье (protected health information, PHI). Вот несколько факторов, которые следует учитывать при работе с медицинскими наборами данных:
Protected Health Information (PHI) содержится в различных медицинских документах: электронных письмах, клинических заметках, результатах тестов или сканах КТ. Хотя диагнозы или медицинские предписания сами по себе не считаются чувствительной информацией, они становятся предметом HIPAA, когда сопоставляются с так называемыми идентификаторами: именами, датами, контактами, номерами социального страхования или счетов, фотографиями лиц или другими элементами, при помощи которых можно находить или идентифицировать конкретного пациента, а также связываться с ним.
Анонимизация медицинских данных и удаление из них персональной информации. Прежде чем использовать медицинские данные для исследовательских или деловых целей, необходимо избавиться от идентификаторов личности и даже от их частей (например, инициалов). Существует два способа это сделать — анонимизация и удаление личной информации. Анонимизация — это безвозвратное устранение всех чувствительных данных. Удаление персональной информации (de-identification) только шифрует личные сведения и скрывает их в отдельных датасетах. Позже идентификаторы можно повторно связать с информацией о здоровье. Вторая методика требует больше усилий, чем первая. Как бы то ни было, в обоих случаях потребность соответствия требованиям нормативов добавляет ещё один этап к подготовке датасетов для машинного обучения.
Разметка медицинских данных. Какие угодно неструктурированные данные (тексты, изображения или аудиофайлы) для обучения моделей машинного обучения требуют разметки или аннотирования. Это процесс добавления к блокам данных описательных элементов (меток или тэгов), чтобы машина могла понимать, что находится в изображении или тексте. При работе с данными здравоохранения разметку должны выполнять медицинские специалисты. Почасовая стоимость их услуг гораздо выше, чем у аннотаторов, не имеющих знаний в предметной области. Это создаёт ещё один барьер перед генерацией качественных медицинских датасетов.
Подводя итог, хочется отметить, что подготовка медицинских данных для машинного обучения обычно требует больше денег и времени, чем в среднем в других отраслях из-за строгого регулирования и участия высокооплачиваемых специалистов в предметной области. Следовательно, мы наблюдаем ситуацию, что публичные медицинские датасеты относительно редко встречаются и привлекают серьёзное внимание исследователей, дата-саентистов и компаний, работающих над ИИ-решениями в сфере медицины.
👍2😁1
📖Топ достаточно полезных книг по визуализации данных
Effective Data Storytelling: How to Drive Change - Книга написана американским консультантом по бизнес-аналитике Брентом Дайксом, подойдет в том числе и читателям без технического бэкграунда. Речь пойдет не столько о визуализации данных, как о том, как через них рассказать историю. В книге Дайкс описывает собственный фреймворк data storytelling — как с помощью трех основных элементов (самих данных, повествования и визуальных эффектов) вычленить закономерности, разработать концепции решений и обосновать их аудитории.
Information Dashboard Design - это практическое руководство, в котором описаны лучшие практики и самые распространенные ошибки при создании дашбордов. Отдельная часть книги посвящена введению в теорию дизайна и визуализации данных.
The Accidental Analyst - интуитивно понятная пошаговая инструкция для решения сложных задач по визуализации данных. В книге описаны семь принципов анализа, которые и определяют порядок действий для работы с данными.
Beautiful Visualization. Looking at Data Through the Eyes of Experts - данная книга рассказывает о процессе визуализации данных на примерах реальных проектов. В ней есть комментарии 24 отраслевых экспертов — от дизайнеров и ученых до художников и статистиков — которые рассказывают о своих методах, подходах и философии визуализации данных.
The Big Book of Dashboards - данная книга представляет собой руководство по созданию дашбордов. Кроме этого, в книге есть целый раздел, посвященный психологическим факторам. Например, как реагировать, если заказчик попросит улучшить ваш дашборд, добавив туда парочку бесполезных диаграмм.
Effective Data Storytelling: How to Drive Change - Книга написана американским консультантом по бизнес-аналитике Брентом Дайксом, подойдет в том числе и читателям без технического бэкграунда. Речь пойдет не столько о визуализации данных, как о том, как через них рассказать историю. В книге Дайкс описывает собственный фреймворк data storytelling — как с помощью трех основных элементов (самих данных, повествования и визуальных эффектов) вычленить закономерности, разработать концепции решений и обосновать их аудитории.
Information Dashboard Design - это практическое руководство, в котором описаны лучшие практики и самые распространенные ошибки при создании дашбордов. Отдельная часть книги посвящена введению в теорию дизайна и визуализации данных.
The Accidental Analyst - интуитивно понятная пошаговая инструкция для решения сложных задач по визуализации данных. В книге описаны семь принципов анализа, которые и определяют порядок действий для работы с данными.
Beautiful Visualization. Looking at Data Through the Eyes of Experts - данная книга рассказывает о процессе визуализации данных на примерах реальных проектов. В ней есть комментарии 24 отраслевых экспертов — от дизайнеров и ученых до художников и статистиков — которые рассказывают о своих методах, подходах и философии визуализации данных.
The Big Book of Dashboards - данная книга представляет собой руководство по созданию дашбордов. Кроме этого, в книге есть целый раздел, посвященный психологическим факторам. Например, как реагировать, если заказчик попросит улучшить ваш дашборд, добавив туда парочку бесполезных диаграмм.
👍2
💥YTsaurus: система для хранения и обработки Big Data Яндекса стала open-source
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;
В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.
В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;
В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.
В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
👍2🔥1
🤔Что такое Data Mesh: суть концепции
Data Mesh - это децентрализованный гибкий подход к работе различных распределенных команд и распространению информации. Data Mesh родился как ответ на господствующие концепции работы с данными в data-driven организациях - Data Warehouse и Data Lake. Их объединяет идея централизованности. Все данные стекаются в некое центральное хранилище, откуда уже их могут забирать для своих целей разные команды. Однако все это нуждается в поддержке командой data-инженеров с особым набором скиллов. Также при при росте количества источников и разнообразия данных становится всё сложнее обеспечивать их бизнес-качество, пайплайны по трансформации становятся всё сложнее.
Дата меш предлагает решать эти и другие проблемы на основе четырёх главных принципов:
1. Domain-oriented ownership - данными владеют доменные команды, а не централизованная Data-команда. Домен - это часть организации, выполняющая определённую бизнес-функцию, например, это могут быть продуктовые домены (маммография, флюорография, КТ органов грудной клетки) или домен по работе с врачами-разметчиками.
2. Data as a product - данные воспринимаются не как статичный датасет, а как динамичный продукт со своими пользователями, метриками качества, бэклогом развития, за которым следит выделенный product-owner.
3. Self-serve data platform. Основная функция дата-платформы в Data Mesh - это устранять лишнюю когнитивную нагрузку. Это позволяет разработчикам в доменных командах (data product developers и data product consumers), которые не являются специалистами по работе с данными, удобно создавать Data-продукты, билдить, деплоить, тестить, обновлять их, получать к ним доступ и использовать в своих целях.
4. Federated computational governance - вместо централизованного управления данными создаётся специальный федеративный орган, состоящий из представителей доменных команд, дата-платформы и экспертов (например, юристов и врачей), который устанавливает глобальные политики в области работы с данными и обсуждает развитие дата-платформы.
Data Mesh - это децентрализованный гибкий подход к работе различных распределенных команд и распространению информации. Data Mesh родился как ответ на господствующие концепции работы с данными в data-driven организациях - Data Warehouse и Data Lake. Их объединяет идея централизованности. Все данные стекаются в некое центральное хранилище, откуда уже их могут забирать для своих целей разные команды. Однако все это нуждается в поддержке командой data-инженеров с особым набором скиллов. Также при при росте количества источников и разнообразия данных становится всё сложнее обеспечивать их бизнес-качество, пайплайны по трансформации становятся всё сложнее.
Дата меш предлагает решать эти и другие проблемы на основе четырёх главных принципов:
1. Domain-oriented ownership - данными владеют доменные команды, а не централизованная Data-команда. Домен - это часть организации, выполняющая определённую бизнес-функцию, например, это могут быть продуктовые домены (маммография, флюорография, КТ органов грудной клетки) или домен по работе с врачами-разметчиками.
2. Data as a product - данные воспринимаются не как статичный датасет, а как динамичный продукт со своими пользователями, метриками качества, бэклогом развития, за которым следит выделенный product-owner.
3. Self-serve data platform. Основная функция дата-платформы в Data Mesh - это устранять лишнюю когнитивную нагрузку. Это позволяет разработчикам в доменных командах (data product developers и data product consumers), которые не являются специалистами по работе с данными, удобно создавать Data-продукты, билдить, деплоить, тестить, обновлять их, получать к ним доступ и использовать в своих целях.
4. Federated computational governance - вместо централизованного управления данными создаётся специальный федеративный орган, состоящий из представителей доменных команд, дата-платформы и экспертов (например, юристов и врачей), который устанавливает глобальные политики в области работы с данными и обсуждает развитие дата-платформы.
👍2
🤓Что такое синтетические данные и зачем их используют?
Синтетические данные — это искусственные данные, имитирующие наблюдения реального мира и используемые для подготовки моделей машинного обучения, когда получение реальных данных невозможно из-за сложности или дороговизны. Синтезированные данные могут использоваться практически для любого проекта, в котором требуется, чтобы компьютерная симуляция прогнозировала или анализировала реальные события. Существует множество причин, по которым бизнес может задуматься об использовании синтетических данных. Вот некоторые из них:
1. Эффективность финансовых и временных затрат. Если нет подходящего датасета, генерация синтетических данных может быть намного дешевле, чем сбор данных событий реального мира. То же самое относится и к временному фактору: синтезирование может занять считанные дни, а для сбора и обработки реальных данных иногда требуются недели, месяцы или даже годы.
2. Исследование редких данных. В некоторых случаях данные редки или их сбор связан с опасностью. Примером редких данных может быть набор необычных случаев мошенничества. Пример опасных реальных данных — это дорожно-транспортные происшествия, на которые должны научиться реагировать беспилотные автомобили. В таком случае их можно заменить синтетическими ДТП.
3. Устранение проблем с конфиденциальностью. При необходимости обработки или передачи сторонним лицам уязвимых данных следует учитывать вопросы конфиденциальности. В отличие от анонимизации, генерация синтетических данных устраняет любые следы идентификации реальных данных, создавая новые валидные датасеты без ущерба конфиденциальности.
4. Простота разметки и контроля. С технической точки зрения, полностью синтетические данные упрощают разметку. Например, если сгенерировано изображение парка, можно легко автоматически присвоить метки деревьям, людям и животным. Вам не придётся нанимать людей для ручной разметки этих объектов. К тому же полностью синтезированные данные легко контролировать и изменять.
Синтетические данные — это искусственные данные, имитирующие наблюдения реального мира и используемые для подготовки моделей машинного обучения, когда получение реальных данных невозможно из-за сложности или дороговизны. Синтезированные данные могут использоваться практически для любого проекта, в котором требуется, чтобы компьютерная симуляция прогнозировала или анализировала реальные события. Существует множество причин, по которым бизнес может задуматься об использовании синтетических данных. Вот некоторые из них:
1. Эффективность финансовых и временных затрат. Если нет подходящего датасета, генерация синтетических данных может быть намного дешевле, чем сбор данных событий реального мира. То же самое относится и к временному фактору: синтезирование может занять считанные дни, а для сбора и обработки реальных данных иногда требуются недели, месяцы или даже годы.
2. Исследование редких данных. В некоторых случаях данные редки или их сбор связан с опасностью. Примером редких данных может быть набор необычных случаев мошенничества. Пример опасных реальных данных — это дорожно-транспортные происшествия, на которые должны научиться реагировать беспилотные автомобили. В таком случае их можно заменить синтетическими ДТП.
3. Устранение проблем с конфиденциальностью. При необходимости обработки или передачи сторонним лицам уязвимых данных следует учитывать вопросы конфиденциальности. В отличие от анонимизации, генерация синтетических данных устраняет любые следы идентификации реальных данных, создавая новые валидные датасеты без ущерба конфиденциальности.
4. Простота разметки и контроля. С технической точки зрения, полностью синтетические данные упрощают разметку. Например, если сгенерировано изображение парка, можно легко автоматически присвоить метки деревьям, людям и животным. Вам не придётся нанимать людей для ручной разметки этих объектов. К тому же полностью синтезированные данные легко контролировать и изменять.
🤔1