🔥Обрабатываем данные с помощью Elastic Stack
Elastic Stack — обширная экосистема компонентов, которые служат для поиска и обработки больших данных. Данная экосистема является распределенной системой на основе JSON, которая сочетает в себе функции NoSQL-базы данных. Работу Elastic Stack обеспечивают такие компоненты, как:
• Elasticsearch - это большое, быстрое и хорошо масштабируемое нереляционное хранилище данных, которое стало отличным инструментом для поиска и аналитики журналов благодаря мощности, простоте, документам JSON без схем, поддержке разных языков и геолокации. Система может быстро обрабатывать большие объемы журналов, индексировать системные логи по мере поступления и выполнять запросы к ним в режиме реального времени. Выполнение операций в Elasticsearch, таких как чтение или запись данных, обычно занимает менее секунды, что позволяет использовать его в таких примерах, где необходимо реагировать почти в режиме реального времени, например, для мониторинга приложений и обнаружения каких-либо аномалий.
• Longstash - данная утилита помогает централизовать данные, связанные с событиями, такие как сведения из файлов регистрации (логов), разные показатели (метрики) или любые другие данные в любом формате. Она может выполнить обработку данных до того, как сформировать нужную вам выборку. Это ключевой компонент Elastic Stack, который используется для сбора и обработки ваших контейнеров данных. Logstash считается компонентом на стороне сервера. Его основная цель — выполнение сбора данных из обширного количества источников ввода в масштабируемом виде, а также обработатка информации и отправка ее по месту назначения. По умолчанию преобразованная информация поступает в Elasticsearch, также существует возможность выбрать один из многих других вариантов вывода. Архитектура Logstash основана на плагинах и легко расширяется. Поддерживаются три вида плагинов: ввода, фильтрации и вывода.
• Kibana - это инструмент для визуализации в Elastic Stack, который помогает наглядно представить данные в Elasticsearch. В Kibana предлагается множество вариантов визуализаций, таких как гистограмма, карта, линейные графики, временные ряды и др. Kibana позволяет создавать визуализации буквально парой щелчков кнопкой мыши и исследовать свои данные в интерактивном виде. Кроме того, есть возможность создавать красивые панели управления, состоящие из различных визуализаций, делиться ими, а также получать высококачественные отчеты.
• Beats - это платформа доставки данных с открытым исходным кодом, дополняющая Logstash. В отличие от Logstash, работающей на серверной стороне, Beats располагается на стороне клиента. В основе данной платформы лежит библиотека libbeat, которая предоставляет API для передачи данных от источника, настройки ввода и реализации сбора данных. Beats устанавливается на устройства, которые не являются частью серверных компонентов, таких как Elasticsearch, Logstash или Kibana. Они размещаются на не кластерных узлах, которые также иногда называют пограничными узлами.
Загрузить элементы Elastic Stack можно по следующей ссылке: https://www.elastic.co/elastic-stack/
Elastic Stack — обширная экосистема компонентов, которые служат для поиска и обработки больших данных. Данная экосистема является распределенной системой на основе JSON, которая сочетает в себе функции NoSQL-базы данных. Работу Elastic Stack обеспечивают такие компоненты, как:
• Elasticsearch - это большое, быстрое и хорошо масштабируемое нереляционное хранилище данных, которое стало отличным инструментом для поиска и аналитики журналов благодаря мощности, простоте, документам JSON без схем, поддержке разных языков и геолокации. Система может быстро обрабатывать большие объемы журналов, индексировать системные логи по мере поступления и выполнять запросы к ним в режиме реального времени. Выполнение операций в Elasticsearch, таких как чтение или запись данных, обычно занимает менее секунды, что позволяет использовать его в таких примерах, где необходимо реагировать почти в режиме реального времени, например, для мониторинга приложений и обнаружения каких-либо аномалий.
• Longstash - данная утилита помогает централизовать данные, связанные с событиями, такие как сведения из файлов регистрации (логов), разные показатели (метрики) или любые другие данные в любом формате. Она может выполнить обработку данных до того, как сформировать нужную вам выборку. Это ключевой компонент Elastic Stack, который используется для сбора и обработки ваших контейнеров данных. Logstash считается компонентом на стороне сервера. Его основная цель — выполнение сбора данных из обширного количества источников ввода в масштабируемом виде, а также обработатка информации и отправка ее по месту назначения. По умолчанию преобразованная информация поступает в Elasticsearch, также существует возможность выбрать один из многих других вариантов вывода. Архитектура Logstash основана на плагинах и легко расширяется. Поддерживаются три вида плагинов: ввода, фильтрации и вывода.
• Kibana - это инструмент для визуализации в Elastic Stack, который помогает наглядно представить данные в Elasticsearch. В Kibana предлагается множество вариантов визуализаций, таких как гистограмма, карта, линейные графики, временные ряды и др. Kibana позволяет создавать визуализации буквально парой щелчков кнопкой мыши и исследовать свои данные в интерактивном виде. Кроме того, есть возможность создавать красивые панели управления, состоящие из различных визуализаций, делиться ими, а также получать высококачественные отчеты.
• Beats - это платформа доставки данных с открытым исходным кодом, дополняющая Logstash. В отличие от Logstash, работающей на серверной стороне, Beats располагается на стороне клиента. В основе данной платформы лежит библиотека libbeat, которая предоставляет API для передачи данных от источника, настройки ввода и реализации сбора данных. Beats устанавливается на устройства, которые не являются частью серверных компонентов, таких как Elasticsearch, Logstash или Kibana. Они размещаются на не кластерных узлах, которые также иногда называют пограничными узлами.
Загрузить элементы Elastic Stack можно по следующей ссылке: https://www.elastic.co/elastic-stack/
Elastic
Elastic Stack: (ELK) Elasticsearch, Kibana & Logstash
Reliably and securely take data from any source, in any format, then search, analyze, and visualize it in real time.
👍2
👑Работаем с графами в Python с помощью NetWorkX
NetWorkX — библиотека, которая предназначена для создания, изучения и манипуляции графами и иными сетевыми структурами. Данная бибилиотека является бесплатной, распространяемой по лицензии BSD. NetworkX используется для обучения теории графов, а также научных исследований и решения прикладных задач, в которых она применяется. NetWorkX имеет ряд сильных преимуществ, среди которых:
Высокая производительность - NetworkX способна свободно оперировать крупными сетевыми системами, содержащими до 10 миллионов вершин и 100 миллионов ребер между ними. Это особенно полезно при анализе Big Data — например, выгрузки из социальных сетей, объединяющих миллионы пользователей.
Простота использования - так как библиотека NetworkX написана на языке Python, работа с ней не составляет особого труда как для профессиональных программистов, так и для любителей. А модули визуализации графов обеспечивают наглядность полученного результата, который можно корректировать в режиме реального времени. Для того, чтобы создать полноценный граф, необходимо всего 4 строчки кода (одна из них - это просто импорт😁):
import networkx as nx
G=nx.Graph()
G.add_edge(1,2) # # значение по умолчанию для дуги задаётся = 1
G.add_edge(2,3,weight=0.9) # # задаётся значение атрибута
Эффективность - из-за того, что библиотека реализована на низкоуровневой структуре данных языка программирования Python, обеспечивается эффективное расходование аппаратных и программных ресурсов компьютера. Это увеличивает возможности по масштабированию графов, а также уменьшает зависимость от особенностей аппаратной платформы и операционной системы.
Постоянная поддержка - для NetworkX разработана подробная документация, описывающая функционал и ограничения библиотеки. Репозитории постоянно обновляются. В них собраны готовые типовые решения для программистов, заметно облегчающие работу.
Открытый исходный код - пользователь получает большие возможности по настройке и расширению функционала библиотеки, ее адаптации под конкретные задачи. При желании пользователь сам может разработать дополнительное ПО для работы с этой библиотекой.
NetWorkX — библиотека, которая предназначена для создания, изучения и манипуляции графами и иными сетевыми структурами. Данная бибилиотека является бесплатной, распространяемой по лицензии BSD. NetworkX используется для обучения теории графов, а также научных исследований и решения прикладных задач, в которых она применяется. NetWorkX имеет ряд сильных преимуществ, среди которых:
Высокая производительность - NetworkX способна свободно оперировать крупными сетевыми системами, содержащими до 10 миллионов вершин и 100 миллионов ребер между ними. Это особенно полезно при анализе Big Data — например, выгрузки из социальных сетей, объединяющих миллионы пользователей.
Простота использования - так как библиотека NetworkX написана на языке Python, работа с ней не составляет особого труда как для профессиональных программистов, так и для любителей. А модули визуализации графов обеспечивают наглядность полученного результата, который можно корректировать в режиме реального времени. Для того, чтобы создать полноценный граф, необходимо всего 4 строчки кода (одна из них - это просто импорт😁):
import networkx as nx
G=nx.Graph()
G.add_edge(1,2) # # значение по умолчанию для дуги задаётся = 1
G.add_edge(2,3,weight=0.9) # # задаётся значение атрибута
Эффективность - из-за того, что библиотека реализована на низкоуровневой структуре данных языка программирования Python, обеспечивается эффективное расходование аппаратных и программных ресурсов компьютера. Это увеличивает возможности по масштабированию графов, а также уменьшает зависимость от особенностей аппаратной платформы и операционной системы.
Постоянная поддержка - для NetworkX разработана подробная документация, описывающая функционал и ограничения библиотеки. Репозитории постоянно обновляются. В них собраны готовые типовые решения для программистов, заметно облегчающие работу.
Открытый исходный код - пользователь получает большие возможности по настройке и расширению функционала библиотеки, ее адаптации под конкретные задачи. При желании пользователь сам может разработать дополнительное ПО для работы с этой библиотекой.
👍3
⛑Топ 7 DS-стартапов в медицине за 2022 год
SWORD Health – сервис для физиотерапии и реабилитации, включающий в себя ряд носимых устройств, которые способны считывать физиологические показатели, сигнализирующие о болевых ощущениях, что позволяет анализировать большие массивы данных и предлагать более эффективное лечение, а также корректировать движения для устранения боли
Cala Health - сервис, предлагающий на данный момент единственное рецептурное неинвазивное средство для лечения эссенциального тремора, основанное на данных измеряемых колебаний с помощью носимых устройств, которые на основе этого также способны осуществлять индивидуальную стимуляцию периферических нервов
AppliedVR – это платформа для лечения хронических болей посредством создания библиотеки с данными, которые влияют на болевые ощущения, что позволяет проводить иммерсивную терапию через VR
Digital Diagnostics – первый автономный ИИ, одобренный федеральной организацией FDA (Food and Drug Administration), основанный на данных изображений сетчатки глаза для диагностики глазных заболеваний, вызванных диабетом, без участия врача
Iterative Health – продукт, представляющий собой сервис для автоматизации процессов проведения и анализа результатов данных эндоскопии. Данная технология основана на интерпретации данных эндоскопических изображений, помогая тем самым врачам лучше оценивать пациентов с потенциальными желудочно-кишечными проблемами
Viz.ai – сервис для интеллектуальной координации и оказания медицинской помощи в радиологии. Данная платформа предназначена для анализа данных КТ-сканов мозга с целью нахождения закупорки в нем крупных сосудов. Все полученные результаты система транслирует специалисту в сфере нервно-сосудистых заболеваний с целью обеспечения терапевтического вмешательства на раннем этапе. Такие результаты система получает буквально за несколько минут, обеспечивая этим быстрое реагирование
Unlearn -стартап, который предлагает платформу для ускорения клинических испытаний с помощью искусственного интеллекта, цифровых двойников и различных статистических методов. Данный серсис сервис способен предлагает обработку исторических наборов данных клинических испытаний от пациентов для создания моделей машинного обучения «для конкретных заболеваний», которые, в свою очередь, можно было бы использовать для создания цифровых двойников с соответствующими виртуальными медицинскими записями.
SWORD Health – сервис для физиотерапии и реабилитации, включающий в себя ряд носимых устройств, которые способны считывать физиологические показатели, сигнализирующие о болевых ощущениях, что позволяет анализировать большие массивы данных и предлагать более эффективное лечение, а также корректировать движения для устранения боли
Cala Health - сервис, предлагающий на данный момент единственное рецептурное неинвазивное средство для лечения эссенциального тремора, основанное на данных измеряемых колебаний с помощью носимых устройств, которые на основе этого также способны осуществлять индивидуальную стимуляцию периферических нервов
AppliedVR – это платформа для лечения хронических болей посредством создания библиотеки с данными, которые влияют на болевые ощущения, что позволяет проводить иммерсивную терапию через VR
Digital Diagnostics – первый автономный ИИ, одобренный федеральной организацией FDA (Food and Drug Administration), основанный на данных изображений сетчатки глаза для диагностики глазных заболеваний, вызванных диабетом, без участия врача
Iterative Health – продукт, представляющий собой сервис для автоматизации процессов проведения и анализа результатов данных эндоскопии. Данная технология основана на интерпретации данных эндоскопических изображений, помогая тем самым врачам лучше оценивать пациентов с потенциальными желудочно-кишечными проблемами
Viz.ai – сервис для интеллектуальной координации и оказания медицинской помощи в радиологии. Данная платформа предназначена для анализа данных КТ-сканов мозга с целью нахождения закупорки в нем крупных сосудов. Все полученные результаты система транслирует специалисту в сфере нервно-сосудистых заболеваний с целью обеспечения терапевтического вмешательства на раннем этапе. Такие результаты система получает буквально за несколько минут, обеспечивая этим быстрое реагирование
Unlearn -стартап, который предлагает платформу для ускорения клинических испытаний с помощью искусственного интеллекта, цифровых двойников и различных статистических методов. Данный серсис сервис способен предлагает обработку исторических наборов данных клинических испытаний от пациентов для создания моделей машинного обучения «для конкретных заболеваний», которые, в свою очередь, можно было бы использовать для создания цифровых двойников с соответствующими виртуальными медицинскими записями.
Sword
Whole-Person AI Care for pain, prevention & more | Sword
Sword delivers AI Care with clinical oversight to prevent pain, support recovery, and promote whole-body health. Trusted by employers and health plans.
👍1
📚Топ книг по Data Science на сегодняшний день
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Наука о данных для экономики и финансов - в данной книге рассматривается наука о данных, включая машинное обучение, анализ социальных сетей, веб аналитика, анализ временных рядов и другое применительно к сфере экономики и финансов.
Использование науки о данных в здравоохранении - в данной книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Понимание статистики и экспериментального дизайна - книга предоставляет основы, необходимые для правильного понимания, интерпретации статистики. В данной книге - ключевые концепции, а также обсуждается вопрос, почему эксперименты часто не воспроизводятся.
Создание data science команд - в книге рассматриваются навыки, перспективы, инструменты, процессы, необходимые для роста команд
Математика для машинного обучения - в данной книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Наука о данных для экономики и финансов - в данной книге рассматривается наука о данных, включая машинное обучение, анализ социальных сетей, веб аналитика, анализ временных рядов и другое применительно к сфере экономики и финансов.
Использование науки о данных в здравоохранении - в данной книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Понимание статистики и экспериментального дизайна - книга предоставляет основы, необходимые для правильного понимания, интерпретации статистики. В данной книге - ключевые концепции, а также обсуждается вопрос, почему эксперименты часто не воспроизводятся.
Создание data science команд - в книге рассматриваются навыки, перспективы, инструменты, процессы, необходимые для роста команд
Математика для машинного обучения - в данной книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Amazon
Ethics and Data Science
Ethics and Data Science
👍4🔥1
💯ТОП-7 мартовских ивентов в Data Science
2 марта - ML Party Yerevan • Ереван, Армения https://events.yandex.ru/events/ml-party-02-03-2023/?from=tgdatagym
6-7 марта - OpenTalks.AI • Ереван, Армения https://opentalks.ai/
16 марта - КОНФЕРЕНЦИЯ ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ 2023 • Online https://events.cnews.ru/events/iskusstvennyi_intellekt_2023.shtml
21-23 марта - XXII Международный Customer Contacts World Forum • Москва, Россия https://ccwf.ru/
22 марта - Big Data и BI Day 2023 • Москва, Россия https://www.tadviser.ru/a/701611
29 марта - IV Специализированная конференция «Передовые Технологии Автоматизации. ПТА - Казань 2023» • Казань, Россия https://www.pta-expo.ru/kazan/
29 марта - IT RETAIL DAY 2023 • Москва, Россия https://www.tadviser.ru/a/701605
2 марта - ML Party Yerevan • Ереван, Армения https://events.yandex.ru/events/ml-party-02-03-2023/?from=tgdatagym
6-7 марта - OpenTalks.AI • Ереван, Армения https://opentalks.ai/
16 марта - КОНФЕРЕНЦИЯ ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ 2023 • Online https://events.cnews.ru/events/iskusstvennyi_intellekt_2023.shtml
21-23 марта - XXII Международный Customer Contacts World Forum • Москва, Россия https://ccwf.ru/
22 марта - Big Data и BI Day 2023 • Москва, Россия https://www.tadviser.ru/a/701611
29 марта - IV Специализированная конференция «Передовые Технологии Автоматизации. ПТА - Казань 2023» • Казань, Россия https://www.pta-expo.ru/kazan/
29 марта - IT RETAIL DAY 2023 • Москва, Россия https://www.tadviser.ru/a/701605
ML Party Yerevan
ML Party — регулярные встречи о самых разных применениях машинного обучения в IT. Приглашаем вас принять участие в первой ML Party в 2023 году, которая пройдет в гибридном формате — встретимся офлайн в Ереване (Армения) и онлайн на YouTube.
👍1
💥Топ источников различных датасетов для визуализации данных
FiveThirtyEight — это журналистский сайт, который делает наборы данных из своих статей общедоступными. Данный источник предоставляет исследовательские данные, подходящие для визуализации, и включает в себя такие наборы, как безопасность авиакомпаний, прогнозы выборов и историю погоды в США. Наборы легко доступны для поиска, и сайт постоянно обновляется.
Earth Data - предлагает исследователям различные датасеты в формате открытого доступа. Информация поступает из репозиториев данных NASA, и пользователи могут исследовать все, от климатических данных до конкретных регионов, таких как океаны, до экологических проблем, таких как лесные пожары. На сайте также есть учебные пособия и вебинары, а также статьи. Богатые данные предлагают визуализацию окружающей среды, а также содержат данные от научных партнеров.
The GDELT Project - глобальный набор данных о событиях в глобальном масштабе. Данный источник предлагает одно из крупнейших хранилищ данных для человеческой цивилизации. Исследователи могут исследовать людей, места, темы, организации и другие типы предметов. Данные бесплатны, и пользователи также могут загружать наборы данных RAW для уникальных вариантов использования. Сайт также предлагает множество инструментов для пользователей с меньшим опытом создания собственных визуализаций.
Singapore Public Data - данные, которые правительство Сингапура доступными для различных исследований. Пользователи могут осуществлять поиск по теме с помощью панели навигации или самостоятельно вводить условия поиска. Наборы данных охватывают такие темы, как окружающая среда, образование, инфраструктура и транспорт.
FiveThirtyEight — это журналистский сайт, который делает наборы данных из своих статей общедоступными. Данный источник предоставляет исследовательские данные, подходящие для визуализации, и включает в себя такие наборы, как безопасность авиакомпаний, прогнозы выборов и историю погоды в США. Наборы легко доступны для поиска, и сайт постоянно обновляется.
Earth Data - предлагает исследователям различные датасеты в формате открытого доступа. Информация поступает из репозиториев данных NASA, и пользователи могут исследовать все, от климатических данных до конкретных регионов, таких как океаны, до экологических проблем, таких как лесные пожары. На сайте также есть учебные пособия и вебинары, а также статьи. Богатые данные предлагают визуализацию окружающей среды, а также содержат данные от научных партнеров.
The GDELT Project - глобальный набор данных о событиях в глобальном масштабе. Данный источник предлагает одно из крупнейших хранилищ данных для человеческой цивилизации. Исследователи могут исследовать людей, места, темы, организации и другие типы предметов. Данные бесплатны, и пользователи также могут загружать наборы данных RAW для уникальных вариантов использования. Сайт также предлагает множество инструментов для пользователей с меньшим опытом создания собственных визуализаций.
Singapore Public Data - данные, которые правительство Сингапура доступными для различных исследований. Пользователи могут осуществлять поиск по теме с помощью панели навигации или самостоятельно вводить условия поиска. Наборы данных охватывают такие темы, как окружающая среда, образование, инфраструктура и транспорт.
FiveThirtyEight
Our Data
We’re sharing the data and code behind some of our articles and graphics.
👍1🤔1
Forwarded from Алексей Чернобровов
В продолжение предыдущего поста об отличиях senior аналитика от junior.👨💻
Одно из самых важных качеств senior’а - умение отличать важную задачу от неважной и отвечать на вопросы, которые не заданы в задаче.
Обычно аналитики загружены большим количеством задач, а времени на их решение не так много⏳️. Поэтому необходимо правильно разделять первостепенное и второстепенное.
Так вот, когда аналитикам приходит очередное задание, junior сразу берётся его делать, а senior пытается понять его ценность, нужно ли вообще уделять этому время.🤷
Грубо говоря, хороший аналитик пытается понять ценность задачи и делает в итоге только те действия, которые необходимы бизнесу (часто переформулируя задачу), минимизируя трудозатраты.
А очень хороший аналитик внедряет аналитическую культуру, создает такую обстановку в команде, что менеджер не приходит с запросом посчитать что-либо, а может самостоятельно находить нужные цифры на основе той инфраструктуры и тех отчетов, которые были ранее созданы аналитиками.🔝 Как правило, в таких командах аналитик решает сложные бизнес задачи, помогает в принятии решений.
Давайте рассмотрим на примере.
Запрос от менеджера: "Что будет, если мы сделаем бесплатную доставку, при условии, что в заказе будет один из товаров из выбранной категории? (список категорий прилагается) Сколько мы потеряем денег на субсидировании доставок?"
❗️Важный нюанс, что в выбранной категории есть очень дешевые товары за 10 рублей, например.
Junior аналитик сразу пошел бы считать, сколько стоили все доставки, где содержался один товар из выбранной категории, нашел все заказы из этой категории, посчитал совокупную цифру, сказав, какая была в прошлом месяце, и радостно бы рапортовал об этом заказчику. Потом нашел у себя ошибку в SQL, потому что нужен не один товар, а хотя бы один. :) Исправил, снова прислал цифру. Менеджер бы стал делать какие-то вывод на основе этого.
Senior сразу бы понял нюанс этой задачи, так как если пользователи знают о категории товаров, при добавлении которых в корзину доставка станет бесплатной, то они начнут докидывать самый дешевый товар из категории постоянно, и практически на всех заказах мы будем субсидировать доставку. И для оценки не нужно делать сложных запросов, а можно за 5 минут грубо оценить эту цифру.💡
Условно в первом случае аналитик потратил на это несколько часов и не помог бизнесу, хотя формально сделал все правильно. А senior решил задачу за 5 минут, потому что понял суть вопроса.😊
Одно из самых важных качеств senior’а - умение отличать важную задачу от неважной и отвечать на вопросы, которые не заданы в задаче.
Обычно аналитики загружены большим количеством задач, а времени на их решение не так много⏳️. Поэтому необходимо правильно разделять первостепенное и второстепенное.
Так вот, когда аналитикам приходит очередное задание, junior сразу берётся его делать, а senior пытается понять его ценность, нужно ли вообще уделять этому время.🤷
Грубо говоря, хороший аналитик пытается понять ценность задачи и делает в итоге только те действия, которые необходимы бизнесу (часто переформулируя задачу), минимизируя трудозатраты.
А очень хороший аналитик внедряет аналитическую культуру, создает такую обстановку в команде, что менеджер не приходит с запросом посчитать что-либо, а может самостоятельно находить нужные цифры на основе той инфраструктуры и тех отчетов, которые были ранее созданы аналитиками.🔝 Как правило, в таких командах аналитик решает сложные бизнес задачи, помогает в принятии решений.
Давайте рассмотрим на примере.
Запрос от менеджера: "Что будет, если мы сделаем бесплатную доставку, при условии, что в заказе будет один из товаров из выбранной категории? (список категорий прилагается) Сколько мы потеряем денег на субсидировании доставок?"
❗️Важный нюанс, что в выбранной категории есть очень дешевые товары за 10 рублей, например.
Junior аналитик сразу пошел бы считать, сколько стоили все доставки, где содержался один товар из выбранной категории, нашел все заказы из этой категории, посчитал совокупную цифру, сказав, какая была в прошлом месяце, и радостно бы рапортовал об этом заказчику. Потом нашел у себя ошибку в SQL, потому что нужен не один товар, а хотя бы один. :) Исправил, снова прислал цифру. Менеджер бы стал делать какие-то вывод на основе этого.
Senior сразу бы понял нюанс этой задачи, так как если пользователи знают о категории товаров, при добавлении которых в корзину доставка станет бесплатной, то они начнут докидывать самый дешевый товар из категории постоянно, и практически на всех заказах мы будем субсидировать доставку. И для оценки не нужно делать сложных запросов, а можно за 5 минут грубо оценить эту цифру.💡
Условно в первом случае аналитик потратил на это несколько часов и не помог бизнесу, хотя формально сделал все правильно. А senior решил задачу за 5 минут, потому что понял суть вопроса.😊
👍2
📈📉📊Python-библиотеки для визуализации данных о которых вы возможно не слышали, но которые вам могут быть очень полезны
Bokeh – это интерактивная библиотека визуализации для современных веб-браузеров. Она обеспечивает элегантное, лаконичное построение универсальной графики и обеспечивает высокопроизводительную интерактивность при работе с большими или потоковыми наборами данных.
Geoplotlib – это библиотека языка Python, которая позволяет пользователю разрабатывать карты и наносить на карту географические данные. Данная библиотека используется для рисования различных типов карт, таких как тепловые карты, точечные карты плотности, а также различные картографические диаграммы.
Folium — это библиотека визуализации данных в Python, которая помогает разработчику визуализировать гео-пространственные данные
VisPy – это высокопроизводительная интерактивная библиотека визуализации 2D /3D данных. Данная библиотека использует вычислительную мощность современных графических процессоров (GPU) через библиотеку OpenGL для отображения очень больших наборов данных
Pygal - библиотека языка Python, которая используется для визуализации данных. Данная библиотека также разрабатывает интерактивные графики, которые затем можно внедрить в веб-браузер
Bokeh – это интерактивная библиотека визуализации для современных веб-браузеров. Она обеспечивает элегантное, лаконичное построение универсальной графики и обеспечивает высокопроизводительную интерактивность при работе с большими или потоковыми наборами данных.
Geoplotlib – это библиотека языка Python, которая позволяет пользователю разрабатывать карты и наносить на карту географические данные. Данная библиотека используется для рисования различных типов карт, таких как тепловые карты, точечные карты плотности, а также различные картографические диаграммы.
Folium — это библиотека визуализации данных в Python, которая помогает разработчику визуализировать гео-пространственные данные
VisPy – это высокопроизводительная интерактивная библиотека визуализации 2D /3D данных. Данная библиотека использует вычислительную мощность современных графических процессоров (GPU) через библиотеку OpenGL для отображения очень больших наборов данных
Pygal - библиотека языка Python, которая используется для визуализации данных. Данная библиотека также разрабатывает интерактивные графики, которые затем можно внедрить в веб-браузер
Bokeh
Bokeh documentation
Bokeh is a Python library for creating interactive visualizations for modern web browsers. It helps you build beautiful graphics, ranging from simple plots to complex dashboards with streaming data...
👍3
📝Как улучшить датасеты медицинских снимков: 4 небольших совета
Получение правильных данных в нужном объёме - перед тем, как заказывать массивы данных медицинских снимков, руководителям проектов нужно скоординироваться с командами машинного обучения, data science и клинических исследователей. Это поможет преодолеть сложности получения «плохих» данных или того, что командам аннотаторов придётся фильтровать тысячи нерелевантных или низкокачественных изображений и видео при аннотировании данных обучения, что влияет на потраченные деньги и время.
Предоставление командам аннотаторов инструментов на основе AI - аннотирование медицинских снимков для моделей машинного обучения требует точности, эффективности, высокого уровня качества и безопасности. Благодаря инструментам аннотирования изображений на основе AI медицинские аннотаторы и специалисты могут экономить часы работы и генерировать более точно размеченные медицинские снимки
Обеспечение простоты передачи данных - клинические данные должны доставляться и передаваться в формате, который легко парсить, аннотировать, портировать, а после аннотирования быстро и эффективно передавать в модель ML.
Преодоление сложностей хранения и передачи - данные медицинских снимков часто состоят из сотен или тысяч терабайтов, которые нельзя просто так отправить по почте. Руководителям проектов нужно обеспечить сквозную безопасность и эффективность покупки или извлечения, очистки, хранения и передачи медицинских данных
Получение правильных данных в нужном объёме - перед тем, как заказывать массивы данных медицинских снимков, руководителям проектов нужно скоординироваться с командами машинного обучения, data science и клинических исследователей. Это поможет преодолеть сложности получения «плохих» данных или того, что командам аннотаторов придётся фильтровать тысячи нерелевантных или низкокачественных изображений и видео при аннотировании данных обучения, что влияет на потраченные деньги и время.
Предоставление командам аннотаторов инструментов на основе AI - аннотирование медицинских снимков для моделей машинного обучения требует точности, эффективности, высокого уровня качества и безопасности. Благодаря инструментам аннотирования изображений на основе AI медицинские аннотаторы и специалисты могут экономить часы работы и генерировать более точно размеченные медицинские снимки
Обеспечение простоты передачи данных - клинические данные должны доставляться и передаваться в формате, который легко парсить, аннотировать, портировать, а после аннотирования быстро и эффективно передавать в модель ML.
Преодоление сложностей хранения и передачи - данные медицинских снимков часто состоят из сотен или тысяч терабайтов, которые нельзя просто так отправить по почте. Руководителям проектов нужно обеспечить сквозную безопасность и эффективность покупки или извлечения, очистки, хранения и передачи медицинских данных
👍2
🤼♂️Hive vs Impala: весьма достойные противники
Hive и Impala - это технологии, которые используются для анализа больших данных. В этом посте мы рассмотрим преимущества и недостатки обеих технологий и сравним их между собой.
Hive - это инструмент для анализа данных, который основан на языке запросов HiveQL. Hive позволяет пользователям обращаться к данным в Hadoop Distributed File System (HDFS) с помощью SQL-подобных запросов. Однако, из-за того, что Hive использует архитектуру MapReduce, он может не быть настолько быстрым, как многие другие инструменты для анализа данных.
Impala является интерактивным инструментом для анализа данных, который предназначен для использования в Hadoop-среде. Impala работает с помощью SQL-запросов и может обрабатывать данные в реальном времени. Это означает, что пользователи могут быстро получать результаты запросов без задержек.
Какие же преимущества и недостатки у Hive и Impala?
Преимущества Hive:
• Hive достаточно легко масштабируется и может обрабатывать огромные объемы данных;
• Поддержка пользовательских функций: Hive позволяет пользователям создавать свои собственные функции и агрегатные функции на языке программирования Java, что позволяет пользователю расширять функциональность Hive и создавать свои индивидуальные решения для обработки данных.
Недостатки Hive:
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Преимущества Impala:
• Быстрая обработка запросов: Impala предоставляет высокую производительность при обработке запросов благодаря тому, что использует MPP-архитектуру и распределенные данные в памяти. Это позволяет аналитикам и разработчикам быстро получать результаты запросов без задержек.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Недостатки Impala:
• Ограниченная масштабируемость: Impala не обрабатывает такие большие объемы данных, как Hive, и может столкнуться с ограничениями масштабируемости при работе с большими данными. Impala может потребовать больше ресурсов для работы, чем Hive.
• Высокие требования к ресурсам: Impala потребляет больше ресурсов, чем Hive, из-за использования распределенных данных в памяти. Это может привести к необходимости использования более мощных серверов для обеспечения производительности.
Конечный выбор между Hive и Impala зависит от конкретной ситуации и требований пользователя. Если вы работаете с большими объемами данных и нуждаетесь в простой и доступной для всех SQL-подобной среде, то Hive может быть лучшим выбором. С другой стороны, если вам нужна быстрая обработка данных и поддержка сложных запросов, то Impala может быть предпочтительнее.
Hive и Impala - это технологии, которые используются для анализа больших данных. В этом посте мы рассмотрим преимущества и недостатки обеих технологий и сравним их между собой.
Hive - это инструмент для анализа данных, который основан на языке запросов HiveQL. Hive позволяет пользователям обращаться к данным в Hadoop Distributed File System (HDFS) с помощью SQL-подобных запросов. Однако, из-за того, что Hive использует архитектуру MapReduce, он может не быть настолько быстрым, как многие другие инструменты для анализа данных.
Impala является интерактивным инструментом для анализа данных, который предназначен для использования в Hadoop-среде. Impala работает с помощью SQL-запросов и может обрабатывать данные в реальном времени. Это означает, что пользователи могут быстро получать результаты запросов без задержек.
Какие же преимущества и недостатки у Hive и Impala?
Преимущества Hive:
• Hive достаточно легко масштабируется и может обрабатывать огромные объемы данных;
• Поддержка пользовательских функций: Hive позволяет пользователям создавать свои собственные функции и агрегатные функции на языке программирования Java, что позволяет пользователю расширять функциональность Hive и создавать свои индивидуальные решения для обработки данных.
Недостатки Hive:
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Преимущества Impala:
• Быстрая обработка запросов: Impala предоставляет высокую производительность при обработке запросов благодаря тому, что использует MPP-архитектуру и распределенные данные в памяти. Это позволяет аналитикам и разработчикам быстро получать результаты запросов без задержек.
• Ограничения на работу с потоковыми данными: Hive не подходит для работы с потоковыми данными, поскольку он использует MapReduce, который является пакетным фреймворком обработки данных. Hive обрабатывает данные только после того, как они были записаны в файлы на HDFS, что ограничивает возможности Hive для работы с потоковыми данными.
Недостатки Impala:
• Ограниченная масштабируемость: Impala не обрабатывает такие большие объемы данных, как Hive, и может столкнуться с ограничениями масштабируемости при работе с большими данными. Impala может потребовать больше ресурсов для работы, чем Hive.
• Высокие требования к ресурсам: Impala потребляет больше ресурсов, чем Hive, из-за использования распределенных данных в памяти. Это может привести к необходимости использования более мощных серверов для обеспечения производительности.
Конечный выбор между Hive и Impala зависит от конкретной ситуации и требований пользователя. Если вы работаете с большими объемами данных и нуждаетесь в простой и доступной для всех SQL-подобной среде, то Hive может быть лучшим выбором. С другой стороны, если вам нужна быстрая обработка данных и поддержка сложных запросов, то Impala может быть предпочтительнее.
👍3
⛑⛑⛑Медицинские данные: что нужно учитывать при работе с информацией здравоохранения
Основная проблема данных здравоохранения заключается в их уязвимости. Они содержат конфиденциальную информацию, защищённую Health Insurance Portability and Accountability Act (HIPAA), и не могут использоваться без явно выраженного согласия. В сфере медицины чувствительные подробности называются защищаемой информацией о здоровье (protected health information, PHI). Вот несколько факторов, которые следует учитывать при работе с медицинскими наборами данных:
Protected Health Information (PHI) содержится в различных медицинских документах: электронных письмах, клинических заметках, результатах тестов или сканах КТ. Хотя диагнозы или медицинские предписания сами по себе не считаются чувствительной информацией, они становятся предметом HIPAA, когда сопоставляются с так называемыми идентификаторами: именами, датами, контактами, номерами социального страхования или счетов, фотографиями лиц или другими элементами, при помощи которых можно находить или идентифицировать конкретного пациента, а также связываться с ним.
Анонимизация медицинских данных и удаление из них персональной информации. Прежде чем использовать медицинские данные для исследовательских или деловых целей, необходимо избавиться от идентификаторов личности и даже от их частей (например, инициалов). Существует два способа это сделать — анонимизация и удаление личной информации. Анонимизация — это безвозвратное устранение всех чувствительных данных. Удаление персональной информации (de-identification) только шифрует личные сведения и скрывает их в отдельных датасетах. Позже идентификаторы можно повторно связать с информацией о здоровье. Вторая методика требует больше усилий, чем первая. Как бы то ни было, в обоих случаях потребность соответствия требованиям нормативов добавляет ещё один этап к подготовке датасетов для машинного обучения.
Разметка медицинских данных. Какие угодно неструктурированные данные (тексты, изображения или аудиофайлы) для обучения моделей машинного обучения требуют разметки или аннотирования. Это процесс добавления к блокам данных описательных элементов (меток или тэгов), чтобы машина могла понимать, что находится в изображении или тексте. При работе с данными здравоохранения разметку должны выполнять медицинские специалисты. Почасовая стоимость их услуг гораздо выше, чем у аннотаторов, не имеющих знаний в предметной области. Это создаёт ещё один барьер перед генерацией качественных медицинских датасетов.
Подводя итог, хочется отметить, что подготовка медицинских данных для машинного обучения обычно требует больше денег и времени, чем в среднем в других отраслях из-за строгого регулирования и участия высокооплачиваемых специалистов в предметной области. Следовательно, мы наблюдаем ситуацию, что публичные медицинские датасеты относительно редко встречаются и привлекают серьёзное внимание исследователей, дата-саентистов и компаний, работающих над ИИ-решениями в сфере медицины.
Основная проблема данных здравоохранения заключается в их уязвимости. Они содержат конфиденциальную информацию, защищённую Health Insurance Portability and Accountability Act (HIPAA), и не могут использоваться без явно выраженного согласия. В сфере медицины чувствительные подробности называются защищаемой информацией о здоровье (protected health information, PHI). Вот несколько факторов, которые следует учитывать при работе с медицинскими наборами данных:
Protected Health Information (PHI) содержится в различных медицинских документах: электронных письмах, клинических заметках, результатах тестов или сканах КТ. Хотя диагнозы или медицинские предписания сами по себе не считаются чувствительной информацией, они становятся предметом HIPAA, когда сопоставляются с так называемыми идентификаторами: именами, датами, контактами, номерами социального страхования или счетов, фотографиями лиц или другими элементами, при помощи которых можно находить или идентифицировать конкретного пациента, а также связываться с ним.
Анонимизация медицинских данных и удаление из них персональной информации. Прежде чем использовать медицинские данные для исследовательских или деловых целей, необходимо избавиться от идентификаторов личности и даже от их частей (например, инициалов). Существует два способа это сделать — анонимизация и удаление личной информации. Анонимизация — это безвозвратное устранение всех чувствительных данных. Удаление персональной информации (de-identification) только шифрует личные сведения и скрывает их в отдельных датасетах. Позже идентификаторы можно повторно связать с информацией о здоровье. Вторая методика требует больше усилий, чем первая. Как бы то ни было, в обоих случаях потребность соответствия требованиям нормативов добавляет ещё один этап к подготовке датасетов для машинного обучения.
Разметка медицинских данных. Какие угодно неструктурированные данные (тексты, изображения или аудиофайлы) для обучения моделей машинного обучения требуют разметки или аннотирования. Это процесс добавления к блокам данных описательных элементов (меток или тэгов), чтобы машина могла понимать, что находится в изображении или тексте. При работе с данными здравоохранения разметку должны выполнять медицинские специалисты. Почасовая стоимость их услуг гораздо выше, чем у аннотаторов, не имеющих знаний в предметной области. Это создаёт ещё один барьер перед генерацией качественных медицинских датасетов.
Подводя итог, хочется отметить, что подготовка медицинских данных для машинного обучения обычно требует больше денег и времени, чем в среднем в других отраслях из-за строгого регулирования и участия высокооплачиваемых специалистов в предметной области. Следовательно, мы наблюдаем ситуацию, что публичные медицинские датасеты относительно редко встречаются и привлекают серьёзное внимание исследователей, дата-саентистов и компаний, работающих над ИИ-решениями в сфере медицины.
👍2😁1
📖Топ достаточно полезных книг по визуализации данных
Effective Data Storytelling: How to Drive Change - Книга написана американским консультантом по бизнес-аналитике Брентом Дайксом, подойдет в том числе и читателям без технического бэкграунда. Речь пойдет не столько о визуализации данных, как о том, как через них рассказать историю. В книге Дайкс описывает собственный фреймворк data storytelling — как с помощью трех основных элементов (самих данных, повествования и визуальных эффектов) вычленить закономерности, разработать концепции решений и обосновать их аудитории.
Information Dashboard Design - это практическое руководство, в котором описаны лучшие практики и самые распространенные ошибки при создании дашбордов. Отдельная часть книги посвящена введению в теорию дизайна и визуализации данных.
The Accidental Analyst - интуитивно понятная пошаговая инструкция для решения сложных задач по визуализации данных. В книге описаны семь принципов анализа, которые и определяют порядок действий для работы с данными.
Beautiful Visualization. Looking at Data Through the Eyes of Experts - данная книга рассказывает о процессе визуализации данных на примерах реальных проектов. В ней есть комментарии 24 отраслевых экспертов — от дизайнеров и ученых до художников и статистиков — которые рассказывают о своих методах, подходах и философии визуализации данных.
The Big Book of Dashboards - данная книга представляет собой руководство по созданию дашбордов. Кроме этого, в книге есть целый раздел, посвященный психологическим факторам. Например, как реагировать, если заказчик попросит улучшить ваш дашборд, добавив туда парочку бесполезных диаграмм.
Effective Data Storytelling: How to Drive Change - Книга написана американским консультантом по бизнес-аналитике Брентом Дайксом, подойдет в том числе и читателям без технического бэкграунда. Речь пойдет не столько о визуализации данных, как о том, как через них рассказать историю. В книге Дайкс описывает собственный фреймворк data storytelling — как с помощью трех основных элементов (самих данных, повествования и визуальных эффектов) вычленить закономерности, разработать концепции решений и обосновать их аудитории.
Information Dashboard Design - это практическое руководство, в котором описаны лучшие практики и самые распространенные ошибки при создании дашбордов. Отдельная часть книги посвящена введению в теорию дизайна и визуализации данных.
The Accidental Analyst - интуитивно понятная пошаговая инструкция для решения сложных задач по визуализации данных. В книге описаны семь принципов анализа, которые и определяют порядок действий для работы с данными.
Beautiful Visualization. Looking at Data Through the Eyes of Experts - данная книга рассказывает о процессе визуализации данных на примерах реальных проектов. В ней есть комментарии 24 отраслевых экспертов — от дизайнеров и ученых до художников и статистиков — которые рассказывают о своих методах, подходах и философии визуализации данных.
The Big Book of Dashboards - данная книга представляет собой руководство по созданию дашбордов. Кроме этого, в книге есть целый раздел, посвященный психологическим факторам. Например, как реагировать, если заказчик попросит улучшить ваш дашборд, добавив туда парочку бесполезных диаграмм.
👍2
💥YTsaurus: система для хранения и обработки Big Data Яндекса стала open-source
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;
В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.
В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
YTsaurus - это платформа распределённого хранения и обработки больших данных с открытым исходным кодом. Данная система построена на основе MapReduce, распределенной файловой системы и NoSQL key-value базы данных.
YTsaurus построен поверх Cypress (или Кипариса) — отказоустойчивого древовидного хранилища, который предоставляет такие возможности, как:
древовидный namespace, узлами которого являются директории, таблицы (структурированные или полуструктурированные данные) и файлы (неструктурированные данные);
поддержка колоночного и строчного механизмов хранения табличных данных;
выразительная схематизация данных с поддержкой иерархических типов и признаков сортированности данных;
фоновые репликация и починка erasure-данных, не требующие никаких ручных действий;
транзакции, которые могут затрагивать много объектов и длиться неограниченно долго;
В общем, YTsaurus является достаточно мощной вычислительной платформой, которая подразумевает запуск произвольного пользовательского кода. На данный момент динамические таблицы YTsaurus хранят петабайты данных, а поверх них строится большое количество интерактивных сервисов.
В Github-репозитории находится серверный код YTsaurus, инфраструктура развёртывания с использованием k8s, а также веб-интерфейс системы и клиентский SDK для распространённых языков программирования — C++, Java, Go и Python. Всё это — под лицензией Apache 2.0, что позволяет всем желающим загрузить его на свои серверы, а также дорабатывать его под свои нужды.
👍2🔥1
🤔Что такое Data Mesh: суть концепции
Data Mesh - это децентрализованный гибкий подход к работе различных распределенных команд и распространению информации. Data Mesh родился как ответ на господствующие концепции работы с данными в data-driven организациях - Data Warehouse и Data Lake. Их объединяет идея централизованности. Все данные стекаются в некое центральное хранилище, откуда уже их могут забирать для своих целей разные команды. Однако все это нуждается в поддержке командой data-инженеров с особым набором скиллов. Также при при росте количества источников и разнообразия данных становится всё сложнее обеспечивать их бизнес-качество, пайплайны по трансформации становятся всё сложнее.
Дата меш предлагает решать эти и другие проблемы на основе четырёх главных принципов:
1. Domain-oriented ownership - данными владеют доменные команды, а не централизованная Data-команда. Домен - это часть организации, выполняющая определённую бизнес-функцию, например, это могут быть продуктовые домены (маммография, флюорография, КТ органов грудной клетки) или домен по работе с врачами-разметчиками.
2. Data as a product - данные воспринимаются не как статичный датасет, а как динамичный продукт со своими пользователями, метриками качества, бэклогом развития, за которым следит выделенный product-owner.
3. Self-serve data platform. Основная функция дата-платформы в Data Mesh - это устранять лишнюю когнитивную нагрузку. Это позволяет разработчикам в доменных командах (data product developers и data product consumers), которые не являются специалистами по работе с данными, удобно создавать Data-продукты, билдить, деплоить, тестить, обновлять их, получать к ним доступ и использовать в своих целях.
4. Federated computational governance - вместо централизованного управления данными создаётся специальный федеративный орган, состоящий из представителей доменных команд, дата-платформы и экспертов (например, юристов и врачей), который устанавливает глобальные политики в области работы с данными и обсуждает развитие дата-платформы.
Data Mesh - это децентрализованный гибкий подход к работе различных распределенных команд и распространению информации. Data Mesh родился как ответ на господствующие концепции работы с данными в data-driven организациях - Data Warehouse и Data Lake. Их объединяет идея централизованности. Все данные стекаются в некое центральное хранилище, откуда уже их могут забирать для своих целей разные команды. Однако все это нуждается в поддержке командой data-инженеров с особым набором скиллов. Также при при росте количества источников и разнообразия данных становится всё сложнее обеспечивать их бизнес-качество, пайплайны по трансформации становятся всё сложнее.
Дата меш предлагает решать эти и другие проблемы на основе четырёх главных принципов:
1. Domain-oriented ownership - данными владеют доменные команды, а не централизованная Data-команда. Домен - это часть организации, выполняющая определённую бизнес-функцию, например, это могут быть продуктовые домены (маммография, флюорография, КТ органов грудной клетки) или домен по работе с врачами-разметчиками.
2. Data as a product - данные воспринимаются не как статичный датасет, а как динамичный продукт со своими пользователями, метриками качества, бэклогом развития, за которым следит выделенный product-owner.
3. Self-serve data platform. Основная функция дата-платформы в Data Mesh - это устранять лишнюю когнитивную нагрузку. Это позволяет разработчикам в доменных командах (data product developers и data product consumers), которые не являются специалистами по работе с данными, удобно создавать Data-продукты, билдить, деплоить, тестить, обновлять их, получать к ним доступ и использовать в своих целях.
4. Federated computational governance - вместо централизованного управления данными создаётся специальный федеративный орган, состоящий из представителей доменных команд, дата-платформы и экспертов (например, юристов и врачей), который устанавливает глобальные политики в области работы с данными и обсуждает развитие дата-платформы.
👍2
🤓Что такое синтетические данные и зачем их используют?
Синтетические данные — это искусственные данные, имитирующие наблюдения реального мира и используемые для подготовки моделей машинного обучения, когда получение реальных данных невозможно из-за сложности или дороговизны. Синтезированные данные могут использоваться практически для любого проекта, в котором требуется, чтобы компьютерная симуляция прогнозировала или анализировала реальные события. Существует множество причин, по которым бизнес может задуматься об использовании синтетических данных. Вот некоторые из них:
1. Эффективность финансовых и временных затрат. Если нет подходящего датасета, генерация синтетических данных может быть намного дешевле, чем сбор данных событий реального мира. То же самое относится и к временному фактору: синтезирование может занять считанные дни, а для сбора и обработки реальных данных иногда требуются недели, месяцы или даже годы.
2. Исследование редких данных. В некоторых случаях данные редки или их сбор связан с опасностью. Примером редких данных может быть набор необычных случаев мошенничества. Пример опасных реальных данных — это дорожно-транспортные происшествия, на которые должны научиться реагировать беспилотные автомобили. В таком случае их можно заменить синтетическими ДТП.
3. Устранение проблем с конфиденциальностью. При необходимости обработки или передачи сторонним лицам уязвимых данных следует учитывать вопросы конфиденциальности. В отличие от анонимизации, генерация синтетических данных устраняет любые следы идентификации реальных данных, создавая новые валидные датасеты без ущерба конфиденциальности.
4. Простота разметки и контроля. С технической точки зрения, полностью синтетические данные упрощают разметку. Например, если сгенерировано изображение парка, можно легко автоматически присвоить метки деревьям, людям и животным. Вам не придётся нанимать людей для ручной разметки этих объектов. К тому же полностью синтезированные данные легко контролировать и изменять.
Синтетические данные — это искусственные данные, имитирующие наблюдения реального мира и используемые для подготовки моделей машинного обучения, когда получение реальных данных невозможно из-за сложности или дороговизны. Синтезированные данные могут использоваться практически для любого проекта, в котором требуется, чтобы компьютерная симуляция прогнозировала или анализировала реальные события. Существует множество причин, по которым бизнес может задуматься об использовании синтетических данных. Вот некоторые из них:
1. Эффективность финансовых и временных затрат. Если нет подходящего датасета, генерация синтетических данных может быть намного дешевле, чем сбор данных событий реального мира. То же самое относится и к временному фактору: синтезирование может занять считанные дни, а для сбора и обработки реальных данных иногда требуются недели, месяцы или даже годы.
2. Исследование редких данных. В некоторых случаях данные редки или их сбор связан с опасностью. Примером редких данных может быть набор необычных случаев мошенничества. Пример опасных реальных данных — это дорожно-транспортные происшествия, на которые должны научиться реагировать беспилотные автомобили. В таком случае их можно заменить синтетическими ДТП.
3. Устранение проблем с конфиденциальностью. При необходимости обработки или передачи сторонним лицам уязвимых данных следует учитывать вопросы конфиденциальности. В отличие от анонимизации, генерация синтетических данных устраняет любые следы идентификации реальных данных, создавая новые валидные датасеты без ущерба конфиденциальности.
4. Простота разметки и контроля. С технической точки зрения, полностью синтетические данные упрощают разметку. Например, если сгенерировано изображение парка, можно легко автоматически присвоить метки деревьям, людям и животным. Вам не придётся нанимать людей для ручной разметки этих объектов. К тому же полностью синтезированные данные легко контролировать и изменять.
🤔1
🔥ТОП-5 апрельских ивентов в Data Science
6 апреля - Data Day 2023 - Москва, Россия - https://data-day.ru/
11-14 апреля - РНВТ–2023 - Москва, Россия - https://hi-techweek.ru/
13-14 апреля - DATA FUSION - Онлайн - https://data-fusion.ru/
16-17 апреля - Heisenbug 2023 - Москва, Россия - https://heisenbug.ru/
18 апреля - First Russian Data Forum 2023 - Москва, Россия - https://data-forum.ru/
6 апреля - Data Day 2023 - Москва, Россия - https://data-day.ru/
11-14 апреля - РНВТ–2023 - Москва, Россия - https://hi-techweek.ru/
13-14 апреля - DATA FUSION - Онлайн - https://data-fusion.ru/
16-17 апреля - Heisenbug 2023 - Москва, Россия - https://heisenbug.ru/
18 апреля - First Russian Data Forum 2023 - Москва, Россия - https://data-forum.ru/
data-day.ru
Форум Data Day 2027. ИИ + ДАННЫЕ. Как сохранять уверенный курс в динамичной среде
8 июля, Москва
Forwarded from Аналитика больших данных (Very Big Anal)
Поисковик Bing снова популярен, благодаря Chat GPT
Использование технологии от OpenAI поднял ежедневную активность пользователей в Bing в 6 раз, а общая дневная аудитория выросла до 100 000 000.
Вместе с популярностью Bing возрос и интерес к Edge – браузеру от Microsoft.
В течение 20 лет в поисковой системе Bing не производилось никаких серьезных изменений. Это привело к тому, что порядка 40% пользователей сталкивались с одной общей проблемой – ссылки при нажатии просто не работали.
Microsoft решила инвестировать средства в OpenAI – компанию-разработчика ChatGPT – и внедрить технологию ИИ в свою поисковую систему. Это сделало ее первой IT-корпорацией, которая решилась на подобную интеграцию.
Использование технологии от OpenAI поднял ежедневную активность пользователей в Bing в 6 раз, а общая дневная аудитория выросла до 100 000 000.
Вместе с популярностью Bing возрос и интерес к Edge – браузеру от Microsoft.
В течение 20 лет в поисковой системе Bing не производилось никаких серьезных изменений. Это привело к тому, что порядка 40% пользователей сталкивались с одной общей проблемой – ссылки при нажатии просто не работали.
Microsoft решила инвестировать средства в OpenAI – компанию-разработчика ChatGPT – и внедрить технологию ИИ в свою поисковую систему. Это сделало ее первой IT-корпорацией, которая решилась на подобную интеграцию.
Forwarded from Аналитика больших данных (Very Big Anal)
😔Россияне боятся потерять работу из-за развития искусственного интеллекта
По результатам опроса, развития искусственного интеллекта боятся 17% россиян. В качестве аргумента чаще всего упоминается риск потери рабочих мест в результате автоматизации.
При этом 43% россиян не испытывают страха, связанного с развитием искусственного интеллекта. Большинство из них уверены, что нейросети никогда не смогут заменить человека.
Согласно исследованиям, наибольший риск потери работы из-за развития искусственного интеллекта ощущают переводчики, менеджеры по туризму и официанты. Меньше всего эта проблема беспокоит врачей, строителей и учителей.
Отмечается, что всего в опросе сервиса приняли участие 1,6 тыс. представителей экономически активного населения из всех округов страны.
По результатам опроса, развития искусственного интеллекта боятся 17% россиян. В качестве аргумента чаще всего упоминается риск потери рабочих мест в результате автоматизации.
При этом 43% россиян не испытывают страха, связанного с развитием искусственного интеллекта. Большинство из них уверены, что нейросети никогда не смогут заменить человека.
Согласно исследованиям, наибольший риск потери работы из-за развития искусственного интеллекта ощущают переводчики, менеджеры по туризму и официанты. Меньше всего эта проблема беспокоит врачей, строителей и учителей.
Отмечается, что всего в опросе сервиса приняли участие 1,6 тыс. представителей экономически активного населения из всех округов страны.
😎Искать данные и параллельно учить SQL-легко!!!
Census GPT — это инструмент, который позволяет пользователям осуществлять поиск данных о городах, микрорайонах и других географических зонах.
Используя технологию искусственного интеллекта, Census-GPT упорядочил и проанализировал огромные объемы данных для создания супербазы данных. В настоящее время база данных Census-GPT содержит информацию о Соединенных Штатах, где пользователи могут запрашивать данные о населении, уровне преступности, образовании, доходе, возрасте и т.д. Кроме того, Census-GPT может отображать карты США в четкой и лаконичной форме.
На сайте Census GPT пользователи также могут улучшать существующие карты. Результаты данных можно получить вместе с SQL-запросом. Соответственно, можно учить SQL и автоматически проверять себя на реальных примерах.
Census GPT — это инструмент, который позволяет пользователям осуществлять поиск данных о городах, микрорайонах и других географических зонах.
Используя технологию искусственного интеллекта, Census-GPT упорядочил и проанализировал огромные объемы данных для создания супербазы данных. В настоящее время база данных Census-GPT содержит информацию о Соединенных Штатах, где пользователи могут запрашивать данные о населении, уровне преступности, образовании, доходе, возрасте и т.д. Кроме того, Census-GPT может отображать карты США в четкой и лаконичной форме.
На сайте Census GPT пользователи также могут улучшать существующие карты. Результаты данных можно получить вместе с SQL-запросом. Соответственно, можно учить SQL и автоматически проверять себя на реальных примерах.
Censusgpt
Census GPT
Search the census database with natural language
🥰4👍1
📝Подборка источников с медицинскими датасетами
Международная система здравоохранения ежедневно генерирует множество медицинских данных, которые (по крайней мере, теоретически) можно использовать для машинного обучения.
Вот несколько источников с медицинскими наборами данных:
1. The Cancer Imaging Archive (TCIA), финансируемый Национальным институтом онкологии США (NCI) — это место хранения в открытом доступе радиологических и гистопатологических снимков
2. National Covid-19 Chest Imaging Database (NCCID), являющаяся частью AI Lab Государственной службы здравоохранения Великобритании (NHS), содержит рентгенограммы, снимки МРТ и КТ органов грудной клетки пациентов больниц по всей Великобритании. Это один из крупнейших архивов такого типа, вклад в который вносят 27 больниц и фондов.
3. Medicare Provider Catalog собирает официальные данные центров услуг Medicare и Medicaid (CMS). Он охватывает множество различных тем, от качества ухода в разных больницах, центрах реабилитации, хосписах и других учреждениях здравоохранения, до стоимости посещения и информации о врачах и клиницистах. Данные можно просматривать в браузере, скачивать конкретные датасеты в формате CSV или подключать собственные приложения к веб-сайту при помощи API.
4. Older Adults Health Data Collection на Data.gov состоит из 96 датасетов, управляемых федеральным правительством США. Его основное предназначение — сбор информации о здоровье людей старше 60 лет в контексте пандемии Covid-19 и вне его. Среди организаций, занимающихся поддержанием коллекции, Департамент здравоохранения и социального обеспечения США, Департамент по делам ветеранов, центры по контролю и профилактике заболеваний (CDC) и другие. Датасеты можно скачивать в различных форматах: HTML, CSV, XSL, JSON, XML и RDF.
5. The Cancer Genome Atlas (TCGA) — это важнейшая база данных геномики, охватывающая 33 типа заболеваний, в том числе 10 редких.
6. Surveillance, Epidemiology, and End Results (SEER) — самый надёжный источник онкологической статистики в США, предназначенный для снижения доли раковых заболеваний в популяции. Её база данных поддерживается Surveillance Research Program (SRP), которая является частью Division of Cancer Control and Population Sciences (DCCPS) Национального института онкологии.
Международная система здравоохранения ежедневно генерирует множество медицинских данных, которые (по крайней мере, теоретически) можно использовать для машинного обучения.
Вот несколько источников с медицинскими наборами данных:
1. The Cancer Imaging Archive (TCIA), финансируемый Национальным институтом онкологии США (NCI) — это место хранения в открытом доступе радиологических и гистопатологических снимков
2. National Covid-19 Chest Imaging Database (NCCID), являющаяся частью AI Lab Государственной службы здравоохранения Великобритании (NHS), содержит рентгенограммы, снимки МРТ и КТ органов грудной клетки пациентов больниц по всей Великобритании. Это один из крупнейших архивов такого типа, вклад в который вносят 27 больниц и фондов.
3. Medicare Provider Catalog собирает официальные данные центров услуг Medicare и Medicaid (CMS). Он охватывает множество различных тем, от качества ухода в разных больницах, центрах реабилитации, хосписах и других учреждениях здравоохранения, до стоимости посещения и информации о врачах и клиницистах. Данные можно просматривать в браузере, скачивать конкретные датасеты в формате CSV или подключать собственные приложения к веб-сайту при помощи API.
4. Older Adults Health Data Collection на Data.gov состоит из 96 датасетов, управляемых федеральным правительством США. Его основное предназначение — сбор информации о здоровье людей старше 60 лет в контексте пандемии Covid-19 и вне его. Среди организаций, занимающихся поддержанием коллекции, Департамент здравоохранения и социального обеспечения США, Департамент по делам ветеранов, центры по контролю и профилактике заболеваний (CDC) и другие. Датасеты можно скачивать в различных форматах: HTML, CSV, XSL, JSON, XML и RDF.
5. The Cancer Genome Atlas (TCGA) — это важнейшая база данных геномики, охватывающая 33 типа заболеваний, в том числе 10 редких.
6. Surveillance, Epidemiology, and End Results (SEER) — самый надёжный источник онкологической статистики в США, предназначенный для снижения доли раковых заболеваний в популяции. Её база данных поддерживается Surveillance Research Program (SRP), которая является частью Division of Cancer Control and Population Sciences (DCCPS) Национального института онкологии.
www.cancer.gov
The Cancer Genome Atlas Program (TCGA)
The Cancer Genome Atlas (TCGA) is a landmark cancer genomics program that sequenced and molecularly characterized over 11,000 cases of primary cancer samples. Learn more about how the program transformed the cancer research community and beyond.
👍2
😳Подборка Python-библиотек для случайной генерации тестовых данных
Многие любят Python за его удобство в обработке данных. Но иногда бывает, что необходимо написать и проверить алгоритм по определенной тематике, но самих данных по этой тематике мало или вовсе нет в открытом доступе. Для таких целей существуют библиотеки с помощью которых можно генерировать фейковые данные с нужными типами.
Faker - библиотека для генерации различных типов случайной информации. Он также имеет интуитивно понятный API. Существуют также реализации для таких языков, как PHP, Perl и Ruby.
Mimesis - это библиотека для языка Python, которая помогает генерировать данные для различных целей. Библиотека написана с использованием средств, включенных в стандартную библиотеку языка Python, потому не имеет никаких сторонних зависимостей.
Radar - Библиотека для генерации случайных дат и времени
Fake2db - библиотека, которая позволяет генерировать данные напрямую в базе данных (также существуют движки для разных СУБД).
Многие любят Python за его удобство в обработке данных. Но иногда бывает, что необходимо написать и проверить алгоритм по определенной тематике, но самих данных по этой тематике мало или вовсе нет в открытом доступе. Для таких целей существуют библиотеки с помощью которых можно генерировать фейковые данные с нужными типами.
Faker - библиотека для генерации различных типов случайной информации. Он также имеет интуитивно понятный API. Существуют также реализации для таких языков, как PHP, Perl и Ruby.
Mimesis - это библиотека для языка Python, которая помогает генерировать данные для различных целей. Библиотека написана с использованием средств, включенных в стандартную библиотеку языка Python, потому не имеет никаких сторонних зависимостей.
Radar - Библиотека для генерации случайных дат и времени
Fake2db - библиотека, которая позволяет генерировать данные напрямую в базе данных (также существуют движки для разных СУБД).
GitHub
GitHub - joke2k/faker: Faker is a Python package that generates fake data for you.
Faker is a Python package that generates fake data for you. - joke2k/faker