📝🤔📊 One Hot Encoding: преимущества и недостатки
One Hot Encoding (OHE) - это метод представления категориальных данных в виде бинарных векторов. Этот метод широко используется в машинном обучении для работы с данными, которые содержат категориальные признаки, то есть признаки, которые не являются числовыми. При One Hot Encoding каждая категория превращается в бинарный вектор, где все значения равны нулю, кроме одного, который соответствует категории данного признака.
Преимущества One Hot Encoding:
1. Подходит для алгоритмов машинного обучения: Многие алгоритмы машинного обучения, такие как линейная регрессия, деревья решений и нейронные сети, работают с числовыми данными. One Hot Encoding позволяет преобразовать категориальные признаки в числовые, делая их пригодными для анализа алгоритмами.
2. Полезно для категориальных признаков без упорядоченных значений: Если категории не имеют естественного порядка или распределены неравномерно, One Hot Encoding может быть более предпочтительным методом представления по сравнению с кодированием меток (Label Encoding).
Недостатки One Hot Encoding:
1. Размерность данных: Преобразование категориальных признаков с большим количеством уникальных категорий может привести к значительному увеличению размерности данных, что может ухудшить производительность алгоритмов машинного обучения и потребовать больше памяти.
2. Мультиколлинеарность: При наличии нескольких категориальных признаков с большим числом уникальных категорий могут возникнуть проблемы мультиколлинеарности, когда один признак линейно зависит от других. Это может усложнить интерпретацию моделей.
3. Увеличение вычислительной сложности: Увеличение размерности данных также может привести к увеличению времени обучения моделей и усложнению задачи отбора признаков.
Таким образом, выбор между One Hot Encoding и другими методами кодирования категориальных признаков зависит от конкретной задачи и алгоритма машинного обучения, который вы планируете использовать.
One Hot Encoding (OHE) - это метод представления категориальных данных в виде бинарных векторов. Этот метод широко используется в машинном обучении для работы с данными, которые содержат категориальные признаки, то есть признаки, которые не являются числовыми. При One Hot Encoding каждая категория превращается в бинарный вектор, где все значения равны нулю, кроме одного, который соответствует категории данного признака.
Преимущества One Hot Encoding:
1. Подходит для алгоритмов машинного обучения: Многие алгоритмы машинного обучения, такие как линейная регрессия, деревья решений и нейронные сети, работают с числовыми данными. One Hot Encoding позволяет преобразовать категориальные признаки в числовые, делая их пригодными для анализа алгоритмами.
2. Полезно для категориальных признаков без упорядоченных значений: Если категории не имеют естественного порядка или распределены неравномерно, One Hot Encoding может быть более предпочтительным методом представления по сравнению с кодированием меток (Label Encoding).
Недостатки One Hot Encoding:
1. Размерность данных: Преобразование категориальных признаков с большим количеством уникальных категорий может привести к значительному увеличению размерности данных, что может ухудшить производительность алгоритмов машинного обучения и потребовать больше памяти.
2. Мультиколлинеарность: При наличии нескольких категориальных признаков с большим числом уникальных категорий могут возникнуть проблемы мультиколлинеарности, когда один признак линейно зависит от других. Это может усложнить интерпретацию моделей.
3. Увеличение вычислительной сложности: Увеличение размерности данных также может привести к увеличению времени обучения моделей и усложнению задачи отбора признаков.
Таким образом, выбор между One Hot Encoding и другими методами кодирования категориальных признаков зависит от конкретной задачи и алгоритма машинного обучения, который вы планируете использовать.
👍2
🌎ТОП октябрьских ивентов в Data Science
1-20 октября - C:\DISGroup\DATA \Hackathon - Онлайн - https://dis-group.ru/events/datahack/
5 октября - На шаг впереди! - Москва, Россия - https://globalcio.ru/apps/one_step_ahead/
5 октября - Диалог с AI 2023 - Онлайн - https://ai-conf.bitrix24.events/
12 октября - DEEP CLOUD DIVE - Онлайн - https://cloud.beeline.ru/events/deep_cloud_dive_12_10_23/
12 октября - VK Data Meetup - Москва, Россия - https://mcs.mail.ru/events/vk-data-meetup
12-13 октября - Digital Bridge 2023 - Астана, Казахстан - https://digitalbridge.kz/?lang=RU
23-25 октября - Digital Exploration 2023 - Сочи, Россия - https://digitalexploration.ru/
1-20 октября - C:\DISGroup\DATA \Hackathon - Онлайн - https://dis-group.ru/events/datahack/
5 октября - На шаг впереди! - Москва, Россия - https://globalcio.ru/apps/one_step_ahead/
5 октября - Диалог с AI 2023 - Онлайн - https://ai-conf.bitrix24.events/
12 октября - DEEP CLOUD DIVE - Онлайн - https://cloud.beeline.ru/events/deep_cloud_dive_12_10_23/
12 октября - VK Data Meetup - Москва, Россия - https://mcs.mail.ru/events/vk-data-meetup
12-13 октября - Digital Bridge 2023 - Астана, Казахстан - https://digitalbridge.kz/?lang=RU
23-25 октября - Digital Exploration 2023 - Сочи, Россия - https://digitalexploration.ru/
DIS Group
Цифровая трансформация и умные решения для бизнеса: Юниверс MDM, Юниверс DG, Юниверс ETL, Плюс7 ФормИТ, Плюс7 ФормИТ Маскинг
DIS Group – IT-компания, основанная в 2005 году. Наша экспертиза лежит в сфере цифровой трансформации на основе данных. Мы предлагаем решения в области управления данными, бизнес-аналитики.
👍1
⚔️🤔Greenplum vs Hive: преимущества и недостатки
Greenplum и Hive - это две различные технологии для обработки и анализа данных, используемые в области больших данных и аналитики.
Преимущества Greenplum:
1. Высокая производительность: Greenplum предоставляет многопользовательский аналитический движок с распределенной архитектурой. Это обеспечивает высокую скорость обработки запросов и агрегаций, что делает его отличным выбором для аналитики в режиме реального времени.
2. Масштабируемость: Greenplum спроектирован для масштабирования горизонтально. Вы можете легко добавлять новые узлы для увеличения производительности и хранения данных по мере необходимости.
3. Управление данными: Greenplum предоставляет инструменты для управления данными, включая репликацию, резервное копирование и мониторинг, что делает его более подходящим для бизнес-задач, требующих надежности и доступности данных.
Недостатки Greenplum:
1. Сложная настройка: Установка и настройка Greenplum может быть сложной задачей. Требуется опыт и знание архитектуры системы для оптимальной работы.
2. Не подходит для всех случаев использования: Greenplum наилучшим образом подходит для аналитических задач и хранения структурированных данных, но не является оптимальным выбором для обработки полу и неструктурированных данных.
Преимущества Hive:
1. Простота использования и настройки: Hive создан поверх Hadoop и предоставляет SQL-подобный интерфейс для запросов данных. Это делает его более доступным для аналитиков и разработчиков, не имеющих опыта работы с большими данными.
2. Совместимость с Hadoop: Hive интегрирован с Hadoop и может использовать его для хранения и обработки данных. Это делает его хорошим выбором для проектов, использующих Hadoop.
3. Поддержка для разнообразных форматов данных: Hive поддерживает различные форматы данных, включая JSON, Parquet, Avro и другие, что делает его удобным для анализа разнообразных данных.
Недостатки Hive:
1. Низкая производительность: Hive работает медленнее Greenplum из-за того, что запросы переводятся в задачи MapReduce, что может привести к значительным задержкам.
2. Ограниченная поддержка сложных аналитических запросов: Hive не так хорошо подходит для выполнения сложных аналитических запросов, как Greenplum, из-за его ограниченных возможностей оптимизации запросов.
3. Не подходит для реального времени: Hive наилучшим образом подходит для пакетной обработки данных и не является подходящим выбором для аналитики в режиме реального времени.
Greenplum и Hive - это две различные технологии для обработки и анализа данных, используемые в области больших данных и аналитики.
Преимущества Greenplum:
1. Высокая производительность: Greenplum предоставляет многопользовательский аналитический движок с распределенной архитектурой. Это обеспечивает высокую скорость обработки запросов и агрегаций, что делает его отличным выбором для аналитики в режиме реального времени.
2. Масштабируемость: Greenplum спроектирован для масштабирования горизонтально. Вы можете легко добавлять новые узлы для увеличения производительности и хранения данных по мере необходимости.
3. Управление данными: Greenplum предоставляет инструменты для управления данными, включая репликацию, резервное копирование и мониторинг, что делает его более подходящим для бизнес-задач, требующих надежности и доступности данных.
Недостатки Greenplum:
1. Сложная настройка: Установка и настройка Greenplum может быть сложной задачей. Требуется опыт и знание архитектуры системы для оптимальной работы.
2. Не подходит для всех случаев использования: Greenplum наилучшим образом подходит для аналитических задач и хранения структурированных данных, но не является оптимальным выбором для обработки полу и неструктурированных данных.
Преимущества Hive:
1. Простота использования и настройки: Hive создан поверх Hadoop и предоставляет SQL-подобный интерфейс для запросов данных. Это делает его более доступным для аналитиков и разработчиков, не имеющих опыта работы с большими данными.
2. Совместимость с Hadoop: Hive интегрирован с Hadoop и может использовать его для хранения и обработки данных. Это делает его хорошим выбором для проектов, использующих Hadoop.
3. Поддержка для разнообразных форматов данных: Hive поддерживает различные форматы данных, включая JSON, Parquet, Avro и другие, что делает его удобным для анализа разнообразных данных.
Недостатки Hive:
1. Низкая производительность: Hive работает медленнее Greenplum из-за того, что запросы переводятся в задачи MapReduce, что может привести к значительным задержкам.
2. Ограниченная поддержка сложных аналитических запросов: Hive не так хорошо подходит для выполнения сложных аналитических запросов, как Greenplum, из-за его ограниченных возможностей оптимизации запросов.
3. Не подходит для реального времени: Hive наилучшим образом подходит для пакетной обработки данных и не является подходящим выбором для аналитики в режиме реального времени.
👍3❤1
📖📚Подборка книг для аналитиков данных
Анализ данных с помощью Python - Полное руководство по науке о данных, аналитике и метрикам с Python.
Математика для машинного обучения - в книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Интерпретируемое машинное обучение - руководство по созданию объяснимых моделей черного ящика
Понимание статистики и экспериментального дизайна - данный учебник предоставляет основы, необходимые для правильного понимания, интерпретации статистики.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Использование науки о данных в здравоохранении - в книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Анализ данных с помощью Python - Полное руководство по науке о данных, аналитике и метрикам с Python.
Математика для машинного обучения - в книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Интерпретируемое машинное обучение - руководство по созданию объяснимых моделей черного ящика
Понимание статистики и экспериментального дизайна - данный учебник предоставляет основы, необходимые для правильного понимания, интерпретации статистики.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Использование науки о данных в здравоохранении - в книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Amazon
Python Data Analysis: Comprehensive Guide to Data Science, Analytics and Metrics with Python (Data Science and Analysis Book 1)
Python Data Analysis: Comprehensive Guide to Data Science, Analytics and Metrics with Python (Data Science and Analysis Book 1) eBook : Campbell, Alex : Amazon.in: Books
👍2
📊📉📈Анализ пользователей с помощью датасета от Яндекса
Яндекс выкладывает в открытый доступ крупнейший русскоязычный датасет отзывов об организациях, опубликованных на Яндекс Картах. Он содержит порядка полумиллиона отзывов пользователей на различные организации, собранных в январе-июне 2023 года.
Особенности датасета:
500 000 уникальных отзывов
Тексты очищены от персональных данных (номеров телефонов, адресов почты)
Датасет не содержит коротких односложных отзывов
Достаточно свежие отзывы: с января по июль 2023 года
Яндекс выкладывает в открытый доступ крупнейший русскоязычный датасет отзывов об организациях, опубликованных на Яндекс Картах. Он содержит порядка полумиллиона отзывов пользователей на различные организации, собранных в январе-июне 2023 года.
Особенности датасета:
500 000 уникальных отзывов
Тексты очищены от персональных данных (номеров телефонов, адресов почты)
Датасет не содержит коротких односложных отзывов
Достаточно свежие отзывы: с января по июль 2023 года
GitHub
GitHub - yandex/geo-reviews-dataset-2023
Contribute to yandex/geo-reviews-dataset-2023 development by creating an account on GitHub.
👍6
📋💡🔎Подборка датасетов для NLP
КартаСловСент — слова и выражения, снабжённые тональной меткой («положительное», «отрицательное», «нейтральное») и скалярным значением силы эмоционально-оценочного заряда из непрерывного диапазона [-1, 1].
WikiQA - представляет собой набор пар вопросов и предложений. Они были собраны и аннотированы для исследования ответов на вопросы в открытых доменах
Amazon Reviews dataset - этот набор данных состоит из нескольких миллионов отзывов покупателей Amazon и их оценок. Датасет используется для возможности обучения fastText, анализируя настроения покупателей. Идея состоит в том, что несмотря на огромный объем данных – это реальная бизнес-задача. Модель обучается за считанные минуты. Именно это отличает Amazon Reviews от аналогов.
Yelp dataset – это множество предприятий, отзывов и пользовательских данных, которые можно применить в Pet-проекте и научной работе. Также можно использовать Yelp для обучения студентов во время работы с базами данных, при изучении NLP и в качестве образца производственных данных. Датасет доступен в виде файлов JSON и является «классикой» в обработке естественного языка.
КартаСловСент — слова и выражения, снабжённые тональной меткой («положительное», «отрицательное», «нейтральное») и скалярным значением силы эмоционально-оценочного заряда из непрерывного диапазона [-1, 1].
WikiQA - представляет собой набор пар вопросов и предложений. Они были собраны и аннотированы для исследования ответов на вопросы в открытых доменах
Amazon Reviews dataset - этот набор данных состоит из нескольких миллионов отзывов покупателей Amazon и их оценок. Датасет используется для возможности обучения fastText, анализируя настроения покупателей. Идея состоит в том, что несмотря на огромный объем данных – это реальная бизнес-задача. Модель обучается за считанные минуты. Именно это отличает Amazon Reviews от аналогов.
Yelp dataset – это множество предприятий, отзывов и пользовательских данных, которые можно применить в Pet-проекте и научной работе. Также можно использовать Yelp для обучения студентов во время работы с базами данных, при изучении NLP и в качестве образца производственных данных. Датасет доступен в виде файлов JSON и является «классикой» в обработке естественного языка.
GitHub
kartaslov/dataset/kartaslovsent at master · dkulagin/kartaslov
Открытые лингвистические датасеты: тональный словарь русского языка КартаСловСент, датасет по семантике, ассоциативный граф и датасет по орфографическим ошибкам и опечаткам. - dkulagin/kartaslov
👍5
⚔️⚡️Altair vs. Matplotlib: преимущества и недостатки визуализаций Big Data
Matplotlib - это старожил в мире визуализации данных, и он широко используется в сообществе Python.
Преимущества Matplotlib:
1. Максимальная гибкость: Matplotlib позволяет вам создавать почти любой вид графиков и настраивать каждую деталь. Вы можете создавать статические и анимированные графики, подходящие для различных целей.
2. Большое сообщество и документация: Благодаря своей популярности, Matplotlib имеет огромное сообщество пользователей и обширную документацию. Это делает его отличным выбором для начинающих и опытных пользователей.
3. Широкий выбор графических элементов: Matplotlib предоставляет богатый выбор графических элементов, таких как линии, точки, столбцы, и многое другое, что позволяет вам создавать разнообразные графики.
Недостатки Matplotlib:
1. Сложность: Создание сложных графиков с Matplotlib может быть нетривиальным и требовать значительных усилий и кода.
2. Внешний вид по умолчанию: Графики, созданные с помощью Matplotlib, могут выглядеть не слишком привлекательно по умолчанию, и для их улучшения часто требуется дополнительная и достаточно трудоемкая работа.
Altair - это более новая библиотека, которая стремится упростить создание декларативных графиков.
Преимущества Altair:
1. Декларативный подход: Altair предлагает декларативный подход к созданию графиков, что означает, что вы описываете, какие данные вы хотите визуализировать и как, а библиотека заботится о деталях.
2. Простота использования: Altair позволяет создавать красивые графики с минимальным объемом кода. Это делает его отличным выбором для быстрого прототипирования и начинающих.
3. Интеграция с Pandas: Altair хорошо интегрируется с библиотекой Pandas, что упрощает работу с данными.
Недостатки Altair:
1. Ограниченные возможности настройки: В сравнении с Matplotlib, Altair предоставляет меньше возможностей для настройки графиков. Если вам нужны сложные и нестандартные графики, это может быть ограничивающим фактором.
2. Меньшее сообщество и документация: Altair, будучи новым проектом, имеет меньшее сообщество пользователей и менее обширную документацию.
Выбор между Altair и Matplotlib зависит от конкретных потребностей и уровня опыта. Matplotlib подходит для тех, кто нуждается в полной гибкости и контроле над графиками, в то время как Altair предоставляет простой и декларативный способ создания красивых графиков с минимальными усилиями.
Matplotlib - это старожил в мире визуализации данных, и он широко используется в сообществе Python.
Преимущества Matplotlib:
1. Максимальная гибкость: Matplotlib позволяет вам создавать почти любой вид графиков и настраивать каждую деталь. Вы можете создавать статические и анимированные графики, подходящие для различных целей.
2. Большое сообщество и документация: Благодаря своей популярности, Matplotlib имеет огромное сообщество пользователей и обширную документацию. Это делает его отличным выбором для начинающих и опытных пользователей.
3. Широкий выбор графических элементов: Matplotlib предоставляет богатый выбор графических элементов, таких как линии, точки, столбцы, и многое другое, что позволяет вам создавать разнообразные графики.
Недостатки Matplotlib:
1. Сложность: Создание сложных графиков с Matplotlib может быть нетривиальным и требовать значительных усилий и кода.
2. Внешний вид по умолчанию: Графики, созданные с помощью Matplotlib, могут выглядеть не слишком привлекательно по умолчанию, и для их улучшения часто требуется дополнительная и достаточно трудоемкая работа.
Altair - это более новая библиотека, которая стремится упростить создание декларативных графиков.
Преимущества Altair:
1. Декларативный подход: Altair предлагает декларативный подход к созданию графиков, что означает, что вы описываете, какие данные вы хотите визуализировать и как, а библиотека заботится о деталях.
2. Простота использования: Altair позволяет создавать красивые графики с минимальным объемом кода. Это делает его отличным выбором для быстрого прототипирования и начинающих.
3. Интеграция с Pandas: Altair хорошо интегрируется с библиотекой Pandas, что упрощает работу с данными.
Недостатки Altair:
1. Ограниченные возможности настройки: В сравнении с Matplotlib, Altair предоставляет меньше возможностей для настройки графиков. Если вам нужны сложные и нестандартные графики, это может быть ограничивающим фактором.
2. Меньшее сообщество и документация: Altair, будучи новым проектом, имеет меньшее сообщество пользователей и менее обширную документацию.
Выбор между Altair и Matplotlib зависит от конкретных потребностей и уровня опыта. Matplotlib подходит для тех, кто нуждается в полной гибкости и контроле над графиками, в то время как Altair предоставляет простой и декларативный способ создания красивых графиков с минимальными усилиями.
GitHub
GitHub - matplotlib/matplotlib: matplotlib: plotting with Python
matplotlib: plotting with Python. Contribute to matplotlib/matplotlib development by creating an account on GitHub.
👍1🤔1
😎⚡️Визуализация астрономии теперь еще проще в Python
APLpy (the Astronomical Plotting Library in Python) - это модуль Python, предназначенный для создания графиков публикации астрономических изображений в формате FITS.
Хотели ли вы когда-нибудь попробовать визуализцию астрономических данных? Теперь это легко делается на Python с помощью данной библиотеки. Для установки этой библиотеки необходимо всего лишь выполнить следующую команду:
pip install aplpy
APLpy (the Astronomical Plotting Library in Python) - это модуль Python, предназначенный для создания графиков публикации астрономических изображений в формате FITS.
Хотели ли вы когда-нибудь попробовать визуализцию астрономических данных? Теперь это легко делается на Python с помощью данной библиотеки. Для установки этой библиотеки необходимо всего лишь выполнить следующую команду:
pip install aplpy
GitHub
GitHub - aplpy/aplpy: Astronomical Plotting Library in Python
Astronomical Plotting Library in Python. Contribute to aplpy/aplpy development by creating an account on GitHub.
👍3
📊📝В открытом доступе сельхозданные Евросоюза
EuroCrops представляет собой обширный сборник датасетов, объединяющий все публично доступные данные о сельском хозяйстве в странах Европейского Союза.
Данный проект финансируется Немецким космическим агентством DLR от имени Федерального министерства экономики и борьбы с изменением климата.
EuroCrops представляет собой обширный сборник датасетов, объединяющий все публично доступные данные о сельском хозяйстве в странах Европейского Союза.
Данный проект финансируется Немецким космическим агентством DLR от имени Федерального министерства экономики и борьбы с изменением климата.
GitHub
GitHub - maja601/EuroCrops: The official repository for the EuroCrops dataset.
The official repository for the EuroCrops dataset. - maja601/EuroCrops
👍3
⚔️📊LDA vs t-SNE: преимущества и недостатки
Два популярных метода для анализа данных данных, LDA (Linear Discriminant Analysis) и t-SNE (t-Distributed Stochastic Neighbor Embedding), используются для решения различных задач. Оба они имеют свои уникальные преимущества и недостатки. Давайте рассмотрим их подробнее.
Преимущества LDA:
1. Классификация: LDA предназначен для задач классификации и разделения данных. Он стремится максимизировать расстояние между классами, что делает его отличным выбором для задач, связанных с классификацией и распознаванием образов.
2. Интерпретируемость: LDA создает новые признаки (линейные комбинации исходных), которые могут быть интерпретированы как "дискриминантные оси". Это упрощает объяснение того, как и почему данные разделяются.
3. Эффективность при больших данных: LDA обычно более эффективен при работе с большими объемами данных, чем t-SNE. Он может быть быстрее и требовать меньше памяти.
Недостатки LDA:
1. Линейная природа: LDA предполагает, что данные линейно разделимы, что может ограничивать его применимость в задачах, где классы не могут быть разделены линейно.
2. Недостаток визуальной информации: LDA создает новое пространство признаков, но не обязательно сохраняет сходство между данными точками. Это делает его менее подходящим для визуализации данных.
Преимущества t-SNE:
1. Устойчивость к нелинейным отношениям: t-SNE может обнаруживать нелинейные зависимости в данных, делая его хорошим выбором для визуализации данных в случаях, когда линейное разделение недостаточно.
2. Отображение высокоразмерных данных: t-SNE может справляться с высокоразмерными данными, сохраняя их структуру при уменьшении размерности.
3. Лучшая визуализация: t-SNE обеспечивает более наглядную визуализацию данных, группируя похожие точки в плотные кластеры.
Недостатки t-SNE:
1. Чувствительность к параметрам: Выбор параметров, таких как perplexity, может сильно повлиять на результаты t-SNE. Необходимо проводить тщательный анализ параметров.
2. Вычислительная сложность: t-SNE может быть вычислительно затратным и медленным при работе с большими наборами данных.
3. Отсутствие интерпретируемости: Поскольку t-SNE стремится к визуальной группировке точек, он не создает интерпретируемых новых признаков.
Таким образом, выбор между LDA и t-SNE зависит от конкретных целей анализа. LDA лучше подходит для задач классификации и интерпретируемости, в то время как t-SNE обычно предпочтителен для визуализации и выявления нелинейных зависимостей.
Два популярных метода для анализа данных данных, LDA (Linear Discriminant Analysis) и t-SNE (t-Distributed Stochastic Neighbor Embedding), используются для решения различных задач. Оба они имеют свои уникальные преимущества и недостатки. Давайте рассмотрим их подробнее.
Преимущества LDA:
1. Классификация: LDA предназначен для задач классификации и разделения данных. Он стремится максимизировать расстояние между классами, что делает его отличным выбором для задач, связанных с классификацией и распознаванием образов.
2. Интерпретируемость: LDA создает новые признаки (линейные комбинации исходных), которые могут быть интерпретированы как "дискриминантные оси". Это упрощает объяснение того, как и почему данные разделяются.
3. Эффективность при больших данных: LDA обычно более эффективен при работе с большими объемами данных, чем t-SNE. Он может быть быстрее и требовать меньше памяти.
Недостатки LDA:
1. Линейная природа: LDA предполагает, что данные линейно разделимы, что может ограничивать его применимость в задачах, где классы не могут быть разделены линейно.
2. Недостаток визуальной информации: LDA создает новое пространство признаков, но не обязательно сохраняет сходство между данными точками. Это делает его менее подходящим для визуализации данных.
Преимущества t-SNE:
1. Устойчивость к нелинейным отношениям: t-SNE может обнаруживать нелинейные зависимости в данных, делая его хорошим выбором для визуализации данных в случаях, когда линейное разделение недостаточно.
2. Отображение высокоразмерных данных: t-SNE может справляться с высокоразмерными данными, сохраняя их структуру при уменьшении размерности.
3. Лучшая визуализация: t-SNE обеспечивает более наглядную визуализацию данных, группируя похожие точки в плотные кластеры.
Недостатки t-SNE:
1. Чувствительность к параметрам: Выбор параметров, таких как perplexity, может сильно повлиять на результаты t-SNE. Необходимо проводить тщательный анализ параметров.
2. Вычислительная сложность: t-SNE может быть вычислительно затратным и медленным при работе с большими наборами данных.
3. Отсутствие интерпретируемости: Поскольку t-SNE стремится к визуальной группировке точек, он не создает интерпретируемых новых признаков.
Таким образом, выбор между LDA и t-SNE зависит от конкретных целей анализа. LDA лучше подходит для задач классификации и интерпретируемости, в то время как t-SNE обычно предпочтителен для визуализации и выявления нелинейных зависимостей.
👍4
Forwarded from Алексей Чернобровов
Benerator - программное средство для создания тестовых данных, которые можно использовать при тестировании и обучении моделей машинного обучения.
DataFactory - облегчает процесс создания тестовых данных для наполнения баз данных и тестирования искусственных интеллектуальных моделей.
MockNeat - это инструмент, который предоставляет удобный интерфейс программирования (API), позволяющий разработчикам создавать данные в различных форматах, таких как json, xml, csv и sql, без особых усилий.
Spawner - это инструмент для генерации данных, который предназначен для использования с разными базами данных и искусственными интеллектуальными моделями. Он предоставляет множество типов полей, включая возможность настраивать их по усмотрению пользователя.
DataFactory - облегчает процесс создания тестовых данных для наполнения баз данных и тестирования искусственных интеллектуальных моделей.
MockNeat - это инструмент, который предоставляет удобный интерфейс программирования (API), позволяющий разработчикам создавать данные в различных форматах, таких как json, xml, csv и sql, без особых усилий.
Spawner - это инструмент для генерации данных, который предназначен для использования с разными базами данных и искусственными интеллектуальными моделями. Он предоставляет множество типов полей, включая возможность настраивать их по усмотрению пользователя.
🔥3❤1👍1
📝🤔Разметка данных: преимущества и обратная сторона
Разметка данных - это процесс присвоения меток или аннотаций определенным элементам в наборе данных, чтобы обучать машины понимать и извлекать информацию из этих данных. Разметка данных играет важную роль в машинном обучении, глубоком обучении и анализе данных, так как она позволяет алгоритмам понимать, какие объекты или факторы в данных являются важными, а какие несущественными.
Преимущества разметки данных:
1. Улучшение точности моделей: Разметка данных способствует созданию более точных и надежных моделей, так как алгоритмы могут учиться на основе правильных меток и избегать ошибок.
2. Обучение алгоритмов: Размеченные данные позволяют более эффективно обучать алгоритмы машинного обучения, что делает их способными к решению сложных задач, таких как распознавание образов, классификация текстов, прогнозирование и другие.
3. Расширение функциональности приложений: Размеченные данные позволяют разрабатывать более интеллектуальные приложения и сервисы, такие как виртуальные помощники, автоматизированные системы и многое другое.
Недостатки разметки данных:
1. Ресурсозатратность: Разметка данных требует значительных усилий и ресурсов, особенно если речь идет о больших наборах данных или сложных задачах.
2. Субъективность: Разметка данных может зависеть от субъективных оценок разметчиков, что может привести к ошибкам и неточностям.
3. Ограниченность задачи: Разметка данных ограничивается конкретной задачей обучения, и изменение этой задачи может потребовать переразметки данных.
4. Обновление данных: Размеченные данные могут устаревать с течением времени, и для поддержания актуальности моделей необходимо периодически обновлять разметку.
В целом, разметка данных является неотъемлемой частью многих проектов в области машинного обучения, и ее преимущества часто превосходят недостатки, особенно при правильной организации и управлении процессом разметки.
Разметка данных - это процесс присвоения меток или аннотаций определенным элементам в наборе данных, чтобы обучать машины понимать и извлекать информацию из этих данных. Разметка данных играет важную роль в машинном обучении, глубоком обучении и анализе данных, так как она позволяет алгоритмам понимать, какие объекты или факторы в данных являются важными, а какие несущественными.
Преимущества разметки данных:
1. Улучшение точности моделей: Разметка данных способствует созданию более точных и надежных моделей, так как алгоритмы могут учиться на основе правильных меток и избегать ошибок.
2. Обучение алгоритмов: Размеченные данные позволяют более эффективно обучать алгоритмы машинного обучения, что делает их способными к решению сложных задач, таких как распознавание образов, классификация текстов, прогнозирование и другие.
3. Расширение функциональности приложений: Размеченные данные позволяют разрабатывать более интеллектуальные приложения и сервисы, такие как виртуальные помощники, автоматизированные системы и многое другое.
Недостатки разметки данных:
1. Ресурсозатратность: Разметка данных требует значительных усилий и ресурсов, особенно если речь идет о больших наборах данных или сложных задачах.
2. Субъективность: Разметка данных может зависеть от субъективных оценок разметчиков, что может привести к ошибкам и неточностям.
3. Ограниченность задачи: Разметка данных ограничивается конкретной задачей обучения, и изменение этой задачи может потребовать переразметки данных.
4. Обновление данных: Размеченные данные могут устаревать с течением времени, и для поддержания актуальности моделей необходимо периодически обновлять разметку.
В целом, разметка данных является неотъемлемой частью многих проектов в области машинного обучения, и ее преимущества часто превосходят недостатки, особенно при правильной организации и управлении процессом разметки.
👍3
🌎ТОП ноябрьских ивентов в Data Science
2 ноября - DataStart 2023 - Москва, Россия - https://datastart.ru/
4-5 ноября - BreakPoint 2023: Insert New. Element - Москва, Россия - https://breakpoint23.ru/
9-10 ноября - МАТЕМАРКЕТИНГ - Москва, Россия - https://matemarketing.ru/
16 ноября - TechRec 2023 - Москва, Россия - https://techrec.pro/
22-24 ноября - AI Journey 2023 - Онлайн - https://aij.ru/
28-30 ноября - DATA & ANALYTICS - Москва, Россия - https://techweek.moscow/data_day/
2 ноября - DataStart 2023 - Москва, Россия - https://datastart.ru/
4-5 ноября - BreakPoint 2023: Insert New. Element - Москва, Россия - https://breakpoint23.ru/
9-10 ноября - МАТЕМАРКЕТИНГ - Москва, Россия - https://matemarketing.ru/
16 ноября - TechRec 2023 - Москва, Россия - https://techrec.pro/
22-24 ноября - AI Journey 2023 - Онлайн - https://aij.ru/
28-30 ноября - DATA & ANALYTICS - Москва, Россия - https://techweek.moscow/data_day/
🔥1
📝🔎💥Управлять качеством данных теперь еще проще
Great Expectations (GX) - это open-source инструмент, созданный на базе языка Python, который служит для контроля качества данных. Он предоставляет командам дата-саентистов возможность проводить анализ и проверку данных, а также создавать с ними отчеты. Этот инструмент обладает удобным интерфейсом командной строки (CLI), что упрощает создание новых тестов и редактирование уже существующих отчетов. Важно отметить, что Great Expectations может быть интегрирован с разнообразными инструментами для извлечения, преобразования и загрузки данных (ETL), такими как Airflow и различные системы управления базами данных. Найти полный список поддерживаемых интеграций и официальную документацию можно на веб-сайте Great Expectations.
Great Expectations (GX) - это open-source инструмент, созданный на базе языка Python, который служит для контроля качества данных. Он предоставляет командам дата-саентистов возможность проводить анализ и проверку данных, а также создавать с ними отчеты. Этот инструмент обладает удобным интерфейсом командной строки (CLI), что упрощает создание новых тестов и редактирование уже существующих отчетов. Важно отметить, что Great Expectations может быть интегрирован с разнообразными инструментами для извлечения, преобразования и загрузки данных (ETL), такими как Airflow и различные системы управления базами данных. Найти полный список поддерживаемых интеграций и официальную документацию можно на веб-сайте Great Expectations.
docs.greatexpectations.io
Introduction to GX Core | Great Expectations
Learn about GX Core components and workflows and try out the GX Core Python library.
👍1🤔1
📝📚Подборка книг по Data Mining
Data Mining: Practical Machine Learning Tools and Techniques - книга предоставляет введение в основы Data Mining и использует популярный инструмент Weka для обучения алгоритмов машинного обучении
Introduction to Data Mining - классическая книга, которая охватывает основные концепции и методы Data Mining
Principles of Data Mining - эта книга предоставляет обширное обсуждение принципов и методов Data Mining
Data Mining Techniques: For Marketing, Sales, and Customer Relationship Management - книга ориентирована на использование Data Mining в маркетинге и управлении клиентскими отношениями
Data Science for Dummies - хороший вариант для начинающих, книга охватывает множество тем, включая Data Mining, машинное обучение и анализ данных
Data Mining: Practical Machine Learning Tools and Techniques - книга предоставляет введение в основы Data Mining и использует популярный инструмент Weka для обучения алгоритмов машинного обучении
Introduction to Data Mining - классическая книга, которая охватывает основные концепции и методы Data Mining
Principles of Data Mining - эта книга предоставляет обширное обсуждение принципов и методов Data Mining
Data Mining Techniques: For Marketing, Sales, and Customer Relationship Management - книга ориентирована на использование Data Mining в маркетинге и управлении клиентскими отношениями
Data Science for Dummies - хороший вариант для начинающих, книга охватывает множество тем, включая Data Mining, машинное обучение и анализ данных
Offidocs
PDF Editor online by OffiDocs
Edit PDF to add annotations, add images, signatures, text to edit your PDF online using your browser!
👍3❤1
🤖⚡️🔎Подборка сервисов на базе AI для анализа Big Data
AskEdith - Упрощает анализ данных, позволяя пользователям задавать вопросы и получать мгновенную информацию. Расширяет возможности "аналитики самообслуживания", обеспечивая безопасный и надежный доступ к данным. Совместим со всеми база данных и CRM (Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery и Redshift и тд)
Tomat.AI - Инструмент на базе искусственного интеллекта, который позволяет специалистам по данным легко исследовать и анализировать большие файлы CSV без необходимости кодирования или написания формул. Вы можете открывать и просматривать огромные файлы CSV всего несколькими щелчками мыши
Coginiti - Позволяет пользователям генерировать SQL запросы, используя подсказки на естественном языке, оптимизировать существующие SQL-запросы, объяснять общий SQL в интегрированном каталоге, давать подробные объяснения и решения ошибок, а также объяснять планы выполнения запросов для лучшей оптимизации. ИИ помощник постоянно развивается на основе каждого взаимодействия, адаптируя рекомендации и предложения в соответствии с индивидуальными потребностями
Speak Ai - Платформа для анализа и исследования языковых данных, которая предлагает возможности транскрипции, анализа данных и анализа настроений для различных типов медиа. Он позволяет выполнять автоматическую транскрипцию, массовый анализ, визуализацию и сбор данных для использования в исследованиях, анализе рынка и конкурентном анализе. Инструмент также предлагает общий медиа-репозиторий, систему текстовых подсказок на базе искусственного интеллекта и решение для SWOT-анализа, а также другие функции
Formula God - Инструмент искусственного интеллекта встроен в Google Таблицы. Он использует искусственный интеллект, чтобы помочь пользователям манипулировать и вычислять данные во всем диапазоне ячеек
Simple ML for Sheets - полезен для экспертов по машинному обучению, которые хотят быстро выполнить итерацию или создать прототип на небольших (например, <1 миллиона примеров) наборах табличных данных. Simple ML for Sheets — это надстройка для Google Sheets от команды TensorFlow Decision Forests.
AskEdith - Упрощает анализ данных, позволяя пользователям задавать вопросы и получать мгновенную информацию. Расширяет возможности "аналитики самообслуживания", обеспечивая безопасный и надежный доступ к данным. Совместим со всеми база данных и CRM (Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery и Redshift и тд)
Tomat.AI - Инструмент на базе искусственного интеллекта, который позволяет специалистам по данным легко исследовать и анализировать большие файлы CSV без необходимости кодирования или написания формул. Вы можете открывать и просматривать огромные файлы CSV всего несколькими щелчками мыши
Coginiti - Позволяет пользователям генерировать SQL запросы, используя подсказки на естественном языке, оптимизировать существующие SQL-запросы, объяснять общий SQL в интегрированном каталоге, давать подробные объяснения и решения ошибок, а также объяснять планы выполнения запросов для лучшей оптимизации. ИИ помощник постоянно развивается на основе каждого взаимодействия, адаптируя рекомендации и предложения в соответствии с индивидуальными потребностями
Speak Ai - Платформа для анализа и исследования языковых данных, которая предлагает возможности транскрипции, анализа данных и анализа настроений для различных типов медиа. Он позволяет выполнять автоматическую транскрипцию, массовый анализ, визуализацию и сбор данных для использования в исследованиях, анализе рынка и конкурентном анализе. Инструмент также предлагает общий медиа-репозиторий, систему текстовых подсказок на базе искусственного интеллекта и решение для SWOT-анализа, а также другие функции
Formula God - Инструмент искусственного интеллекта встроен в Google Таблицы. Он использует искусственный интеллект, чтобы помочь пользователям манипулировать и вычислять данные во всем диапазоне ячеек
Simple ML for Sheets - полезен для экспертов по машинному обучению, которые хотят быстро выполнить итерацию или создать прототип на небольших (например, <1 миллиона примеров) наборах табличных данных. Simple ML for Sheets — это надстройка для Google Sheets от команды TensorFlow Decision Forests.
Athenic
Athenic: AI Data Analyst for Your Business
Athenic is an agentic AI data analyst. Connect your business data, ask questions in plain English, and build live dashboards & automated reports — no SQL required.
🔥2❤1👍1
📝🔎Apache Flink: преимущества и недостатки
Apache Flink - это распределенный система обработки данных в реальном времени, которая предоставляет возможности для потоковой обработки данных и анализа в реальном времени.
Преимущества Apache Flink:
1. Потоковая обработка данных: Flink предназначен для эффективной обработки данных в режиме реального времени, что позволяет быстро реагировать на изменения и события.
2. Высокая производительность: Flink обеспечивает высокую производительность благодаря оптимизированному выполнению запросов и эффективному распределению задач на кластере.
3. Гибкость и масштабируемость: Flink обеспечивает гибкость в определении и изменении потоковых вычислений. Также следует отметить Повышение производительности при увеличении объема обрабатываемых данных.
Недостатки Apache Flink:
1. Сложность настройки: Настройка и управление кластером Apache Flink может потребовать значительных усилий и опыта.
2. Отсутствие широкой популярности: По сравнению с некоторыми другими системами обработки данных в реальном времени, Apache Flink не так широко используется, что может сказаться на доступности ресурсов и сообществе поддержки.
3. Сложности в интеграции: Интеграция Apache Flink с существующими системами и инструментами может быть сложной задачей, требующей переработку данных для совместимости с форматами и структурами других систем.
В целом, Apache Flink предоставляет мощные возможности для обработки данных в реальном времени, но требует внимательного внедрения и управления для достижения максимальной производительности и надежности.
Apache Flink - это распределенный система обработки данных в реальном времени, которая предоставляет возможности для потоковой обработки данных и анализа в реальном времени.
Преимущества Apache Flink:
1. Потоковая обработка данных: Flink предназначен для эффективной обработки данных в режиме реального времени, что позволяет быстро реагировать на изменения и события.
2. Высокая производительность: Flink обеспечивает высокую производительность благодаря оптимизированному выполнению запросов и эффективному распределению задач на кластере.
3. Гибкость и масштабируемость: Flink обеспечивает гибкость в определении и изменении потоковых вычислений. Также следует отметить Повышение производительности при увеличении объема обрабатываемых данных.
Недостатки Apache Flink:
1. Сложность настройки: Настройка и управление кластером Apache Flink может потребовать значительных усилий и опыта.
2. Отсутствие широкой популярности: По сравнению с некоторыми другими системами обработки данных в реальном времени, Apache Flink не так широко используется, что может сказаться на доступности ресурсов и сообществе поддержки.
3. Сложности в интеграции: Интеграция Apache Flink с существующими системами и инструментами может быть сложной задачей, требующей переработку данных для совместимости с форматами и структурами других систем.
В целом, Apache Flink предоставляет мощные возможности для обработки данных в реальном времени, но требует внимательного внедрения и управления для достижения максимальной производительности и надежности.
👍2❤1🔥1
💥😎Подборка открытых датасетов по различным областям
Данная подборка представляет собой список открытых датасетов высокого качества для машинного обучения, временных рядов, NLP, обработки изображений и т.д., ориентированный на конкретные темы.
Датасеты доступны по данной ссылке.
Данная подборка представляет собой список открытых датасетов высокого качества для машинного обучения, временных рядов, NLP, обработки изображений и т.д., ориентированный на конкретные темы.
Датасеты доступны по данной ссылке.
GitHub
GitHub - awesomedata/awesome-public-datasets: A topic-centric list of HQ open datasets.
A topic-centric list of HQ open datasets. Contribute to awesomedata/awesome-public-datasets development by creating an account on GitHub.
👍1🔥1
📝Немного о ClickHouse: преимущества и недостатки
ClickHouse - это колоночная база данных с открытым исходным кодом, предназначенная для обработки аналитических запросов с большим объемом данных.
Преимущества ClickHouse:
1. Высокая производительность: ClickHouse оптимизирована для выполнения аналитических запросов над большими объемами данных. Она обеспечивает высокую скорость выполнения запросов благодаря своей колоночной структуре данных и другим оптимизациям.
2. Масштабируемость: ClickHouse легко масштабируется горизонтально, позволяя добавлять новые узлы кластера для обработки растущего объема данных.
3. Эффективное использование ресурсов: Благодаря колоночной ориентации и сжатию данных, ClickHouse может эффективно использовать ресурсы хранения, что уменьшает потребление дискового пространства.
4. Низкие накладные расходы на операции чтения: Благодаря структуре данных и оптимизациям, ClickHouse обеспечивает высокую производительность при выполнении операций чтения.
Недостатки ClickHouse:
1. Ограниченная поддержка транзакций: ClickHouse ориентирована на аналитические запросы и не обладает полной поддержкой транзакций, что может быть недостатком для приложений, требующих сильной согласованности данных.
2. Ограниченная поддержка операций записи: ClickHouse предназначена прежде всего для чтения данных, и операции записи могут быть менее эффективными по сравнению с другими системами управления базами данных при больших объемах изменений.
3. Недостаточная поддержка индексации: ClickHouse имеет ограниченную поддержку индексации по сравнению с некоторыми другими СУБД, что может повлиять на производительность операций поиска.
4. Сложность в обслуживании и настройке: Настройка ClickHouse может потребовать определенных навыков и понимания ее архитектуры, что может сделать ее менее привлекательной для менее опытных администраторов.
В целом, выбор ClickHouse зависит от конкретных потребностей проекта. Если задачи связаны с аналитикой и обработкой больших объемов данных, ClickHouse может быть отличным вариантом. Однако, если необходимы транзакции и операции записи с высокой степенью согласованности, стоит рассмотреть другие решения.
ClickHouse - это колоночная база данных с открытым исходным кодом, предназначенная для обработки аналитических запросов с большим объемом данных.
Преимущества ClickHouse:
1. Высокая производительность: ClickHouse оптимизирована для выполнения аналитических запросов над большими объемами данных. Она обеспечивает высокую скорость выполнения запросов благодаря своей колоночной структуре данных и другим оптимизациям.
2. Масштабируемость: ClickHouse легко масштабируется горизонтально, позволяя добавлять новые узлы кластера для обработки растущего объема данных.
3. Эффективное использование ресурсов: Благодаря колоночной ориентации и сжатию данных, ClickHouse может эффективно использовать ресурсы хранения, что уменьшает потребление дискового пространства.
4. Низкие накладные расходы на операции чтения: Благодаря структуре данных и оптимизациям, ClickHouse обеспечивает высокую производительность при выполнении операций чтения.
Недостатки ClickHouse:
1. Ограниченная поддержка транзакций: ClickHouse ориентирована на аналитические запросы и не обладает полной поддержкой транзакций, что может быть недостатком для приложений, требующих сильной согласованности данных.
2. Ограниченная поддержка операций записи: ClickHouse предназначена прежде всего для чтения данных, и операции записи могут быть менее эффективными по сравнению с другими системами управления базами данных при больших объемах изменений.
3. Недостаточная поддержка индексации: ClickHouse имеет ограниченную поддержку индексации по сравнению с некоторыми другими СУБД, что может повлиять на производительность операций поиска.
4. Сложность в обслуживании и настройке: Настройка ClickHouse может потребовать определенных навыков и понимания ее архитектуры, что может сделать ее менее привлекательной для менее опытных администраторов.
В целом, выбор ClickHouse зависит от конкретных потребностей проекта. Если задачи связаны с аналитикой и обработкой больших объемов данных, ClickHouse может быть отличным вариантом. Однако, если необходимы транзакции и операции записи с высокой степенью согласованности, стоит рассмотреть другие решения.
ClickHouse Documentation
Индекс - ClickHouse Documentation
👍1
😎🔎Подборка полезных OLAP-сервисов для обработки Big Data
Apache Druid - движок OLAP в реальном времени. Он ориентирован на данные временных рядов, но может использоваться для любых данных. Он использует свой собственный столбчатый формат, который может сильно сжимать данные, и он имеет множество встроенных оптимизаций, таких как инвертированные индексы, кодирование текста, автоматическое сворачивание данных и многое другое.
Apache Pinot - предлагает меньшую задержку благодаря индексу Startree, который выполняет частичное предварительное вычисление, поэтому его можно использовать для приложений, ориентированных на пользователя (он использовался для получения лент LinkedIn). Здесь используется отсортированный индекс вместо инвертированного, который работает быстрее.
Apache Tajo - разработан для выполнения специальных запросов с малыми задержкой и масштабируемостью, онлайн-агрегирования и ETL для больших наборов данных, хранящихся в HDFS и других источниках данных. Он поддерживает интеграцию с Hive Metastore для доступа к общим схемам.
Solr - очень быстрая платформа корпоративного поиска с открытым исходным кодом, построенная на Apache Lucene. Solr является надежным, масштабируемым и отказоустойчивым инструментом, обеспечивая распределенное индексирование, репликацию и запросы с балансировкой нагрузки, автоматическое переключение при отказе и восстановление, централизованную настройку и многое другое
Presto - платформа от Facebook с открытым исходным кодом. Это распределенный механизм SQL-запросов для выполнения интерактивных аналитических запросов к источникам данных любого размера. Presto позволяет запрашивать данные там, где они находятся, включая Hive, Cassandra, реляционные базы данных и файловые системы. Она может выполнять запросы к большим наборам данных за секунды. Presto не зависит от Hadoop, но интегрируется с большинством его инструментов, особенно с Hive, для выполнения SQL-запросов.
Apache Druid - движок OLAP в реальном времени. Он ориентирован на данные временных рядов, но может использоваться для любых данных. Он использует свой собственный столбчатый формат, который может сильно сжимать данные, и он имеет множество встроенных оптимизаций, таких как инвертированные индексы, кодирование текста, автоматическое сворачивание данных и многое другое.
Apache Pinot - предлагает меньшую задержку благодаря индексу Startree, который выполняет частичное предварительное вычисление, поэтому его можно использовать для приложений, ориентированных на пользователя (он использовался для получения лент LinkedIn). Здесь используется отсортированный индекс вместо инвертированного, который работает быстрее.
Apache Tajo - разработан для выполнения специальных запросов с малыми задержкой и масштабируемостью, онлайн-агрегирования и ETL для больших наборов данных, хранящихся в HDFS и других источниках данных. Он поддерживает интеграцию с Hive Metastore для доступа к общим схемам.
Solr - очень быстрая платформа корпоративного поиска с открытым исходным кодом, построенная на Apache Lucene. Solr является надежным, масштабируемым и отказоустойчивым инструментом, обеспечивая распределенное индексирование, репликацию и запросы с балансировкой нагрузки, автоматическое переключение при отказе и восстановление, централизованную настройку и многое другое
Presto - платформа от Facebook с открытым исходным кодом. Это распределенный механизм SQL-запросов для выполнения интерактивных аналитических запросов к источникам данных любого размера. Presto позволяет запрашивать данные там, где они находятся, включая Hive, Cassandra, реляционные базы данных и файловые системы. Она может выполнять запросы к большим наборам данных за секунды. Presto не зависит от Hadoop, но интегрируется с большинством его инструментов, особенно с Hive, для выполнения SQL-запросов.
druid.apache.org
Apache Druid | Apache® Druid
❤1👍1