😎💥Крутые AI-сервисы для работы с Big Data
AskEdith - Работает в режиме "Чат с данными", где вы можете подключиться к вашему источнику данных и задавать вопросы на естественном языке. AskEdith предоставляет ответы в различных форматах, включая визуализацию. Способен анализировать обширные объемы данных и поддерживает подключение к различным базам данных и CRM-системам, таким как Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery, Redshift и другим.
Tomat.AI - позволяет проводить анализ крупных CSV-файлов без необходимости в программировании или создании специальных формул. Вы можете легко фильтровать, сортировать, объединять несколько файлов и создавать визуализации всего в несколько кликов.
Coginiti - Создает SQL-запросы, разъясняет их смысл и, при необходимости, оптимизирует производительность. Поддерживает доступ к разным хранилищам данных, включая Redshift, Microsoft, Snowflake, IBM, BigQuery, Yellowbrick, Databricks и другие. Кроме того, имеется репозиторий для хранения SQL-запросов.
Formula God - Искусственный интеллект, который интегрируется в Google Таблицы, облегчает работу с данными без необходимости владения формулами. Вы можете создавать запросы, используя обычный естественный язык.
Simple ML for Sheets - с помощью данного расширения каждый может использовать машинное обучение в Google Sheets, не зная программирования и ML. Но и экспертам также подойдет, если они хотят быстро выполнить задачу на небольшом объеме данных. Разработан командой TensorFlow Decision Forests.
AskEdith - Работает в режиме "Чат с данными", где вы можете подключиться к вашему источнику данных и задавать вопросы на естественном языке. AskEdith предоставляет ответы в различных форматах, включая визуализацию. Способен анализировать обширные объемы данных и поддерживает подключение к различным базам данных и CRM-системам, таким как Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery, Redshift и другим.
Tomat.AI - позволяет проводить анализ крупных CSV-файлов без необходимости в программировании или создании специальных формул. Вы можете легко фильтровать, сортировать, объединять несколько файлов и создавать визуализации всего в несколько кликов.
Coginiti - Создает SQL-запросы, разъясняет их смысл и, при необходимости, оптимизирует производительность. Поддерживает доступ к разным хранилищам данных, включая Redshift, Microsoft, Snowflake, IBM, BigQuery, Yellowbrick, Databricks и другие. Кроме того, имеется репозиторий для хранения SQL-запросов.
Formula God - Искусственный интеллект, который интегрируется в Google Таблицы, облегчает работу с данными без необходимости владения формулами. Вы можете создавать запросы, используя обычный естественный язык.
Simple ML for Sheets - с помощью данного расширения каждый может использовать машинное обучение в Google Sheets, не зная программирования и ML. Но и экспертам также подойдет, если они хотят быстро выполнить задачу на небольшом объеме данных. Разработан командой TensorFlow Decision Forests.
👍2
📝🤔📊 One Hot Encoding: преимущества и недостатки
One Hot Encoding (OHE) - это метод представления категориальных данных в виде бинарных векторов. Этот метод широко используется в машинном обучении для работы с данными, которые содержат категориальные признаки, то есть признаки, которые не являются числовыми. При One Hot Encoding каждая категория превращается в бинарный вектор, где все значения равны нулю, кроме одного, который соответствует категории данного признака.
Преимущества One Hot Encoding:
1. Подходит для алгоритмов машинного обучения: Многие алгоритмы машинного обучения, такие как линейная регрессия, деревья решений и нейронные сети, работают с числовыми данными. One Hot Encoding позволяет преобразовать категориальные признаки в числовые, делая их пригодными для анализа алгоритмами.
2. Полезно для категориальных признаков без упорядоченных значений: Если категории не имеют естественного порядка или распределены неравномерно, One Hot Encoding может быть более предпочтительным методом представления по сравнению с кодированием меток (Label Encoding).
Недостатки One Hot Encoding:
1. Размерность данных: Преобразование категориальных признаков с большим количеством уникальных категорий может привести к значительному увеличению размерности данных, что может ухудшить производительность алгоритмов машинного обучения и потребовать больше памяти.
2. Мультиколлинеарность: При наличии нескольких категориальных признаков с большим числом уникальных категорий могут возникнуть проблемы мультиколлинеарности, когда один признак линейно зависит от других. Это может усложнить интерпретацию моделей.
3. Увеличение вычислительной сложности: Увеличение размерности данных также может привести к увеличению времени обучения моделей и усложнению задачи отбора признаков.
Таким образом, выбор между One Hot Encoding и другими методами кодирования категориальных признаков зависит от конкретной задачи и алгоритма машинного обучения, который вы планируете использовать.
One Hot Encoding (OHE) - это метод представления категориальных данных в виде бинарных векторов. Этот метод широко используется в машинном обучении для работы с данными, которые содержат категориальные признаки, то есть признаки, которые не являются числовыми. При One Hot Encoding каждая категория превращается в бинарный вектор, где все значения равны нулю, кроме одного, который соответствует категории данного признака.
Преимущества One Hot Encoding:
1. Подходит для алгоритмов машинного обучения: Многие алгоритмы машинного обучения, такие как линейная регрессия, деревья решений и нейронные сети, работают с числовыми данными. One Hot Encoding позволяет преобразовать категориальные признаки в числовые, делая их пригодными для анализа алгоритмами.
2. Полезно для категориальных признаков без упорядоченных значений: Если категории не имеют естественного порядка или распределены неравномерно, One Hot Encoding может быть более предпочтительным методом представления по сравнению с кодированием меток (Label Encoding).
Недостатки One Hot Encoding:
1. Размерность данных: Преобразование категориальных признаков с большим количеством уникальных категорий может привести к значительному увеличению размерности данных, что может ухудшить производительность алгоритмов машинного обучения и потребовать больше памяти.
2. Мультиколлинеарность: При наличии нескольких категориальных признаков с большим числом уникальных категорий могут возникнуть проблемы мультиколлинеарности, когда один признак линейно зависит от других. Это может усложнить интерпретацию моделей.
3. Увеличение вычислительной сложности: Увеличение размерности данных также может привести к увеличению времени обучения моделей и усложнению задачи отбора признаков.
Таким образом, выбор между One Hot Encoding и другими методами кодирования категориальных признаков зависит от конкретной задачи и алгоритма машинного обучения, который вы планируете использовать.
👍2
🌎ТОП октябрьских ивентов в Data Science
1-20 октября - C:\DISGroup\DATA \Hackathon - Онлайн - https://dis-group.ru/events/datahack/
5 октября - На шаг впереди! - Москва, Россия - https://globalcio.ru/apps/one_step_ahead/
5 октября - Диалог с AI 2023 - Онлайн - https://ai-conf.bitrix24.events/
12 октября - DEEP CLOUD DIVE - Онлайн - https://cloud.beeline.ru/events/deep_cloud_dive_12_10_23/
12 октября - VK Data Meetup - Москва, Россия - https://mcs.mail.ru/events/vk-data-meetup
12-13 октября - Digital Bridge 2023 - Астана, Казахстан - https://digitalbridge.kz/?lang=RU
23-25 октября - Digital Exploration 2023 - Сочи, Россия - https://digitalexploration.ru/
1-20 октября - C:\DISGroup\DATA \Hackathon - Онлайн - https://dis-group.ru/events/datahack/
5 октября - На шаг впереди! - Москва, Россия - https://globalcio.ru/apps/one_step_ahead/
5 октября - Диалог с AI 2023 - Онлайн - https://ai-conf.bitrix24.events/
12 октября - DEEP CLOUD DIVE - Онлайн - https://cloud.beeline.ru/events/deep_cloud_dive_12_10_23/
12 октября - VK Data Meetup - Москва, Россия - https://mcs.mail.ru/events/vk-data-meetup
12-13 октября - Digital Bridge 2023 - Астана, Казахстан - https://digitalbridge.kz/?lang=RU
23-25 октября - Digital Exploration 2023 - Сочи, Россия - https://digitalexploration.ru/
DIS Group
Цифровая трансформация и умные решения для бизнеса: Юниверс MDM, Юниверс DG, Юниверс ETL, Плюс7 ФормИТ, Плюс7 ФормИТ Маскинг
DIS Group – IT-компания, основанная в 2005 году. Наша экспертиза лежит в сфере цифровой трансформации на основе данных. Мы предлагаем решения в области управления данными, бизнес-аналитики.
👍1
⚔️🤔Greenplum vs Hive: преимущества и недостатки
Greenplum и Hive - это две различные технологии для обработки и анализа данных, используемые в области больших данных и аналитики.
Преимущества Greenplum:
1. Высокая производительность: Greenplum предоставляет многопользовательский аналитический движок с распределенной архитектурой. Это обеспечивает высокую скорость обработки запросов и агрегаций, что делает его отличным выбором для аналитики в режиме реального времени.
2. Масштабируемость: Greenplum спроектирован для масштабирования горизонтально. Вы можете легко добавлять новые узлы для увеличения производительности и хранения данных по мере необходимости.
3. Управление данными: Greenplum предоставляет инструменты для управления данными, включая репликацию, резервное копирование и мониторинг, что делает его более подходящим для бизнес-задач, требующих надежности и доступности данных.
Недостатки Greenplum:
1. Сложная настройка: Установка и настройка Greenplum может быть сложной задачей. Требуется опыт и знание архитектуры системы для оптимальной работы.
2. Не подходит для всех случаев использования: Greenplum наилучшим образом подходит для аналитических задач и хранения структурированных данных, но не является оптимальным выбором для обработки полу и неструктурированных данных.
Преимущества Hive:
1. Простота использования и настройки: Hive создан поверх Hadoop и предоставляет SQL-подобный интерфейс для запросов данных. Это делает его более доступным для аналитиков и разработчиков, не имеющих опыта работы с большими данными.
2. Совместимость с Hadoop: Hive интегрирован с Hadoop и может использовать его для хранения и обработки данных. Это делает его хорошим выбором для проектов, использующих Hadoop.
3. Поддержка для разнообразных форматов данных: Hive поддерживает различные форматы данных, включая JSON, Parquet, Avro и другие, что делает его удобным для анализа разнообразных данных.
Недостатки Hive:
1. Низкая производительность: Hive работает медленнее Greenplum из-за того, что запросы переводятся в задачи MapReduce, что может привести к значительным задержкам.
2. Ограниченная поддержка сложных аналитических запросов: Hive не так хорошо подходит для выполнения сложных аналитических запросов, как Greenplum, из-за его ограниченных возможностей оптимизации запросов.
3. Не подходит для реального времени: Hive наилучшим образом подходит для пакетной обработки данных и не является подходящим выбором для аналитики в режиме реального времени.
Greenplum и Hive - это две различные технологии для обработки и анализа данных, используемые в области больших данных и аналитики.
Преимущества Greenplum:
1. Высокая производительность: Greenplum предоставляет многопользовательский аналитический движок с распределенной архитектурой. Это обеспечивает высокую скорость обработки запросов и агрегаций, что делает его отличным выбором для аналитики в режиме реального времени.
2. Масштабируемость: Greenplum спроектирован для масштабирования горизонтально. Вы можете легко добавлять новые узлы для увеличения производительности и хранения данных по мере необходимости.
3. Управление данными: Greenplum предоставляет инструменты для управления данными, включая репликацию, резервное копирование и мониторинг, что делает его более подходящим для бизнес-задач, требующих надежности и доступности данных.
Недостатки Greenplum:
1. Сложная настройка: Установка и настройка Greenplum может быть сложной задачей. Требуется опыт и знание архитектуры системы для оптимальной работы.
2. Не подходит для всех случаев использования: Greenplum наилучшим образом подходит для аналитических задач и хранения структурированных данных, но не является оптимальным выбором для обработки полу и неструктурированных данных.
Преимущества Hive:
1. Простота использования и настройки: Hive создан поверх Hadoop и предоставляет SQL-подобный интерфейс для запросов данных. Это делает его более доступным для аналитиков и разработчиков, не имеющих опыта работы с большими данными.
2. Совместимость с Hadoop: Hive интегрирован с Hadoop и может использовать его для хранения и обработки данных. Это делает его хорошим выбором для проектов, использующих Hadoop.
3. Поддержка для разнообразных форматов данных: Hive поддерживает различные форматы данных, включая JSON, Parquet, Avro и другие, что делает его удобным для анализа разнообразных данных.
Недостатки Hive:
1. Низкая производительность: Hive работает медленнее Greenplum из-за того, что запросы переводятся в задачи MapReduce, что может привести к значительным задержкам.
2. Ограниченная поддержка сложных аналитических запросов: Hive не так хорошо подходит для выполнения сложных аналитических запросов, как Greenplum, из-за его ограниченных возможностей оптимизации запросов.
3. Не подходит для реального времени: Hive наилучшим образом подходит для пакетной обработки данных и не является подходящим выбором для аналитики в режиме реального времени.
👍3❤1
📖📚Подборка книг для аналитиков данных
Анализ данных с помощью Python - Полное руководство по науке о данных, аналитике и метрикам с Python.
Математика для машинного обучения - в книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Интерпретируемое машинное обучение - руководство по созданию объяснимых моделей черного ящика
Понимание статистики и экспериментального дизайна - данный учебник предоставляет основы, необходимые для правильного понимания, интерпретации статистики.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Использование науки о данных в здравоохранении - в книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Анализ данных с помощью Python - Полное руководство по науке о данных, аналитике и метрикам с Python.
Математика для машинного обучения - в книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Интерпретируемое машинное обучение - руководство по созданию объяснимых моделей черного ящика
Понимание статистики и экспериментального дизайна - данный учебник предоставляет основы, необходимые для правильного понимания, интерпретации статистики.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Использование науки о данных в здравоохранении - в книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
Amazon
Python Data Analysis: Comprehensive Guide to Data Science, Analytics and Metrics with Python (Data Science and Analysis Book 1)
Python Data Analysis: Comprehensive Guide to Data Science, Analytics and Metrics with Python (Data Science and Analysis Book 1) eBook : Campbell, Alex : Amazon.in: Books
👍2
📊📉📈Анализ пользователей с помощью датасета от Яндекса
Яндекс выкладывает в открытый доступ крупнейший русскоязычный датасет отзывов об организациях, опубликованных на Яндекс Картах. Он содержит порядка полумиллиона отзывов пользователей на различные организации, собранных в январе-июне 2023 года.
Особенности датасета:
500 000 уникальных отзывов
Тексты очищены от персональных данных (номеров телефонов, адресов почты)
Датасет не содержит коротких односложных отзывов
Достаточно свежие отзывы: с января по июль 2023 года
Яндекс выкладывает в открытый доступ крупнейший русскоязычный датасет отзывов об организациях, опубликованных на Яндекс Картах. Он содержит порядка полумиллиона отзывов пользователей на различные организации, собранных в январе-июне 2023 года.
Особенности датасета:
500 000 уникальных отзывов
Тексты очищены от персональных данных (номеров телефонов, адресов почты)
Датасет не содержит коротких односложных отзывов
Достаточно свежие отзывы: с января по июль 2023 года
GitHub
GitHub - yandex/geo-reviews-dataset-2023
Contribute to yandex/geo-reviews-dataset-2023 development by creating an account on GitHub.
👍6
📋💡🔎Подборка датасетов для NLP
КартаСловСент — слова и выражения, снабжённые тональной меткой («положительное», «отрицательное», «нейтральное») и скалярным значением силы эмоционально-оценочного заряда из непрерывного диапазона [-1, 1].
WikiQA - представляет собой набор пар вопросов и предложений. Они были собраны и аннотированы для исследования ответов на вопросы в открытых доменах
Amazon Reviews dataset - этот набор данных состоит из нескольких миллионов отзывов покупателей Amazon и их оценок. Датасет используется для возможности обучения fastText, анализируя настроения покупателей. Идея состоит в том, что несмотря на огромный объем данных – это реальная бизнес-задача. Модель обучается за считанные минуты. Именно это отличает Amazon Reviews от аналогов.
Yelp dataset – это множество предприятий, отзывов и пользовательских данных, которые можно применить в Pet-проекте и научной работе. Также можно использовать Yelp для обучения студентов во время работы с базами данных, при изучении NLP и в качестве образца производственных данных. Датасет доступен в виде файлов JSON и является «классикой» в обработке естественного языка.
КартаСловСент — слова и выражения, снабжённые тональной меткой («положительное», «отрицательное», «нейтральное») и скалярным значением силы эмоционально-оценочного заряда из непрерывного диапазона [-1, 1].
WikiQA - представляет собой набор пар вопросов и предложений. Они были собраны и аннотированы для исследования ответов на вопросы в открытых доменах
Amazon Reviews dataset - этот набор данных состоит из нескольких миллионов отзывов покупателей Amazon и их оценок. Датасет используется для возможности обучения fastText, анализируя настроения покупателей. Идея состоит в том, что несмотря на огромный объем данных – это реальная бизнес-задача. Модель обучается за считанные минуты. Именно это отличает Amazon Reviews от аналогов.
Yelp dataset – это множество предприятий, отзывов и пользовательских данных, которые можно применить в Pet-проекте и научной работе. Также можно использовать Yelp для обучения студентов во время работы с базами данных, при изучении NLP и в качестве образца производственных данных. Датасет доступен в виде файлов JSON и является «классикой» в обработке естественного языка.
GitHub
kartaslov/dataset/kartaslovsent at master · dkulagin/kartaslov
Открытые лингвистические датасеты: тональный словарь русского языка КартаСловСент, датасет по семантике, ассоциативный граф и датасет по орфографическим ошибкам и опечаткам. - dkulagin/kartaslov
👍5
⚔️⚡️Altair vs. Matplotlib: преимущества и недостатки визуализаций Big Data
Matplotlib - это старожил в мире визуализации данных, и он широко используется в сообществе Python.
Преимущества Matplotlib:
1. Максимальная гибкость: Matplotlib позволяет вам создавать почти любой вид графиков и настраивать каждую деталь. Вы можете создавать статические и анимированные графики, подходящие для различных целей.
2. Большое сообщество и документация: Благодаря своей популярности, Matplotlib имеет огромное сообщество пользователей и обширную документацию. Это делает его отличным выбором для начинающих и опытных пользователей.
3. Широкий выбор графических элементов: Matplotlib предоставляет богатый выбор графических элементов, таких как линии, точки, столбцы, и многое другое, что позволяет вам создавать разнообразные графики.
Недостатки Matplotlib:
1. Сложность: Создание сложных графиков с Matplotlib может быть нетривиальным и требовать значительных усилий и кода.
2. Внешний вид по умолчанию: Графики, созданные с помощью Matplotlib, могут выглядеть не слишком привлекательно по умолчанию, и для их улучшения часто требуется дополнительная и достаточно трудоемкая работа.
Altair - это более новая библиотека, которая стремится упростить создание декларативных графиков.
Преимущества Altair:
1. Декларативный подход: Altair предлагает декларативный подход к созданию графиков, что означает, что вы описываете, какие данные вы хотите визуализировать и как, а библиотека заботится о деталях.
2. Простота использования: Altair позволяет создавать красивые графики с минимальным объемом кода. Это делает его отличным выбором для быстрого прототипирования и начинающих.
3. Интеграция с Pandas: Altair хорошо интегрируется с библиотекой Pandas, что упрощает работу с данными.
Недостатки Altair:
1. Ограниченные возможности настройки: В сравнении с Matplotlib, Altair предоставляет меньше возможностей для настройки графиков. Если вам нужны сложные и нестандартные графики, это может быть ограничивающим фактором.
2. Меньшее сообщество и документация: Altair, будучи новым проектом, имеет меньшее сообщество пользователей и менее обширную документацию.
Выбор между Altair и Matplotlib зависит от конкретных потребностей и уровня опыта. Matplotlib подходит для тех, кто нуждается в полной гибкости и контроле над графиками, в то время как Altair предоставляет простой и декларативный способ создания красивых графиков с минимальными усилиями.
Matplotlib - это старожил в мире визуализации данных, и он широко используется в сообществе Python.
Преимущества Matplotlib:
1. Максимальная гибкость: Matplotlib позволяет вам создавать почти любой вид графиков и настраивать каждую деталь. Вы можете создавать статические и анимированные графики, подходящие для различных целей.
2. Большое сообщество и документация: Благодаря своей популярности, Matplotlib имеет огромное сообщество пользователей и обширную документацию. Это делает его отличным выбором для начинающих и опытных пользователей.
3. Широкий выбор графических элементов: Matplotlib предоставляет богатый выбор графических элементов, таких как линии, точки, столбцы, и многое другое, что позволяет вам создавать разнообразные графики.
Недостатки Matplotlib:
1. Сложность: Создание сложных графиков с Matplotlib может быть нетривиальным и требовать значительных усилий и кода.
2. Внешний вид по умолчанию: Графики, созданные с помощью Matplotlib, могут выглядеть не слишком привлекательно по умолчанию, и для их улучшения часто требуется дополнительная и достаточно трудоемкая работа.
Altair - это более новая библиотека, которая стремится упростить создание декларативных графиков.
Преимущества Altair:
1. Декларативный подход: Altair предлагает декларативный подход к созданию графиков, что означает, что вы описываете, какие данные вы хотите визуализировать и как, а библиотека заботится о деталях.
2. Простота использования: Altair позволяет создавать красивые графики с минимальным объемом кода. Это делает его отличным выбором для быстрого прототипирования и начинающих.
3. Интеграция с Pandas: Altair хорошо интегрируется с библиотекой Pandas, что упрощает работу с данными.
Недостатки Altair:
1. Ограниченные возможности настройки: В сравнении с Matplotlib, Altair предоставляет меньше возможностей для настройки графиков. Если вам нужны сложные и нестандартные графики, это может быть ограничивающим фактором.
2. Меньшее сообщество и документация: Altair, будучи новым проектом, имеет меньшее сообщество пользователей и менее обширную документацию.
Выбор между Altair и Matplotlib зависит от конкретных потребностей и уровня опыта. Matplotlib подходит для тех, кто нуждается в полной гибкости и контроле над графиками, в то время как Altair предоставляет простой и декларативный способ создания красивых графиков с минимальными усилиями.
GitHub
GitHub - matplotlib/matplotlib: matplotlib: plotting with Python
matplotlib: plotting with Python. Contribute to matplotlib/matplotlib development by creating an account on GitHub.
👍1🤔1
😎⚡️Визуализация астрономии теперь еще проще в Python
APLpy (the Astronomical Plotting Library in Python) - это модуль Python, предназначенный для создания графиков публикации астрономических изображений в формате FITS.
Хотели ли вы когда-нибудь попробовать визуализцию астрономических данных? Теперь это легко делается на Python с помощью данной библиотеки. Для установки этой библиотеки необходимо всего лишь выполнить следующую команду:
pip install aplpy
APLpy (the Astronomical Plotting Library in Python) - это модуль Python, предназначенный для создания графиков публикации астрономических изображений в формате FITS.
Хотели ли вы когда-нибудь попробовать визуализцию астрономических данных? Теперь это легко делается на Python с помощью данной библиотеки. Для установки этой библиотеки необходимо всего лишь выполнить следующую команду:
pip install aplpy
GitHub
GitHub - aplpy/aplpy: Astronomical Plotting Library in Python
Astronomical Plotting Library in Python. Contribute to aplpy/aplpy development by creating an account on GitHub.
👍3
📊📝В открытом доступе сельхозданные Евросоюза
EuroCrops представляет собой обширный сборник датасетов, объединяющий все публично доступные данные о сельском хозяйстве в странах Европейского Союза.
Данный проект финансируется Немецким космическим агентством DLR от имени Федерального министерства экономики и борьбы с изменением климата.
EuroCrops представляет собой обширный сборник датасетов, объединяющий все публично доступные данные о сельском хозяйстве в странах Европейского Союза.
Данный проект финансируется Немецким космическим агентством DLR от имени Федерального министерства экономики и борьбы с изменением климата.
GitHub
GitHub - maja601/EuroCrops: The official repository for the EuroCrops dataset.
The official repository for the EuroCrops dataset. - maja601/EuroCrops
👍3
⚔️📊LDA vs t-SNE: преимущества и недостатки
Два популярных метода для анализа данных данных, LDA (Linear Discriminant Analysis) и t-SNE (t-Distributed Stochastic Neighbor Embedding), используются для решения различных задач. Оба они имеют свои уникальные преимущества и недостатки. Давайте рассмотрим их подробнее.
Преимущества LDA:
1. Классификация: LDA предназначен для задач классификации и разделения данных. Он стремится максимизировать расстояние между классами, что делает его отличным выбором для задач, связанных с классификацией и распознаванием образов.
2. Интерпретируемость: LDA создает новые признаки (линейные комбинации исходных), которые могут быть интерпретированы как "дискриминантные оси". Это упрощает объяснение того, как и почему данные разделяются.
3. Эффективность при больших данных: LDA обычно более эффективен при работе с большими объемами данных, чем t-SNE. Он может быть быстрее и требовать меньше памяти.
Недостатки LDA:
1. Линейная природа: LDA предполагает, что данные линейно разделимы, что может ограничивать его применимость в задачах, где классы не могут быть разделены линейно.
2. Недостаток визуальной информации: LDA создает новое пространство признаков, но не обязательно сохраняет сходство между данными точками. Это делает его менее подходящим для визуализации данных.
Преимущества t-SNE:
1. Устойчивость к нелинейным отношениям: t-SNE может обнаруживать нелинейные зависимости в данных, делая его хорошим выбором для визуализации данных в случаях, когда линейное разделение недостаточно.
2. Отображение высокоразмерных данных: t-SNE может справляться с высокоразмерными данными, сохраняя их структуру при уменьшении размерности.
3. Лучшая визуализация: t-SNE обеспечивает более наглядную визуализацию данных, группируя похожие точки в плотные кластеры.
Недостатки t-SNE:
1. Чувствительность к параметрам: Выбор параметров, таких как perplexity, может сильно повлиять на результаты t-SNE. Необходимо проводить тщательный анализ параметров.
2. Вычислительная сложность: t-SNE может быть вычислительно затратным и медленным при работе с большими наборами данных.
3. Отсутствие интерпретируемости: Поскольку t-SNE стремится к визуальной группировке точек, он не создает интерпретируемых новых признаков.
Таким образом, выбор между LDA и t-SNE зависит от конкретных целей анализа. LDA лучше подходит для задач классификации и интерпретируемости, в то время как t-SNE обычно предпочтителен для визуализации и выявления нелинейных зависимостей.
Два популярных метода для анализа данных данных, LDA (Linear Discriminant Analysis) и t-SNE (t-Distributed Stochastic Neighbor Embedding), используются для решения различных задач. Оба они имеют свои уникальные преимущества и недостатки. Давайте рассмотрим их подробнее.
Преимущества LDA:
1. Классификация: LDA предназначен для задач классификации и разделения данных. Он стремится максимизировать расстояние между классами, что делает его отличным выбором для задач, связанных с классификацией и распознаванием образов.
2. Интерпретируемость: LDA создает новые признаки (линейные комбинации исходных), которые могут быть интерпретированы как "дискриминантные оси". Это упрощает объяснение того, как и почему данные разделяются.
3. Эффективность при больших данных: LDA обычно более эффективен при работе с большими объемами данных, чем t-SNE. Он может быть быстрее и требовать меньше памяти.
Недостатки LDA:
1. Линейная природа: LDA предполагает, что данные линейно разделимы, что может ограничивать его применимость в задачах, где классы не могут быть разделены линейно.
2. Недостаток визуальной информации: LDA создает новое пространство признаков, но не обязательно сохраняет сходство между данными точками. Это делает его менее подходящим для визуализации данных.
Преимущества t-SNE:
1. Устойчивость к нелинейным отношениям: t-SNE может обнаруживать нелинейные зависимости в данных, делая его хорошим выбором для визуализации данных в случаях, когда линейное разделение недостаточно.
2. Отображение высокоразмерных данных: t-SNE может справляться с высокоразмерными данными, сохраняя их структуру при уменьшении размерности.
3. Лучшая визуализация: t-SNE обеспечивает более наглядную визуализацию данных, группируя похожие точки в плотные кластеры.
Недостатки t-SNE:
1. Чувствительность к параметрам: Выбор параметров, таких как perplexity, может сильно повлиять на результаты t-SNE. Необходимо проводить тщательный анализ параметров.
2. Вычислительная сложность: t-SNE может быть вычислительно затратным и медленным при работе с большими наборами данных.
3. Отсутствие интерпретируемости: Поскольку t-SNE стремится к визуальной группировке точек, он не создает интерпретируемых новых признаков.
Таким образом, выбор между LDA и t-SNE зависит от конкретных целей анализа. LDA лучше подходит для задач классификации и интерпретируемости, в то время как t-SNE обычно предпочтителен для визуализации и выявления нелинейных зависимостей.
👍4
Forwarded from Алексей Чернобровов
Benerator - программное средство для создания тестовых данных, которые можно использовать при тестировании и обучении моделей машинного обучения.
DataFactory - облегчает процесс создания тестовых данных для наполнения баз данных и тестирования искусственных интеллектуальных моделей.
MockNeat - это инструмент, который предоставляет удобный интерфейс программирования (API), позволяющий разработчикам создавать данные в различных форматах, таких как json, xml, csv и sql, без особых усилий.
Spawner - это инструмент для генерации данных, который предназначен для использования с разными базами данных и искусственными интеллектуальными моделями. Он предоставляет множество типов полей, включая возможность настраивать их по усмотрению пользователя.
DataFactory - облегчает процесс создания тестовых данных для наполнения баз данных и тестирования искусственных интеллектуальных моделей.
MockNeat - это инструмент, который предоставляет удобный интерфейс программирования (API), позволяющий разработчикам создавать данные в различных форматах, таких как json, xml, csv и sql, без особых усилий.
Spawner - это инструмент для генерации данных, который предназначен для использования с разными базами данных и искусственными интеллектуальными моделями. Он предоставляет множество типов полей, включая возможность настраивать их по усмотрению пользователя.
🔥3❤1👍1
📝🤔Разметка данных: преимущества и обратная сторона
Разметка данных - это процесс присвоения меток или аннотаций определенным элементам в наборе данных, чтобы обучать машины понимать и извлекать информацию из этих данных. Разметка данных играет важную роль в машинном обучении, глубоком обучении и анализе данных, так как она позволяет алгоритмам понимать, какие объекты или факторы в данных являются важными, а какие несущественными.
Преимущества разметки данных:
1. Улучшение точности моделей: Разметка данных способствует созданию более точных и надежных моделей, так как алгоритмы могут учиться на основе правильных меток и избегать ошибок.
2. Обучение алгоритмов: Размеченные данные позволяют более эффективно обучать алгоритмы машинного обучения, что делает их способными к решению сложных задач, таких как распознавание образов, классификация текстов, прогнозирование и другие.
3. Расширение функциональности приложений: Размеченные данные позволяют разрабатывать более интеллектуальные приложения и сервисы, такие как виртуальные помощники, автоматизированные системы и многое другое.
Недостатки разметки данных:
1. Ресурсозатратность: Разметка данных требует значительных усилий и ресурсов, особенно если речь идет о больших наборах данных или сложных задачах.
2. Субъективность: Разметка данных может зависеть от субъективных оценок разметчиков, что может привести к ошибкам и неточностям.
3. Ограниченность задачи: Разметка данных ограничивается конкретной задачей обучения, и изменение этой задачи может потребовать переразметки данных.
4. Обновление данных: Размеченные данные могут устаревать с течением времени, и для поддержания актуальности моделей необходимо периодически обновлять разметку.
В целом, разметка данных является неотъемлемой частью многих проектов в области машинного обучения, и ее преимущества часто превосходят недостатки, особенно при правильной организации и управлении процессом разметки.
Разметка данных - это процесс присвоения меток или аннотаций определенным элементам в наборе данных, чтобы обучать машины понимать и извлекать информацию из этих данных. Разметка данных играет важную роль в машинном обучении, глубоком обучении и анализе данных, так как она позволяет алгоритмам понимать, какие объекты или факторы в данных являются важными, а какие несущественными.
Преимущества разметки данных:
1. Улучшение точности моделей: Разметка данных способствует созданию более точных и надежных моделей, так как алгоритмы могут учиться на основе правильных меток и избегать ошибок.
2. Обучение алгоритмов: Размеченные данные позволяют более эффективно обучать алгоритмы машинного обучения, что делает их способными к решению сложных задач, таких как распознавание образов, классификация текстов, прогнозирование и другие.
3. Расширение функциональности приложений: Размеченные данные позволяют разрабатывать более интеллектуальные приложения и сервисы, такие как виртуальные помощники, автоматизированные системы и многое другое.
Недостатки разметки данных:
1. Ресурсозатратность: Разметка данных требует значительных усилий и ресурсов, особенно если речь идет о больших наборах данных или сложных задачах.
2. Субъективность: Разметка данных может зависеть от субъективных оценок разметчиков, что может привести к ошибкам и неточностям.
3. Ограниченность задачи: Разметка данных ограничивается конкретной задачей обучения, и изменение этой задачи может потребовать переразметки данных.
4. Обновление данных: Размеченные данные могут устаревать с течением времени, и для поддержания актуальности моделей необходимо периодически обновлять разметку.
В целом, разметка данных является неотъемлемой частью многих проектов в области машинного обучения, и ее преимущества часто превосходят недостатки, особенно при правильной организации и управлении процессом разметки.
👍3
🌎ТОП ноябрьских ивентов в Data Science
2 ноября - DataStart 2023 - Москва, Россия - https://datastart.ru/
4-5 ноября - BreakPoint 2023: Insert New. Element - Москва, Россия - https://breakpoint23.ru/
9-10 ноября - МАТЕМАРКЕТИНГ - Москва, Россия - https://matemarketing.ru/
16 ноября - TechRec 2023 - Москва, Россия - https://techrec.pro/
22-24 ноября - AI Journey 2023 - Онлайн - https://aij.ru/
28-30 ноября - DATA & ANALYTICS - Москва, Россия - https://techweek.moscow/data_day/
2 ноября - DataStart 2023 - Москва, Россия - https://datastart.ru/
4-5 ноября - BreakPoint 2023: Insert New. Element - Москва, Россия - https://breakpoint23.ru/
9-10 ноября - МАТЕМАРКЕТИНГ - Москва, Россия - https://matemarketing.ru/
16 ноября - TechRec 2023 - Москва, Россия - https://techrec.pro/
22-24 ноября - AI Journey 2023 - Онлайн - https://aij.ru/
28-30 ноября - DATA & ANALYTICS - Москва, Россия - https://techweek.moscow/data_day/
🔥1
📝🔎💥Управлять качеством данных теперь еще проще
Great Expectations (GX) - это open-source инструмент, созданный на базе языка Python, который служит для контроля качества данных. Он предоставляет командам дата-саентистов возможность проводить анализ и проверку данных, а также создавать с ними отчеты. Этот инструмент обладает удобным интерфейсом командной строки (CLI), что упрощает создание новых тестов и редактирование уже существующих отчетов. Важно отметить, что Great Expectations может быть интегрирован с разнообразными инструментами для извлечения, преобразования и загрузки данных (ETL), такими как Airflow и различные системы управления базами данных. Найти полный список поддерживаемых интеграций и официальную документацию можно на веб-сайте Great Expectations.
Great Expectations (GX) - это open-source инструмент, созданный на базе языка Python, который служит для контроля качества данных. Он предоставляет командам дата-саентистов возможность проводить анализ и проверку данных, а также создавать с ними отчеты. Этот инструмент обладает удобным интерфейсом командной строки (CLI), что упрощает создание новых тестов и редактирование уже существующих отчетов. Важно отметить, что Great Expectations может быть интегрирован с разнообразными инструментами для извлечения, преобразования и загрузки данных (ETL), такими как Airflow и различные системы управления базами данных. Найти полный список поддерживаемых интеграций и официальную документацию можно на веб-сайте Great Expectations.
docs.greatexpectations.io
Introduction to GX Core | Great Expectations
Learn about GX Core components and workflows and try out the GX Core Python library.
👍1🤔1
📝📚Подборка книг по Data Mining
Data Mining: Practical Machine Learning Tools and Techniques - книга предоставляет введение в основы Data Mining и использует популярный инструмент Weka для обучения алгоритмов машинного обучении
Introduction to Data Mining - классическая книга, которая охватывает основные концепции и методы Data Mining
Principles of Data Mining - эта книга предоставляет обширное обсуждение принципов и методов Data Mining
Data Mining Techniques: For Marketing, Sales, and Customer Relationship Management - книга ориентирована на использование Data Mining в маркетинге и управлении клиентскими отношениями
Data Science for Dummies - хороший вариант для начинающих, книга охватывает множество тем, включая Data Mining, машинное обучение и анализ данных
Data Mining: Practical Machine Learning Tools and Techniques - книга предоставляет введение в основы Data Mining и использует популярный инструмент Weka для обучения алгоритмов машинного обучении
Introduction to Data Mining - классическая книга, которая охватывает основные концепции и методы Data Mining
Principles of Data Mining - эта книга предоставляет обширное обсуждение принципов и методов Data Mining
Data Mining Techniques: For Marketing, Sales, and Customer Relationship Management - книга ориентирована на использование Data Mining в маркетинге и управлении клиентскими отношениями
Data Science for Dummies - хороший вариант для начинающих, книга охватывает множество тем, включая Data Mining, машинное обучение и анализ данных
Offidocs
PDF Editor online by OffiDocs
Edit PDF to add annotations, add images, signatures, text to edit your PDF online using your browser!
👍3❤1
🤖⚡️🔎Подборка сервисов на базе AI для анализа Big Data
AskEdith - Упрощает анализ данных, позволяя пользователям задавать вопросы и получать мгновенную информацию. Расширяет возможности "аналитики самообслуживания", обеспечивая безопасный и надежный доступ к данным. Совместим со всеми база данных и CRM (Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery и Redshift и тд)
Tomat.AI - Инструмент на базе искусственного интеллекта, который позволяет специалистам по данным легко исследовать и анализировать большие файлы CSV без необходимости кодирования или написания формул. Вы можете открывать и просматривать огромные файлы CSV всего несколькими щелчками мыши
Coginiti - Позволяет пользователям генерировать SQL запросы, используя подсказки на естественном языке, оптимизировать существующие SQL-запросы, объяснять общий SQL в интегрированном каталоге, давать подробные объяснения и решения ошибок, а также объяснять планы выполнения запросов для лучшей оптимизации. ИИ помощник постоянно развивается на основе каждого взаимодействия, адаптируя рекомендации и предложения в соответствии с индивидуальными потребностями
Speak Ai - Платформа для анализа и исследования языковых данных, которая предлагает возможности транскрипции, анализа данных и анализа настроений для различных типов медиа. Он позволяет выполнять автоматическую транскрипцию, массовый анализ, визуализацию и сбор данных для использования в исследованиях, анализе рынка и конкурентном анализе. Инструмент также предлагает общий медиа-репозиторий, систему текстовых подсказок на базе искусственного интеллекта и решение для SWOT-анализа, а также другие функции
Formula God - Инструмент искусственного интеллекта встроен в Google Таблицы. Он использует искусственный интеллект, чтобы помочь пользователям манипулировать и вычислять данные во всем диапазоне ячеек
Simple ML for Sheets - полезен для экспертов по машинному обучению, которые хотят быстро выполнить итерацию или создать прототип на небольших (например, <1 миллиона примеров) наборах табличных данных. Simple ML for Sheets — это надстройка для Google Sheets от команды TensorFlow Decision Forests.
AskEdith - Упрощает анализ данных, позволяя пользователям задавать вопросы и получать мгновенную информацию. Расширяет возможности "аналитики самообслуживания", обеспечивая безопасный и надежный доступ к данным. Совместим со всеми база данных и CRM (Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery и Redshift и тд)
Tomat.AI - Инструмент на базе искусственного интеллекта, который позволяет специалистам по данным легко исследовать и анализировать большие файлы CSV без необходимости кодирования или написания формул. Вы можете открывать и просматривать огромные файлы CSV всего несколькими щелчками мыши
Coginiti - Позволяет пользователям генерировать SQL запросы, используя подсказки на естественном языке, оптимизировать существующие SQL-запросы, объяснять общий SQL в интегрированном каталоге, давать подробные объяснения и решения ошибок, а также объяснять планы выполнения запросов для лучшей оптимизации. ИИ помощник постоянно развивается на основе каждого взаимодействия, адаптируя рекомендации и предложения в соответствии с индивидуальными потребностями
Speak Ai - Платформа для анализа и исследования языковых данных, которая предлагает возможности транскрипции, анализа данных и анализа настроений для различных типов медиа. Он позволяет выполнять автоматическую транскрипцию, массовый анализ, визуализацию и сбор данных для использования в исследованиях, анализе рынка и конкурентном анализе. Инструмент также предлагает общий медиа-репозиторий, систему текстовых подсказок на базе искусственного интеллекта и решение для SWOT-анализа, а также другие функции
Formula God - Инструмент искусственного интеллекта встроен в Google Таблицы. Он использует искусственный интеллект, чтобы помочь пользователям манипулировать и вычислять данные во всем диапазоне ячеек
Simple ML for Sheets - полезен для экспертов по машинному обучению, которые хотят быстро выполнить итерацию или создать прототип на небольших (например, <1 миллиона примеров) наборах табличных данных. Simple ML for Sheets — это надстройка для Google Sheets от команды TensorFlow Decision Forests.
Athenic
Athenic: AI Data Analyst for Your Business
Athenic is an agentic AI data analyst. Connect your business data, ask questions in plain English, and build live dashboards & automated reports — no SQL required.
🔥2❤1👍1
📝🔎Apache Flink: преимущества и недостатки
Apache Flink - это распределенный система обработки данных в реальном времени, которая предоставляет возможности для потоковой обработки данных и анализа в реальном времени.
Преимущества Apache Flink:
1. Потоковая обработка данных: Flink предназначен для эффективной обработки данных в режиме реального времени, что позволяет быстро реагировать на изменения и события.
2. Высокая производительность: Flink обеспечивает высокую производительность благодаря оптимизированному выполнению запросов и эффективному распределению задач на кластере.
3. Гибкость и масштабируемость: Flink обеспечивает гибкость в определении и изменении потоковых вычислений. Также следует отметить Повышение производительности при увеличении объема обрабатываемых данных.
Недостатки Apache Flink:
1. Сложность настройки: Настройка и управление кластером Apache Flink может потребовать значительных усилий и опыта.
2. Отсутствие широкой популярности: По сравнению с некоторыми другими системами обработки данных в реальном времени, Apache Flink не так широко используется, что может сказаться на доступности ресурсов и сообществе поддержки.
3. Сложности в интеграции: Интеграция Apache Flink с существующими системами и инструментами может быть сложной задачей, требующей переработку данных для совместимости с форматами и структурами других систем.
В целом, Apache Flink предоставляет мощные возможности для обработки данных в реальном времени, но требует внимательного внедрения и управления для достижения максимальной производительности и надежности.
Apache Flink - это распределенный система обработки данных в реальном времени, которая предоставляет возможности для потоковой обработки данных и анализа в реальном времени.
Преимущества Apache Flink:
1. Потоковая обработка данных: Flink предназначен для эффективной обработки данных в режиме реального времени, что позволяет быстро реагировать на изменения и события.
2. Высокая производительность: Flink обеспечивает высокую производительность благодаря оптимизированному выполнению запросов и эффективному распределению задач на кластере.
3. Гибкость и масштабируемость: Flink обеспечивает гибкость в определении и изменении потоковых вычислений. Также следует отметить Повышение производительности при увеличении объема обрабатываемых данных.
Недостатки Apache Flink:
1. Сложность настройки: Настройка и управление кластером Apache Flink может потребовать значительных усилий и опыта.
2. Отсутствие широкой популярности: По сравнению с некоторыми другими системами обработки данных в реальном времени, Apache Flink не так широко используется, что может сказаться на доступности ресурсов и сообществе поддержки.
3. Сложности в интеграции: Интеграция Apache Flink с существующими системами и инструментами может быть сложной задачей, требующей переработку данных для совместимости с форматами и структурами других систем.
В целом, Apache Flink предоставляет мощные возможности для обработки данных в реальном времени, но требует внимательного внедрения и управления для достижения максимальной производительности и надежности.
👍2❤1🔥1
💥😎Подборка открытых датасетов по различным областям
Данная подборка представляет собой список открытых датасетов высокого качества для машинного обучения, временных рядов, NLP, обработки изображений и т.д., ориентированный на конкретные темы.
Датасеты доступны по данной ссылке.
Данная подборка представляет собой список открытых датасетов высокого качества для машинного обучения, временных рядов, NLP, обработки изображений и т.д., ориентированный на конкретные темы.
Датасеты доступны по данной ссылке.
GitHub
GitHub - awesomedata/awesome-public-datasets: A topic-centric list of HQ open datasets.
A topic-centric list of HQ open datasets. Contribute to awesomedata/awesome-public-datasets development by creating an account on GitHub.
👍1🔥1
📝Немного о ClickHouse: преимущества и недостатки
ClickHouse - это колоночная база данных с открытым исходным кодом, предназначенная для обработки аналитических запросов с большим объемом данных.
Преимущества ClickHouse:
1. Высокая производительность: ClickHouse оптимизирована для выполнения аналитических запросов над большими объемами данных. Она обеспечивает высокую скорость выполнения запросов благодаря своей колоночной структуре данных и другим оптимизациям.
2. Масштабируемость: ClickHouse легко масштабируется горизонтально, позволяя добавлять новые узлы кластера для обработки растущего объема данных.
3. Эффективное использование ресурсов: Благодаря колоночной ориентации и сжатию данных, ClickHouse может эффективно использовать ресурсы хранения, что уменьшает потребление дискового пространства.
4. Низкие накладные расходы на операции чтения: Благодаря структуре данных и оптимизациям, ClickHouse обеспечивает высокую производительность при выполнении операций чтения.
Недостатки ClickHouse:
1. Ограниченная поддержка транзакций: ClickHouse ориентирована на аналитические запросы и не обладает полной поддержкой транзакций, что может быть недостатком для приложений, требующих сильной согласованности данных.
2. Ограниченная поддержка операций записи: ClickHouse предназначена прежде всего для чтения данных, и операции записи могут быть менее эффективными по сравнению с другими системами управления базами данных при больших объемах изменений.
3. Недостаточная поддержка индексации: ClickHouse имеет ограниченную поддержку индексации по сравнению с некоторыми другими СУБД, что может повлиять на производительность операций поиска.
4. Сложность в обслуживании и настройке: Настройка ClickHouse может потребовать определенных навыков и понимания ее архитектуры, что может сделать ее менее привлекательной для менее опытных администраторов.
В целом, выбор ClickHouse зависит от конкретных потребностей проекта. Если задачи связаны с аналитикой и обработкой больших объемов данных, ClickHouse может быть отличным вариантом. Однако, если необходимы транзакции и операции записи с высокой степенью согласованности, стоит рассмотреть другие решения.
ClickHouse - это колоночная база данных с открытым исходным кодом, предназначенная для обработки аналитических запросов с большим объемом данных.
Преимущества ClickHouse:
1. Высокая производительность: ClickHouse оптимизирована для выполнения аналитических запросов над большими объемами данных. Она обеспечивает высокую скорость выполнения запросов благодаря своей колоночной структуре данных и другим оптимизациям.
2. Масштабируемость: ClickHouse легко масштабируется горизонтально, позволяя добавлять новые узлы кластера для обработки растущего объема данных.
3. Эффективное использование ресурсов: Благодаря колоночной ориентации и сжатию данных, ClickHouse может эффективно использовать ресурсы хранения, что уменьшает потребление дискового пространства.
4. Низкие накладные расходы на операции чтения: Благодаря структуре данных и оптимизациям, ClickHouse обеспечивает высокую производительность при выполнении операций чтения.
Недостатки ClickHouse:
1. Ограниченная поддержка транзакций: ClickHouse ориентирована на аналитические запросы и не обладает полной поддержкой транзакций, что может быть недостатком для приложений, требующих сильной согласованности данных.
2. Ограниченная поддержка операций записи: ClickHouse предназначена прежде всего для чтения данных, и операции записи могут быть менее эффективными по сравнению с другими системами управления базами данных при больших объемах изменений.
3. Недостаточная поддержка индексации: ClickHouse имеет ограниченную поддержку индексации по сравнению с некоторыми другими СУБД, что может повлиять на производительность операций поиска.
4. Сложность в обслуживании и настройке: Настройка ClickHouse может потребовать определенных навыков и понимания ее архитектуры, что может сделать ее менее привлекательной для менее опытных администраторов.
В целом, выбор ClickHouse зависит от конкретных потребностей проекта. Если задачи связаны с аналитикой и обработкой больших объемов данных, ClickHouse может быть отличным вариантом. Однако, если необходимы транзакции и операции записи с высокой степенью согласованности, стоит рассмотреть другие решения.
ClickHouse Documentation
Индекс - ClickHouse Documentation
👍1