Big Data Science [RU]
1.62K subscribers
80 photos
9 videos
545 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
😎💡Где взять данные? Несколько открытых репозиториев
Awesome Data - Github репозиторий. Список открытых наборов данных с прямыми ссылками на скачивание. Есть данные с видео, картинками, аудио, и вообще со всем.
Open ML - источник, который включает в себя 20k+ датасетов. Есть также библиотеки для Python и R.
Open Data Registry - хранилище данных от AWS. Тут есть некоторые датасеты, которых больше нигде не найти.
Papers with Code. - подборки датасетов, которые использовались в реальных исследованиях
Dagshub - хранилище, в котором Датасеты удобно поделены по областям применения (NLP, CV, пр.)
👍4
💡SQL vs NoSQL: преимущества и недостатки
SQL и NoSQL - это два основных подхода к хранению и обработке данных. Каждый из них имеет свои преимущества и недостатки, и выбор между ними зависит от конкретных потребностей проекта. Давайте рассмотрим основные различия между ними.
SQL (Structured Query Language) базы данных представляют собой реляционные базы данных, а также СУБД экосистемы Hadoop, использующие структурированные таблицы для хранения данных.
Преимущества SQL:
1. Структурированность данных: Таблицы, связи и схемы делают данные легко понятными и легко управляемыми.
2. ACID-согласованность: SQL базы данных гарантируют соблюдение принципов ACID (атомарность, согласованность, изолированность, долговечность), обеспечивая надежность транзакций.
3. Универсальный язык запросов: SQL предоставляет богатый и универсальный набор инструментов для выполнения сложных запросов и аналитики. В отдельных СУБД могут быть лишь небольшие отклонения в виде SQL-диалектов
Недостатки SQL:
1. Горизонтальное масштабирование: Традиционные SQL базы данных часто сталкиваются с ограничениями масштабирования при большом объеме данных.
2. Сложность схемы: Изменение схемы данных может быть сложным и затратным процессом.
3. Ограниченная гибкость: Некоторые SQL базы данных могут иметь ограничения на типы данных или структуры, что может быть неподходящим для некоторых видов данных.
NoSQL базы данных, с другой стороны, не используют традиционные таблицы, а вместо этого предлагают гибкие модели данных.
Преимущества NoSQL:
1. Гибкость структуры данных: NoSQL базы данных могут легко масштабироваться и изменяться без необходимости перестраивать схему.
2. Горизонтальное масштабирование: Многие NoSQL базы данных легко масштабируются горизонтально, обеспечивая высокую производительность при больших объемах данных.
3. Поддержка неструктурированных данных: NoSQL базы данных хорошо подходят для хранения и обработки неструктурированных данных, таких как текст, изображения и видео.
Недостатки NoSQL:
1. Недостаточная поддержка ACID: Многие NoSQL базы данных жертвуют ACID-согласованностью ради производительности или гибкости.
2. Сложность консистентности: При масштабировании и распределении данных NoSQL базы данных могут сталкиваться с проблемами поддержания консистентности данных.
Таким образом, в зависимости от требований проекта и приоритетов по производительности, масштабируемости и гибкости, выбор между SQL и NoSQL базами данных может быть разным.
👍2
💡Датасет для обнаружения проблем в коде
SWE-bench - датасет, который был разработан для того, чтобы предоставить разнообразный набор проблем кодовой базы, которые можно было бы проверить с помощью юнит-тестов в репозитории. Полный тестовый сплит SWE-bench включает в себя 2 294 пары issue-commit в 12 репозиториях python.
Таким образом, датасет предлагает новую задачу: решение проблем при наличии полного репозитория и проблемы на GitHub.
Для загрузки датасет с помощью Python-скрипта можно возпользоваться следующей командой:
from datasets import load_dataset
dataset = load_dataset("princeton-nlp/SWE-bench")
👍1
📊😎💡🤖Каталог датасетов для обнаружения и сегментации объектов
SAM + Optical Flow = FlowSAM
FlowSAM - новый инструмент для обнаружения и сегментации движущихся объектов на видео, который значительно превосходит все предыдущие модели, как для одного объекта, так и для множества объектов
Для обучения модели было использовано множество датасетов, которые стали доступны для загрузки по этой ссылке
👍2
📉📊Подборочка инструментов для работы с Big Data
Drill - акладывается поверх множества источников данных, позволяя пользователям запрашивать широкий спектр информации в различных форматах, от Hadoop-файлов последовательностей и журналов сервера до баз данных NoSQL и облачных хранилищ объектов.
Druid - это аналитическая база данных реального времени, обеспечивающая низкую задержку запросов, высокий параллелизм, многопользовательские возможности и мгновенную видимость потоковых данных. По словам ее сторонников, несколько конечных пользователей могут одновременно запрашивать данные, хранящиеся в Druid, без какого-либо воздействия на производительность.
HPCC Systems — это платформа обработки больших данных, разработанная компанией LexisNexis и получившая открытый исходный код в 2011 году. В соответствии со своим полным названием — High-Performance Computing Cluster — технология по своей сути представляет собой кластер компьютеров, созданный на основе стандартного аппаратного обеспечения для обработки, управления и доставки больших данных.
Iceberg - это открытый формат таблицы, используемой для управления данными в озерах, что частично достигается путем отслеживания отдельных файлов с информацией в таблицах, а не в каталогах. Созданная компанией Netflix для использования со своими таблицами петабайтного размера, Iceberg теперь является проектом Apache. Iceberg обычно "используется в продакшне, где одна таблица может содержать десятки петабайт данных".
Kylin — это распределенное хранилище информации и аналитическая платформа для больших данных. Она предоставляет механизм аналитической обработки информации (OLAP), предназначенный для работы с очень большими массивами данных. Поскольку Kylin построена на базе других технологий Apache, включая Hadoop, Hive, Parquet и Spark, то она, по словам ее сторонников, может легко масштабироваться для обработки больших объемов данных.
Samza — это система распределенной обработки потоков, созданная компанией LinkedIn и являющаяся в настоящее время проектом с открытым исходным кодом под управлением Apache. Система может запускаться поверх Hadoop YARN или Kubernetes, также предлагается вариант автономного развертывания. Согласно информации от разработчиков, Samza может обрабатывать "несколько терабайт" информации о состоянии данных с низкой задержкой и высокой пропускной способностью для быстрого анализа.
👍3
💡Подбоорка ETL-сервисов для Big Data
Renta Marketing ETL - Облачное решение, которое позволяет интегрировать 28 корпоративных источников данных с популярными хранилищами данных вроде Snowflake и BigQuery, ервис позволяет команде инженеров и аналитиков интегрировать сторонние инструменты и за пару минут создавать конвейеры данных без кода. Например, настроить интеграцию Facebook Ads с BigQuery можно в четыре клика. Для работы в Renta Marketing ETL не нужно привлекать разработчиков.
Fivertran - Облачное ПО, которое позволяет пользователям быстро и просто создавать конвейеры. Платформа поддерживает более 90 источников. Fivertran предоставляет набор готовых интеграций, так что даже начинающие разработчики разберутся в сервисе.
Hevo Data - cервис предоставляет пользователям более 150 готовых интеграций. Настроить интеграции можно за три простых шага. В итоге получается конвейер, который копирует данные в хранилище и не требует обслуживания.
Matillion - низкокодовое приложение для создания конвейеров. С помощью Matillion команды могут создавать конвейеры и автоматизировать обработку данных. У сервиса простой интерфейс, так что создавать и изменять данные сможет пользователь, далёкий от программирования. Marillion поддерживает обработку в реальном времени. Инструмент поддерживает популярные источники данных и позволяет легко выявлять и устранять проблемы с данными.
Supermetrics - ETL-решение, предназначенное для малого бизнеса и маркетологов, которые в основном используют сервисы Facebook Ads, Google Ads и Google Analytics. В инструменте есть встроенное приложение на облачной платформе Google, которое позволяет экспортировать данные непосредственно в Google BigQuery.
👍2
🌎ТОП майских ивентов в Data Science
15-16 мая - The Trends 2.0 - Москва, Россия - https://thetrends.tech/
17 мая - True Tech Day 2.0 - Москва, Россия - https://truetechday.ru/
21-22 мая - I’ML 2024 - Онлайн - https://imlconf.com/
23 мая - SUPPLY&DEMAND PLANNING CONFERENCE - Москва, Россия - https://planning-conference.ru/
24-25 мая - ANALYST DAYS / 18 - Санкт-Петербург, Россия - https://analystdays.ru/en/index
25 мая - Data Fest 2024 - Москва, Россия - https://ods.ai/events/datafest2024
31 мая - TechRec 2024. AI & HR - Москва, Россия - https://techrec.pro/techrec2024
💡😎Отличный ресурс в коллекцию: датасеты для LLM
На многих примерах (в том числе на LLama-3 и Phi-3) можно заметить, что развитие LLM = создание качественных корпусов данных.
Разработчик из Лондона взял и описал в этом репозитории огоромное множество датасетов для предобучения или файнтюнинга LLM в формате таблицы: ссылка, размер, авторы, дата и личные пометки.
Кроме того, там есть указания, как собрать свой собственный качественный датасет, и что вообще значит слово «качественный» в контексте датасета.
👍5
☁️💡Датасет для исследования прямого захвата воздуха
Исследователи из GeorgiaTech опубликовали крупнейший датасет и новую SOTA модель для исследования прямого захвата воздуха, это — ключевой процесс для борьбы с изменением климата
Данный набор данных содержит тестовый набор внутри домена и 4 тестовых набора вне домена (ood-large, ood-linker, ood-topology и ood-linker & topology). Все LMD-базы сжаты в один файл .tar.gz.
💡📊Сервис для быстрой передачи Big Data
Redpanda — это платформа для потоковой передачи данных. Она отлично совместима с API Kafka. В 10 раз быстрее. Не требует никакого ZooKeeper и никаких JVM.
Redpanda спроектирована для полной загрузки быстрых накопителей больших данных, таких как SSD или NVMe-устройства, а также на использование преимуществ многоядерных процессоров и компьютеров с большим объемом оперативной памяти. Это позволяет достичь максимальной производительности при обработке значительных объемов данных и запросов.
Документация доступна по этой ссылке
👍2❤1🔥1👏1
🔎Извлечение данных с Quivr
Quivr — это open-source сервис, который позволяет извлекать информацию из локальных файлов (PDF, CSV, Excel, Word, аудио, видео и т.д)
Quivr может работать в автономном режиме, поэтому всегда существует возможность получить доступ к своим данным в любое время и в любом месте.
Quivr также совместим с ОС Ubuntu 22 или новее
Открытый исходный код можно получить по данной ссылке
👍1🔥1
⚖️Apache Superset: преимущества и недостатки
Apache Superset - это инструмент визуализации данных с открытым исходным кодом, который обеспечивает богатый набор возможностей для анализа данных и создания интерактивных дашбордов.
Преимущества Apache Superset:
1. Открытый исходный код: Apache Superset разрабатывается и поддерживается сообществом, что обеспечивает высокую степень гибкости и возможность расширения под различные потребности.
2. Мощная визуализация данных: Superset предлагает широкий выбор графиков, диаграмм и визуальных элементов, позволяя пользователям создавать красочные и информативные дашборды для анализа данных.
3. Интерактивные возможности: Пользователи могут легко взаимодействовать с дашбордами, применять фильтры, изменять параметры и проводить свертывание/развертывание данных для получения более глубокого понимания информации.
4. Интеграция с различными источниками данных: Superset поддерживает множество источников данных, включая базы данных, хранилища данных, Apache Druid и многие другие, что делает его универсальным инструментом для работы с данными из различных источников.
5. Масштабируемость и производительность: Благодаря своей архитектуре и использованию технологий, таких как Apache Druid, Superset способен эффективно обрабатывать большие объемы данных и обеспечивать высокую производительность при работе с дашбордами.
Недостатки Apache Superset:
1. Сложность настройки: Несмотря на то, что Superset предоставляет обширные возможности, его настройка и конфигурация могут быть сложными, особенно для новичков, требуя определенного уровня технической образованности.
2. Недостаточная документация: Некоторые пользователи отмечают, что документация по Superset не всегда достаточно подробна или актуальна, что может затруднить процесс изучения и работы с инструментом.
В целом, Apache Superset представляет собой мощный инструмент для визуализации данных с открытым исходным кодом, который обладает рядом преимуществ, таких как гибкость, масштабируемость и мощные визуальные возможности. Однако, перед использованием следует учитывать и недостатки, такие как сложность настройки и некоторые ограничения по ее доступности.
👍1
💡😎Подборка векторных баз данных
Векторные базы данных — это особый тип баз данных, предназначенный для организации данных на основе сходства. Для этого они преобразуют исходные данные — такие как изображения, текст, видео или аудио — в математические представления, известные как многомерные векторы. Каждый вектор может иметь от десятков до тысяч измерений, в зависимости от сложности исходных данных. на данный момент существуют такие векторные БД, как:
Chroma - Это векторная база данных с открытым исходным кодом, созданная для обеспечения разработчиков и организаций любого размера ресурсами, необходимыми для создания приложений на основе больших языковых моделей (LLM). Она предоставляет разработчикам высокомасштабируемое и эффективное решение для хранения, поиска и извлечения многомерных векторов.
Одной из причин популярности Chroma является ее гибкость
Pinecone - Это облачная управляемая векторная база данных. Широкая поддержка многомерных векторов делает Pinecone подходящей для различных сценариев использования, включая поиск по сходству, рекомендательные системы, персонализацию и семантический поиск. Она также поддерживает возможность одноступенчатой фильтрации. А способность анализировать данные в реальном времени делает ее отличным выбором для обнаружения угроз и мониторинга кибератак в сфере кибербезопасности.
Weviate - Примечательной особенностью этой БД является то, что ее можно использовать для хранения как векторов, так и объектов. Это делает ее подходящей для приложений, сочетающих несколько методов поиска, таких как векторный поиск и поиск по ключевым словам.
Milvus - использует самые современные алгоритмы для ускорения процесса поиска, что позволяет быстро находить похожие векторы даже при работе с большими массивами данных.
👍3
💡😎Основы работы с Data-Mining: процесс, инструменты и методики
Дата-майнинг (data mining) — это процесс обработки данных для выявления паттернов, корреляций и аномалий в крупных датасетах. В нём применяются разнообразные методики статистического анализа и машинного обучения для извлечения из данных значимой информации и выводов. Компании могут использовать эти выводы для принятия обоснованных решений, прогнозирования трендов и совершенствования бизнес-стратегий.
Можно выделить такие методики дата-майнинга, как:
Деревья решений - в конце каждой ветви находится прогноз или решение. В задачах классификации эти конечные точки разделяют данные на категории
Выявление аномалий - аномалии могут возникать из-за колебаний измерений или быть показателями ошибки экспериментов; в некоторых случаях они могут указывать на важное открытие или на новый тренд
ПО для работы с дата-майнингом делится на:
1. Инструменты визуализации:
Grafana - подходит для аналитики и мониторинга в реальном времени
Google Charts — это веб-решение для создания интерактивных графиков
2. Платформы дата-майнинга:
KNIME - это аналитическая платформа, позволяющая выгружать данные из различных источников, трансформировать данные и загружать их в различные базы данных
RapidMiner - это программная многопользовательская платформа, которая представляет собой интегрированную среду для обработки данных в больших информационных массивах, машинного обучения, текстовой аналитики и построения прогностических моделей, а также для решения иных задач Data Mining.
🔥2
⚔️💡MySQL vs PostgreSQL в Data Mining: преимущества и недостатки
Когда дело доходит до выбора базы данных для задач data mining, два самых популярных решения — MySQL и PostgreSQL. Оба эти СУБД имеют свои сильные и слабые стороны, и выбор между ними зависит от специфических требований проекта. Давайте рассмотрим основные преимущества и недостатки каждого из них в контексте data mining.
Преимущества MySQL:
1. Высокая производительность: MySQL известна своей быстрой производительностью при выполнении простых операций чтения и записи, что делает её подходящей для приложений с высокими нагрузками.
2. Широкая распространённость: MySQL имеет обширное сообщество и множество документации, что облегчает поиск решений и получение помощи.
3. Интеграция с веб-технологиями: MySQL часто используется в веб-разработке и имеет хорошую совместимость
Недостатки MySQL:
1. Ограниченные возможности для аналитики: MySQL менее эффективна при выполнении сложных аналитических запросов и не поддерживает некоторые продвинутые функции, такие как оконные функции, которые важны для data mining.
2. Меньшая поддержка JSON и NoSQL: Хотя MySQL имеет поддержку JSON, она не так развита, как в PostgreSQL.
3. Ограниченные транзакционные возможности: MySQL уступает PostgreSQL в плане управления сложными транзакциями и соблюдения ACID.
Преимущества PostgreSQL:
1. Мощные аналитические возможности: PostgreSQL поддерживает сложные аналитические запросы, оконные функции и CTE (Common Table Expressions), что делает её отличным выбором для data mining.
2. Поддержка JSON и NoSQL: PostgreSQL имеет продвинутую поддержку JSON и может использоваться как гибридная СУБД, что упрощает работу с полу-структурированными данными.
3. Расширяемость и совместимость: PostgreSQL легко расширяется с помощью плагинов и поддерживает множество стандартов SQL, что делает её очень гибкой.
4. Надёжность и соответствие ACID: PostgreSQL обеспечивает высокий уровень надежности данных и полного соблюдения ACID-транзакций, что важно для критически важных data mining приложений.
Недостатки PostgreSQL:
1. Сложность настройки и администрирования: PostgreSQL требует более глубокой настройки и администрирования, что может быть сложнее для новичков.
2. Производительность на простых задачах: в некоторых случаях PostgreSQL может уступать MySQL по скорости выполнения простых операций.
3. Ресурсоёмкость: PostgreSQL может требовать больше ресурсов для достижения высокой производительности, особенно в сложных сценариях.
Таким образом, выбор между MySQL и PostgreSQL для задач data mining зависит от конкретных потребностей проекта. Если нужна простая и быстрая СУБД для базовых операций и интеграции с веб-приложениями, MySQL может быть лучшим выбором. Если же проект требует сложного анализа данных, гибкости и надежности, PostgreSQL станет более подходящим вариантом.
👍1
💡🔎Помощник для взаимодействия с любыми данными
Verba — это полностью настраиваемый персональный помощник для запроса и взаимодействия с вашими данными, локально или развернутыми через облако.

Он также может отвечать на вопросы, связанные с вашими документами и получать информацию из существующих баз знаний.

Verba отлично сочетает в себе современные технологии RAG и контекстно-зависимую базу данных Weaviate.
👍1
💡Большой датасет отзывов
RLAIF-V-Dataset - это большой мультимодальный датасет отзывов. Набор данных построен с использованием моделей с открытым исходным кодом для обеспечения высококачественных отзывов.
Набор данных RLAIF-V-Dataset представляет собой новый метод использования MLLM с открытым исходным кодом для обеспечения высококачественной обратной связи с откликами деконфаундинговых моделей. Благодаря обучению на этих данных, модели могут достичь более высокого уровня достоверности по сравнению с существующими моделями с открытым исходным кодом.
Загрузить датасет с помощью Python-скрипта можно следующим образом:
from datasets import load_dataset
dataset = load_dataset("HaoyeZhang/RLAIF-V-Dataset")
👍3
📊🔎Небольшая подборочка не очень популярных, но полезных библиотек для анализа данных
PySheets - предоставляет пользовательский интерфейс электронных таблиц для Python. Используйте Pandas, создавайте диаграммы, импортируйте листы Excel, анализируйте данные и создавайте отчеты.
py2wasm - преобразует программы и данные в Python в WebAssembly и работает с ними их в 3 раза быстрее.
databonsai - это библиотека Python, которая использует LLM для задач очистки данных, таких как категоризация, преобразование и извлечение.
👍3
🔎💡Полезные репозитории GitHub для разработки мастер-данных и новичков
Awesome Data Engineering - содержит список инструментов, фреймворков и библиотек для инженерии данных, что делает его отличной отправной точкой для тех, кто хочет погрузиться в эту область.
Data Engineering Zoomcamp - это полный курс, позволяющий получить практический опыт в области инженерии данных.
The Data Engineering Cookbook - это сборник статей и учебников, посвященных различным аспектам инженерии данных, включая ввод данных, обработку данных и хранилища данных.
Awesome Open Source Data Engineering - это список инструментов для проектирования данных с открытым исходным кодом, который станет золотой жилой для всех, кто хочет внести свой вклад или использовать их для создания реальных проектов по проектированию данных. Он содержит огромное количество информации об инструментах и фреймворках с открытым исходным кодом, что делает его отличным ресурсом для тех, кто хочет изучить альтернативные решения в области инженерии данных.
Data Engineer Handbook - это всеобъемлющая коллекция ресурсов, охватывающая все аспекты инженерии данных. В него входят учебники, статьи и книги по всем темам, связанным с инженерией данных. Независимо от того, ищете ли вы краткое справочное руководство или глубокие знания, в этом справочнике найдется что-то для инженеров по обработке данных любого уровня.
Репозиторий Data Engineering Wiki - это вики, созданная сообществом, которая представляет собой всеобъемлющий ресурс для изучения инженерии данных. Этот репозиторий охватывает широкий спектр тем, включая конвейеры данных, хранилища данных и моделирование данных.
Data Engineering Practice - предлагает практический подход к изучению инженерии данных. В нем представлены практические проекты и упражнения, которые помогут вам применить свои знания и навыки в реальных сценариях. Выполняя эти проекты, вы получите практический опыт и составите портфолио, демонстрирующее ваши способности в области инженерии данных.
👍2
🌎ТОП июньских ивентов в Data Science
4 июня - infra.conf - Москва, Россия - https://infraevents.yandex.ru/event/infraconf2024
20 июня - NexSummIT 2024 - Москва, Россия - https://fcongress.forbes.ru/events/nexsummit-2024
21 - 23 июня - PRACTICE & SCALE AI - Онлайн - https://practice-scale.ru/
24-25 июня - Saint HighLoad++ 2024 - Санкт-Петрбург, Россия - https://highload.ru/spb/2024
26-28 июня - TECH WEEK 2024 - Москва, Россия - https://techweek.moscow/
27 июня - GigaConf - Москва, Россия - https://gigaconf.ru/
💡🔎📉Adversarial Validation: Преимущества и Недостатки
Adversarial Validation (AV) — это метод, который позволяет оценить, насколько тестовые данные отличаются от тренировочных данных. Это особенно полезно в задачах машинного обучения, где качество предсказаний может существенно зависеть от того, насколько хорошо распределения данных совпадают между тренировочной и тестовой выборками. Рассмотрим основные преимущества и недостатки этого подхода.
Преимущества Adversarial Validation:
1. Обнаружение несоответствий в данных:
AV помогает выявить, если тренировочные и тестовые данные сильно различаются по распределению. Это может сигнализировать о потенциальных проблемах с генерализацией модели.
2. Улучшение качества модели: Устранив различия между тренировочными и тестовыми данными, можно значительно повысить качество предсказаний модели на тестовой выборке.
3. Оптимизация выборки данных: Используя AV, можно более точно сформировать тренировочные и валидационные наборы данных, что позволит избежать переобучения и улучшить общее качество модели.
4. Идентификация утечек данных: AV помогает обнаружить случаи, когда информация из тестовой выборки "просачивается" в тренировочную, что может привести к необъективно высоким результатам модели.
Недостатки Adversarial Validation:
1. Увеличение вычислительных затрат: Для выполнения AV требуется обучение дополнительной модели (обычно это классификатор), что увеличивает вычислительные затраты и время, необходимое для анализа данных.
2. Сложность реализации: Настройка и проведение AV могут требовать значительных знаний и опыта в области машинного обучения, что может быть сложным для новичков.
3. Риск переобучения: Слишком частое использование AV для коррекции данных может привести к переобучению модели на тренировочные данные и ухудшению её способности к генерализации.
👍3❤1