Data Engineering Digest
1.16K subscribers
21 photos
27 links
Краткие выжимки и обзоры лучших докладов с конференций по Data Engineering. Экономим ваше время, оставляя только полезное. Для тех, кто любит данные и хочет быть в курсе лучшего в индустрии. Присоединяйтесь! 📊

contact: @NickTselishchev
Download Telegram
Продолжение предыдущего поста. Выводы и ответы на вопросы не влезли)

📝 Чего избегать:
1️⃣ С осторожностью соединять процессоры
2️⃣ Не усложнять процессор в погоне за оптимизацией

❔Ответы на вопросы:

Q: Где брать готовые процессоры для NiFi
A: Ожидать сервис от коммьюнити, сейчас никак
Q: Можно ли отладить процессор в IDE?
A: в NiFi есть эмуляция процессов, можно написать тест там. Возможно открыть PortDebug, поможет если уже процессор работает, но ведет себя аномально.
Q: Как часто ты рекомендуешь использовать систему логгирования?
A: Использую всегда. Трейсы пишу всегда, когда есть ошибки, ворнинги пишу, но стараюсь не перегружать ими.
Q: Как дебажить ScriptedProcessor?
A: Если его не выпилят в 2.0, я напишу функционал и выложу. для Groovy такое уже есть
❤7👍6🔥4
✨ Станислав Лысиков — StarRocks как ядро современной платформы данных
Станислав Лысиков рассказал о внедрении StarRocks в продуктовом финтехе с данными до петабайта. Доклад — это честный разбор опыта перехода на новую аналитическую СУБД.

Дисклеймер: Рекомендую не читать этот пост, а посмотреть доклад самим) Смотрится легко и очень интересно)

YouTube: https://www.youtube.com/watch?v=oiPXIbX-cTw
VK Видео: https://vkvideo.ru/video-147464741_456239483

Сложность: 2/3 (Технически насыщенный доклад, требует понимания архитектуры аналитических баз данных)
Кому будет интересно:
• Дата-архитекторам и инженерам
• Всем, кто выбирает аналитическую СУБД для высокой нагрузки

🔍 Проблемы, которые привели к StarRocks
• Старый стек: Микросервисы на MySQL + Go, но аналитика не масштабировалась
• Требования к новой БД:
✔️ Дешевое внедрение и масштабируемость
✔️ Высокая скорость на потоковых данных
✔️ Open Source с активным сообществом

🏗 Архитектура и установка
Два режима работы:
1 Share Nothing (данные + вычисления на одних нодах)
2 Share Data (отдельное хранилище)
Минимальные требования:
• 3 ноды для продакшна (рекомендуется 5)
• NVMe диски, RAID не требуется
• Репликация на уровне серверов
Управление:
• Готовность к Kubernetes (есть операторы)
• Простое ручное развертывание через Helm

⚡️ Ключевые особенности StarRocks
Производительность:
• Разработан для лямбда-архитектуры
• Высокая скорость запросов (сравнима с ClickHouse, быстрее Vertica/Spark)
Поддержка форматов:
• Нативные коннекторы к HDFS, Iceberg, JSON
• Работа с Hive Metastore
Уникальные фичи:
• Data Recovery — восстановление случайно удаленных данных
• Частичные UPDATE по условию
• Хранение Kafka-оффсетов в БД (независимость от consumer groups)

🔄 Интеграция с данными
Потоковая загрузка:
• Нативная поддержка Kafka
• Проблема с порядком сообщений решена через таймштампы
Работа с Go:
• Прямая работа с Go-структурами (команда без Java/.NET специалистов)

🛠 Проблемы и решения
1️⃣ Шардирование данных:
• Двухуровневое (партиции + бакеты)
• Автоматическое распределение при добавлении нод
2️⃣ Совместимость:
• Драйвер через MySQL-протокол
• Проблемы с некоторыми системами (например, Vertica)
3️⃣ Decimal типы:
• Пришлось реализовывать кастомное решение

📊 Сравнение с аналогами
StarRocks vs ClickHouse/Trino:
• Выше скорость на аналитических запросах
• Лучшая поддержка потоковой загрузки
StarRocks vs Doris:
• Разная кодовая база
• Активное развитие отдельного сообщества

🤝 Сообщество и поддержка
• Open Source: Активное развитие, быстрое исправление регрессий
• В РФ: Доступна платная поддержка (решение Selena)
• Коммерческие внедрения: Успешные кейсы в банках и телекоме

💡 Практические выводы
✅ Плюсы:
• Простое развертывание и масштабирование
• Высокая скорость работы с потоковыми данными
• Активное сообщество
⚠️ Минусы:
• Молодая экосистема (проблемы с некоторыми драйверами)
• Требует адаптации под специфичные типы данных

Итог: StarRocks — мощный вариант для построение DWH и для аналитики в реальном времени. Подходит для компаний, которые хотят быстро развернуть производительное решение без огромных затрат.
👍10❤9🔥8👌2👎1
Мне очень нравится вопрос: Чем Parquet отличается от Iceberg?
Если очень-очень грубо усреднить ответы, то получится что-то типа: Parquet - это файл с данными, а Iceberg - это данные + метаданные про этот файл.

Но если Iceberg «умный» и уже хранит метаданные, почему в стеке Trino + S3 до сих пор живет Metastore? Какие функции он выполняет?

На этот вопрос ответят в докладе Михаила Иванова "Что такое metastore и с чем его едят?"

YT : https://www.youtube.com/watch?v=BJnOb_BJCLQ
VK : https://vkvideo.ru/video-147464741_456239481

Привычного формата поста не будет, так как в докладе разбирают специфичный кейс компании, которой не подошли современные metastore и они пошли по пути написания своего решения. Я бы порекомендовал посмотреть первые 15 минут доклада для Junior/middle специалистов, а для Senior/Architector последние 15 минут доклада) Но доклад правда интересный)

Покидаю интересные скрины с доклада следующим постом:
❤8👍5
Ещё один доклад из которого не получился пост по причине того, что админ очень не любит spark)

https://youtu.be/xhgsQIqkNYY?si=iSXHWg8Fyd-goJz4

Приложу три самых интересных для меня скринов из доклада
🔥10🥰1
5 октября начнется 19-й поток программы Data Engineer от Newprolab

Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE

📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы

📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы

Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь

👉 Подробности и квиз – на сайте

Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa

Реклама. НОЧУ ДПО «НЬЮПРОЛАБ», ИНН 7729461098, erid: CQH36pWzJqVKq9rQTHdoerUjCtLJwbma2q2Sq6DgPEKAP7
❤3👍1👎1🔥1
Прошу простить, уже долгое время не могу выделить время на полноценный пост о интересных докладах с конференциях. Но это не значит, что доклады я перестал смотреть)

По итогам просмотра очередного доклада: https://www.youtube.com/watch?v=JeAP_L671CQ родился небольшой пост.

На курсах по Clickhouse меня спрашивали: "А если у нас только логи, которые мы хотим анализировать, нам нужен Clickhouse или можно обойтись Elasticsearch?"

Я ответил что-то вроде:

а) Полнотекстовый поиск и расследование, объём умеренный, хранить недолго - оставайтесь на Elasticsearch.
б) Отчёты, тренды, долгая история, SQL - берите ClickHouse, даже если источник только логи. Полнотекстовый поиск в CH тоже есть (индексы для полнотекстового поиска), но заставить их работать - тот ещё квест.
в) Нужны оба сценария - это два разных хранилища: Elasticsearch на короткий операционный контур, ClickHouse на аналитику и длинное хранение. Одно другим не заменяется.

А от меня хотели услышать цифры, сравнение производительности. А я их дать не смог) В этом докладе ссылочка на неплохую статью https://infostart.ru/1c/articles/1325649/

Сам доклад так же рекомендую)
🔥6❤4👍3
5 октября начнется 19-й поток программы Data Engineer от Newprolab

Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE

📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы

📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы

Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь

👉 Подробности и квиз – на сайте

Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
❤4👎1