На вебинаре вместе с Павлом Беляевым разберёмся, чем отличаются строчное и колоночное хранение данных, почему PostgreSQL отлично подходит для одних задач, а ClickHouse — для других, и как эти базы работают в реальных проектах.
На вебинаре вы:
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5❤4👍4
13 сентября — день айтишника. И да, это не повод дарить ежедневник с принтом «SELECT * from users» ☺️
Мы в Симулейтив против шаблонных поздравлений. Собрали чек-лист главных ошибок при поздравлении айтишника — и что сказать/сделать вместо них, чтобы это не звучало как открытка из 2000-х.
Листайте карточки⬆️
Поздравляем вас, дорогие аналитики! С днём тех, кто действительно понимает, что происходит в БД и проде🧡
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Мы в Симулейтив против шаблонных поздравлений. Собрали чек-лист главных ошибок при поздравлении айтишника — и что сказать/сделать вместо них, чтобы это не звучало как открытка из 2000-х.
Листайте карточки
Поздравляем вас, дорогие аналитики! С днём тех, кто действительно понимает, что происходит в БД и проде
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7😁4🔥3👨💻2
Привет! На связи Павел Беляев — автор канала Тимлидское об аналитике и ментор Симулейтив 👋🏻
На днях я писал о конвейере, который проходят данные, чтобы принести пользу. Конечно, это грубая схема, скрывающая под собой массу нюансов. Хочу немного дополнить её, описав некоторые вызовы, с которыми может столкнуться дата-аналитик в реальной работе.
1️⃣ Формулировка требований
Зачастую заказчики аналитики знают о своём предмете не сильно больше, чем вы. Во всяком случае, о том, что надо измерять, чтобы понять, например, эффективность затраченных усилий.
Они могут выразить интуитивное желание получить некую ясность, а вам придется помочь им облечь его в конкретные метрики и продумать, как их вычислить. Это потребует от вас некоей эмпатии, умения интервьюировать, и, конечно, знания метрик.
2️⃣ Качество данных
Причин недостоверности данных много: технические, организационные, человеческие... Конвейер длинный — на каждом шагу может что-то пойти не так.
Например, пользователь накосячил с вводом, отвалилось API третьестепенных данных, на которых, внезапно, завязаны расчеты, кто-то что-то закостылил, а аналитикам не сказали — всё это требует постоянного неустанного слежения за качеством данных, желательно автоматического.
Поэтому полезно завести привычку ничему не доверять и постоянно всё проверять.
3️⃣ Техническая реализуемость
И дело даже не в том, что далеко не все пожелания можно реализовать, а в том, что не все они заслуживают того ресурса (вашего времени), который потребуется для реализации.
Бывает, что заказчики прямо фонтанируют идеями — громкими, но сомнительными. Я не сторонник того, чтобы «обламывать» такие порывы. Но долг аналитика — выслушать, оценить, внести коррективы, которые позволят исполнить более удобное или недорогое решение.
4️⃣ Внезапные изменения в источниках
Работа аналитиков сильно завязана на источниках данных: база данных, сторонние сервисы и др. Если база данных находится в ведении других команд (у разработчиков приложения, например), то нужно иметь в виду, что у них свои цели и процессы. Вы им не нужны, это они вам нужны 🙂
Из-за этого они могут просто забыть сообщить вам, что, например, у них изменилась структура таблицы, которую вы привычно тянете, или что база вовсе переезжает, причем, послезавтра.
К таким орг. нестыковкам нужно быть готовыми и постоянно напоминать руководству, что переориентация на новые источники требует времени, а аналитики должны обязательно узнавать о грядущих изменениях сильно заранее.
5️⃣ Как себя проверить?
Вы, как аналитик, обрабатывающий данные, тоже влияете на их качество. Проверка того, что ваша витрина выдает достоверный результат — не всегда простая задача. Особенно, если логика сложна или применяется множество источников.
Часто бывает, что время на проверку результата сильно превышает время разработки SQL-запроса для его получения. Читайте в моей статье несколько советов о проверке витрин данных.
6️⃣ Как это работает?!
Бывает, что встречается код, который рассчитывает какие-то метрики, но никто уже не знает, почему именно так. Кто писал — уволился, документации не оставил, а конечные пользователи не задумываются, как оно измеряется и что означает.
Это не только к вопросу об обязательном документировании, но и к тому, что я писал в начале поста — потребители данных иногда слабо понимают, что за цифры они смотрят.
Будьте готовы к этому, помогать пользователям разбираться в метриках — одна из задач дата-аналитика. Ну а код возможно, стоит переделать заново, но с прозрачной для всех логикой.
В общем, будни дата-аналитика — штука весёлая. И всё же, в эту сферу войти проще, чем в хардкорное программирование. Начать свой путь до оффера в аналитике можно после обучения на курсе «BI-аналитик», где я буду вашим ментором.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6❤3 1
Давайте обсудим некоторые ключевые аспекты работы с джоинами в SQL, на которые стоит обратить внимание, чтобы избежать ошибок и недоразумений.
🔑 Сохранение данных в приоритете
При написании запросов с джоинами, особенно с транзитивными связями, всегда задавайте себе вопрос:
Выбор правильного типа джоина имеет огромное значение, потому что неверный выбор может привести к некорректным результатам. Часто бывает так:
Давайте рассмотрим этот момент на примере:
SELECT *
FROM problem p
JOIN page p2
ON p.page_id = p2.id
JOIN company c
ON p.company_id = c.id
На первый взгляд, этот запрос кажется корректным, и результаты выглядят нормально. Однако если внимательно проанализировать, вы увидите, что множество записей из таблицы problem просто исчезли 😱
Что, если в таблице
problem есть строки, в которых company_id = NULL? Тогда такие строки будут исключены из результата, ведь в таблице company поле id — первичный ключ и не содержит NULL.SELECT *
FROM problem p
JOIN page p2
ON p.page_id = p2.id
LEFT JOIN company c
ON p.company_id = c.id
Используя
LEFT JOIN, вы сохраните все записи из problem и соответствующие им записи из company, где problem.company_id=NULL, будут иметь пустые значения.Помните об этом важном аспекте при работе с джоинами, чтобы получать точные и полные результаты! И ставьте
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13❤3👍1
Пока данных немного, их можно забрать из двух источников, обработать на Python и положить в базу. Но затем бизнес растёт. Данные уже измеряются терабайтами, обновляются постоянно, а руководитель хочет видеть новые показатели на дашборде с задержкой не больше минуты. Старая архитектура перестаёт справляться — и дата-инженеру нужно спроектировать новую.
На вебинаре разберём три версии одной задачи:
🎙Спикер — Андрей Вильмов, Data Engineer в IBS. Ранее — CTO «ПерилаГлавСнаб», CEO и сооснователь FlowAI.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤2🔥2
Хотите понять, чего ждать, если устраиваетесь аналитиком в среднюю компанию — из чего состоит рабочий день, какие инструменты нужно знать и как вопрос бизнеса превращается в решение?
23 сентября вместе с Павлом Беляевым покажем аналитический контур Яндекс eLama глазами дата-аналитика: от сбора данных до принятия решений.
На вебинаре вы:
🧑🏻💻 Спикер: Павел Беляев, руководитель группы дата-аналитиков в Яндекс eLama, ментор курсов «BI-аналитик» и «Fullstack-аналитик».
Записи не будет. Приходите на живой эфир!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥2👍1