Друзья, спасибо за ваши вопросы! Надеемся, ответы были вам полезны 🧡
Напомним, какие курсы упоминал Андрон, и ждём вас в числе наших студентов:
🟠 Курс «Аналитик данных»: simulative.ru/data-analyst
🟠 Курс «Fullstack-аналитик»: simulative.ru/fullstack-analyst
Остаёмся на связи!
Напомним, какие курсы упоминал Андрон, и ждём вас в числе наших студентов:
Остаёмся на связи!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥3👍1
Симулейтив
Практика: прокачиваем SQL на реальных задачах Приготовили для вас новый формат эфиров! На практическом стриме с Евгением Буториным, ментором курса «Аналитик данных» и руководителем CRM-аналитики в Альфа Банке, разберём четыре реальные задачи, которые часто…
Евгений Буторин подготовил четыре реальные задачи аналитика, которые мы будем решать на стриме. Вы увидите живые примеры кода и подходы к оптимизации сложных запросов.
Напоминаем, что это новый формат, и будем рады обратной связи!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤3👍2
Старты обучения в мае 🪴
Уже готовы к майским праздникам? Не забудьте запланировать обучение — а мы подскажем, когда завершаем наборы. Смотрите календарь⬆️
8 мая
🌿 Аналитик данных
Ментор курса: Александр Грудинин, Lead Data Analyst в AdTech Holding
🌿 BI-аналитик
Ментор курса: Павел Беляев, тимлид аналитиков данных в Яндекс eLama
15 мая
🌿 Инженер данных
Ментор курса: Валерия Елпатьевская, инженер данных в Альфа-Банке
🌿 Временные ряды
Автор курса: Павел Беляев, тимлид аналитиков данных в Яндекс eLama
18 мая
🌿 Fullstack-аналитик
Ментор курса: Павел Беляев, тимлид аналитиков данных в Яндекс eLama
22 мая
🌿 Дата-сайентист
Ментор курса: Мария Жарова, ML-инженер в команде рекомендаций в Wildberries
🌿 ML-инженер
Ментор курса: Мария Жарова, ML-инженер в команде рекомендаций в Wildberries
🌿 DL-инженер
Ментор курса: Евгения Анкудинова, дата-сайентист в Avito
25 мая
🌿 A/B-тестирование
Автор курса: Аслан Байрамкулов, руководитель направления алгоритмических продуктов в ЦУМ
29 мая
🌿 Аналитик данных
Ментор курса: Александр Грудинин, Lead Data Analyst в AdTech Holding
Ждём вас на наших курсах!
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Уже готовы к майским праздникам? Не забудьте запланировать обучение — а мы подскажем, когда завершаем наборы. Смотрите календарь
Напоминаем, что все наши курсы (включая те, что выйдут в течение года с момента покупки) доступны по подписке с выгодой до 70%!
8 мая
🌿 Аналитик данных
Ментор курса: Александр Грудинин, Lead Data Analyst в AdTech Holding
🌿 BI-аналитик
Ментор курса: Павел Беляев, тимлид аналитиков данных в Яндекс eLama
15 мая
🌿 Инженер данных
Ментор курса: Валерия Елпатьевская, инженер данных в Альфа-Банке
🌿 Временные ряды
Автор курса: Павел Беляев, тимлид аналитиков данных в Яндекс eLama
18 мая
🌿 Fullstack-аналитик
Ментор курса: Павел Беляев, тимлид аналитиков данных в Яндекс eLama
22 мая
🌿 Дата-сайентист
Ментор курса: Мария Жарова, ML-инженер в команде рекомендаций в Wildberries
🌿 ML-инженер
Ментор курса: Мария Жарова, ML-инженер в команде рекомендаций в Wildberries
🌿 DL-инженер
Ментор курса: Евгения Анкудинова, дата-сайентист в Avito
25 мая
🌿 A/B-тестирование
Автор курса: Аслан Байрамкулов, руководитель направления алгоритмических продуктов в ЦУМ
29 мая
🌿 Аналитик данных
Ментор курса: Александр Грудинин, Lead Data Analyst в AdTech Holding
Ждём вас на наших курсах!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2👍1
Всем привет! На связи Мария Жарова, ментор курсов «ML-инженер» и «Дата-сайентист» 👋🏻
В одной небезызвестной соцсети с картинками собираю задачи с собеседований, которые хорошо прокачивают аналитическое мышление. Даже если они вам не попадутся, полезно потренироваться 😁
Небольшую подборку собрала тут. А ещё больше задач ищите по нику simulative_official❤️
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
В одной небезызвестной соцсети с картинками собираю задачи с собеседований, которые хорошо прокачивают аналитическое мышление. Даже если они вам не попадутся, полезно потренироваться 😁
Небольшую подборку собрала тут. А ещё больше задач ищите по нику simulative_official
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥4👍1
Два вебинара с Павлом Беляевым на этой неделе!
Тимлид дата-аналитиков в Яндекс eLama будет разбирать тестовое задание и решать задачи по прогнозированию в прямом эфире. Присоединяйтесь❤️
Регистрируйтесь и добавляйте события к себе в календарь, чтобы не забыть!
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Тимлид дата-аналитиков в Яндекс eLama будет разбирать тестовое задание и решать задачи по прогнозированию в прямом эфире. Присоединяйтесь
⭐️ 5 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Lamoda»
На вебинаре решим реальное тестовое аналитика: разберём структуру заказов и позиций, посчитаем нужные метрики и увидим, как к таким задачам подходит практикующий аналитик.➡️ Зарегистрироваться
⭐️ 7 мая, 19:00 МСК — «Решаем задачи по временным рядам»
Покажем, как строить прогнозы на реальных данных, объясним, зачем это нужно бизнесу, и напишем рабочий код прямо на стриме.➡️ Зарегистрироваться
Регистрируйтесь и добавляйте события к себе в календарь, чтобы не забыть!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4 3❤2
Как выявить выбросы в данных?
Всем привет, я Павел Беляев, ведущий канала Тимлидское об аналитике и автор нового курса Симулейтив «Временные ряды» 👋🏻
Одна из самых «популярных» проблем аналитика — выбросы в данных.
Выброс — это значение, которое сильно отличается от остальных. Датчик глюкнул, данные съехали при выгрузке, случилось что-то аномальное. Если не поймать баг, статистика будет искажена, модель будет учиться на мусоре, и в отчёты попадёт ложь. Поэтому выбросы следует постоянно детектировать — или разово перед началом анализа, если это единичное исследование.
Привожу три распространённых способа выявления выбросов:
➖ Ящик с усами (Box Plot)
Визуальный метод. Строите график — и сразу видите точки, которые торчат за «усами». Никакой математики руками, просто смотрите глазами. Хорош для быстрого первичного осмотра данных.
Минус: показывает, где выброс, но не говорит, сколько их, и не автоматизируется легко.
➖ Межквартильный размах (IQR)
Математическая основа того же ящика. Считаем разницу между 75-м и 25-м перцентилем (Q1 и Q3) — это и есть IQR. Всё, что выходит за границы Q1−1.5×IQR и Q3+1.5×IQR — выброс.
Плюс: не зависит от формы распределения, устойчив к самим выбросам. Работает даже на кривых данных.
➖ Z-score
Считаем, на сколько стандартных отклонений точка далека от среднего. Это число обозначается как |z|. Обычно если |z| > 3 — подозрительно, возможно выброс.
Минус: предполагает нормальное распределение. Если данные скошены, метод будет ошибаться. К тому же сами среднее и сигма чувствительны к выбросам.
Все эти методы очистки мы рассмотрим в новом курсе «Временные ряды» — с кодом и подробными пояснениями.
🛎️ Записывайтесь, скоро стартуем: simulative.ru/time-series
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Всем привет, я Павел Беляев, ведущий канала Тимлидское об аналитике и автор нового курса Симулейтив «Временные ряды» 👋🏻
Одна из самых «популярных» проблем аналитика — выбросы в данных.
Выброс — это значение, которое сильно отличается от остальных. Датчик глюкнул, данные съехали при выгрузке, случилось что-то аномальное. Если не поймать баг, статистика будет искажена, модель будет учиться на мусоре, и в отчёты попадёт ложь. Поэтому выбросы следует постоянно детектировать — или разово перед началом анализа, если это единичное исследование.
Привожу три распространённых способа выявления выбросов:
Визуальный метод. Строите график — и сразу видите точки, которые торчат за «усами». Никакой математики руками, просто смотрите глазами. Хорош для быстрого первичного осмотра данных.
Минус: показывает, где выброс, но не говорит, сколько их, и не автоматизируется легко.
Математическая основа того же ящика. Считаем разницу между 75-м и 25-м перцентилем (Q1 и Q3) — это и есть IQR. Всё, что выходит за границы Q1−1.5×IQR и Q3+1.5×IQR — выброс.
Плюс: не зависит от формы распределения, устойчив к самим выбросам. Работает даже на кривых данных.
Считаем, на сколько стандартных отклонений точка далека от среднего. Это число обозначается как |z|. Обычно если |z| > 3 — подозрительно, возможно выброс.
Минус: предполагает нормальное распределение. Если данные скошены, метод будет ошибаться. К тому же сами среднее и сигма чувствительны к выбросам.
Что выбрать?✅ Если быстро посмотреть глазами → Box Plot;✅ Если надёжная автоматическая очистка → IQR;✅ Если данные близки к нормальным → Z-score.
На практике используют несколько методов сразу и сравнивают результат.
Все эти методы очистки мы рассмотрим в новом курсе «Временные ряды» — с кодом и подробными пояснениями.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥4 1
Симулейтив
Два вебинара с Павлом Беляевым на этой неделе! Тимлид дата-аналитиков в Яндекс eLama будет разбирать тестовое задание и решать задачи по прогнозированию в прямом эфире. Присоединяйтесь ❤️ ⭐️ 5 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Lamoda»…
Присоединяйтесь сегодня в 19:00 по МСК к вебинару — Павел Беляев, тимлид дата-аналитиков в Яндекс eLama, поделится своим решением тестового задания в Lamoda.
На примере реального тестового вы сможете «заглянуть в голову» нанимающему аналитику, разобрать живые кейсы и понять, как отвечать растущим требованиям рынка, не утопая в абстрактной теории.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤2 1
Логирование для инженера данных: что использовать вместо
Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻
Сегодня расскажу о важном инструменте, о котором многие почему-то забывают. О логировании.
Согласитесь, хочется понимать, что происходит после запуска кода? Представьте, вы запустили пайплайн, но данные не загрузились. Где ошибка? Что пошло не так? Хорошо, если вы хотя бы расставили
Зачем логировать?
➖ Видеть этапы «загрузка → очистка → сохранение»;
➖ Ловить ошибки с контекстом: не просто «сбой», а «ошибка парсинга в строке 142 файла X»;
➖ Иметь историю: логи хранят время и порядок, консоль — нет.
Почему
➖ Нет времени, уровня важности и структуры;
➖ Нельзя отфильтровать или подключить к мониторингу.
Решение — модуль
1️⃣ Установить можно через
2️⃣ Импортировать
3️⃣ Использовать настроенный логер в коде:
Что мы увидим в консоли:
Формат задаёт внешний вид, а
Логирование — это контроль и ваша страховка от стресса. Сохраняйте пост и ставьте 🔥, если было полезно!
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
print()Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻
Сегодня расскажу о важном инструменте, о котором многие почему-то забывают. О логировании.
Согласитесь, хочется понимать, что происходит после запуска кода? Представьте, вы запустили пайплайн, но данные не загрузились. Где ошибка? Что пошло не так? Хорошо, если вы хотя бы расставили
print() по ходу, когда проверяли работу пайплайна. Но есть опция надёжнее.Зачем логировать?
Почему
print() не подходит для продакшна?Решение — модуль
loguru. Улучшенный и упрощённый логер, в котором легко разобраться. Держите мини-гайд, как начать использовать его уже сейчас.pip или conda:pip install loguru
logger и либо использовать его из коробки, либо настроить под себя:from loguru import logger
import sys
# Настраиваем формат и теги
logger.remove() # удалить дефолтные настройки
logger_format = (
"{time:HH:mm:ss} | " # настраиваем формат даты
"{level: <8} | " # для красоты, чтобы уровни были ровно
"{name}:{function}:{line} | " # что хотим видеть (файл:функция:строка)
"{extra[task_id]} - {message}" # если хотим добавить свою информацию
)
logger.add(
sys.stderr, # вывод в stderr
format=logger_format, # добавляем формат, который выше определили
level="INFO" # с какого уровня начинаем логировать
)
def run_etl(file: str, task_id: str = "my_daily_task"):
# bind() добавляет кастомный тег к этому сообщению
logger.bind(task_id=task_id).info(f"Старт: {file}")
try:
# наш код...
logger.success(f"Готово: {file}")
except Exception as e:
logger.error(f"Ошибка: {e}")
raise
run_etl("orders.csv", task_id="sales_v2")
Что мы увидим в консоли:
14:22:10 | INFO | __main__:run_etl:12 | sales_v2 - Старт: orders.csv
14:22:13 | SUCCESS | __main__:run_etl:14 | sales_v2 - Готово: orders.csv
14:22:15 | ERROR | __main__:run_etl:16 | sales_v2 - Ошибка: [текст ошибки]
Формат задаёт внешний вид, а
extra[] и bind() — контекст. В реальных проектах теги task_id, env, user позволяют отфильтровать логи одного пайплайна среди тысяч других.С чего начать уже сегодня:
1. Замените print() на logger.info/error/warning/debug;
2. Добавьте {time} и 1-2 тега в format;
3. Оборачивайте основные шаги, в которых возможны ошибки, в try/except с logger.error().
Логирование — это контроль и ваша страховка от стресса. Сохраняйте пост и ставьте 🔥, если было полезно!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10❤4👍4
Симулейтив
Два вебинара с Павлом Беляевым на этой неделе! Тимлид дата-аналитиков в Яндекс eLama будет разбирать тестовое задание и решать задачи по прогнозированию в прямом эфире. Присоединяйтесь ❤️ ⭐️ 5 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Lamoda»…
Присоединяйтесь в 19:00 МСК к вебинару с Павлом Беляевым — он разберёт несколько подходов к прогнозированию данных и расскажет, как объяснить ценность прогнозирования заказчику.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤1 1
Замените слово в фильме и сериале на аналитика. Мы начнём: «Аналитик носит Prada» 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
😁7😎2