Симулейтив
7.47K subscribers
2.01K photos
86 videos
1 file
1.59K links
Мы — образовательная платформа в сфере аналитики Симулейтив: simulative.ru

Создаём курсы-симуляторы, где обучаем на кейсах из реального бизнеса.

Канал по ML: @modprod
Наш уютный чат: @itresume_chat
Поддержка: @simulative_support
Download Telegram
Всем привет! На связи Мария Жарова, ментор курсов «ML-инженер» и «Дата-сайентист» 👋🏻

В одной небезызвестной соцсети с картинками собираю задачи с собеседований, которые хорошо прокачивают аналитическое мышление. Даже если они вам не попадутся, полезно потренироваться 😁

Небольшую подборку собрала тут. А ещё больше задач ищите по нику simulative_official ❤️

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥4👍1
Два вебинара с Павлом Беляевым на этой неделе!

Тимлид дата-аналитиков в Яндекс eLama будет разбирать тестовое задание и решать задачи по прогнозированию в прямом эфире. Присоединяйтесь ❤️

⭐️ 5 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Lamoda»

На вебинаре решим реальное тестовое аналитика: разберём структуру заказов и позиций, посчитаем нужные метрики и увидим, как к таким задачам подходит практикующий аналитик.

➡️ Зарегистрироваться


⭐️ 7 мая, 19:00 МСК — «Решаем задачи по временным рядам»

Покажем, как строить прогнозы на реальных данных, объясним, зачем это нужно бизнесу, и напишем рабочий код прямо на стриме.

➡️ Зарегистрироваться


Регистрируйтесь и добавляйте события к себе в календарь, чтобы не забыть!

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥43❤2
Как выявить выбросы в данных?

Всем привет, я Павел Беляев, ведущий канала Тимлидское об аналитике и автор нового курса Симулейтив «Временные ряды» 👋🏻

Одна из самых «популярных» проблем аналитика — выбросы в данных.

Выброс — это значение, которое сильно отличается от остальных. Датчик глюкнул, данные съехали при выгрузке, случилось что-то аномальное. Если не поймать баг, статистика будет искажена, модель будет учиться на мусоре, и в отчёты попадёт ложь. Поэтому выбросы следует постоянно детектировать — или разово перед началом анализа, если это единичное исследование.

Привожу три распространённых способа выявления выбросов:

➖ Ящик с усами (Box Plot)
Визуальный метод. Строите график — и сразу видите точки, которые торчат за «усами». Никакой математики руками, просто смотрите глазами. Хорош для быстрого первичного осмотра данных.

Минус: показывает, где выброс, но не говорит, сколько их, и не автоматизируется легко.

➖ Межквартильный размах (IQR)
Математическая основа того же ящика. Считаем разницу между 75-м и 25-м перцентилем (Q1 и Q3) — это и есть IQR. Всё, что выходит за границы Q1−1.5×IQR и Q3+1.5×IQR — выброс.

Плюс: не зависит от формы распределения, устойчив к самим выбросам. Работает даже на кривых данных.

➖ Z-score
Считаем, на сколько стандартных отклонений точка далека от среднего. Это число обозначается как |z|. Обычно если |z| > 3 — подозрительно, возможно выброс.

Минус: предполагает нормальное распределение. Если данные скошены, метод будет ошибаться. К тому же сами среднее и сигма чувствительны к выбросам.

Что выбрать?
✅ Если быстро посмотреть глазами → Box Plot;
✅ Если надёжная автоматическая очистка → IQR;
✅ Если данные близки к нормальным → Z-score.
На практике используют несколько методов сразу и сравнивают результат.


Все эти методы очистки мы рассмотрим в новом курсе «Временные ряды» — с кодом и подробными пояснениями.

🛎️ Записывайтесь, скоро стартуем: simulative.ru/time-series

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥41
This media is not supported in your browser
VIEW IN TELEGRAM
❤2🔥2👍1
Симулейтив
Два вебинара с Павлом Беляевым на этой неделе! Тимлид дата-аналитиков в Яндекс eLama будет разбирать тестовое задание и решать задачи по прогнозированию в прямом эфире. Присоединяйтесь ❤️ ⭐️ 5 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Lamoda»…
⚡️ Через пару часов решаем тестовое в Lamoda

Присоединяйтесь сегодня в 19:00 по МСК к вебинару — Павел Беляев, тимлид дата-аналитиков в Яндекс eLama, поделится своим решением тестового задания в Lamoda.

На примере реального тестового вы сможете «заглянуть в голову» нанимающему аналитику, разобрать живые кейсы и понять, как отвечать растущим требованиям рынка, не утопая в абстрактной теории.

➡️ Регистрация

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤21
Логирование для инженера данных: что использовать вместо print()

Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻

Сегодня расскажу о важном инструменте, о котором многие почему-то забывают. О логировании.

Согласитесь, хочется понимать, что происходит после запуска кода? Представьте, вы запустили пайплайн, но данные не загрузились. Где ошибка? Что пошло не так? Хорошо, если вы хотя бы расставили print() по ходу, когда проверяли работу пайплайна. Но есть опция надёжнее.

Зачем логировать?
➖ Видеть этапы «загрузка → очистка → сохранение»;
➖ Ловить ошибки с контекстом: не просто «сбой», а «ошибка парсинга в строке 142 файла X»;
➖ Иметь историю: логи хранят время и порядок, консоль — нет.

Почему print() не подходит для продакшна?
➖ Нет времени, уровня важности и структуры;
➖ Нельзя отфильтровать или подключить к мониторингу.

Решение — модуль loguru. Улучшенный и упрощённый логер, в котором легко разобраться. Держите мини-гайд, как начать использовать его уже сейчас.

1️⃣ Установить можно через pip или conda:

pip install loguru


2️⃣ Импортировать logger и либо использовать его из коробки, либо настроить под себя:

from loguru import logger
import sys

# Настраиваем формат и теги
logger.remove() # удалить дефолтные настройки

logger_format = (
"{time:HH:mm:ss} | " # настраиваем формат даты
"{level: <8} | " # для красоты, чтобы уровни были ровно
"{name}:{function}:{line} | " # что хотим видеть (файл:функция:строка)
"{extra[task_id]} - {message}" # если хотим добавить свою информацию
)
logger.add(
sys.stderr, # вывод в stderr
format=logger_format, # добавляем формат, который выше определили
level="INFO" # с какого уровня начинаем логировать
)


3️⃣ Использовать настроенный логер в коде:

def run_etl(file: str, task_id: str = "my_daily_task"):
# bind() добавляет кастомный тег к этому сообщению
logger.bind(task_id=task_id).info(f"Старт: {file}")
try:
# наш код...
logger.success(f"Готово: {file}")
except Exception as e:
logger.error(f"Ошибка: {e}")
raise

run_etl("orders.csv", task_id="sales_v2")


Что мы увидим в консоли:

14:22:10 | INFO          | __main__:run_etl:12 | sales_v2 - Старт: orders.csv
14:22:13 | SUCCESS | __main__:run_etl:14 | sales_v2 - Готово: orders.csv
14:22:15 | ERROR | __main__:run_etl:16 | sales_v2 - Ошибка: [текст ошибки]


Формат задаёт внешний вид, а extra[] и bind() — контекст. В реальных проектах теги task_id, env, user позволяют отфильтровать логи одного пайплайна среди тысяч других.

С чего начать уже сегодня:
1. Замените print() на logger.info/error/warning/debug;
2. Добавьте {time} и 1-2 тега в format;
3. Оборачивайте основные шаги, в которых возможны ошибки, в try/except с logger.error().


Логирование — это контроль и ваша страховка от стресса. Сохраняйте пост и ставьте 🔥, если было полезно!

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10❤4👍4
This media is not supported in your browser
VIEW IN TELEGRAM
❤4👍1🔥1
Симулейтив
Два вебинара с Павлом Беляевым на этой неделе! Тимлид дата-аналитиков в Яндекс eLama будет разбирать тестовое задание и решать задачи по прогнозированию в прямом эфире. Присоединяйтесь ❤️ ⭐️ 5 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Lamoda»…
⚡️ Уже сегодня: решаем задачи по прогнозированию

Присоединяйтесь в 19:00 МСК к вебинару с Павлом Беляевым — он разберёт несколько подходов к прогнозированию данных и расскажет, как объяснить ценность прогнозирования заказчику.

➡️ Зарегистрироваться

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤11
Замените слово в фильме и сериале на аналитика. Мы начнём: «Аналитик носит Prada» 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
😁7😎2
Вебинары этой недели

Разбираем очередное тестовое задание на аналитика и рассказываем, почему SQL и Python недостаточно для успешной карьеры ❤️

🛎️ 11 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Магнит Tech»

С помощью SQL потренируемся искать нужное в товарном ассортименте, а Python поможет определять слова-палиндромы. А ещё увидим тестовое задание по SQL eLama, безотказно работающее 6 лет. В нём есть заковырка, на которой многие сыпались!

➡️ Зарегистрироваться


🛎️ 14 мая, 19:00 МСК — «Как устроена аналитика данных в 2026 году — и почему знать SQL и Python недостаточно»

Вместе с преподавателем магистратуры Симулейтив поговорим про рынок аналитики, типовые ошибки новичков и барьеры роста для тех, кто уже работает джуном или миддлом.

➡️ Зарегистрироваться


Регистрируйтесь и добавляйте события к себе в календарь, чтобы не забыть!

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤32
Media is too big
VIEW IN TELEGRAM
⚡️ Вебинар сегодня: разбираем тестовое задание в Магнит Tech

Сегодня в 19:00 МСК ждём вас на вебинаре — Павел Беляев разберет тестовое задание от крупнейшей ритейл-сети «Магнит». Мы познакомимся с тренажёром и приступим к решению, а потом ещё бонусом разберём тестовое по SQL от eLama.

➡️ Зарегистрироваться

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤2👍1
Секрет сложной сезонности

Всем привет, на связи Павел Беляев, ведущий канала Тимлидское об аналитике и автор курса «Временные ряды» 👋🏻

Предсказание будущего — штука крайне желанная для бизнеса, но коварная и полная неочевидных нюансов (как и сама жизнь). Расскажу об одной ловушке, в которую попадают даже опытные аналитики.

Задача: спрогнозировать продажи зонтов на 3 месяца вперёд.


Данные чистые, история длинная — 4 года. Аналитик строит классическую модель с сезонностью, всё красиво. Июль традиционно слабый, август чуть лучше, октябрь — пик. Модель обучена, метрики хорошие. Прогноз готов.

А потом октябрь оказался сухим, без дождей!

Ошибка прогноза — 40%. Склад затоварен, деньги заморожены, все недовольны.

Что пошло не так? Модель всё делала правильно — она честно выучила исторический паттерн. Проблема в другом: сезонность продаж зонтов — это не календарная сезонность, это сезонность осадков.

А осадки и календарь связаны лишь статистически, но не причинно. Когда погода ведёт себя «по учебнику» — модель работает. Когда нет — рассыпается.

Как это чинится?

Добавляем внешний регрессор — прогноз осадков на горизонт планирования. В Prophet это параметр add_regressor(), в SARIMA — экзогенные переменные (SARIMAX), в градиентном бустинге — просто ещё один признак.

Но здесь начинается самое интересное. Нельзя просто взять данные об осадках и скормить их модели. Нужно ответить на три вопроса:

➡️ С каким лагом осадки влияют на продажи? Люди покупают зонт не в ливень, а накануне;
➡️ Как агрегировать — суммарные осадки за неделю или количество дождливых дней?
➡️ Что делать на горизонте прогноза, где у нас уже не факт, а прогноз погоды — то есть переменная с собственной ошибкой?

Последний пункт особенно коварен. Вы строите прогноз на основе прогноза. Ошибки перемножаются. Это нужно явно учитывать в доверительных интервалах — иначе вы будете уверены в числе, которое на самом деле очень нечёткое.


Таких внешних факторов в реальных задачах — десятки. Курс валют, праздники со смещёнными датами, школьные каникулы, спортивные события, промоакции конкурентов. Каждый из них потенциально ломает вашу красивую сезонную модель.

Хороший аналитик временных рядов — это тот, кто умеет думать о природе данных и понимает, какие силы на самом деле двигают ряд. Но начать надо всё же с алгоритма, научиться его применять, тогда и опыт подтянется!

⭐️ Курс «Временные ряды» стартует уже в пятницу, 15 мая, присоединяйтесь: simulative.ru/time-series

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥41
Запускаем тренажёр для аналитика 💪🏻

Знать SQL, Python и Excel необходимо, но недостаточно. На собеседованиях и в реальной работе аналитика оценивают по другому: умеешь ли ты разобраться в бизнес-задаче, выбрать нужный инструмент и дать ответ, который будет полезен заказчику. Именно этот навык сложнее всего прокачать по учебникам и статьям — и именно его мы вынесли в основу курса.

5 июня стартует тренажёр аналитика данных от Михаила Строганова — продуктового аналитика в Magnit OMNI с более чем пятилетним опытом в аналитике данных, автора более 40 A/B-тестов и преподавателя курсов на SkyPro и Hexlet. Михаил знает, как выглядят реальные задачи бизнеса изнутри — и собрал их в одном курсе.

За 2-3 месяца вы:

🔶 Решите 15 объёмных кейсов из eCommerce, FinTech, маркетинга, RideTech и стриминга — задачи уровней от джуна до сеньора и основаны на реальных бизнес-запросах;
🔶 Научитесь понимать запрос заказчика и выбирать подходящий инструмент под конкретную задачу — SQL, Python или Excel;
🔶 Получите разбор ваших решений от преподавателя с развёрнутой обратной связью;
🔶 Соберёте портфолио из кейсов разного уровня сложности — от джуна до сеньора.

После курса у вас будет не просто набор инструментов, а понимание, как их применять. Это то, что отличает кандидата, которому дают оффер, от кандидата, которому отказывают.

🎁 Специальное предложение: до 25 мая действует скидка 20% на курс!


➡️ Подробности и запись: simulative.ru/da-practice

📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤32