Симулейтив
7.47K subscribers
2.01K photos
86 videos
1 file
1.59K links
Мы — образовательная платформа в сфере аналитики Симулейтив: simulative.ru

Создаём курсы-симуляторы, где обучаем на кейсах из реального бизнеса.

Канал по ML: @modprod
Наш уютный чат: @itresume_chat
Поддержка: @simulative_support
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
❤3👍3🔥2
Симулейтив
Мастер-класс по SQL уже через 1,5 часа Вместе с Евгением Буториным, ментором курса «Аналитик данных», мы решим несколько задач по SQL и выполним полноценное ТЗ от клиента. Не пропустите вебинар в 19:00 МСК! 😶 Зарегистрироваться 📈 Симулейтив | ВК | YouTube
По многочисленным просьбам — повторяем мастер-класс по SQL

Мы получили огромное количество положительной обратной связи. Прикрепляем комментарии! Спасибо вам 🧡

Мы редко проводим такое, но в этот раз решили сделать повтор вебинара и дать шанс тем, кто очень хотел прийти, но не получилось. 

Напоминаем, что вас ждёт: 
— Разберём SQL как главный инструмент аналитика;
— Решаем задачи по SQL и реальные задачи бизнеса.

❗️ Встречаемся вновь сегодня 8 апреля в 13:00 и 19:00 МСК.

➡️ Прямая ссылка на комнату

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥22
Как я убрал рутину из ежемесячных отчётов навсегда: Power Pivot + меры в DAX

Всем привет! С вами Евгений Буторин, ментор курса «Аналитик данных» 👋🏻

За 5 лет в аналитике я устал от одной и той же боли: обновление отчётов руками. Да, данные в отчёт проливались через Power Query автоматически (через кнопку «Обновить всё»), но метрики были нестандартные.

Например, у нас есть показатель, когда на одну формулу накладываем другие. В итоге при добавлении нового месяца приходилось каждый раз протягивать формулы на новый месяц в 25 таблицах и обновлять графики. На это уходило около 30-40 минут рабочего времени.

Теперь обновление отчёта занимает 2 минуты: нажимаю «Обновить всё» — и всё готово. Для этого я загрузил данные из Power Query в модель данных и написал меры, которые позволяют «на лету» считать все нужные вычисления.

Вот как это работает:
➖ Загружаешь сырые данные в модель через Power Query или напрямую в модель Power Pivot;
➖ Пишешь меры на DAX (один раз и навсегда);
➖ Строишь график/сводную таблицу — и больше никогда её не трогаешь.

Пример реальной меры, которую я использую — дельта конверсий (в %):

Delta Conv MoM = 

VAR GKG =
DIVIDE(CALCULATE(sum(query[sales]), ggroup = “ГКГ”), CALCULATE(sum(query[cnt_cl]), ggroup = “ГКГ”))

VAR CG =
DIVIDE(CALCULATE(sum(query[sales]), ggroup = “ЦГ”), CALCULATE(sum(query[cnt_cl]), ggroup = “ЦГ”))

RETURN

CG - GKG


После этого график «Дельта конверсий» живёт своей жизнью — самостоятельно обновляется и пересчитывается в зависимости от выбранных фильтров.

Конечно, это не единственная мера, но потратить на написание мер 30 минут однократно и сэкономить при этом часы на рутинной работе стоит каждой потраченной минуты.

🟠 Записаться на поток с моим менторством: simulative.ru/data-analyst

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10❤4👍4
Забирайте модуль по Excel при покупке курса!

Друзья, мы запустили акцию: покупаете любой курс-профессию → получаете наш полноценный модуль по Excel.

Вы научитесь работать с таблицами, сводными, формулами и визуализацией — с базой, без которой не обходится ни один аналитик. А если вы уже профи, повторите основы и закроете пробелы.

📌 Акция действует до 15 апреля включительно на платные курсы Симулейтив (кроме тренингов и магистратуры).


Ваш Excel-бонус уже скучает, успевайте забрать 😉

👉 Оставить заявку

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥4👍3
Одна строчка в SQL, которая экономит время при каждом обновлении отчёта

Привет, коллеги! С вами снова Евгений Буторин, ментор курса «Аналитик данных» 👋🏻

Раньше, когда нужно было обновить отчёт за последний месяц, я либо тянул ВЕСЬ период данных (гигантский объём), либо вручную правил даты в 20 разных местах запроса.

Оба варианта — боль 😥

Теперь я использую динамические переменные в процедурах и могу быстро изменить их под свои нужды — например, если нужно обновить один конкретный месяц.

Как это выглядит:

DECLARE @StartDate DATE = add_months(trunc(sysdate,’mm’),-2);
DECLARE @EndDate DATE = last_day(trunc(sysdate));

DELETE FROM table WHERE Date BETWEEN @StartDate AND @EndDate;

COMMIT;

INSERT INTO table

SELECT
Channel,
COUNT(*) AS Leads,
SUM(CASE WHEN Status = 'Купил' THEN 1 ELSE 0 END) AS Sales,
SUM(CASE WHEN Status = 'Купил' THEN 1 ELSE 0 END) * 1.0 / COUNT(*) AS ConvRate
FROM MarketingLeads
WHERE Date BETWEEN @StartDate AND @EndDate
GROUP BY Channel;

COMMIT;


Всё. Хочу пересчитать апрель 2024 года — меняю переменные на две даты в начале процедуры и запускаю запрос заново. Никаких правок в 20 местах. При этом другие периоды не меняются, что исключает эффект «плавающих данных».

Возможно это выглядит сложно, но на деле мы не становимся сразу сеньорами (старшими аналитиками), мы учимся постоянно и дорабатываем свои скрипты.


➡️ Записаться на поток с моим менторством (стартуем сегодня!): simulative.ru/data-analyst

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥54❤3
😁😆😁 опубликовать анонс вебинара по дата сайенс, 13 апреля 19:00 МСК, спикер Мария Жарова. Вебинар про профессию дата-сайентиста с практикой.

Ссылка на регистрацию https://bothelp.cc/mini?domain=simulative&id=29&utm_source=telegram&utm_medium=social&utm_campaign=webinar&utm_content=10-04-2026-web-1304
Please open Telegram to view this post
VIEW IN TELEGRAM
😁10❤4🔥3😎2🌚1
👍👍👍👍

Вебинар: всё, что нужно знать о профессии дата-сайентиста


Data Scientist — одна из самых востребованных профессий в аналитике, но вокруг неё до сих пор много путаницы: чем она отличается от машинного и глубокого обучения? Когда одной аналитики недостаточно? И что реально нужно уметь, чтобы получить первую работу?

На вебинаре с Марией Жаровой разложим по полочкам профессию дата-сайентиста — разберёмся в терминах, поговорим о спросе на рынке, требованиях к джунам. И конечно, попрактикуемся — построим модели прогнозирования оттока на реальных данных.

На вебинаре расскажем:
➖ Кто такой дата-сайентист и как различать аббревиатуры DS, ML, DL и AI;
➖ Откуда спрос на эту профессию и какие задачи решают DS в бизнесе;
➖ Какие требования предъявляют к джуну;
➖ Построим модели прогнозирования оттока клиентов банка, сравним подходы по метрикам и интерпретируемости, разберём ключевые факторы оттока.

❗️ Встречаемся 13 апреля в 19:00 МСК

💬 Подключайтесь к эфиру, чтобы задать Марии вопросы про карьеру в Data Science, машинное обучение и практические кейсы.


➡️ Зарегистрироваться на вебинар

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥4😁32
Почему t-test — это всё, что вам нужно в A/B-тестах

Привет! На связи Илья Ковалёв, старший аналитик данных в Dodo Brands и автор канала про аналитику кусочек пиццы 👋🏻

В аналитическом сообществе есть негласная иерархия: чем сложнее метод, тем умнее выглядит аналитик. Bootstrap, тест Манна-Уитни, CUPED, байесовские подходы — всё это звучит внушительно на собеседованиях и в статьях на Хабре.

Но на практике в 80% случаев достаточно обычного t-теста.

Что такое t-test и как он работает

T-test проверяет одну простую гипотезу: отличаются ли средние значения метрики в двух группах или нет. Формально он считает t-статистику:

t = (x̄₁ - x̄₂) / √(s₁²/n₁ + s₂²/n₂),
где x̄ — среднее в группе, s² — дисперсия, n — размер выборки.


Дальше по этой статистике считается p-value — вероятность получить такой же или более экстремальный результат при условии, что никакого эффекта нет.

Если p-value < 0.05, эффект считается статистически значимым.

Почему часто всё усложняют

Главный аргумент против t-теста звучит так: «Данные не распределены нормально, значит t-test некорректен». Но на самом деле это не так.

T-test опирается не на нормальность исходных данных, а на нормальность распределения выборочного среднего.

А оно, согласно центральной предельной теореме, стремится к нормальному при достаточно большой выборке — вне зависимости от того, как распределены сами данные.

На практике при выборке от 1000 наблюдений на группу это условие выполняется почти всегда. А в большинстве продуктовых A/B-тестов выборки именно такого размера или больше.

Однако не стоит пихать t-test во все возможные эксперименты. Иногда он может и не подойти.

Когда t-test действительно не подходит

T-test работает плохо в нескольких ситуациях:

➖ Очень маленькие выборки (до 30 наблюдений на группу). В этом случае ЦПТ ещё не работает в полную силу.

➖ Метрика с экстремальными выбросами — например, выручка, где один крупный платёж может сильно сдвинуть среднее. В таком случае имеет смысл либо сглаживать выбросы и перепроверять результаты тестом Манна-Уитни.

➖ Бинарные метрики с очень низкой конверсией — в этом случае лучше работает z-test для пропорций, хотя при больших выборках разница минимальна.

Во всех остальных случаях t-test справляется.

Зачем тогда все эти сложные методы?

Они решают конкретные задачи — и только их. CUPED снижает дисперсию и позволяет быстрее набрать нужную выборку. Bootstrap помогает строить доверительные интервалы для нестандартных метрик. Линеаризация помогает работать с Ratio-метриками.

Это полезные инструменты. Но они не отменяют t-test, а дополняют его в нестандартных случаях. Браться за них только потому, что «так серьёзнее» — это усложнение ради усложнения. А усложнение ради усложнения в аналитике стоит дорого: дольше согласование, сложнее объяснить бизнесу, выше риск ошибки в реализации.

Простой инструмент, применённый правильно, лучше сложного, применённого без понимания.

➡️ Записаться на курс по A/B-тестам: simulative.ru/ab-test

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9❤3🔥3
Только 12 и 13 апреля — космические -35% на аналитику! 🚀

В космонавтике без аналитиков никуда. Спутниковые данные, траектории полётов, телеметрия, прогнозы перегрузок — всё это огромные массивы информации, которые нужно обрабатывать, визуализировать и интерпретировать. Именно аналитики помогают принимать точные решения на Земле и за её пределами.

Хотите освоить профессию, востребованную как в аэрокосмической отрасли, так и в любом бизнесе? Время решаться!

📉 До -35% на все курсы Симулейтив (кроме тренингов и программ магистратуры).
⏳ Акция действует всего два дня: 12 и 13 апреля.

Успейте взять курс по аналитике, визуализации данных или data science с выгодой до 35% и не упустите шанс выйти на новую орбиту!

👉 Оставить заявку: simulative.ru/web-cosmos-offer-book

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4❤21
Зачем нужны временные ряды?

Всем привет, я Павел Беляев, ведущий канала Тимлидское об аналитике и автор нового курса Симулейтив «Временные ряды» 👋🏻

Почему эта тема всегда актуальна для любого аналитика? Очевидно, потому что большая часть данных представляет собой упорядоченные во времени последовательности значений, то есть, собственно, временные ряды! И умение легко обращаться с их свойствами и методами их обработки — необходимый навык в нашем деле.

Вот лишь несколько типовых направлений использования временных рядов.

➖ Визуализация и изучение исторической динамики
Выявление трендов, сезонных патернов и даже исследование случайного шума помогает не только ориентироваться в ситуации, но и набрести на ценные инсайты.

➖ Мониторинг качества данных
Например, сравнение каждого значения метрики со скользящим средним позволяет обнаруживать локальные выбросы и вовремя инициировать инциденты. Существуют и более изощрённые и точные способы детекции аномалий.

➖ Прогнозирование
Руководители-заказчики крайне интересуются, как будут чувствовать себя в будущем финансовые показатели, кто из клиентов оттечёт, как вырастет нагрузка на техподдержку и т. д. Ведь им нужно планировать, учитывать риски, подготавливать необходимые ресурсы. Временные ряды позволяют делать такие предсказания.

➖ Взаимное влияние разных процессов
Если рассматривать изменение нескольких величин на одной и той же временной шкале, можно считать этот процесс многомерным временным рядом. Тогда можно вычислить степень взаимосвязи этих метрик, а значит, найти способ управлять одним целевым параметром, изменяя другие. Такое знание дорогого стоит!

Методы анализа временных рядов позволяют отделить реальный сигнал от шума, понять, что именно движет вашими данными, и строить прогнозы, которым можно доверять.

Этому и посвящён наш новый курс. Мы разберём всё: от базовой визуализации и проверки стационарности до прогнозирования на Prophet с густой насыщенной практикой в Python.


➡️ Записаться на курс: simulative.ru/time-series

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍2🔥2
Через пару часов начинаем вебинар о data science

Напомним, что с Марией Жаровой разложим по полочкам профессию дата-сайентиста — разберёмся в терминах, поговорим о спросе на рынке, требованиях к джунам. И конечно, попрактикуемся — построим модели прогнозирования оттока на реальных данных.

🔔 Зарегистрироваться

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤2🔥2
Привет! На связи Валерия Елпатьевская, инженер данных в Альфа Банке и ментор одноимённого курса Симулейтив 👋🏻

Мой путь начался не в IT: филология, преподавание, потом Data Science. Но быстро поняла, что без инженерной базы далеко не уедешь. Пошла разбираться в очередях, оркестрации и архитектуре… и как-то незаметно стала Data Engineer.

Пока вкатывалась в роль, думала, что ничего не понимаю. А через полгода уже объясняла коллегам, как всё работает. На этом пути усвоила 4 урока, которые точно помогут не сдаться:

Урок № 1. Никогда не будет всё понятно. Научитесь кайфовать от этого

Я уже несколько лет пишу код и знаю десятки инструментов, но каждый раз находится тема, которую приходится изучать с нуля. И каждый раз «ничего не понятно». Если сейчас чувствуете то же самое — добро пожаловать в IT!

Плохая новость: это не пройдёт. Хорошая: именно поэтому вы будете чувствовать себя на вершине, когда разберётесь. Но ровно до следующей задачи. Чем раньше примете это, тем меньше шанс выгореть.

Урок № 2. Не стыдно чего-то не знать

На созвоне или в чате обязательно будет момент, когда кто-то бросит термин, а вы вообще не поймёте, о чём речь. Человек звучит так уверенно, что кажется «боже, как стыдно не знать». Спойлер: не стыдно. Спрашивайте. Уточняйте. Никто не подумает о вас плохо. Плохо думают о тех, кто делает вид, что понял, а потом ломает прод.

Урок № 3. Никто на самом деле ничего не знает

В начале кажется, что все вокруг гении, а вы попали сюда случайно. Но это синдром самозванца. Вы всегда будете работать с равными: у них просто другие компетенции. Лучшее лекарство — задавать вопросы и делиться тем, что изучил сам. Даже если кажется, что «все это знают». Скорее всего, половина чата впервые это слышит.

Урок № 4. Нейросеть архитектуру не придумает

Сейчас везде кричат, что LLM напишет код за вас. И правда напишет! Только вам же потом придётся его рефакторить и чинить в проде. Круто отдавать моделям рутину или устраивать брейншторм.

Но архитектура решения, дизайн пайплайна, выбор инструментов — это ваша зона ответственности. Вы должны точно понимать, что и зачем делаете. Не делегируйте это ИИ, иначе прод упадёт, а разбираться всё равно вам.

Если откликается, ставьте реакции и пишите в комментариях, где вы сейчас, какая цель и что больше всего бесит в текущих задачах/обучении?


😶 А кому интересно почитать мою большую статью о «войти в айти», добро пожаловать на Хабр: https://habr.com/ru/companies/lanit/articles/842136

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥18❤92
Как одна «незначительная» фича сломала модель в бою

Привет! На связи Мария Жарова, ментор курсов «ML-инженер» и «Дата-сайентист» 👋🏻

Хочу поделиться кейсом, который хорошо показывает, как «безобидный» признак может неожиданно повлиять на модель.

Мы решали задачу предсказания оттока пользователей. Классическая история: табличные данные, градиентный бустинг, аккуратный пайплайн, валидация — всё как надо. На кросс-валидации модель давала стабильный прирост к бейзлайну, метрики выглядели уверенно.

Перед выкаткой решили добавить ещё одну фичу — «время последнего действия пользователя». На первый взгляд, абсолютно логичный и даже полезный признак. После добавления метрика на валидации ещё немного подросла — казалось бы, идеальный кандидат в прод.

Но через несколько дней после выкатки метрики в проде поползли вниз… Сначала думали на данные, потом на инфраструктуру, потом на сдвиг распределений — но оказалось, дело в одной фиче! Как раз «время последнего действия» в обучении считалось относительно фиксированной даты (условно, «срез данных на момент выгрузки»). А в проде — относительно текущего времени.

Звучит безобидно, но по факту:
➖ в обучении модель видела, что«“клиент давно не заходил» — это, например, 30 дней;
➖ в проде это же значение могло стать 60, 90 и т. д., потому что время идёт, а логика пересчёта не была синхронизирована.

В результате распределение признака в проде уплыло относительно train, и модель начала получать значения, которых «не видела» на обучении — поэтому предсказания поехали.

Более того, этот признак оказался одним из самых важных — модель сильно на него опиралась, и даже небольшая логическая несостыковка дала ощутимый эффект.

Поэтому всегда имейте в виду:
😶 Любая фича, завязанная на время — почти всегда источник проблем, если не продумана логика её расчёта в проде;
😶 Важно проверять не только код обучения, но и код генерации признаков для прода — они должны быть идентичны по смыслу;
😶 Полезно смотреть на распределения признаков: train vs prod, хотя бы на базовом уровне;
😶 Если фича становится топ-важной — к ней должно быть повышенное внимание, потому что именно она может «уронить» модель.


И да, чаще всего модель ломает не сложная математика, а такие вот мелочи, которые сначала кажутся очевидными.

Сохраняйте, чтобы не наступить на те же грабли!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥32
This media is not supported in your browser
VIEW IN TELEGRAM
❤3🔥3👍2
⬆️ Ментор курса «Аналитик данных» Евгений Буторин отвечает на вопрос, какие навыки будут полезны аналитику для работы в финтехе.

➡️ Всё необходимое для работы даём на курсе, записывайтесь: simulative.ru/data-analyst

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍3🔥3
🔥 Большой эфир по временным рядам

Если вы работаете с данными, которые меняются со временем — поздравляю, вы уже работаете с временными рядами. Методы анализа временных рядов позволяют отделить реальный сигнал от шума, понять, что именно движет вашими данными, и строить прогнозы, которым можно доверять.

Вместе с Павлом Беляевым, руководителем группы дата-аналитиков в Яндекс eLama и автором курса «Временные ряды», разберём на мастер-классе ключевые задачи временных рядов в аналитике. Отдельно поговорим о декомпозиции и фильтрации: зачем они нужны, как применяются и где чаще всего ошибаются.

И конечно, не обойдётся без практики: вместе с вами сядем и плотно попитоним в прямом эфире 😁

Если вы хотите увереннее работать с динамикой метрик, лучше понимать поведение данных и не путать сигнал с шумом, ждём вас на мастер-классе!


😶 20 апреля в 19:00 МСК
😶 Зарегистрироваться на мастер-класс

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥52
Прокачиваем навыки аналитика: топ платформ для практики SQL, Python и анализа данных

Привет, коллеги! С вами снова Евгений Буторин, ментор курса «Аналитик данных» 👋🏻

Если вы готовитесь к собеседованиям на позицию аналитика, то просто читать теорию мало — нужна практика на реальных задачах. Вот моя личная подборка платформ, которые реально помогают прокачать хард скилы:

1️⃣ Leetcode. Классика. Раздел Database + SQL — must-have. Плюс куча задач на Python (pandas, data manipulation). Отлично готовит к FAANG и российским продуктовым компаниям.

2️⃣ HackerRank. Есть отдельный трек Analytics и SQL. Задачи часто берут прямо из реальных интервью. Удобно отслеживать прогресс. Дополнительно можно получить сертификат.

3️⃣ StrataScratch. Один из моих фаворитов для аналитиков. Более 1000 SQL-задач из реальных интервью в Amazon, Meta, Netflix и т. д. Есть разделение по уровню сложности и по компаниям.

4️⃣ DataLemur. Ещё один топ для SQL-аналитиков. Задачи заточены именно под data-роли, много оконных функций и бизнес-кейсов.

5️⃣ Kaggle. Когда хочется не просто SQL, а полноценный анализ данных: датасеты, notebooks, соревнования. Идеально для портфолио.

😶 А между делом — обязательно загляните на IT Resume. Там не только практические задания по аналитике и SQL, но и инструмент, который помогает сразу превратить прокачанные навыки в сильное IT-резюме.


Делитесь в комментариях своими любимыми платформами для тренировки навыков аналитика 👇🏻

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11🔥8👍4
This media is not supported in your browser
VIEW IN TELEGRAM
❤2🔥21
Симулейтив
🔥 Большой эфир по временным рядам Если вы работаете с данными, которые меняются со временем — поздравляю, вы уже работаете с временными рядами. Методы анализа временных рядов позволяют отделить реальный сигнал от шума, понять, что именно движет вашими данными…
⚡️ Мастер-класс по временным рядам: скоро начинаем!

Присоединяйтесь к эфиру в 19:00 МСК, где вместе с Павлом Беляевым разберём ключевые задачи временных рядов в аналитике. А также порешаем реальные задачи по временным рядам на Python:

➡️ Регистрация

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥21
Симулейтив
⚡️ Мастер-класс по временным рядам: скоро начинаем! Присоединяйтесь к эфиру в 19:00 МСК, где вместе с Павлом Беляевым разберём ключевые задачи временных рядов в аналитике. А также порешаем реальные задачи по временным рядам на Python: ➡️ Регистрация 📈 Симулейтив…
🔥 Для тех, кто не успел: повтор мастер-класса по временным рядам

Сегодня в 13:00 и 19:00 по МСК вы сможете посмотреть эфир с Павлом Беляевым и узнать все тонкости построения временных рядов в аналитике, а также познакомиться с нашим курсом «Временные ряды». Много практики гарантируем 😎

➡️ Присоединяйтесь к эфиру

📈 Симулейтив | ВК | YouTube
Please open Telegram to view this post
VIEW IN TELEGRAM
❤32🔥1