Как я стал аналитиком📊
В конце 1 курса я начал задумываться о карьере и узнавать, где работают и чем занимаются выпускники моего факультета или аналогичных факультетов других вузов.
Оказалось, что большинство из них выбирают анализ данных или финансы.
Тогда я уже прошел пару курсов по финансам в университете и понимал, что это не совсем моё.
Также я рассматривал классический трек экономиста с глубоким погружением в макроэкономику и работой в ЦБ / research подразделениях банков.
Почему выбрал именно анализ данных?🤔
В середине второго курса началась макроэкономика и я понял, что мне не очень интересно. Это стало стимулом поставить на первое место в своем видении карьеры анализ данных. К тому же я уже знал Python и очень хорошо закрыл Тервер и Матстат.
В анализе данных меня привлекала возможность находить инсайты в данных, строить на основе данных прогнозы с помощью моделей. Это похоже на работу детектива: сложить картину из имеющихся улик, спрогнозировать ситуацию наперед 🕵️♂️
Обучение🧑🎓
К моменту середины 2 курса из релевантных дисциплин я знал:
- Python
- Тервер и статистику
За второй семестр я прошел курсы:
- Основы машинного обучения
- Анализ данных на Python
Все эти курсы дали мне отличную базу знаний для старта, но главное - научили быстро находить нужную информацию в своей области и дали понять, что
лучший подход в изучении нового - это быстрый переход от теории к практике.
Поэтому всем новичкам я рекомендую закреплять пройденный материал на пет-проектах.
Здесь и здесь можно найти хорошие подборки тем для пет-проектов. О своих пет-проектах, сделанных до первой работы, расскажу в следующих постах этой серии.
С таким набором знаний я уже мог рассчитывать на какой-то успех при выходе на рынок труда🤩
Поиск первой работы🔍
Еще на 1 курсе, когда я еще не знал точно, чем хочу заниматься, я решил, что очень хочу летом после 2 курса попасть на стажировку, чтобы получить реальный опыт и изучить выбранную сферу изнутри. Поэтому на 2 курсе с марта я начал откликаться на стажировки и джуновские вакансии на аналитика / ds.
Я подавался как на отдельные вакансии, так и на большие программы стажировок (такие есть к Сбера, Озона, Авито и др.). На программах я в основном получал отказы, так как искали как минимум студентов 3 курса.
Для поиска вакансий я использовал все популярные ресурсы: сайты компаний, hh.ru, Хабр карьера, HSE career и др.
Таким образом я отправил более 70 откликов, прошел 4 собеседования и получил 2 оффера: 1 на стажера и 1 на джуна.
Что я бы изменил в своем процессе поиска работы?📝
1. Добавлял бы больше достижений в cv🥇
Например не «работал учебным ассистентом по Микроэкономике, проверял домашние работы студентов», а «работал учебным ассистентом по Микроэкономике и за семестр провел 5 консультаций для студентов, повысив их успеваемость в сравнении с другими группами»
2. Больше использовал бы ресурсы знакомых для попадания через рефералки.
3. Использовал бы Linkedin📱
В следующем посте расскажу про самое важное собеседование: как я готовился, какие неожиданные вопросы задавали и что, по моему мнению, стало решающим для оффера в Сбер💳
Главное, что я понял: путь в аналитику — это не про идеальное резюме, а про готовность учиться на ошибках и действовать.
У меня получилось — получится и у вас! 🌅
А пока вопрос к вам: что для вас сейчас самое сложное на пути к первой работе в аналитике?
Поделитесь в комментариях — постараюсь дать совет или разберу в будущих постах.💬
Ставьте
🔥 если было полезно
❤️ если ждете новые посты из этой серии
🤩если сейчас ищете свою первую работу
#жизнь_аналитика
#карьера
#образование
#анализ_данных
#путь_в_аналитику
В конце 1 курса я начал задумываться о карьере и узнавать, где работают и чем занимаются выпускники моего факультета или аналогичных факультетов других вузов.
Оказалось, что большинство из них выбирают анализ данных или финансы.
Тогда я уже прошел пару курсов по финансам в университете и понимал, что это не совсем моё.
Также я рассматривал классический трек экономиста с глубоким погружением в макроэкономику и работой в ЦБ / research подразделениях банков.
Почему выбрал именно анализ данных?
В середине второго курса началась макроэкономика и я понял, что мне не очень интересно. Это стало стимулом поставить на первое место в своем видении карьеры анализ данных. К тому же я уже знал Python и очень хорошо закрыл Тервер и Матстат.
В анализе данных меня привлекала возможность находить инсайты в данных, строить на основе данных прогнозы с помощью моделей. Это похоже на работу детектива: сложить картину из имеющихся улик, спрогнозировать ситуацию наперед 🕵️♂️
Обучение
К моменту середины 2 курса из релевантных дисциплин я знал:
- Python
- Тервер и статистику
За второй семестр я прошел курсы:
- Основы машинного обучения
- Анализ данных на Python
Все эти курсы дали мне отличную базу знаний для старта, но главное - научили быстро находить нужную информацию в своей области и дали понять, что
лучший подход в изучении нового - это быстрый переход от теории к практике.
Поэтому всем новичкам я рекомендую закреплять пройденный материал на пет-проектах.
Здесь и здесь можно найти хорошие подборки тем для пет-проектов. О своих пет-проектах, сделанных до первой работы, расскажу в следующих постах этой серии.
С таким набором знаний я уже мог рассчитывать на какой-то успех при выходе на рынок труда🤩
Поиск первой работы
Еще на 1 курсе, когда я еще не знал точно, чем хочу заниматься, я решил, что очень хочу летом после 2 курса попасть на стажировку, чтобы получить реальный опыт и изучить выбранную сферу изнутри. Поэтому на 2 курсе с марта я начал откликаться на стажировки и джуновские вакансии на аналитика / ds.
Я подавался как на отдельные вакансии, так и на большие программы стажировок (такие есть к Сбера, Озона, Авито и др.). На программах я в основном получал отказы, так как искали как минимум студентов 3 курса.
Для поиска вакансий я использовал все популярные ресурсы: сайты компаний, hh.ru, Хабр карьера, HSE career и др.
Таким образом я отправил более 70 откликов, прошел 4 собеседования и получил 2 оффера: 1 на стажера и 1 на джуна.
Что я бы изменил в своем процессе поиска работы?
1. Добавлял бы больше достижений в cv
Например не «работал учебным ассистентом по Микроэкономике, проверял домашние работы студентов», а «работал учебным ассистентом по Микроэкономике и за семестр провел 5 консультаций для студентов, повысив их успеваемость в сравнении с другими группами»
2. Больше использовал бы ресурсы знакомых для попадания через рефералки.
3. Использовал бы Linkedin
В следующем посте расскажу про самое важное собеседование: как я готовился, какие неожиданные вопросы задавали и что, по моему мнению, стало решающим для оффера в Сбер
Главное, что я понял: путь в аналитику — это не про идеальное резюме, а про готовность учиться на ошибках и действовать.
У меня получилось — получится и у вас! 🌅
А пока вопрос к вам: что для вас сейчас самое сложное на пути к первой работе в аналитике?
Поделитесь в комментариях — постараюсь дать совет или разберу в будущих постах.
Ставьте
🔥 если было полезно
❤️ если ждете новые посты из этой серии
🤩если сейчас ищете свою первую работу
#жизнь_аналитика
#карьера
#образование
#анализ_данных
#путь_в_аналитику
Please open Telegram to view this post
VIEW IN TELEGRAM
❤12🔥8🤩2🦄1
Что не расскажут на курсах: проблемы реальных данных 🗂
В учебных проектах, датасетах с Kaggle данные, как правило, чистые: без пропусков, дублей, ошибок.
В промышленных данных не всё так гладко, поэтому сегодня решил рассказать о работе с такими данными и о том, как избежать ошибок при их анализе.
Какие проблемы могут быть с данными и как их решать?🚨
1. Пропуски
В витринах данные часто содержат пропуски, которые могут серьезно исказить анализ, если их игнорировать.
Решение: перед JOIN изучите таблицы на пропуски. В pandas — .isnull().sum(). Решайте: удалить, игнорировать или заполнить. Ищите и скрытые пропуски (типа -1, "N/A") через SELECT DISTINCT.
2. Дубликаты
Часто бывает, что по ошибке в витрину заносится например 2 записи об одном клиенте, хотя структура этого не предполагает. Здесь появляется риск дважды учесть один и тот же показатель.
Решение: ищите через duplicated() по ключевым столбцам. Скрытые дубли (типа «ООО Феникс» и «Феникс») — через LIKE в SQL.
Совет: для джойнов используйте только id.
3. Лаги в поставках данных
Данные в витрины могут поставляться не сразу, а, например, через 2 дня.
Если вы пишите скрипты, которые регулярно обновляются, подтягивая данные из витрин, это надо учитывать.
4. Смещение во времени
Разные таблицы обновляются в разное время (например, таблица заказов — в реальном времени, таблица возвратов — раз в неделю). Если вы их джойните по дате, вы теряете свежие данные или создаёте видимость, что возвратов нет.
Пример: Заказ от 25 января есть, а информация о его возможном возврате появится только 1 февраля.
Решение: Всегда проверяйте MAX(date) в каждой таблице перед анализом. Используй JOIN с пониманием, что часть данных может быть «ещё в пути».
5. Изменение бизнес логики
Например, ml модель приоритизирует клиентов, и до 2026 года 20% дохода с продаж засчитывалось департаменту, разработавшему модель. А с начала года правила изменились, и теперь департаменту засчитывается 30% дохода. В витрине все новые данные по продажам рассчитываются согласно новому правилу, а исторические данные пересчитаны не были. Поэтому при анализе доходов департамента можно сделать ложный вывод о том, что продажи выросли (на самом деле не факт).
Решение: регулярно уточнять у владельцев данных по последним изменениям или попросить уведомлять о них.
6. Неявные зависимости, скрытые фильтры
Пример: в витрине может быть скрытый атрибут для фильтрации актуальных записей.
Решение: перед использованием витрины изучите скрипты коллег.
Что делать в первый день работы с новой таблицей🆕 :
1. SELECT COUNT(*), MIN(date), MAX(date) FROM table — объём и временные границы.
2. SELECT COUNT(*) - COUNT(key_column) FROM table — пропуски в ключевом поле.
3. SELECT key_column, COUNT(*) as cnt FROM table GROUP BY key_column HAVING cnt > 1 ORDER BY cnt DESC LIMIT 5 — поиск явных дублей по ключу.
4. SELECT column, COUNT(*) FROM table GROUP BY column ORDER BY 2 DESC LIMIT 10 — посмотреть топ-10 значений в важной колонке (поймаешь «-1» и «N/A»).
5. Спросить у коллеги: «Какая самая частая ошибка именно в этой витрине?»
Принципы работы с грязными данными🐖
Доверяй, но проверяй✔️
Любые данные могут содержать ошибки, проверка никогда не будет лишней
Контекст важнее чистоты🔍
Иногда дубли, пропуски могут быть сигналом о проблеме в бизнес процессе.
Например, если аналитик видит пропуски в поле "Причина отказа", это может означать, что менеджеры по
продажам не заполняют его, и стоит обязать их делать это.
Единый взгляд на данные - залог успеха🤝
Огромное количество проблем в компаниях начинается с того, что разные люди используют разные данные и делают по ним разные выводы.
Поэтому не жалейте времени на сверку с коллегами.
💎 Работа с «грязными» данными — ваше преимущество. Она показывает реальный бизнес и даёт возможность разглядеть неочевидные проблемы.
А какие у вас принципы работы с промышленными данными? Пишите в комментариях!💬
Ставьте
🔥 если было полезно
❤️ если интересно увидеть ещё посты про работу с необработанными данными
🤩 если видите в работе с такими данными точки роста
#анализ_данных
#данные
#качество_данных
В учебных проектах, датасетах с Kaggle данные, как правило, чистые: без пропусков, дублей, ошибок.
В промышленных данных не всё так гладко, поэтому сегодня решил рассказать о работе с такими данными и о том, как избежать ошибок при их анализе.
Какие проблемы могут быть с данными и как их решать?
1. Пропуски
В витринах данные часто содержат пропуски, которые могут серьезно исказить анализ, если их игнорировать.
Решение: перед JOIN изучите таблицы на пропуски. В pandas — .isnull().sum(). Решайте: удалить, игнорировать или заполнить. Ищите и скрытые пропуски (типа -1, "N/A") через SELECT DISTINCT.
2. Дубликаты
Часто бывает, что по ошибке в витрину заносится например 2 записи об одном клиенте, хотя структура этого не предполагает. Здесь появляется риск дважды учесть один и тот же показатель.
Решение: ищите через duplicated() по ключевым столбцам. Скрытые дубли (типа «ООО Феникс» и «Феникс») — через LIKE в SQL.
Совет: для джойнов используйте только id.
3. Лаги в поставках данных
Данные в витрины могут поставляться не сразу, а, например, через 2 дня.
Если вы пишите скрипты, которые регулярно обновляются, подтягивая данные из витрин, это надо учитывать.
4. Смещение во времени
Разные таблицы обновляются в разное время (например, таблица заказов — в реальном времени, таблица возвратов — раз в неделю). Если вы их джойните по дате, вы теряете свежие данные или создаёте видимость, что возвратов нет.
Пример: Заказ от 25 января есть, а информация о его возможном возврате появится только 1 февраля.
Решение: Всегда проверяйте MAX(date) в каждой таблице перед анализом. Используй JOIN с пониманием, что часть данных может быть «ещё в пути».
5. Изменение бизнес логики
Например, ml модель приоритизирует клиентов, и до 2026 года 20% дохода с продаж засчитывалось департаменту, разработавшему модель. А с начала года правила изменились, и теперь департаменту засчитывается 30% дохода. В витрине все новые данные по продажам рассчитываются согласно новому правилу, а исторические данные пересчитаны не были. Поэтому при анализе доходов департамента можно сделать ложный вывод о том, что продажи выросли (на самом деле не факт).
Решение: регулярно уточнять у владельцев данных по последним изменениям или попросить уведомлять о них.
6. Неявные зависимости, скрытые фильтры
Пример: в витрине может быть скрытый атрибут для фильтрации актуальных записей.
Решение: перед использованием витрины изучите скрипты коллег.
Что делать в первый день работы с новой таблицей
1. SELECT COUNT(*), MIN(date), MAX(date) FROM table — объём и временные границы.
2. SELECT COUNT(*) - COUNT(key_column) FROM table — пропуски в ключевом поле.
3. SELECT key_column, COUNT(*) as cnt FROM table GROUP BY key_column HAVING cnt > 1 ORDER BY cnt DESC LIMIT 5 — поиск явных дублей по ключу.
4. SELECT column, COUNT(*) FROM table GROUP BY column ORDER BY 2 DESC LIMIT 10 — посмотреть топ-10 значений в важной колонке (поймаешь «-1» и «N/A»).
5. Спросить у коллеги: «Какая самая частая ошибка именно в этой витрине?»
Принципы работы с грязными данными
Доверяй, но проверяй
Любые данные могут содержать ошибки, проверка никогда не будет лишней
Контекст важнее чистоты
Иногда дубли, пропуски могут быть сигналом о проблеме в бизнес процессе.
Например, если аналитик видит пропуски в поле "Причина отказа", это может означать, что менеджеры по
продажам не заполняют его, и стоит обязать их делать это.
Единый взгляд на данные - залог успеха
Огромное количество проблем в компаниях начинается с того, что разные люди используют разные данные и делают по ним разные выводы.
Поэтому не жалейте времени на сверку с коллегами.
А какие у вас принципы работы с промышленными данными? Пишите в комментариях!
Ставьте
🔥 если было полезно
❤️ если интересно увидеть ещё посты про работу с необработанными данными
🤩 если видите в работе с такими данными точки роста
#анализ_данных
#данные
#качество_данных
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11🔥7👍3😈1🎄1
Как я управляю временем на работе? ⏳
В первые месяцы работы, когда я еще был стажером, я часто разрывался в попытках успеть все и сразу.
С опытом я выработал (и продолжаю дорабатывать) систему работы с задачами.
Сейчас она экономит мое время и нервы, возможно и для вас будет полезна.
Составление корзины🛒
Раз в неделю на catch up с коллегой смотрим на список всех моих задач и обновляем статусы и приоритеты.
Список является обычным письмом в почте с примерной структурой:
1. Модель X - до 30.01 собрать датасет для MVP
2. Выборка клиентов Y - ждем обратную связь от W. Напомнить ему
3. Исследование Q - к 2.02 вернуться с прогрессом
И так далее.
Этот список помогает мне в ежедневном тайм-менеджменте.
а.
Какие бывают задачи? Моя классификация📝
1. Срочные☄️
Как правило, появляются неожиданно и не очень сложны в выполнении.
Пример: выгрузить доходы по клиенту X в разрезе по месяцам
2. Проектные задачи🗺
Модели, дашборды, бэктесты и т.п.
В общем все, что требует >1 дня
3. Операционные процессы⌛
Процессы, связанные с жизненным циклом продукта. Примером может стать запуск новой кампании продаж
Как я распределяю время внутри дня?🕒
Каждое утро я составляю примерный список задач на день.
В первую очередь в него входят задачи, по которым есть конкретные сроки и они достаточно близко. Поэтому первые 2-3 часа я как правило трачу на такие задачи, чтобы закрыть их, или хотя бы значительно продвинуться.
Затем я уделяю время операционным процессам.
Здесь могут быть разные подзадачи: собрать выборку потенциальных клиентов, согласовать запуск новой кампании продаж, проанализировать эффективность продукта за последнее время и презентовать на регулярной встрече.
Вечер (после первых двух пунктов может остаться как час, так и 4 часа) я оставляю на проекты. В первую очередь занимаюсь теми, для которых поджимают сроки.
Что делать, когда много срочных задач?🆘
1. Выделить задачи, по которым срок сегодня или завтра
2. Для каждой из них подумать, насколько быстрота моего выполнения повлияет на бизнес? (Для многих задач срок задан просто из общих соображений, поэтому их можно отложить в такой ситуации)
3. Если приходит понимание, что не успеваешь - связаться с коллегами и объяснить ситуацию, попросив больше времени
Инструменты: что конкретно использую 🛠
1. Письмо с списком задач.✉️
Оно всегда открыто на одном из мониторов.
2. Тетрадь📝
Новый день = новая страница. Помогает распределять время внутри дня и не забывать про срочные задачи.
3. Календарь📆
В календаре корпоративной почты удобно забивать себе время на проекты. Так легче выделить на них время + никто не будет беспокоить в это время.
4. Переоценка времени➕
Если думаю, что задача займет 2 часа, закладываю на нее как минимум 3. Всегда находятся неожиданности: не хватает данных, нужно уточнение от коллег, зависает кластер.
5. Вечернее планирование 🌇
За 10 минут до конца я прикидываю, что сделал за день и что обязательно надо доделать завтра. Помогает снять напряжение, вызванное неопределенностью.
Мои главные принципы❗️
1. Не откладывать задачи надолго
Даже если по задаче нет конкретных сроков, я не забываю про нее, и стараюсь регулярно продвигаться. В любой момент может подняться приоритет по задаче и лучше будет, если я начну ее делать не с 0.
2. Доводить до результата
Как правило, зависимость результата от потраченного времени имеет убывающую отдачу от масштаба. Поэтому я считаю, что лучше довести несколько проектов до хорошего результата, чем за то же время 1 проект до идеала.
3. Двигаться итерациями
С опытом я перестал надеяться, что сделаю любую задачу за 1 подход. Всегда возникают сложности, которые в начале трудно предугадать. Итеративное движение помогает держать ритм и постепенно идти к результату.
А какие инструменты/принципы используете вы? Пишите в комментариях!💬
Ставьте
🔥если было полезно
❤️ если вас интересны посты на тему таймменеджмента
🤩 если ваши наблюдения совпадают с моими
#жизнь_аналитика
#тайм_менеджмент
#анализ_данных
#софт_скиллы
В первые месяцы работы, когда я еще был стажером, я часто разрывался в попытках успеть все и сразу.
С опытом я выработал (и продолжаю дорабатывать) систему работы с задачами.
Сейчас она экономит мое время и нервы, возможно и для вас будет полезна.
Составление корзины
Раз в неделю на catch up с коллегой смотрим на список всех моих задач и обновляем статусы и приоритеты.
Список является обычным письмом в почте с примерной структурой:
1. Модель X - до 30.01 собрать датасет для MVP
2. Выборка клиентов Y - ждем обратную связь от W. Напомнить ему
3. Исследование Q - к 2.02 вернуться с прогрессом
И так далее.
Этот список помогает мне в ежедневном тайм-менеджменте.
а.
Какие бывают задачи? Моя классификация
1. Срочные
Как правило, появляются неожиданно и не очень сложны в выполнении.
Пример: выгрузить доходы по клиенту X в разрезе по месяцам
2. Проектные задачи
Модели, дашборды, бэктесты и т.п.
В общем все, что требует >1 дня
3. Операционные процессы
Процессы, связанные с жизненным циклом продукта. Примером может стать запуск новой кампании продаж
Как я распределяю время внутри дня?
Каждое утро я составляю примерный список задач на день.
В первую очередь в него входят задачи, по которым есть конкретные сроки и они достаточно близко. Поэтому первые 2-3 часа я как правило трачу на такие задачи, чтобы закрыть их, или хотя бы значительно продвинуться.
Затем я уделяю время операционным процессам.
Здесь могут быть разные подзадачи: собрать выборку потенциальных клиентов, согласовать запуск новой кампании продаж, проанализировать эффективность продукта за последнее время и презентовать на регулярной встрече.
Вечер (после первых двух пунктов может остаться как час, так и 4 часа) я оставляю на проекты. В первую очередь занимаюсь теми, для которых поджимают сроки.
Что делать, когда много срочных задач?
1. Выделить задачи, по которым срок сегодня или завтра
2. Для каждой из них подумать, насколько быстрота моего выполнения повлияет на бизнес? (Для многих задач срок задан просто из общих соображений, поэтому их можно отложить в такой ситуации)
3. Если приходит понимание, что не успеваешь - связаться с коллегами и объяснить ситуацию, попросив больше времени
Инструменты: что конкретно использую 🛠
1. Письмо с списком задач.
Оно всегда открыто на одном из мониторов.
2. Тетрадь
Новый день = новая страница. Помогает распределять время внутри дня и не забывать про срочные задачи.
3. Календарь
В календаре корпоративной почты удобно забивать себе время на проекты. Так легче выделить на них время + никто не будет беспокоить в это время.
4. Переоценка времени
Если думаю, что задача займет 2 часа, закладываю на нее как минимум 3. Всегда находятся неожиданности: не хватает данных, нужно уточнение от коллег, зависает кластер.
5. Вечернее планирование 🌇
За 10 минут до конца я прикидываю, что сделал за день и что обязательно надо доделать завтра. Помогает снять напряжение, вызванное неопределенностью.
Мои главные принципы
1. Не откладывать задачи надолго
Даже если по задаче нет конкретных сроков, я не забываю про нее, и стараюсь регулярно продвигаться. В любой момент может подняться приоритет по задаче и лучше будет, если я начну ее делать не с 0.
2. Доводить до результата
Как правило, зависимость результата от потраченного времени имеет убывающую отдачу от масштаба. Поэтому я считаю, что лучше довести несколько проектов до хорошего результата, чем за то же время 1 проект до идеала.
3. Двигаться итерациями
С опытом я перестал надеяться, что сделаю любую задачу за 1 подход. Всегда возникают сложности, которые в начале трудно предугадать. Итеративное движение помогает держать ритм и постепенно идти к результату.
А какие инструменты/принципы используете вы? Пишите в комментариях!
Ставьте
🔥если было полезно
❤️ если вас интересны посты на тему таймменеджмента
🤩 если ваши наблюдения совпадают с моими
#жизнь_аналитика
#тайм_менеджмент
#анализ_данных
#софт_скиллы
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥21🤩3❤2😈1💅1
Что я смотрю на YouTube: подборка каналов для аналитика 📺
Сегодня воскресенье, поэтому решил не грузить вас объемными постами, а просто поделиться подборкой каналов про анализ данных и карьеру на📺 , которые я смотрю
📚 Фундамент и теория
📊 StatQuest with Josh Starmer
Короткие ролики, которые ставят всё на свои места. Идеально, когда нужно быстро понять конкретную тему по ML или статистике.
🔵🟤3Blue1Brown
Лучший в своем жанре (короткие ролики с анимацией) канал.
Тут можно найти плейлисты по множеству тем – от мат анализа до нейронных сетей.
🧑💻 freeCodeCamp.org
Длинные обучающие ролики в формате быстрых курсов. Любителям такого формата точно понравится. Например есть курс по основам А/Б тестов за 4 часа
🛠 Инструменты и практика
🏫Канал ФКН ВШЭ с записями занятий
Именно этот канал стал топ-1 по времени просмотра у меня в 2025 на ютубе.
Супер ресурс с курсами легендарного факультета. Вдобавок есть вики страничка, где к большинству курсов можно найти не только записи занятий, но и домашки, которые традиционно на ФКН мега полезные и насыщенные. Когда-нибудь сделаю пост с подборкой моих любимых курсов отсюда.
💻 Ryan & Matt Data Science
Недооцененный канал с кучей полезных роликов. Много плейлистов, позволяющих изучать новые разделы с нуля на практических примерах, например, плейлист по pandas.
🚀 Карьера
🌎Noukash
Один из лучших каналов про карьеру в IT. Автор прошел путь от вката в аналитику из другой профессии до офферов на Senior позиции в Кремниевой долине.
Канал многогранен и здесь можно найти как видео по А/Б тестам для новичков, так и ролик про выгорание и методы борьбы с ним.
А какие каналы смотрите вы?
Пишите в комментариях!💬
Ставьте
🔥 если подборка полезна вам
❤️ если интересно видеть другие подборки материалов / каналов от меня
🤩 если ваш набор каналов пересекается с моим
#анализ_данных
#карьера
#образование
#подборка
Сегодня воскресенье, поэтому решил не грузить вас объемными постами, а просто поделиться подборкой каналов про анализ данных и карьеру на
📚 Фундамент и теория
Короткие ролики, которые ставят всё на свои места. Идеально, когда нужно быстро понять конкретную тему по ML или статистике.
🔵🟤3Blue1Brown
Лучший в своем жанре (короткие ролики с анимацией) канал.
Тут можно найти плейлисты по множеству тем – от мат анализа до нейронных сетей.
Длинные обучающие ролики в формате быстрых курсов. Любителям такого формата точно понравится. Например есть курс по основам А/Б тестов за 4 часа
🛠 Инструменты и практика
🏫Канал ФКН ВШЭ с записями занятий
Именно этот канал стал топ-1 по времени просмотра у меня в 2025 на ютубе.
Супер ресурс с курсами легендарного факультета. Вдобавок есть вики страничка, где к большинству курсов можно найти не только записи занятий, но и домашки, которые традиционно на ФКН мега полезные и насыщенные. Когда-нибудь сделаю пост с подборкой моих любимых курсов отсюда.
Недооцененный канал с кучей полезных роликов. Много плейлистов, позволяющих изучать новые разделы с нуля на практических примерах, например, плейлист по pandas.
🌎Noukash
Один из лучших каналов про карьеру в IT. Автор прошел путь от вката в аналитику из другой профессии до офферов на Senior позиции в Кремниевой долине.
Канал многогранен и здесь можно найти как видео по А/Б тестам для новичков, так и ролик про выгорание и методы борьбы с ним.
А какие каналы смотрите вы?
Пишите в комментариях!
Ставьте
🔥 если подборка полезна вам
❤️ если интересно видеть другие подборки материалов / каналов от меня
🤩 если ваш набор каналов пересекается с моим
#анализ_данных
#карьера
#образование
#подборка
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥17❤6🤩2😍1😈1
Корреляция ≠ Причинность: как не обмануться цифрами 📈
Заголовки вроде «Красное вино продлевает жизнь» часто основаны лишь на корреляции, которую выдают за причину. Путаница между этими понятиями — частая ошибка в анализе и топовый вопрос на собеседованиях аналитиков и ds (по моим наблюдениям входит в топ-10 самых популярных🔝 )
Суть проблемы🚨
Высокая корреляция — это сигнал к размышлению, а не готовый вывод. За ней может стоять:
1. Скрытая переменная: жара → рост продаж мороженого и числа утоплений. В таком случае корреляция между продажами мороженого и количеством утоплений будет высокой, но первое явно не является причиной второго.
2. Обратная причинность: не прием таблеток → смерть, а болезнь → приём таблеток + смерть.
3. Случайное совпадение: если перебрать тысячи наборов данных, найдутся идеальные тренды, как акции Barclays и число экологов в штате Нью-Джерси (на картинке). Множество подобных примеров собрано на этом сайте.
4. Истинная причинно-следственная связь: как раз то, что нужно уметь распознавать аналитикам.
❗️ Таким образом, из причинно-следственной связи следует корреляция, а вот обратное верно далеко не всегда.
Как искать причинность? Практические методы👍
1. Золотой стандарт: A/B-тесты 🆎
Рандомизация на тестовую и контрольную группы позволяет изолировать эффект. Статистическая проверка результатов часто основана на линейной регрессии, что тесно связывает эксперимент с базовой аналитикой.
2. Если эксперимент невозможен (работа с историческими, рыночными данными), применяют:
- Проверку временного порядка: Причина всегда предшествует следствию. Если это правило не выполняется – можно не продолжать анализ.
- Контроль смешивающих факторов: Внеся в модель (например, через регрессию) возможные скрытые переменные (например, социальный статус), можно увидеть, исчезнет ли исходная связь.
- Поиск инструментальных переменных и другие квазиэкспериментальные методы для приближения к чистоте эксперимента.
Если интересно узнать больше про эконометрические способы детекции эффектов воздействия, ставьте 🐳
Еще могу порекомендовать данный канал, он специализируется на этом.
Корреляция — начало расследования, а не его итог. Чтобы говорить о причине, нужны доказательства, которые можно получить с помощью экспериментов 🔬
А встречали ли вы в своих проектах / задачах кейсы с высокой корреляцией, за которой не стояла причинно-следственная связь?
Пишите в комментариях!💬
Ставьте
🔥 если было полезно
❤️ если интересны разборы популярных вопросов с собеседований
🤩 если хотите увидеть посты про корреляционный и каузальный анализ
#аналитические_методы
#статистика
#собеседования
Заголовки вроде «Красное вино продлевает жизнь» часто основаны лишь на корреляции, которую выдают за причину. Путаница между этими понятиями — частая ошибка в анализе и топовый вопрос на собеседованиях аналитиков и ds (по моим наблюдениям входит в топ-10 самых популярных
Суть проблемы
Высокая корреляция — это сигнал к размышлению, а не готовый вывод. За ней может стоять:
1. Скрытая переменная: жара → рост продаж мороженого и числа утоплений. В таком случае корреляция между продажами мороженого и количеством утоплений будет высокой, но первое явно не является причиной второго.
2. Обратная причинность: не прием таблеток → смерть, а болезнь → приём таблеток + смерть.
3. Случайное совпадение: если перебрать тысячи наборов данных, найдутся идеальные тренды, как акции Barclays и число экологов в штате Нью-Джерси (на картинке). Множество подобных примеров собрано на этом сайте.
4. Истинная причинно-следственная связь: как раз то, что нужно уметь распознавать аналитикам.
Как искать причинность? Практические методы
1. Золотой стандарт: A/B-тесты 🆎
Рандомизация на тестовую и контрольную группы позволяет изолировать эффект. Статистическая проверка результатов часто основана на линейной регрессии, что тесно связывает эксперимент с базовой аналитикой.
2. Если эксперимент невозможен (работа с историческими, рыночными данными), применяют:
- Проверку временного порядка: Причина всегда предшествует следствию. Если это правило не выполняется – можно не продолжать анализ.
- Контроль смешивающих факторов: Внеся в модель (например, через регрессию) возможные скрытые переменные (например, социальный статус), можно увидеть, исчезнет ли исходная связь.
- Поиск инструментальных переменных и другие квазиэкспериментальные методы для приближения к чистоте эксперимента.
Если интересно узнать больше про эконометрические способы детекции эффектов воздействия, ставьте 🐳
Еще могу порекомендовать данный канал, он специализируется на этом.
Корреляция — начало расследования, а не его итог. Чтобы говорить о причине, нужны доказательства, которые можно получить с помощью экспериментов 🔬
А встречали ли вы в своих проектах / задачах кейсы с высокой корреляцией, за которой не стояла причинно-следственная связь?
Пишите в комментариях!
Ставьте
🔥 если было полезно
❤️ если интересны разборы популярных вопросов с собеседований
🤩 если хотите увидеть посты про корреляционный и каузальный анализ
#аналитические_методы
#статистика
#собеседования
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🐳6🤩4🔥3😈1😨1
Мой топ: как я подбираю визуализацию и библиотеку под неё 📊
Визуальный анализ — база любого проекта.
Для частых задач я собрал свой набор графиков, где миксую matplotlib, seaborn и plotly.
Сегодня расскажу, какую библиотеку и под какой сценарий беру.
Гистограмма распределения с выделением мер центральной тенденции↗️
Для визуализации распределения я обычно использую seaborn, так как kde-сглаживание и hue-группировка делаются в одну строку. Добавление линий среднего и медианы помогает понять, в каком хвосте выбросы. Если среднее заметно правее/левее медианы — почти наверняка в этой стороне есть выбросы. На первой картинке видно: хвост справа тянет среднее за собой.
Распределения + выбросы🔭
Еще для изучения распределений и детекции выбросов хорошо подходят графики boxplot, их я тоже строю с помощью seaborn. Причем можно как просто визуализировать распределение одной непрерывной переменной, так и разбить выборку по какому-нибудь категориальному признаку и сравнить распределения - пример на второй картинке. Еще я делал пост про более сложную визуализацию, которая помогает хорошо отследить взаимосвязи между несколькими переменными.
Временные ряды📈
Для временных рядов я обычно использую plotly line.
Plotly позволяет быстро подсветить максимумы/минимумы. Я могу навести курсор и сразу увидеть дату и значение без дополнительного кода — это ускоряет поиск аномалий.
Пример использования на третьей картинке. Также есть пост про визуализацию нескольких рядов сразу для сравнения.
Столбчатые диаграммы📊
Для столбчатых диаграмм я использую как seaborn, так и plotly. Seaborn в основном предпочитаю в случаях, когда надо визуализировать частотность (countplot) или сравнить средние/медианы по группам (группировка + barplot) - примеры на 4й и 5й картинках.
В plotly легко сделать анимированные или накопительные доли, а интерактивность помогает смотреть структуру без тонны графиков.
Пример на шестой картинке.
Тепловая карта корреляций🎨
Для анализа корреляций идеально подходит heatmap от seaborn. Чем выше корреляция - тем ярче заливка ячейки. Пример на седьмой картинке.
Код для построения всех этих графиков с датасетами выложил на kaggle.
А какую библиотеку для визуализации предпочитаете вы? Или, как и я, используете разные?
Пишите в комментариях💬
Ставьте
🔥 если было полезно
❤️ если интересны посты про визуализацию данных
🤩 если согласны с моим топом
#визуализация_данных
#python
#matplotlib
#seaborn
#plotly
Визуальный анализ — база любого проекта.
Для частых задач я собрал свой набор графиков, где миксую matplotlib, seaborn и plotly.
Сегодня расскажу, какую библиотеку и под какой сценарий беру.
Гистограмма распределения с выделением мер центральной тенденции
Для визуализации распределения я обычно использую seaborn, так как kde-сглаживание и hue-группировка делаются в одну строку. Добавление линий среднего и медианы помогает понять, в каком хвосте выбросы. Если среднее заметно правее/левее медианы — почти наверняка в этой стороне есть выбросы. На первой картинке видно: хвост справа тянет среднее за собой.
Распределения + выбросы
Еще для изучения распределений и детекции выбросов хорошо подходят графики boxplot, их я тоже строю с помощью seaborn. Причем можно как просто визуализировать распределение одной непрерывной переменной, так и разбить выборку по какому-нибудь категориальному признаку и сравнить распределения - пример на второй картинке. Еще я делал пост про более сложную визуализацию, которая помогает хорошо отследить взаимосвязи между несколькими переменными.
Временные ряды
Для временных рядов я обычно использую plotly line.
Plotly позволяет быстро подсветить максимумы/минимумы. Я могу навести курсор и сразу увидеть дату и значение без дополнительного кода — это ускоряет поиск аномалий.
Пример использования на третьей картинке. Также есть пост про визуализацию нескольких рядов сразу для сравнения.
Столбчатые диаграммы
Для столбчатых диаграмм я использую как seaborn, так и plotly. Seaborn в основном предпочитаю в случаях, когда надо визуализировать частотность (countplot) или сравнить средние/медианы по группам (группировка + barplot) - примеры на 4й и 5й картинках.
В plotly легко сделать анимированные или накопительные доли, а интерактивность помогает смотреть структуру без тонны графиков.
Пример на шестой картинке.
Тепловая карта корреляций
Для анализа корреляций идеально подходит heatmap от seaborn. Чем выше корреляция - тем ярче заливка ячейки. Пример на седьмой картинке.
Код для построения всех этих графиков с датасетами выложил на kaggle.
А какую библиотеку для визуализации предпочитаете вы? Или, как и я, используете разные?
Пишите в комментариях
Ставьте
❤️ если интересны посты про визуализацию данных
🤩 если согласны с моим топом
#визуализация_данных
#python
#matplotlib
#seaborn
#plotly
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15❤1☃1🐳1
Разбор кейса: сырые данные, коммуникация и вайбкодинг — как я собрал дашборд 📈
Контекст
Недавно наша команда получила доступ к общебанковской CRM. В ней хранятся данные по всем кампаниям продаж — настоящий кладезь информации.
Как только коллеги из бизнес‑подразделения узнали об этом, они пришли к нам с запросом: «Сделайте дашборд по кампаниям другого департамента. Хотим понять, влияют ли их лиды на продажи нашего продукта».
На всякий случай напишу:
Лид (конкретно в моей сфере ) — это клиент, который соответствует критериям потенциально склонного к покупке продукта. Информация о таких клиентах передается сейлзам, которые предлагают потенциальным клиентам продукты.
Кампания продаж — логика отбора лидов + процесс постановки задач по этой логике сейлзам.
Задача звучала просто: собрать статистику за последний год и оценить эффект. Но на практике всё оказалось куда интереснее.
Первые шаги▶️
Начал выгружать данные — и сразу две проблемы:
1. Кампании без названий (одни описания).
2. Дубликаты лидов (на одного клиента — несколько лидов за короткое время).
Дубликаты схлопнул скриптом. С кампаниями без названий помог аналитик из того департамента: объяснил, что это тестовые/нетиповые кампании, и я объединил их.
Инструменты и решение⚙️
Когда данные были приведены в порядок, встал вопрос визуализации. Я насмотрелся красивых примеров Plotly Dash и решил попробовать, чтобы заодно попрактиковаться в Plotly.
Но синтаксис Dash оказался очень неприятным. Тогда я решил прибегнуть к вайбкодингу, но не напрямую:
- В ipynb построил графики и таблицы.
- Скопировал код в нейросеть с описанием нужной структуры
- Получил код, запустил — что-то съехало. Уточнил промт, через пару итераций заработало.
- Каждый раз сверял расчёты, чтобы нейросеть не исказила логику.
В итоге нейросеть написала 80% кода, а я сэкономил несколько дней.
Что получилось на дашборде👀
На дашборде несколько блоков — каждый закрывает свой вопрос:
1. Таблица с детализацией по кампаниям (лиды, сделки, отказы, доход) + фильтры — фото 1.
2. Динамика доходов: наши клиенты vs клиенты с лидами — фото 2.
3. Работа с лидами: выставлено vs отработано по месяцам — фото 3.
4. Сделки и отказы по месяцам — фото 4.
5. Документация с формулами — чтобы дашборд не был чёрным ящиком.
Польза для бизнеса🏆
Благодаря дашборду коллеги из бизнес‑команды сделали несколько важных выводов:
- Доля «лидовых» доходов росла в течение 2025 года. Значит, есть потенциал для совместной работы департаментов.
- Нашлись кампании-чемпионы, регулярно приводившие клиентов к покупке нашего продукта. Логику этих кампаний будут анализировать, чтобы запустить похожие.
- Процент отработанных лидов и скорость отработки оказались на высоком уровне, значит сейлзы не забывают про лиды.
Но главное — дашборд стал рабочим инструментом. Коллега из бизнеса теперь заходит в него перед встречами с тем самым департаментом и использует наши расчёты, чтобы аргументированно обсуждать эффективность совместной работы.
Рефлексия: что пошло не так и чему я научился🤔
На самом деле не всё прошло гладко с первого раза. Когда я показал первую версию дашборда коллеге из бизнеса, его ожидания не совпали с реальностью. Оказалось, что заказчику важно видеть немного другие разрезы, другие сравнения. Пришлось переделывать.
Из этого я вынес два урока:
1. ТЗ нужно уточнять до мелочей. Не просто «сделай дашборд по кампаниям», а «какие метрики, в каких разрезах, с какой периодичностью ты будешь смотреть». Лучше потратить час на уточнение в начале, чем неделю на переделку в конце.
2. Двигаться итеративно. Вместо того чтобы две недели чистить данные и строить всё сразу, стоило показать сырые данные, потом простые графики, согласовать метрики, и только потом дотачивать визуал. Тогда не пришлось бы переделывать.
А вы сталкивались с ситуацией, когда ожидания заказчика и реальность расходились?
Делитесь опытом в комментариях💬
Ставьте
🤩 если понравилась рубрика с разбором кейсов с моей работы
❤️ если интересны посты про то, как я использую вайбкодинг
🔥 если было полезно
#из_моей_практики
#разбор_кейса
#plotly
Контекст
Недавно наша команда получила доступ к общебанковской CRM. В ней хранятся данные по всем кампаниям продаж — настоящий кладезь информации.
Как только коллеги из бизнес‑подразделения узнали об этом, они пришли к нам с запросом: «Сделайте дашборд по кампаниям другого департамента. Хотим понять, влияют ли их лиды на продажи нашего продукта».
На всякий случай напишу:
Лид (конкретно в моей сфере ) — это клиент, который соответствует критериям потенциально склонного к покупке продукта. Информация о таких клиентах передается сейлзам, которые предлагают потенциальным клиентам продукты.
Кампания продаж — логика отбора лидов + процесс постановки задач по этой логике сейлзам.
Задача звучала просто: собрать статистику за последний год и оценить эффект. Но на практике всё оказалось куда интереснее.
Первые шаги
Начал выгружать данные — и сразу две проблемы:
1. Кампании без названий (одни описания).
2. Дубликаты лидов (на одного клиента — несколько лидов за короткое время).
Дубликаты схлопнул скриптом. С кампаниями без названий помог аналитик из того департамента: объяснил, что это тестовые/нетиповые кампании, и я объединил их.
Инструменты и решение
Когда данные были приведены в порядок, встал вопрос визуализации. Я насмотрелся красивых примеров Plotly Dash и решил попробовать, чтобы заодно попрактиковаться в Plotly.
Но синтаксис Dash оказался очень неприятным. Тогда я решил прибегнуть к вайбкодингу, но не напрямую:
- В ipynb построил графики и таблицы.
- Скопировал код в нейросеть с описанием нужной структуры
- Получил код, запустил — что-то съехало. Уточнил промт, через пару итераций заработало.
- Каждый раз сверял расчёты, чтобы нейросеть не исказила логику.
В итоге нейросеть написала 80% кода, а я сэкономил несколько дней.
Что получилось на дашборде
На дашборде несколько блоков — каждый закрывает свой вопрос:
1. Таблица с детализацией по кампаниям (лиды, сделки, отказы, доход) + фильтры — фото 1.
2. Динамика доходов: наши клиенты vs клиенты с лидами — фото 2.
3. Работа с лидами: выставлено vs отработано по месяцам — фото 3.
4. Сделки и отказы по месяцам — фото 4.
5. Документация с формулами — чтобы дашборд не был чёрным ящиком.
Польза для бизнеса
Благодаря дашборду коллеги из бизнес‑команды сделали несколько важных выводов:
- Доля «лидовых» доходов росла в течение 2025 года. Значит, есть потенциал для совместной работы департаментов.
- Нашлись кампании-чемпионы, регулярно приводившие клиентов к покупке нашего продукта. Логику этих кампаний будут анализировать, чтобы запустить похожие.
- Процент отработанных лидов и скорость отработки оказались на высоком уровне, значит сейлзы не забывают про лиды.
Но главное — дашборд стал рабочим инструментом. Коллега из бизнеса теперь заходит в него перед встречами с тем самым департаментом и использует наши расчёты, чтобы аргументированно обсуждать эффективность совместной работы.
Рефлексия: что пошло не так и чему я научился
На самом деле не всё прошло гладко с первого раза. Когда я показал первую версию дашборда коллеге из бизнеса, его ожидания не совпали с реальностью. Оказалось, что заказчику важно видеть немного другие разрезы, другие сравнения. Пришлось переделывать.
Из этого я вынес два урока:
1. ТЗ нужно уточнять до мелочей. Не просто «сделай дашборд по кампаниям», а «какие метрики, в каких разрезах, с какой периодичностью ты будешь смотреть». Лучше потратить час на уточнение в начале, чем неделю на переделку в конце.
2. Двигаться итеративно. Вместо того чтобы две недели чистить данные и строить всё сразу, стоило показать сырые данные, потом простые графики, согласовать метрики, и только потом дотачивать визуал. Тогда не пришлось бы переделывать.
А вы сталкивались с ситуацией, когда ожидания заказчика и реальность расходились?
Делитесь опытом в комментариях
Ставьте
🤩 если понравилась рубрика с разбором кейсов с моей работы
❤️ если интересны посты про то, как я использую вайбкодинг
🔥 если было полезно
#из_моей_практики
#разбор_кейса
#plotly
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩14🔥2❤1👏1😈1
Путь в аналитику: два взгляда на инвестиции в себя 🐂
Когда люди хотят вкатиться в аналитику, перед ними вырисовывается дилемма: выбрать бесплатные источники (ютуб, stepik, открытые лекции) или готовые курсы, где всё разложено по полочкам — Python, SQL, статистика и иногда даже помощь в поиске первой работы.
У каждого пути есть свои преимущества и подводные камни.
Поэтому мы с Машей, автором канала RockAnalyst, решили подискутировать на эту тему.
Я расскажу, как вошёл в аналитику без вложений, и почему иногда отсутствие денег на старте — это суперсила.
А Маша расскажет про свой опыт обучения на платных курсах — со всеми плюсами, минусами и неочевидными последствиями таких инвестиций.
Мой путь🗺
Первый этап: знакомство со сферой🔍
На 1-м курсе университета был курс по основам Python, но для новичков он шёл тяжело. Летом я сам перепрошёл всё с нуля по курсам «Поколение Python» на Stepik и Ютубу. Это заложило базу и понимание, что аналитика — моё.
Второй этап: погружение🤿
Изучив Python до хорошего уровня, взялся за курс «Основы машинного обучения» Е. Соколова (ФКН ВШЭ). Он полностью бесплатный на вики-странице ФКН. Идеальный уровень для аналитика, не ML-инженера (для таких есть более глубокий курс МО-1).
Статистику проходил в универе, а позже для углубления обращался к курсам «Основы статистики».
По SQL есть достаточно много открытых материалов, но я выбрал бесплатный курс Карпова и не пожалел. Для нарешивания использую тренажер sql academy.
Третий этап: подготовка к работе🚀
Пет-проекты — must have. Сделал с командой проект по данным с Kaggle (поддержанные авто): EDA, проверка гипотез, линейные модели. Благодаря этому проекту я не только прокачался в EDA и базовом ML, но и обрел проект, о котором можно рассказать на собеседовании.
Рекомендации🔝
Все вышеупомянутые курсы могу смело рекомендовать, они хороши для старта.
Если хочется посмотреть что-то на ютубе, есть вот такая подборка, да и в целом там можно найти туториалы по любой теме, особенно на английском.
Также уверенно могу сказать, что без практики знания очень быстро стираются, поэтому рекомендую после прохождения курсов регулярно практиковаться. Для Python и SQL есть много хороших тренажеров (SQL academy, Python tutor). В ml можно практиковаться, участвуя в соревнованиях на kaggle. Полезно изучать решения топ-авторов, например cdeotte.
Главные преимущества бесплатного обучения➕
Нет риска: не понравилось - перестал смотреть и нашел другой курс
Сообщество: на kaggle есть дискуссии, на Stepik можно найти решения и сравнить со своими вариантами.
Что прокачаете вдобавок к хард-скиллам:
• Самостоятельный поиск — ключевой навык аналитика. На платных курсах его часто «выключают», давая всё готовое.
• Дисциплина — вы сами управляете графиком и мотивацией, а это ценнейший софт-скилл.
Мой путь доказывает, что главное в наше время — не деньги, а любознательность, упорство и умение искать.
Бесплатные курсы — это полноценная образовательная среда, а не вынужденная замена.
А какой у вас опыт?
Делитесь в комментариях!💬
А теперь — вторая сторона медали. Обязательно прочитайте пост Маши о ее опыте обучения на платных курсах.
❗️ Важное дополнение
Весь этот пост — про вход в профессию. Для старта бесплатных ресурсов действительно достаточно, и мой опыт это подтверждает. Но когда уже работаешь аналитиком, потребности меняются: хочется глубже разобраться в конкретных темах, получить структурированные знания от практиков и разобрать сложные кейсы. В таких ситуациях выбор в пользу открытых курсов уже не так очевиден и платные курсы могут стать подходящим вариантом.
Ставьте:
🔥 если было полезно
❤️ если интересны посты про курсы
🤩 если интересны подобные обсуждения с авторами других каналов
#старт_в_аналитике
#софт_скиллы
#образование
#карьера
Когда люди хотят вкатиться в аналитику, перед ними вырисовывается дилемма: выбрать бесплатные источники (ютуб, stepik, открытые лекции) или готовые курсы, где всё разложено по полочкам — Python, SQL, статистика и иногда даже помощь в поиске первой работы.
У каждого пути есть свои преимущества и подводные камни.
Поэтому мы с Машей, автором канала RockAnalyst, решили подискутировать на эту тему.
Я расскажу, как вошёл в аналитику без вложений, и почему иногда отсутствие денег на старте — это суперсила.
А Маша расскажет про свой опыт обучения на платных курсах — со всеми плюсами, минусами и неочевидными последствиями таких инвестиций.
Мой путь
Первый этап: знакомство со сферой
На 1-м курсе университета был курс по основам Python, но для новичков он шёл тяжело. Летом я сам перепрошёл всё с нуля по курсам «Поколение Python» на Stepik и Ютубу. Это заложило базу и понимание, что аналитика — моё.
Второй этап: погружение
Изучив Python до хорошего уровня, взялся за курс «Основы машинного обучения» Е. Соколова (ФКН ВШЭ). Он полностью бесплатный на вики-странице ФКН. Идеальный уровень для аналитика, не ML-инженера (для таких есть более глубокий курс МО-1).
Статистику проходил в универе, а позже для углубления обращался к курсам «Основы статистики».
По SQL есть достаточно много открытых материалов, но я выбрал бесплатный курс Карпова и не пожалел. Для нарешивания использую тренажер sql academy.
Третий этап: подготовка к работе
Пет-проекты — must have. Сделал с командой проект по данным с Kaggle (поддержанные авто): EDA, проверка гипотез, линейные модели. Благодаря этому проекту я не только прокачался в EDA и базовом ML, но и обрел проект, о котором можно рассказать на собеседовании.
Рекомендации
Все вышеупомянутые курсы могу смело рекомендовать, они хороши для старта.
Если хочется посмотреть что-то на ютубе, есть вот такая подборка, да и в целом там можно найти туториалы по любой теме, особенно на английском.
Также уверенно могу сказать, что без практики знания очень быстро стираются, поэтому рекомендую после прохождения курсов регулярно практиковаться. Для Python и SQL есть много хороших тренажеров (SQL academy, Python tutor). В ml можно практиковаться, участвуя в соревнованиях на kaggle. Полезно изучать решения топ-авторов, например cdeotte.
Главные преимущества бесплатного обучения
Нет риска: не понравилось - перестал смотреть и нашел другой курс
Сообщество: на kaggle есть дискуссии, на Stepik можно найти решения и сравнить со своими вариантами.
Что прокачаете вдобавок к хард-скиллам:
• Самостоятельный поиск — ключевой навык аналитика. На платных курсах его часто «выключают», давая всё готовое.
• Дисциплина — вы сами управляете графиком и мотивацией, а это ценнейший софт-скилл.
Мой путь доказывает, что главное в наше время — не деньги, а любознательность, упорство и умение искать.
Бесплатные курсы — это полноценная образовательная среда, а не вынужденная замена.
А какой у вас опыт?
Делитесь в комментариях!
А теперь — вторая сторона медали. Обязательно прочитайте пост Маши о ее опыте обучения на платных курсах.
Весь этот пост — про вход в профессию. Для старта бесплатных ресурсов действительно достаточно, и мой опыт это подтверждает. Но когда уже работаешь аналитиком, потребности меняются: хочется глубже разобраться в конкретных темах, получить структурированные знания от практиков и разобрать сложные кейсы. В таких ситуациях выбор в пользу открытых курсов уже не так очевиден и платные курсы могут стать подходящим вариантом.
Ставьте:
🔥 если было полезно
❤️ если интересны посты про курсы
🤩 если интересны подобные обсуждения с авторами других каналов
#старт_в_аналитике
#софт_скиллы
#образование
#карьера
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13🤩8❤4☃1⚡1
Идём учить A/B-тесты ⚡️
Недавно задумался о том, в каком разделе аналитики мне больше всего не хватает знаний, и осознал, что A/B тесты на 1 месте с отрывом. Я знаю теорию и даже решал какие-то задачи, но глобального понимания процесса не хватает. Хочется уверенно определять оптимальный метод для эксперимента, правильно интерпретировать результаты.
Я решил, что так это оставлять нельзя и начал ресерч, с целью найти лучшие курсы по A/B и выбрать один из них для себя.
✍️ В первую очередь я ориентировался на отзывы аналитиков, прошедших курс, и программу. Мне хотелось найти курс, освоив который я смогу закрыть все пробелы в теории и проработать на практике изученные методы.
✅ В итоге мой выбор пал на курс Павла Бухтика. Курс максимально практико-ориентированный: студенты проводят А/B тесты от формулировки цели эксперимента до интерпретации результатов.
Курсом довольны как начинающие, так и опытные аналитики. Для первых - это возможность погрузиться в эксперименты с нуля, для вторых - отличный способ расширить свой кругозор и изучить продвинутые методы.
🚀 Павел имеет 7+ лет опыта работы и обладает широчайшей экспертизой в экспериментах. Он сам ведет занятия, проверяет домашки и дает обратную связь.
⏰ Осталось 2 дня, чтобы оставить заявку. Следующий поток будет только осенью, поэтому рекомендую не откладывать!
Я хочу прокачаться в A/B, поэтому залетаю на курс. Если тоже хотите - погнали вместе, заявку можно оставить тут
Сегодня уже первая встреча потока, а в понедельник – первое занятие. Осталось всего 5 мест
❗️ Важно: мое решение пойти на курс не противоречит предыдущему посту. Я чувствую, что сейчас мне нужно укрепить свои знания в A/B и считаю, что данный курс - оптимальный вариант для достижения этой цели.
#образование
#карьера
Недавно задумался о том, в каком разделе аналитики мне больше всего не хватает знаний, и осознал, что A/B тесты на 1 месте с отрывом. Я знаю теорию и даже решал какие-то задачи, но глобального понимания процесса не хватает. Хочется уверенно определять оптимальный метод для эксперимента, правильно интерпретировать результаты.
Я решил, что так это оставлять нельзя и начал ресерч, с целью найти лучшие курсы по A/B и выбрать один из них для себя.
Курсом довольны как начинающие, так и опытные аналитики. Для первых - это возможность погрузиться в эксперименты с нуля, для вторых - отличный способ расширить свой кругозор и изучить продвинутые методы.
Я хочу прокачаться в A/B, поэтому залетаю на курс. Если тоже хотите - погнали вместе, заявку можно оставить тут
Сегодня уже первая встреча потока, а в понедельник – первое занятие. Осталось всего 5 мест
#образование
#карьера
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9❤4🌭3👻1🎄1👾1
Парадокс Симпсона: ловушка, которую обязан знать каждый аналитик ⚡️
Представьте такую ситуацию: вы исследуете данные, в которых есть 2 группы объектов, в каждой из которых прослеживается одна и та же тенденция. Но когда вы объединяете данные, направление зависимости меняется на противоположное. Поначалу может показаться, что в данных ошибка, но на самом деле это один из известных статистических парадоксов — парадокс Симпсона.
Парадокс становится возможен, когда каждый объект имеет какой-то существенный признак, и внутри групп распределение по этому признаку неравномерное.
Рассмотрим парадокс на примере🏀
Пусть некий баскетболист в сезоне 24/25 имел такую статистику бросков:
Двухочковые: 80 попаданий из 100 бросков => точность = 80%
Трехочковые: 10 попаданий из 100 бросков => точность = 10%
А в сезоне 25/26 у него такая статистика:
Двухочковые: 41 попадание из 50 бросков => точность = 82%
Трехочковые: 200 попаданий из 500 бросков => точность = 40%
82% > 80% и 40% > 10%. Хочется сделать вывод, что точность баскетболиста улучшилась. Но посмотрим на суммарный процент попаданий:
В сезоне 24/25: 90/200 = 0,45
В сезоне 25/26: 241/550 = 0,438
Как ни странно, точность снизилась.
Почему так произошло?🤔
Все дело в том, что соотношение бросков между двухочковыми и трехочковыми не сохранилось.
Пример с интернет-магазином🛒
В прошлом году интернет-магазин имел:
• Десктоп: 1000 посетителей, конверсия 10% (средний чек 50₽)
• Мобилка: 1000 посетителей, конверсия 5% (средний чек 200₽)
Общая конверсия 7,5%, выручка 15 000₽.
В текущем году конверсия упала на каждом типе устройства:
• Десктоп: 2000 посетителей, конверсия 9% (чек 50₽)
• Мобилка: 500 посетителей, конверсия 4% (чек 200₽)
Общая конверсия выросла до 8% (из-за увеличения доли десктопов с высокой конверсией), но выручка упала до 13 000₽ (так как основной трафик теперь идёт через десктоп с низким чеком).
Бонус: здесь разобрал A/B-тест на данных отелей. Конверсия растёт по регионам, но падает в сумме — классический парадокс Симпсона. Можно зайти и покрутить данные.
Почему этот парадокс важен для аналитиков📢
• Нельзя доверять только агрегированным данным, нужно анализировать страты.
• Особенно критично при оценке эффективности (рекламные кампании, лечение и т.п.).
• Про парадокс любят спрашивать на собеседованиях – стоит понимать суть и уметь построить пример.
Как не попасть в ловушку🎣
• Всегда смотреть на данные в разрезе важных признаков (пол, возраст, регион, тип устройства).
• Использовать стратификацию перед анализом.
• Помнить про скоринг склонностей (PSM – про него тоже когда-нибудь расскажу), если группы несбалансированны.
А вы сталкивались с парадоксом Симпсона в своей практике?
Делитесь в комментариях!💬
Ставьте:
🔥 если было полезно
❤️ если интересны разборы популярных вопросов с собеседований
🤩 если интересны посты про статистику
#аналитические_методы
#статистика
#собеседования
Представьте такую ситуацию: вы исследуете данные, в которых есть 2 группы объектов, в каждой из которых прослеживается одна и та же тенденция. Но когда вы объединяете данные, направление зависимости меняется на противоположное. Поначалу может показаться, что в данных ошибка, но на самом деле это один из известных статистических парадоксов — парадокс Симпсона.
Парадокс становится возможен, когда каждый объект имеет какой-то существенный признак, и внутри групп распределение по этому признаку неравномерное.
Рассмотрим парадокс на примере
Пусть некий баскетболист в сезоне 24/25 имел такую статистику бросков:
Двухочковые: 80 попаданий из 100 бросков => точность = 80%
Трехочковые: 10 попаданий из 100 бросков => точность = 10%
А в сезоне 25/26 у него такая статистика:
Двухочковые: 41 попадание из 50 бросков => точность = 82%
Трехочковые: 200 попаданий из 500 бросков => точность = 40%
82% > 80% и 40% > 10%. Хочется сделать вывод, что точность баскетболиста улучшилась. Но посмотрим на суммарный процент попаданий:
В сезоне 24/25: 90/200 = 0,45
В сезоне 25/26: 241/550 = 0,438
Как ни странно, точность снизилась.
Почему так произошло?
Все дело в том, что соотношение бросков между двухочковыми и трехочковыми не сохранилось.
Пример с интернет-магазином
В прошлом году интернет-магазин имел:
• Десктоп: 1000 посетителей, конверсия 10% (средний чек 50₽)
• Мобилка: 1000 посетителей, конверсия 5% (средний чек 200₽)
Общая конверсия 7,5%, выручка 15 000₽.
В текущем году конверсия упала на каждом типе устройства:
• Десктоп: 2000 посетителей, конверсия 9% (чек 50₽)
• Мобилка: 500 посетителей, конверсия 4% (чек 200₽)
Общая конверсия выросла до 8% (из-за увеличения доли десктопов с высокой конверсией), но выручка упала до 13 000₽ (так как основной трафик теперь идёт через десктоп с низким чеком).
Бонус: здесь разобрал A/B-тест на данных отелей. Конверсия растёт по регионам, но падает в сумме — классический парадокс Симпсона. Можно зайти и покрутить данные.
Почему этот парадокс важен для аналитиков
• Нельзя доверять только агрегированным данным, нужно анализировать страты.
• Особенно критично при оценке эффективности (рекламные кампании, лечение и т.п.).
• Про парадокс любят спрашивать на собеседованиях – стоит понимать суть и уметь построить пример.
Как не попасть в ловушку
• Всегда смотреть на данные в разрезе важных признаков (пол, возраст, регион, тип устройства).
• Использовать стратификацию перед анализом.
• Помнить про скоринг склонностей (PSM – про него тоже когда-нибудь расскажу), если группы несбалансированны.
А вы сталкивались с парадоксом Симпсона в своей практике?
Делитесь в комментариях!
Ставьте:
🔥 если было полезно
❤️ если интересны разборы популярных вопросов с собеседований
🤩 если интересны посты про статистику
#аналитические_методы
#статистика
#собеседования
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10❤5👏3🤣2🤯1😈1
Самая скучная, но самая важная привычка в моей работе 🥱
Думаю, каждый из нас хоть раз ошибался и отправлял коллеге неверные данные.
У меня это последний раз случилось на прошлой неделе, поэтому я решил составить себе чек-лист для проверки данных перед отправкой, чтобы в следующий раз не попасть впросак. Этим чек-листом поделюсь и с вами, уверен, многим будет полезно.
Уникальность и дубли🛍
Нет ли задвоений там, где их быть не должно (id клиента, номер транзакции и т.п.)
В pandas это легко проверить сравнением shape датафрейма и .nunique() по столбцу.
Также у меня в практике были случаи, когда задвоение оказывалось не ошибкой, а бизнес логикой хранения данных. Если при выгрузке из новой для себя таблицы вы видите неочевидные для себя моменты, лучше обратиться к менеджеру данных, чтобы понять по какой логике происходит заполнение витрины.
Контрольные суммы👆
В данных по платежам, транзакциям часто можно напороться на двойной учет, например, 1 строка – для самой операции, вторая – для перевода между разными статьями баланса банка. В таком случае нас не интересует вторая строка.
Сейчас я когда встречаюсь с новым источником данных по действиям пользователей (переводы, оплаты и т.п.) беру несколько случайных id и смотрю, сколько строк по каждому из них выгружается. Если неожиданно выгружается >1 строки, надо копать глубже.
Также при подсчете сумм, средних и других агрегатов можно смотреть динамику к прошлым периодам для сравнения и проверки подсчетов на адекватность.
Даты📆
В витринах часто бывает так, что определенным объектам присваивают даты из будущего (например, договор заключен, но сделка состоится только через 2 месяца). Важно знать о возможности возникновения таких случаев и быть аккуратным с фильтрами на дату типа > <. Тут опять же помогает понимание устройства витрины.
Также иногда пропуски дат заполняют одной определенной датой, это можно вычислить по большому количеству строк с этой датой.
Выбросы, аномалии и ошибки в данных👻
Для детекции таких случаев можно смотреть max, min и mean по выборке.
Если одно / несколько значений сильно выбивается из общей картины, стоит выяснить, выброс это или же ошибка в данных.
Я однажды встретился с витриной, где значение в поле “номинал” заполнялось менеджерами по продажам со слов клиента руками. При этом не было единых правил и кто-то вносил номинал в млн рублей, кто-то в рублях.
Для перевода в единую шкалу (рубли) я использовал if else алгоритм, где например номиналы = 1 интерпретировал как 1 млн.
Типы данных🗂
Тут объясню на примере. В первые дни работы я еще не знал, что при чтении excel файлов в pandas значения ИНН интерпретируются как числовые, если не задать строковой тип для столбца при чтении файла. Из-за этого я терял некоторых клиентов, так как у них первым знаком ИНН был 0, который терялся при чтении.
Важно всегда проверять типы данных и проверять итоговые файлы на адекватность, иначе риск ошибки очень велик.
Выводы❗️
Я постарался перечислить основные места, в которых можно накосячить.
Главные советы – проверяйте итоговые файлы на адекватность и будьте уверены, что понимаете устройство витрин. Не стесняйтесь задавать вопросы коллегам и менеджерам данных.
Сохраните этот пост в закладки, чтобы перед важной отправкой пробежаться по списку📌
А какие методы используете вы для проверки данных?
Пишите в комментариях!💬
Ставьте:
🔥 если было полезно
❤️ если интересны подобные чек-листы с ошибками
🤩 если просто рады приходу весны
#данные
#чеклист
Думаю, каждый из нас хоть раз ошибался и отправлял коллеге неверные данные.
У меня это последний раз случилось на прошлой неделе, поэтому я решил составить себе чек-лист для проверки данных перед отправкой, чтобы в следующий раз не попасть впросак. Этим чек-листом поделюсь и с вами, уверен, многим будет полезно.
Уникальность и дубли
Нет ли задвоений там, где их быть не должно (id клиента, номер транзакции и т.п.)
В pandas это легко проверить сравнением shape датафрейма и .nunique() по столбцу.
Также у меня в практике были случаи, когда задвоение оказывалось не ошибкой, а бизнес логикой хранения данных. Если при выгрузке из новой для себя таблицы вы видите неочевидные для себя моменты, лучше обратиться к менеджеру данных, чтобы понять по какой логике происходит заполнение витрины.
Контрольные суммы
В данных по платежам, транзакциям часто можно напороться на двойной учет, например, 1 строка – для самой операции, вторая – для перевода между разными статьями баланса банка. В таком случае нас не интересует вторая строка.
Сейчас я когда встречаюсь с новым источником данных по действиям пользователей (переводы, оплаты и т.п.) беру несколько случайных id и смотрю, сколько строк по каждому из них выгружается. Если неожиданно выгружается >1 строки, надо копать глубже.
Также при подсчете сумм, средних и других агрегатов можно смотреть динамику к прошлым периодам для сравнения и проверки подсчетов на адекватность.
Даты
В витринах часто бывает так, что определенным объектам присваивают даты из будущего (например, договор заключен, но сделка состоится только через 2 месяца). Важно знать о возможности возникновения таких случаев и быть аккуратным с фильтрами на дату типа > <. Тут опять же помогает понимание устройства витрины.
Также иногда пропуски дат заполняют одной определенной датой, это можно вычислить по большому количеству строк с этой датой.
Выбросы, аномалии и ошибки в данных
Для детекции таких случаев можно смотреть max, min и mean по выборке.
Если одно / несколько значений сильно выбивается из общей картины, стоит выяснить, выброс это или же ошибка в данных.
Я однажды встретился с витриной, где значение в поле “номинал” заполнялось менеджерами по продажам со слов клиента руками. При этом не было единых правил и кто-то вносил номинал в млн рублей, кто-то в рублях.
Для перевода в единую шкалу (рубли) я использовал if else алгоритм, где например номиналы = 1 интерпретировал как 1 млн.
Типы данных
Тут объясню на примере. В первые дни работы я еще не знал, что при чтении excel файлов в pandas значения ИНН интерпретируются как числовые, если не задать строковой тип для столбца при чтении файла. Из-за этого я терял некоторых клиентов, так как у них первым знаком ИНН был 0, который терялся при чтении.
Важно всегда проверять типы данных и проверять итоговые файлы на адекватность, иначе риск ошибки очень велик.
Выводы
Я постарался перечислить основные места, в которых можно накосячить.
Главные советы – проверяйте итоговые файлы на адекватность и будьте уверены, что понимаете устройство витрин. Не стесняйтесь задавать вопросы коллегам и менеджерам данных.
Сохраните этот пост в закладки, чтобы перед важной отправкой пробежаться по списку
А какие методы используете вы для проверки данных?
Пишите в комментариях!
Ставьте:
🔥 если было полезно
❤️ если интересны подобные чек-листы с ошибками
🤩 если просто рады приходу весны
#данные
#чеклист
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9❤5🤩2🤯1😈1
Мои первые ошибки в аналитике: разбор с последствиями 🫣
Когда я только пришел в аналитику, мои хард скиллы были не на очень высоком уровне, как и софт скиллы, которые я вообще недооценивал.
Сегодня я расскажу 3 реальные истории из первых месяцев работы. Это чисто технические ошибки. А поведенческие ошибки разберет Кристина, автор канала risk & data talks
Неправильно понял бизнес логику поля🔍
В одной из первых задач я использовал витрину валютных операций с полем direction, которое принимает значения buy или sell.
Я подумал, что buy - значит клиент купил валюту у банка за рубли.
Я выгрузил клиентов по критериям и на основе этой выборки мы запустили кампанию продаж.
Через пару дней начала приходить обратная связь о том, что данные ошибочные и на самом деле многие клиенты из выборки не совершали сделки покупки валюты у банка.
Пообщавшись с коллегами, я выяснил, что оказывается buy - значит банк купил валюту у клиента за рубли.
Выборку пришлось пересобрать, а сейлзы потратили время на отработку неверной кампании.
С тех пор я всегда проверяю логику атрибутов, где может быть неоднозначная интерпретация.
Доверился чужому скрипту без проверки⚠️
Другой аналитик написал скрипт для поиска определенных клиентов. Я попросил у него скрипт, чтобы переиспользовать для своей задачи.
Проверять скрипт я сначала не стал, просто запустил на нужном мне временном периоде и отправил продакт менеджеру excel файл с результатом.
Но продакт вернулся ко мне и указал на неоднозначность данных: в файле каждый клиент встречался по несколько раз, чего по условию задачи быть не должно. Оказалось, что аналитик, у которого я взял скрипт, решал немного другую задачу, и код нужно было редактировать перед использованием.
Этот случай дал мне понять, что нельзя без проверки использовать чужие скрипты, всегда нужно проверять их и уточнять, какую именно задачу они решают.
Не изучил уникальные значения столбца👀
В одной из витрин с данными по продажам допустили неточность, и часть сделок хранилась с атрибутом product = «Валютные форварда», а часть – «Валютные форварды».
Однако я изначально увидел только Валютные форварда, и считал доход только по ним.
Спустя время я заметил, что доходы выглядят заниженными. Тогда я наконец выполнил select distinct – и все стало ясно.
Теперь я стараюсь всегда смотреть, какие значения может принимать категориальная переменная в витрине, а в часто используемых скриптах еще и делать это регулярно.
Выводы💡
Через эти истории я хотел донести до вас, что важнейшим качеством аналитика является умение мыслить критически и задавать вопросы к себе.
Технические ошибки проще заметить, если выработать привычку смотреть на данные под разными углами и проверять себя.
Однажды мой руководитель сказал: «Большое число проблем в компании возникает потому, что разные люди берут разные данные и делают на них разные выводы».
Но есть и ошибки другого рода – поведенческие. Они не менее часто встречаются у начинающих аналитиков.
Именно о таких ошибках рассказывает Кристина в своём канале risk & data talks. Очень рекомендую прочитать её пост и подписаться — там как раз вторая часть нашего совместного разбора.
А какие ошибки допускали вы в начале пути?
Пишите в комментариях💬
Ставьте:
🔥 если было полезно
❤️ если допускали похожие ошибки
🤩 если нравится формат коллабораций
#жизнь_аналитика
#карьера
#ошибки
Когда я только пришел в аналитику, мои хард скиллы были не на очень высоком уровне, как и софт скиллы, которые я вообще недооценивал.
Сегодня я расскажу 3 реальные истории из первых месяцев работы. Это чисто технические ошибки. А поведенческие ошибки разберет Кристина, автор канала risk & data talks
Неправильно понял бизнес логику поля
В одной из первых задач я использовал витрину валютных операций с полем direction, которое принимает значения buy или sell.
Я подумал, что buy - значит клиент купил валюту у банка за рубли.
Я выгрузил клиентов по критериям и на основе этой выборки мы запустили кампанию продаж.
Через пару дней начала приходить обратная связь о том, что данные ошибочные и на самом деле многие клиенты из выборки не совершали сделки покупки валюты у банка.
Пообщавшись с коллегами, я выяснил, что оказывается buy - значит банк купил валюту у клиента за рубли.
Выборку пришлось пересобрать, а сейлзы потратили время на отработку неверной кампании.
С тех пор я всегда проверяю логику атрибутов, где может быть неоднозначная интерпретация.
Доверился чужому скрипту без проверки
Другой аналитик написал скрипт для поиска определенных клиентов. Я попросил у него скрипт, чтобы переиспользовать для своей задачи.
Проверять скрипт я сначала не стал, просто запустил на нужном мне временном периоде и отправил продакт менеджеру excel файл с результатом.
Но продакт вернулся ко мне и указал на неоднозначность данных: в файле каждый клиент встречался по несколько раз, чего по условию задачи быть не должно. Оказалось, что аналитик, у которого я взял скрипт, решал немного другую задачу, и код нужно было редактировать перед использованием.
Этот случай дал мне понять, что нельзя без проверки использовать чужие скрипты, всегда нужно проверять их и уточнять, какую именно задачу они решают.
Не изучил уникальные значения столбца
В одной из витрин с данными по продажам допустили неточность, и часть сделок хранилась с атрибутом product = «Валютные форварда», а часть – «Валютные форварды».
Однако я изначально увидел только Валютные форварда, и считал доход только по ним.
Спустя время я заметил, что доходы выглядят заниженными. Тогда я наконец выполнил select distinct – и все стало ясно.
Теперь я стараюсь всегда смотреть, какие значения может принимать категориальная переменная в витрине, а в часто используемых скриптах еще и делать это регулярно.
Выводы
Через эти истории я хотел донести до вас, что важнейшим качеством аналитика является умение мыслить критически и задавать вопросы к себе.
Технические ошибки проще заметить, если выработать привычку смотреть на данные под разными углами и проверять себя.
Однажды мой руководитель сказал: «Большое число проблем в компании возникает потому, что разные люди берут разные данные и делают на них разные выводы».
Но есть и ошибки другого рода – поведенческие. Они не менее часто встречаются у начинающих аналитиков.
Именно о таких ошибках рассказывает Кристина в своём канале risk & data talks. Очень рекомендую прочитать её пост и подписаться — там как раз вторая часть нашего совместного разбора.
А какие ошибки допускали вы в начале пути?
Пишите в комментариях
Ставьте:
🔥 если было полезно
❤️ если допускали похожие ошибки
🤩 если нравится формат коллабораций
#жизнь_аналитика
#карьера
#ошибки
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15❤3🥰2😈1