Как я использую ИИ в аналитике данных
Начал использовать ИИ в аналитике достаточно давно и поначалу результат был так себе: описываешь задачу - получаешь какую-то фигню на выходе. Забил на время, но иногда возвращался из-за интереса. Со временем понял, что с ИИ тоже нужно уметь работать и как-то вкатился. Сейчас использую довольно часто.
Расскажу, что получается, а что не очень
С кодом зашло неплохо
Claude AI для программирования использую чаще всего. ChatGPT тоже норм, но Claude почему-то стабильнее.
Недавно нужно было написать функцию для retention. Обычно час-два бы ковырялся с pandas, а тут написал: "Сделай функцию для retention по когортам из DataFrame с user_id, date, action" - получил готовый код за минуту.
Код в SQL/ pandas/ spark переводит хорошо, ошибки в скриптах находит быстро. Вот только бизнес-логику не понимает. Это важно учитывать при работе с кодом.
NotebookLM - лучший друг студента
NotebookLM от Google случайно попробовал месяца два назад. Можешь загрузить целую книгу и задавать по ней вопросы.
Сейчас читаю "Causal Inference in Python: Applying Causal Inference in the Tech Industry". Книгу читаю полностью, но NotebookLM помогает читать быстрее — он сразу погружается в контекст концепции, которую пытаюсь разобрать, и объясняет в нужном формате.
Например, спрашиваю: "Объясни мне формулу Doubly Robust по шагам” - и получаю именно тот ответ, который нужен для понимания и затем далее двигаюсь по книге.
Думаете это все? Он еще и подкасты генерирует на основании загруженных документов!🤯
Работа с метриками - тут посложнее
ChatGPT и Gemini пробую для работы с метриками. Хорошо структурируют идеи, но часто предлагают какую-то учебниковую ерунду.
Недавно работал над иерархией метрик для анализа маркетинговых акций. Он базовую иерархию, которая плохо подходила для решения задачи, однако в процессе общения с ним мне пришла идея посмотреть на задачу со стороны customer journey, что привело к созданию наиболее подходящей структуры метрик.
Получается своеобразная “вторая голова” об которую можно подумать.
Perplexity для парсинга
Perplexity оказался полезным для поиска данных о конкурентах.
Нужно было узнать цены конкурентов на меню в одной из стран Европы. Обычно надо тратить несколько часов на изучение сайтов или сборку парсера. А тут спросил — и он собрал информацию с разных источников, приложив ссылки. Правда, иногда попадаются неактуальные данные (поэтому я обычно дабл-чекаю результаты), но даже в таком формате это значительно экономит время.
Дизайн тестов тоже пробую
С простыми A/B тестами получается неплохо. Описываешь гипотезу и контекст — получаешь план с метриками, методом рандомизации и расчетом выборки. PROFIT
А вот сложные эксперименты - это проблема. Пытался спроектировать тест с несколькими переменными - ИИ предложил стандартную схему, но не учел особенности нашего трафика. Сам потом полдня дорабатывал дизайн.
А вот непосредственно анализ данных пока не делегирую
Для качественного анализа ИИ нужно очень много контекста - особенности бизнеса, цели исследования, нюансы данных. По времени объяснение всего этого получается сравнимо с самим процессом анализа.
Думаю, это изменится, когда в компаниях появятся внутренние ИИ-агенты, которые уже знают данные компании и понимают контекст. Но это будет нескоро - напишу свои мысли на эту тему в отдельном посте.
Главная проблема - врет
ИИ может очень убедительно придумывать факты. Особенно когда просишь что-то специфическое. Поэтому важно следить за теми результатами, которые он выдает. Даже указание на ошибки влоб иногда не помогает. Есть некоторые промпты, которые снижают случайность ответов, но не сказал бы, что они решают проблему на 100%.
Сейчас начал формировать подобие библиотеки промптов для разных задач. Возможно когда-нибудь поделюсь.
А какой у вас опыт работы с ИИ?
Начал использовать ИИ в аналитике достаточно давно и поначалу результат был так себе: описываешь задачу - получаешь какую-то фигню на выходе. Забил на время, но иногда возвращался из-за интереса. Со временем понял, что с ИИ тоже нужно уметь работать и как-то вкатился. Сейчас использую довольно часто.
Расскажу, что получается, а что не очень
С кодом зашло неплохо
Claude AI для программирования использую чаще всего. ChatGPT тоже норм, но Claude почему-то стабильнее.
Недавно нужно было написать функцию для retention. Обычно час-два бы ковырялся с pandas, а тут написал: "Сделай функцию для retention по когортам из DataFrame с user_id, date, action" - получил готовый код за минуту.
Код в SQL/ pandas/ spark переводит хорошо, ошибки в скриптах находит быстро. Вот только бизнес-логику не понимает. Это важно учитывать при работе с кодом.
NotebookLM - лучший друг студента
NotebookLM от Google случайно попробовал месяца два назад. Можешь загрузить целую книгу и задавать по ней вопросы.
Сейчас читаю "Causal Inference in Python: Applying Causal Inference in the Tech Industry". Книгу читаю полностью, но NotebookLM помогает читать быстрее — он сразу погружается в контекст концепции, которую пытаюсь разобрать, и объясняет в нужном формате.
Например, спрашиваю: "Объясни мне формулу Doubly Robust по шагам” - и получаю именно тот ответ, который нужен для понимания и затем далее двигаюсь по книге.
Думаете это все? Он еще и подкасты генерирует на основании загруженных документов!🤯
Работа с метриками - тут посложнее
ChatGPT и Gemini пробую для работы с метриками. Хорошо структурируют идеи, но часто предлагают какую-то учебниковую ерунду.
Недавно работал над иерархией метрик для анализа маркетинговых акций. Он базовую иерархию, которая плохо подходила для решения задачи, однако в процессе общения с ним мне пришла идея посмотреть на задачу со стороны customer journey, что привело к созданию наиболее подходящей структуры метрик.
Получается своеобразная “вторая голова” об которую можно подумать.
Perplexity для парсинга
Perplexity оказался полезным для поиска данных о конкурентах.
Нужно было узнать цены конкурентов на меню в одной из стран Европы. Обычно надо тратить несколько часов на изучение сайтов или сборку парсера. А тут спросил — и он собрал информацию с разных источников, приложив ссылки. Правда, иногда попадаются неактуальные данные (поэтому я обычно дабл-чекаю результаты), но даже в таком формате это значительно экономит время.
Дизайн тестов тоже пробую
С простыми A/B тестами получается неплохо. Описываешь гипотезу и контекст — получаешь план с метриками, методом рандомизации и расчетом выборки. PROFIT
А вот сложные эксперименты - это проблема. Пытался спроектировать тест с несколькими переменными - ИИ предложил стандартную схему, но не учел особенности нашего трафика. Сам потом полдня дорабатывал дизайн.
А вот непосредственно анализ данных пока не делегирую
Для качественного анализа ИИ нужно очень много контекста - особенности бизнеса, цели исследования, нюансы данных. По времени объяснение всего этого получается сравнимо с самим процессом анализа.
Думаю, это изменится, когда в компаниях появятся внутренние ИИ-агенты, которые уже знают данные компании и понимают контекст. Но это будет нескоро - напишу свои мысли на эту тему в отдельном посте.
Главная проблема - врет
ИИ может очень убедительно придумывать факты. Особенно когда просишь что-то специфическое. Поэтому важно следить за теми результатами, которые он выдает. Даже указание на ошибки влоб иногда не помогает. Есть некоторые промпты, которые снижают случайность ответов, но не сказал бы, что они решают проблему на 100%.
Сейчас начал формировать подобие библиотеки промптов для разных задач. Возможно когда-нибудь поделюсь.
А какой у вас опыт работы с ИИ?
👍3🔥2
Как самостоятельно определять метрики, необходимые для оценки эффективности бизнеса
Работа аналитика напрямую связана с метриками продукта или бизнеса: их разработкой, мониторингом и исследованием. Но как выбирать "правильные" метрики и как с ними работать?
Ответ на этот вопрос строится на 3х аспектах: понимание целей бизнеса, аналитическое мышление, продуктовое мышление и насмотренность.
1. Понимание целей бизнеса
Этот аспект стоит первым - потому что именно от того, насколько хорошо вы понимаете текущий запрос бизнеса, зависит качество результата вашей работы, как аналитика.
Совет тут один: четко формулируйте с заказчиками цель до начала решения задачи и удостоверьтесь в том, что вы видите ее одинаково. Ну и не бойтесь задавать глупые вопросы, если вдруг что-то непонятно. Лучше это сделать заранее, чем потратить множество сил на решение не той задачи.
2. Аналитическое мышление
В этот аспект я закладываю 2 характеристики: то, под каким углом вы смотрите на проблему и то, как вы ее декомпозируете.
Под углом взгляда на проблему я подразумеваю тот подход, который вы используете при анализе проблемы. На одну и ту же задачу можно посмотреть, как со стороны пути клиента (CJM), как с финансовой стороны (P&L), так и со стороны продукта в целом. Поэтому важно понимать базовые фреймворки и уметь их адаптировать под себя.
Примеры фреймворков:
1. Пиратские метрики
- https://vc.ru/life/116967-samyy-polnyy-gayd-po-freymvorku-aarrr-s-keysami-prodakt-menedzherov-megadiska-i-storebox
- https://tilda.education/articles-aarrr-metrics
- https://userpilot.com/blog/aarra-vs-rarra/
2. HEART
- https://clevertap.com/blog/google-heart-framework/
- https://vc.ru/marketing/121986-instrukciya-po-freymvorku-heart-na-primere-komandy-megafon-biznes
3. CJM
- https://practicum.yandex.ru/blog/customer-journey-map/
- https://habr.com/ru/articles/709772/
4. P&L
- https://vc.ru/id18440/721393-prodakt-otvechayushii-za-pl-golubaya-mechta-ili-realnost
- https://www.youtube.com/watch?v=By4wAxH8D5w
Что касается декомпозиции, то базовый принцип - это MECE (Mutually Exclusive, Collectively Exhaustive). Его главная идея заключается в том, что каждая часть анализа должна быть чётко определена, не пересекаться с другими и охватывать всю проблемную область.
Расшифровка аббревиатуры:
1. Взаимоисключающие (Mutually Exclusive) — категории должны быть сформированы таким образом, чтобы между ними не было логических пересечений.
2. Cовместно исчерпывающие (Collectively Exhaustive) — все аспекты проблемы должны быть охвачены, чтобы обеспечить полное понимание.
Детальнее с принципом можно ознакомиться на хабре
3. Продуктовое мышление и насмотренность
По моему мнению, это самый комплексный и сложный в освоении аспект из всех перечисленных выше.
Он показывает, насколько хорошо вы погружены в доменную область бизнеса или продукта и как ловко вы в ней ориентируетесь. Чем лучше вы понимаете бизнес-модель вашей компании - тем проще вам будет работать с метриками. Формирует насмотренность опыт, однако получать его можно разными способами:
1. Работать в разных компаниях. Чем в большем количестве компаний вы поработали, тем выше ваша насмотренность и, соответственно, тем более тонко можете работать с метриками.
2. Изучать профессионалов. Сейчас очень много информации про различные бизнесы: конференции, лекции, разборы, подкасты, интервью и пр.
Примеры, к которым я обращаюсь:
- лекции школы менеджеров Яндекса
- записи с матемаркетинга
- лекции product-map
3. Кейсы. Стоит взять в привычку рассматривать каждый продукт/бизнес, с которым вы сталкиваетесь как потребитель как отдельный "кейс" и пытаться разобрать его бизнес-модель. Например, пользуясь приложением доставки еды, представьте себя ее владельцем. Попытайтесь определить цель бизнеса, его основную метрику и разложить ее до метрик, на которые вы можете оказать влияние.
В любом случае, эти постулаты не высечены в камне - не стесняйтесь их комбинировать и адаптировать под себя, если это помогает достичь ваших целей
Работа аналитика напрямую связана с метриками продукта или бизнеса: их разработкой, мониторингом и исследованием. Но как выбирать "правильные" метрики и как с ними работать?
Ответ на этот вопрос строится на 3х аспектах: понимание целей бизнеса, аналитическое мышление, продуктовое мышление и насмотренность.
1. Понимание целей бизнеса
Этот аспект стоит первым - потому что именно от того, насколько хорошо вы понимаете текущий запрос бизнеса, зависит качество результата вашей работы, как аналитика.
Совет тут один: четко формулируйте с заказчиками цель до начала решения задачи и удостоверьтесь в том, что вы видите ее одинаково. Ну и не бойтесь задавать глупые вопросы, если вдруг что-то непонятно. Лучше это сделать заранее, чем потратить множество сил на решение не той задачи.
2. Аналитическое мышление
В этот аспект я закладываю 2 характеристики: то, под каким углом вы смотрите на проблему и то, как вы ее декомпозируете.
Под углом взгляда на проблему я подразумеваю тот подход, который вы используете при анализе проблемы. На одну и ту же задачу можно посмотреть, как со стороны пути клиента (CJM), как с финансовой стороны (P&L), так и со стороны продукта в целом. Поэтому важно понимать базовые фреймворки и уметь их адаптировать под себя.
Примеры фреймворков:
1. Пиратские метрики
- https://vc.ru/life/116967-samyy-polnyy-gayd-po-freymvorku-aarrr-s-keysami-prodakt-menedzherov-megadiska-i-storebox
- https://tilda.education/articles-aarrr-metrics
- https://userpilot.com/blog/aarra-vs-rarra/
2. HEART
- https://clevertap.com/blog/google-heart-framework/
- https://vc.ru/marketing/121986-instrukciya-po-freymvorku-heart-na-primere-komandy-megafon-biznes
3. CJM
- https://practicum.yandex.ru/blog/customer-journey-map/
- https://habr.com/ru/articles/709772/
4. P&L
- https://vc.ru/id18440/721393-prodakt-otvechayushii-za-pl-golubaya-mechta-ili-realnost
- https://www.youtube.com/watch?v=By4wAxH8D5w
Что касается декомпозиции, то базовый принцип - это MECE (Mutually Exclusive, Collectively Exhaustive). Его главная идея заключается в том, что каждая часть анализа должна быть чётко определена, не пересекаться с другими и охватывать всю проблемную область.
Расшифровка аббревиатуры:
1. Взаимоисключающие (Mutually Exclusive) — категории должны быть сформированы таким образом, чтобы между ними не было логических пересечений.
2. Cовместно исчерпывающие (Collectively Exhaustive) — все аспекты проблемы должны быть охвачены, чтобы обеспечить полное понимание.
Детальнее с принципом можно ознакомиться на хабре
3. Продуктовое мышление и насмотренность
По моему мнению, это самый комплексный и сложный в освоении аспект из всех перечисленных выше.
Он показывает, насколько хорошо вы погружены в доменную область бизнеса или продукта и как ловко вы в ней ориентируетесь. Чем лучше вы понимаете бизнес-модель вашей компании - тем проще вам будет работать с метриками. Формирует насмотренность опыт, однако получать его можно разными способами:
1. Работать в разных компаниях. Чем в большем количестве компаний вы поработали, тем выше ваша насмотренность и, соответственно, тем более тонко можете работать с метриками.
2. Изучать профессионалов. Сейчас очень много информации про различные бизнесы: конференции, лекции, разборы, подкасты, интервью и пр.
Примеры, к которым я обращаюсь:
- лекции школы менеджеров Яндекса
- записи с матемаркетинга
- лекции product-map
3. Кейсы. Стоит взять в привычку рассматривать каждый продукт/бизнес, с которым вы сталкиваетесь как потребитель как отдельный "кейс" и пытаться разобрать его бизнес-модель. Например, пользуясь приложением доставки еды, представьте себя ее владельцем. Попытайтесь определить цель бизнеса, его основную метрику и разложить ее до метрик, на которые вы можете оказать влияние.
В любом случае, эти постулаты не высечены в камне - не стесняйтесь их комбинировать и адаптировать под себя, если это помогает достичь ваших целей
🔥8
Почему хороших хардов недостаточно для роста в карьере?
Иногда слышу от знакомых тимлидов похожие истории: "Нанял мидла с хорошими техническими скиллами, а он до сих пор работает как джуниор ".
В такой ситуации проблема редко связана с недостатком знаний. Разница заключается в том, как аналитик воспринимает свои задачи - как исполнитель инструкций или как участник, влияющий на результат компании.
Junior → "Калькулятор"
На старте карьеры от тебя действительно мало что ждут кроме технического исполнения.
"Посчитай retention по когортам", "Сделай разбивку конверсии по источникам" - стандартный набор задач.
Но даже на этом этапе можно работать по-разному. Когда получаешь задачу проанализировать падение активности пользователей, можно просто показать графики и сказать "активность упала на 15%". А можно попытаться понять причины: посмотреть на корреляцию с маркетинговыми активностями, изменениями в продукте, внешними факторами.
Во втором случае аналитик находит не только факт проблемы, но и её источник. Задача из разряда "посчитать и показать" превращается в "найти и решить проблему". Такие примеры проактивности всегда заметны и очень высоко ценятся.
Middle → "Консультант"
На уровне мидла уже можно и нужно предлагать свои решения. Критически важно начать связывать свою работу с бизнес-целями и откидывать задачи, которые с ними не коррелируют.
Например, при анализе эффективности каналов привлечения стандартный подход - показать CPA и ROAS по каналам. Но аналитик с пониманием бизнеса предложит посмотреть на lifetime value пользователей из разных источников.
Часто оказывается, что канал с самым высоким CPA приносит пользователей с LTV в разы выше остальных. Такой подход может кардинально поменять маркетинговую стратегию - перераспределить значительную часть бюджета в пользу более качественного источника.
Именно на этом этапе аналитик понимает: чем больше думаешь о бизнес-импакте своего анализа, тем интереснее становятся задачи и тем больше тебя ценят как специалиста. На senior+ позициях именно такие кейсы с измеримым влиянием на бизнес становятся решающими на собеседованиях или перфоманс-ревью.
Senior → "Партнер"
Как уже было сказано выше, на этом уровне от аналитика уже ждут прямого влияния на бизнес-метрики. Здесь анализ - это не цель, а инструмент для принятия стратегических решений.
Типичная ситуация: продукт сталкивается с проблемой - растет количество пользователей, но выручка на пользователя падает. Руководство планирует запустить новые платные фичи.
Аналитик-калькулятор просто проанализирует поведение пользователей и покажет воронки. Аналитик-партнер предложит другую гипотезу: проблема может быть в изменившемся миксе пользователей. Глубокий анализ показывает, что приток большого количества пользователей из нового гео с низкой покупательной способностью размывает общие метрики.
Решение оказывается простым - сегментировать метрики по регионам и скорректировать стратегию монетизации под каждый сегмент. Выручка на пользователя в старых регионах продолжает расти, а для новых разрабатывается отдельная модель.
На заре карьеры один из руководителей сказал мне, что хороший аналитик окупает затраты компании на себя в несколько раз. С тех пор я оцениваю все задачи и проекты через призму "моя работа → выручка компании". И замечаю, что именно этот фактор играет ключевую роль на ревью и собеседованиях .
Если хотите погрузиться чуть глубже и понять требования к кандидатам на каждом из грейдов, советую ознакомиться с:
— Плейбуком по грейдам аналитиков в Авито
— Гайдом GoPractice по уровням аналитиков в Яндексе
Материалы написаны достаточно давно, но не теряют своей актуальности и сейчас
Иногда слышу от знакомых тимлидов похожие истории: "Нанял мидла с хорошими техническими скиллами, а он до сих пор работает как джуниор ".
В такой ситуации проблема редко связана с недостатком знаний. Разница заключается в том, как аналитик воспринимает свои задачи - как исполнитель инструкций или как участник, влияющий на результат компании.
Junior → "Калькулятор"
На старте карьеры от тебя действительно мало что ждут кроме технического исполнения.
"Посчитай retention по когортам", "Сделай разбивку конверсии по источникам" - стандартный набор задач.
Но даже на этом этапе можно работать по-разному. Когда получаешь задачу проанализировать падение активности пользователей, можно просто показать графики и сказать "активность упала на 15%". А можно попытаться понять причины: посмотреть на корреляцию с маркетинговыми активностями, изменениями в продукте, внешними факторами.
Во втором случае аналитик находит не только факт проблемы, но и её источник. Задача из разряда "посчитать и показать" превращается в "найти и решить проблему". Такие примеры проактивности всегда заметны и очень высоко ценятся.
Middle → "Консультант"
На уровне мидла уже можно и нужно предлагать свои решения. Критически важно начать связывать свою работу с бизнес-целями и откидывать задачи, которые с ними не коррелируют.
Например, при анализе эффективности каналов привлечения стандартный подход - показать CPA и ROAS по каналам. Но аналитик с пониманием бизнеса предложит посмотреть на lifetime value пользователей из разных источников.
Часто оказывается, что канал с самым высоким CPA приносит пользователей с LTV в разы выше остальных. Такой подход может кардинально поменять маркетинговую стратегию - перераспределить значительную часть бюджета в пользу более качественного источника.
Именно на этом этапе аналитик понимает: чем больше думаешь о бизнес-импакте своего анализа, тем интереснее становятся задачи и тем больше тебя ценят как специалиста. На senior+ позициях именно такие кейсы с измеримым влиянием на бизнес становятся решающими на собеседованиях или перфоманс-ревью.
Senior → "Партнер"
Как уже было сказано выше, на этом уровне от аналитика уже ждут прямого влияния на бизнес-метрики. Здесь анализ - это не цель, а инструмент для принятия стратегических решений.
Типичная ситуация: продукт сталкивается с проблемой - растет количество пользователей, но выручка на пользователя падает. Руководство планирует запустить новые платные фичи.
Аналитик-калькулятор просто проанализирует поведение пользователей и покажет воронки. Аналитик-партнер предложит другую гипотезу: проблема может быть в изменившемся миксе пользователей. Глубокий анализ показывает, что приток большого количества пользователей из нового гео с низкой покупательной способностью размывает общие метрики.
Решение оказывается простым - сегментировать метрики по регионам и скорректировать стратегию монетизации под каждый сегмент. Выручка на пользователя в старых регионах продолжает расти, а для новых разрабатывается отдельная модель.
На заре карьеры один из руководителей сказал мне, что хороший аналитик окупает затраты компании на себя в несколько раз. С тех пор я оцениваю все задачи и проекты через призму "моя работа → выручка компании". И замечаю, что именно этот фактор играет ключевую роль на ревью и собеседованиях .
Если хотите погрузиться чуть глубже и понять требования к кандидатам на каждом из грейдов, советую ознакомиться с:
— Плейбуком по грейдам аналитиков в Авито
— Гайдом GoPractice по уровням аналитиков в Яндексе
Материалы написаны достаточно давно, но не теряют своей актуальности и сейчас
GitHub
playbook/analytics-management.md at master · avito-tech/playbook
AvitoTech team playbook. Contribute to avito-tech/playbook development by creating an account on GitHub.
❤12
Не очень относится к аналитике, но в друг кому-то будет полезно.
OpenAI выкатил бесплатный оптимизатор промптов для LLM: https://platform.openai.com/chat/edit?models=gpt-5&optimize=true
Прикольно то, что кроме готового промпта также дается подробное объяснение произведенных изменений: что именно поменяли и почему
Чувствую, необходимость в библиотеках промптов, которые некоторые старательно ведут (и даже продают), может скоро пропасть.
OpenAI выкатил бесплатный оптимизатор промптов для LLM: https://platform.openai.com/chat/edit?models=gpt-5&optimize=true
Прикольно то, что кроме готового промпта также дается подробное объяснение произведенных изменений: что именно поменяли и почему
Чувствую, необходимость в библиотеках промптов, которые некоторые старательно ведут (и даже продают), может скоро пропасть.
Openai
OpenAI Platform
Многозадачность — это ложь
Многозадачность, как способность вести много дел одновременно, считается признаком высокого профессионализма. В любой компании ценят людей, которые успевают вести несколько проектов, менторить, драйвить изменения, и успевать развиваться самим. Но как они это делают?
Долгое время я искренне верил в миф, что настоящий профессионал должен легко жонглировать десятком задач в моменте. Открыл 15 вкладок, запустил три анализа, параллельно отвечаешь в чатах и участвуешь в созвонах. Вот она - настоящая продуктивность.
При этом каждый раз, когда я пытался практиковать такой подход, к вечеру (а иногда и к середине дня) накатывала усталость, гудела голова и даже наступало чувство апатии, когда ничего не хочется делать, кроме как лежать и смотреть в потолок. При этом под конец дня количество выполненных задач не увеличивалось. Увеличивалось только количество начатых. Знакомо?
Почему так происходит?
Проблема не в том, что мы делаем что-то не так или недостаточно эффективны. Основная причина в том, что настоящая многозадачность — это иллюзия.
Мы физиологически не можем направлять фокус на несколько задач одновременно. Когда мы думаем, что выполняем несколько задач, наш мозг на самом деле быстро переключается между ними. И каждое переключение стоит нам дорого.
Исследования показывают, что при переключении внимания мы "теряем" от 10 секунд до нескольких минут на восстановление контекста. Для аналитической работы на это тратится еще больше времени.
Ученые из Стэндфорда, обнаружили парадокс: люди, считающие себя мастерами в этом деле, показали худшие результаты в тестах на концентрацию по сравнению с теми, кто избегает многозадачности.
Что же делать?
Настоящий путь к многозадачности (возможности делать больше за меньший промежуток времени) - это глубокий фокус. Так что ответ прост - надо решать в моменте только одну конкретную задачу и не пытаться распыляться в надежде все успеть.
Если переходить к практическим рекомендациям, то я практикую следующее:
Планирование
У меня есть план на неделю и план на день. Каждый день в неделе у меня разделен на промежутки по 60 - 120 мин под конкретные задачи. Это может быть все, что угодно: работа, быт, спорт, хобби. Логика всегда одна: утром - самые сложные задачи/ обучение, когда мозг свежий. После обеда - коммуникации и рутина. Вечером - разгрузка мозга (хобби, спорт)
Давать мозгу скучать
Скроллинг, игры, видео не дают мозгу отдохнуть и поддерживают мозговую активность на высоком уровне. Мозг привык получать информацию и постоянно быть активным, поэтому стоит принудительно его разгружать: практиковать медитации, созерцание, прогулки. Попробуйте, например, посидеть в тишине в течение 5 минут. Можете заметить, что это не так уж и просто.
Цифровой детокс
Во время глубокой работы закрываю все лишнее. Один браузер, одна вкладка, одна задача. Телеграмм в режиме "не беспокоить”, беззвучный режим на телефоне.
Ритуал входа в рабочее состояние
Перед сложной аналитической работой создаю особую атмосферу: наушники с фокус-музыкой, чашка кофе, чистый стол. Мозг быстро привыкает к этим сигналам и настраивается на концентрацию. (на самом деле такое состояние называется поток. Оно подробно описано в книге Михайя Чиксентмихайи "Поток: Психология оптимального переживания”. Советую почитать)
Батчинг коммуникаций
Основная идея отвечать на сообщения в специально отведенное время — утром, в обед и вечером. Скажу честно - у меня получается не всегда. Но я точно сношу встречи, которые мне ставят день-в-день.
Отказывать
Если ты понимаешь, что в моменте не можешь переключиться на новую задачу и тебе требуется время на погружение, то лучше отказаться от влетевшего запроса или отложить его в бэклог, если он действительно важен. (очень часто задачи влетающие таким образом, не так уж и важны)
Будьте уверены, многозадачность — не навык, а когнитивная ловушка. В аналитике, где одна ошибка может стоить компании серьезных денег, цена рассеянного внимания слишком высока.
Попробуйте неделю работать в режиме глубокой концентрации. Вы быстро заметите, как стали успевать гораздо больше.
Многозадачность, как способность вести много дел одновременно, считается признаком высокого профессионализма. В любой компании ценят людей, которые успевают вести несколько проектов, менторить, драйвить изменения, и успевать развиваться самим. Но как они это делают?
Долгое время я искренне верил в миф, что настоящий профессионал должен легко жонглировать десятком задач в моменте. Открыл 15 вкладок, запустил три анализа, параллельно отвечаешь в чатах и участвуешь в созвонах. Вот она - настоящая продуктивность.
При этом каждый раз, когда я пытался практиковать такой подход, к вечеру (а иногда и к середине дня) накатывала усталость, гудела голова и даже наступало чувство апатии, когда ничего не хочется делать, кроме как лежать и смотреть в потолок. При этом под конец дня количество выполненных задач не увеличивалось. Увеличивалось только количество начатых. Знакомо?
Почему так происходит?
Проблема не в том, что мы делаем что-то не так или недостаточно эффективны. Основная причина в том, что настоящая многозадачность — это иллюзия.
Мы физиологически не можем направлять фокус на несколько задач одновременно. Когда мы думаем, что выполняем несколько задач, наш мозг на самом деле быстро переключается между ними. И каждое переключение стоит нам дорого.
Исследования показывают, что при переключении внимания мы "теряем" от 10 секунд до нескольких минут на восстановление контекста. Для аналитической работы на это тратится еще больше времени.
Ученые из Стэндфорда, обнаружили парадокс: люди, считающие себя мастерами в этом деле, показали худшие результаты в тестах на концентрацию по сравнению с теми, кто избегает многозадачности.
Что же делать?
Настоящий путь к многозадачности (возможности делать больше за меньший промежуток времени) - это глубокий фокус. Так что ответ прост - надо решать в моменте только одну конкретную задачу и не пытаться распыляться в надежде все успеть.
Если переходить к практическим рекомендациям, то я практикую следующее:
Планирование
У меня есть план на неделю и план на день. Каждый день в неделе у меня разделен на промежутки по 60 - 120 мин под конкретные задачи. Это может быть все, что угодно: работа, быт, спорт, хобби. Логика всегда одна: утром - самые сложные задачи/ обучение, когда мозг свежий. После обеда - коммуникации и рутина. Вечером - разгрузка мозга (хобби, спорт)
Давать мозгу скучать
Скроллинг, игры, видео не дают мозгу отдохнуть и поддерживают мозговую активность на высоком уровне. Мозг привык получать информацию и постоянно быть активным, поэтому стоит принудительно его разгружать: практиковать медитации, созерцание, прогулки. Попробуйте, например, посидеть в тишине в течение 5 минут. Можете заметить, что это не так уж и просто.
Цифровой детокс
Во время глубокой работы закрываю все лишнее. Один браузер, одна вкладка, одна задача. Телеграмм в режиме "не беспокоить”, беззвучный режим на телефоне.
Ритуал входа в рабочее состояние
Перед сложной аналитической работой создаю особую атмосферу: наушники с фокус-музыкой, чашка кофе, чистый стол. Мозг быстро привыкает к этим сигналам и настраивается на концентрацию. (на самом деле такое состояние называется поток. Оно подробно описано в книге Михайя Чиксентмихайи "Поток: Психология оптимального переживания”. Советую почитать)
Батчинг коммуникаций
Основная идея отвечать на сообщения в специально отведенное время — утром, в обед и вечером. Скажу честно - у меня получается не всегда. Но я точно сношу встречи, которые мне ставят день-в-день.
Отказывать
Если ты понимаешь, что в моменте не можешь переключиться на новую задачу и тебе требуется время на погружение, то лучше отказаться от влетевшего запроса или отложить его в бэклог, если он действительно важен. (очень часто задачи влетающие таким образом, не так уж и важны)
Будьте уверены, многозадачность — не навык, а когнитивная ловушка. В аналитике, где одна ошибка может стоить компании серьезных денег, цена рассеянного внимания слишком высока.
Попробуйте неделю работать в режиме глубокой концентрации. Вы быстро заметите, как стали успевать гораздо больше.
🔥7
Джуны не нужны?
Периодически в Linkedin натыкаюсь на мнения, что вкатываться в ИТ сейчас бессмысленно - джунов никто не берет. Особенно после появления ChatGPT и различных ИИ-инструментов. Не берусь говорить про весь рынок в целом, но добавлю свои 5 копеек про рынок аналитики данных.
Согласно исследованию Я.Практикума за 2024г: джунов без опыта ищут меньше всего - всего 8.2% от общего числа вакансий. Большинство компаний предпочитают junior+ (54%) с опытом 1-3 года и middle (34.5%). Что интересно, вакансий на Senior-позиции всего 3.3%.
Кроме того, и в Додо, и в Яндексе мы не нанимали джунов.
Почему так?
Во-первых, это не выгодно. Джуниора нужно интенсивно обучать и менторить, тем самым забирая от 30-50% времени сеньоров. Все это время компания несет серьезные расходы с нулевой отдачей.
Во-вторых, качество работы. Джуниор не понимает бизнес-контекст и может потратить неделю на анализ чего угодно, только не того, что нужно. “Дали задачу посчитать конверсию воронки - получили презентацию на 10-20 слайдов с графиками не по теме" - достаточно типичная ситуация.
Однако самое болезненное - это то, что происходит дальше. Через год-полтора, когда джуниор наконец набирается опыта, он видит рынок и уходит за большими деньгами в другую компанию. Получается, что компания вложила ресурсы в обучение конкурентам.
Появление ИИ только ухудшило ситуацию. Раньше джуниор мог заниматься простыми задачами: строить базовые дашборды, делать срезы данных, считать простую статистику. Теперь многое из этого умеют делать LLM или специализированные инструменты. Планка входа поднялась - от джуниора сразу ждут более сложной работы.
Так что же - джуны и правда не нужны?
Ответ неоднозначный. В текущем формате - да, они стали экономически невыгодными для большинства компаний. Однако не стоит вешать руки.
Спрос на аналитику данных продолжает расти. Объем мирового рынка инструментов Big Data достиг $348,21 млрд с ростом на 13,2%. Каждая новая компания, выходящая в цифру, каждый интернет-магазин, каждый стартап - все они рано или поздно приходят к необходимости анализировать данные. Растет количество данных, растет ценность персонализации, растут требования к качеству аналитики.
Откуда возьмутся middle и senior специалисты, чтобы поддерживать все это, если никто не растит джунов? Люди не рождаются с готовыми навыками работы в Tableau и знанием SQL.
Получается парадокс: все хотят готовых мидлов, конкурируют за них, поднимают зарплаты. Но мидлов не становится больше - их просто перетасовывают между компаниями.
Джуны никуда не пропадут, но к ним точно вырастут требования. Если раньше можно было устроиться джуном, зная только Excel и базовый SQL, то теперь нужно:
- Понимать основы машинного обучения (потому что ИИ не заменит, а дополнит аналитика)
- Уметь работать с современными инструментами BI
- Понимать основы программирования на Python
- Иметь портфолио реальных проектов и хакатонов, а не только сертификаты курсов
По сути, новые джуны должны быть на уровне вчерашних junior+. Это болезненный, но естественный процесс - рынок адаптируется к новым реалиям.
Тем, кто все-таки хочет войти в профессию, стоит честно оценить свои возможности. Теперь нужна более серьезная подготовка и больше времени на самообразование. Я бы лично закладывал около года на освоение всех инструментов и формирование пет-проектов.
Но возможности все еще есть - просто планка стала выше.
Периодически в Linkedin натыкаюсь на мнения, что вкатываться в ИТ сейчас бессмысленно - джунов никто не берет. Особенно после появления ChatGPT и различных ИИ-инструментов. Не берусь говорить про весь рынок в целом, но добавлю свои 5 копеек про рынок аналитики данных.
Согласно исследованию Я.Практикума за 2024г: джунов без опыта ищут меньше всего - всего 8.2% от общего числа вакансий. Большинство компаний предпочитают junior+ (54%) с опытом 1-3 года и middle (34.5%). Что интересно, вакансий на Senior-позиции всего 3.3%.
Кроме того, и в Додо, и в Яндексе мы не нанимали джунов.
Почему так?
Во-первых, это не выгодно. Джуниора нужно интенсивно обучать и менторить, тем самым забирая от 30-50% времени сеньоров. Все это время компания несет серьезные расходы с нулевой отдачей.
Во-вторых, качество работы. Джуниор не понимает бизнес-контекст и может потратить неделю на анализ чего угодно, только не того, что нужно. “Дали задачу посчитать конверсию воронки - получили презентацию на 10-20 слайдов с графиками не по теме" - достаточно типичная ситуация.
Однако самое болезненное - это то, что происходит дальше. Через год-полтора, когда джуниор наконец набирается опыта, он видит рынок и уходит за большими деньгами в другую компанию. Получается, что компания вложила ресурсы в обучение конкурентам.
Появление ИИ только ухудшило ситуацию. Раньше джуниор мог заниматься простыми задачами: строить базовые дашборды, делать срезы данных, считать простую статистику. Теперь многое из этого умеют делать LLM или специализированные инструменты. Планка входа поднялась - от джуниора сразу ждут более сложной работы.
Так что же - джуны и правда не нужны?
Ответ неоднозначный. В текущем формате - да, они стали экономически невыгодными для большинства компаний. Однако не стоит вешать руки.
Спрос на аналитику данных продолжает расти. Объем мирового рынка инструментов Big Data достиг $348,21 млрд с ростом на 13,2%. Каждая новая компания, выходящая в цифру, каждый интернет-магазин, каждый стартап - все они рано или поздно приходят к необходимости анализировать данные. Растет количество данных, растет ценность персонализации, растут требования к качеству аналитики.
Откуда возьмутся middle и senior специалисты, чтобы поддерживать все это, если никто не растит джунов? Люди не рождаются с готовыми навыками работы в Tableau и знанием SQL.
Получается парадокс: все хотят готовых мидлов, конкурируют за них, поднимают зарплаты. Но мидлов не становится больше - их просто перетасовывают между компаниями.
Джуны никуда не пропадут, но к ним точно вырастут требования. Если раньше можно было устроиться джуном, зная только Excel и базовый SQL, то теперь нужно:
- Понимать основы машинного обучения (потому что ИИ не заменит, а дополнит аналитика)
- Уметь работать с современными инструментами BI
- Понимать основы программирования на Python
- Иметь портфолио реальных проектов и хакатонов, а не только сертификаты курсов
По сути, новые джуны должны быть на уровне вчерашних junior+. Это болезненный, но естественный процесс - рынок адаптируется к новым реалиям.
Тем, кто все-таки хочет войти в профессию, стоит честно оценить свои возможности. Теперь нужна более серьезная подготовка и больше времени на самообразование. Я бы лично закладывал около года на освоение всех инструментов и формирование пет-проектов.
Но возможности все еще есть - просто планка стала выше.
❤3🔥3
Что такое разница-разниц и как она помогает с оценкой акций?
Ранее я писал про способы оценки экспериментов при отсутствии контрольной групппы.
Теперь вот решил написать серию постов с более развернутым разбором каждого из методов.
Этот пост будет первым и будет он про метод разницы-разниц (Difference-in-Difference).
Представьте, что ваши коллеги провели акцию в Москве и просят вас оценить ее влияние на выручку. Акция проводилась на весь город и выделить контрольную группу никто не удосужился.
Что делать?
В целом вы можете развернуть заказчика и отправить на все 4 стороны (и даже будете правы), но можете и попытаться ему помочь.
Как?
Как раз с помощью метода выше.
Обычно у нас всегда есть данные по тестовой группе: по динамике целевой метрики до и после воздействия. В нашем случае, это подневная динамика выручки до и после акции.
Кроме того, у нас могут быть данные и по другим городам. Например, данные по выручке в Санкт-Петербурге до/ после акции.
Этих данных в целом достаточно для данного метода.
В чем его суть?
Логика метода включает всего четыре составляющие:
1. Тестовая группа до воздействия - исходный уровень показателя в группе, которая будет подвержена вмешательству. (Выручка в Москве до акции)
2. Тестовая группа после воздействия - уровень показателя в той же группе после вмешательства. (Выручка в Москве после акции)
3. Контрольная группа до воздействия - исходный уровень в группе, которая не подвергается вмешательству. (Выручка в Санкт-Петербурге до акции)
4. Контрольная группа после воздействия - уровень в контрольной группе в тот же период времени. (Выручка в Санкт-Петербурге после акции)
Эффект вмешательства рассчитывается по формуле:
DiD = (После - До)₍эксперимент₎ - (После - До)₍контроль₎
Если представить формулу визуально, то DID - это разница между синий линией (фактический результат тестовой группы) и оранжевой пунктирной линией (контр-фактический результат тестовой группы). Контр-фактический результат - это предполагаемое поведение метрики в тестовой группе в случае отсутствия воздействия.
Метод кажется очень простым, однако он применим не всегда.
Для корректного применения метода необходимо соблюдать некоторые условия:
1. Параллельные тренды.
Без вмешательства целевые метрики в тесте и контроле должны иметь параллельные тренды. Эту предпосылку невозможно проверить напрямую, но можно оценить, изучив предшествующие периоды.
2. Отсутствие композиционных изменений.
Состав групп не должен существенно изменяться в период наблюдения.
3. Отсутствие других воздействий
Если в период акции тестовая группа была подвергнута и другим воздействиям, например, праздники, сезонность, параллельные акции, то DiD не сможет отделить эффект конкретной акции от остальных факторов, и выдаст смещенную оценку.
По сути, влияние других факторов - это центральная проблема причинно-следственного анализа. DiD помогает с некоторыми типами конфаундеров (постоянные различия между группами, общие временные тренды), но бессилен против временно-изменяющихся факторов, которые по-разному влияют на группы.
С этим тоже можно работать, например, используя метод DiD с контролем за ковариатами (Conditional DiD) или метод Синтетического контроля (про них я напишу в отдельных постах), но иногда хватает и стандартного DiD.
В любом случае, этот метод, как и все прочие методы оценки гипотез имеет свои плюсы и минусы и не является панацеей. Используйте каждый инструмент, учитывая его сильные и слабые стороны, и будет вам счастье😉
Ранее я писал про способы оценки экспериментов при отсутствии контрольной групппы.
Теперь вот решил написать серию постов с более развернутым разбором каждого из методов.
Этот пост будет первым и будет он про метод разницы-разниц (Difference-in-Difference).
Представьте, что ваши коллеги провели акцию в Москве и просят вас оценить ее влияние на выручку. Акция проводилась на весь город и выделить контрольную группу никто не удосужился.
Что делать?
В целом вы можете развернуть заказчика и отправить на все 4 стороны (и даже будете правы), но можете и попытаться ему помочь.
Как?
Как раз с помощью метода выше.
Обычно у нас всегда есть данные по тестовой группе: по динамике целевой метрики до и после воздействия. В нашем случае, это подневная динамика выручки до и после акции.
Кроме того, у нас могут быть данные и по другим городам. Например, данные по выручке в Санкт-Петербурге до/ после акции.
Этих данных в целом достаточно для данного метода.
В чем его суть?
Логика метода включает всего четыре составляющие:
1. Тестовая группа до воздействия - исходный уровень показателя в группе, которая будет подвержена вмешательству. (Выручка в Москве до акции)
2. Тестовая группа после воздействия - уровень показателя в той же группе после вмешательства. (Выручка в Москве после акции)
3. Контрольная группа до воздействия - исходный уровень в группе, которая не подвергается вмешательству. (Выручка в Санкт-Петербурге до акции)
4. Контрольная группа после воздействия - уровень в контрольной группе в тот же период времени. (Выручка в Санкт-Петербурге после акции)
Эффект вмешательства рассчитывается по формуле:
DiD = (После - До)₍эксперимент₎ - (После - До)₍контроль₎
Если представить формулу визуально, то DID - это разница между синий линией (фактический результат тестовой группы) и оранжевой пунктирной линией (контр-фактический результат тестовой группы). Контр-фактический результат - это предполагаемое поведение метрики в тестовой группе в случае отсутствия воздействия.
Метод кажется очень простым, однако он применим не всегда.
Для корректного применения метода необходимо соблюдать некоторые условия:
1. Параллельные тренды.
Без вмешательства целевые метрики в тесте и контроле должны иметь параллельные тренды. Эту предпосылку невозможно проверить напрямую, но можно оценить, изучив предшествующие периоды.
2. Отсутствие композиционных изменений.
Состав групп не должен существенно изменяться в период наблюдения.
3. Отсутствие других воздействий
Если в период акции тестовая группа была подвергнута и другим воздействиям, например, праздники, сезонность, параллельные акции, то DiD не сможет отделить эффект конкретной акции от остальных факторов, и выдаст смещенную оценку.
По сути, влияние других факторов - это центральная проблема причинно-следственного анализа. DiD помогает с некоторыми типами конфаундеров (постоянные различия между группами, общие временные тренды), но бессилен против временно-изменяющихся факторов, которые по-разному влияют на группы.
С этим тоже можно работать, например, используя метод DiD с контролем за ковариатами (Conditional DiD) или метод Синтетического контроля (про них я напишу в отдельных постах), но иногда хватает и стандартного DiD.
В любом случае, этот метод, как и все прочие методы оценки гипотез имеет свои плюсы и минусы и не является панацеей. Используйте каждый инструмент, учитывая его сильные и слабые стороны, и будет вам счастье😉
🔥5✍2
Вдохну чуть больше жизни в канал и поделюсь фотками с отпуска.
Связь не ловит, интернет только в апартах. Людей тоже почти нет.
И это, блин, кайфово!
В сравнении с Московским темпом очень классно замедлится и ощутить, как долго могут тянуться дни.
Связь не ловит, интернет только в апартах. Людей тоже почти нет.
И это, блин, кайфово!
В сравнении с Московским темпом очень классно замедлится и ощутить, как долго могут тянуться дни.
❤7
Есть ложь, есть наглая ложь, а есть статистика
Нас нанимают за точность и объективность данных. Мы привыкли доверять цифрам - они кажутся беспристрастными. На их основе мы делаем выбор и принимаем решения.
Но могут ли цифры врать?
Даррел Хафф в книге "Как лгать с помощью статистики" систематизировал способы обмана - от простых визуальных трюков до сложных манипуляций с методологией.
Можно выделить несколько видов статистических манипуляций:
- Визуальные манипуляции
- Манипуляции с выборкой
- Корреляция как причинность
- Статистическая значимость vs важность
- Эффект выживших
- Селективная отчетность
- Комбинированные манипуляции
Визуальные манипуляции
Самый простой способ - исказить восприятие через графики. Рост с 98% до 99% выглядит драматично, если ось начинается с 97%. Корпорации используют объемные диаграммы: если показатель вырос вдвое, площадь квадрата увеличится в 4 раза, а объем куба - в 8 раз. Визуальный эффект ошеломляющий при том же 100% росте.
Манипуляции с выборкой
Классический провал произошел в 1936 году, когда Literary Digest опросил 2,4 млн избирателей и предсказал победу Лэндона с результатом 57%. Реальный результат получился обратеый: Рузвельт победил 61% против 37% у Лэндона.
Выборка формировалась со смещением: из телефонных справочников и списков владельцев автомобилей - в то время это была элита, склонная голосовать за республиканцев.
Современные компании повторяют ошибку. Стартап заявляет, что "78% пользователей предпочитают новый интерфейс", тестируя только тех, кто сам обновил приложение.
Корреляция как причинность
Например, в США количество разводов коррелирует с потреблением маргарина. Логичный вывод: маргарин разрушает семьи!
На самом деле оба показателя росли параллельно с урбанизацией - классический пример ложной корреляции.
Статистическая значимость vs важность
Фармкомпании мастерски используют подмену понятий. Препарат показал "статистически значимое снижение смертности на 22% среди 18,000 пациентов”. Звучит революционно! Абсолютные цифры: 23 смерти против 29 в контрольной группе. Снижение с 0.13% до 0.16% - на жалкие 0.03 процентного пункта.
Ошибка выжившего
Во Второй мировой инженеры анализировали вернувшиеся бомбардировщики. Больше всего пробоин в крыльях и фюзеляже - логично усилить эти места.
Статистик Абрахам Вальд возразил: самолеты с пробоинами в двигателе и кабине пилота просто не вернулись. Усиливать надо именно критические зоны.
Бизнес-школы используют тот же принцип: "94% MBA-выпускников получают оффер за 3 месяца".
Из статистики исчезли отчисленные, сменившие специализацию, основавшие стартапы без зарплаты.
Селективная отчетность
Хафф приводит пример с зубной пастой: реклама утверждала, что "две трети стоматологов рекомендуют нашу пасту". Звучит убедительно! На деле опросили всего 12 стоматологов, причем вопрос звучал как "какие пасты вы иногда рекомендуете пациентам?" Можно было выбрать несколько вариантов. Восемь врачей среди прочих назвали и эту пасту.
Табачные компании довели селективность до совершенства. Philip Morris финансировала тысячи исследований о курении в 1970-90х, но в открытом доступе оказались менее 10% - те, что не показали связь с раком.
Комбинированные манипуляции
Наиболее коварны случаи, когда несколько техник используются одновременно. Исследование "доказало" безопасность продукта, исключив из анализа всех участников с побочными эффектами (манипуляция с выборкой), показав только относительные, а не абсолютные риски (подмена понятий), и опубликовав только успешные испытания из серии (селективная отчетность).
В эпоху больших данных проблема усугубилась - из петабайтов можно выкроить любую желаемую картину. Хафф предупреждал об этом 70 лет назад, но его уроки актуальны до сих пор.
Нас нанимают за точность и объективность данных. Мы привыкли доверять цифрам - они кажутся беспристрастными. На их основе мы делаем выбор и принимаем решения.
Но могут ли цифры врать?
Даррел Хафф в книге "Как лгать с помощью статистики" систематизировал способы обмана - от простых визуальных трюков до сложных манипуляций с методологией.
Можно выделить несколько видов статистических манипуляций:
- Визуальные манипуляции
- Манипуляции с выборкой
- Корреляция как причинность
- Статистическая значимость vs важность
- Эффект выживших
- Селективная отчетность
- Комбинированные манипуляции
Визуальные манипуляции
Самый простой способ - исказить восприятие через графики. Рост с 98% до 99% выглядит драматично, если ось начинается с 97%. Корпорации используют объемные диаграммы: если показатель вырос вдвое, площадь квадрата увеличится в 4 раза, а объем куба - в 8 раз. Визуальный эффект ошеломляющий при том же 100% росте.
Манипуляции с выборкой
Классический провал произошел в 1936 году, когда Literary Digest опросил 2,4 млн избирателей и предсказал победу Лэндона с результатом 57%. Реальный результат получился обратеый: Рузвельт победил 61% против 37% у Лэндона.
Выборка формировалась со смещением: из телефонных справочников и списков владельцев автомобилей - в то время это была элита, склонная голосовать за республиканцев.
Современные компании повторяют ошибку. Стартап заявляет, что "78% пользователей предпочитают новый интерфейс", тестируя только тех, кто сам обновил приложение.
Корреляция как причинность
Например, в США количество разводов коррелирует с потреблением маргарина. Логичный вывод: маргарин разрушает семьи!
На самом деле оба показателя росли параллельно с урбанизацией - классический пример ложной корреляции.
Статистическая значимость vs важность
Фармкомпании мастерски используют подмену понятий. Препарат показал "статистически значимое снижение смертности на 22% среди 18,000 пациентов”. Звучит революционно! Абсолютные цифры: 23 смерти против 29 в контрольной группе. Снижение с 0.13% до 0.16% - на жалкие 0.03 процентного пункта.
Ошибка выжившего
Во Второй мировой инженеры анализировали вернувшиеся бомбардировщики. Больше всего пробоин в крыльях и фюзеляже - логично усилить эти места.
Статистик Абрахам Вальд возразил: самолеты с пробоинами в двигателе и кабине пилота просто не вернулись. Усиливать надо именно критические зоны.
Бизнес-школы используют тот же принцип: "94% MBA-выпускников получают оффер за 3 месяца".
Из статистики исчезли отчисленные, сменившие специализацию, основавшие стартапы без зарплаты.
Селективная отчетность
Хафф приводит пример с зубной пастой: реклама утверждала, что "две трети стоматологов рекомендуют нашу пасту". Звучит убедительно! На деле опросили всего 12 стоматологов, причем вопрос звучал как "какие пасты вы иногда рекомендуете пациентам?" Можно было выбрать несколько вариантов. Восемь врачей среди прочих назвали и эту пасту.
Табачные компании довели селективность до совершенства. Philip Morris финансировала тысячи исследований о курении в 1970-90х, но в открытом доступе оказались менее 10% - те, что не показали связь с раком.
Комбинированные манипуляции
Наиболее коварны случаи, когда несколько техник используются одновременно. Исследование "доказало" безопасность продукта, исключив из анализа всех участников с побочными эффектами (манипуляция с выборкой), показав только относительные, а не абсолютные риски (подмена понятий), и опубликовав только успешные испытания из серии (селективная отчетность).
В эпоху больших данных проблема усугубилась - из петабайтов можно выкроить любую желаемую картину. Хафф предупреждал об этом 70 лет назад, но его уроки актуальны до сих пор.
👍6❤2
Что и где учить, если решил стать аналитиком данных
С момента, как только я задумался о переходе в аналитику данных по настоящее время, я прошел довольно много платных и бесплатных курсов по аналитике данных. Решил систематизировать эти знания и поделиться с вами.
Начну с того, что я выделяю 3 разных уровня знания хард-скиллов, которые могут быть у аналитика данных:
1. Необходимый минимум🖥: SQL + Python + BI.
Это база, необходимая каждому аналитику. Зная ее вы можете претендовать на стартовые роли и далее обрастать более профильными знаниями. Какими конкретно - зависит от вашей роли аналитика. Подробнее о ролях аналитика здесь
2. Базовый уровень🔫: SQL + Python + BI + Статистика + базовый A/B.
Тот стандарт, на который ориентируются большинство компаний.
На этом уровне вы справитесь с 80% задач аналитика данных (% оценил по личному опыту), что в целом достаточно для роли мидла в большинстве компаний.
3. Продвинутый 😎: SQL + Python + BI + Статистика + продвинутый A/B + ML.
Умеете все, что необходимо и даже больше. Справитесь с любыми техническими задачами. Рекрутеры будут гоняться за вами с предложениями пособеситься. Есть личное наблюдение, что этот уровень по-немногу становится базовым в большинстве компаний, т.к. уровень аналитики везде развивается.
Кроме того очень важно качать аналитическое мышление. Про это я также писал отдельный пост.
Теперь перейдем непосредственно к навыкам и где их изучать.
>> SQL >>
В большинстве случаев достаточно понимать план запроса, как работают джойны, оконки, CTE и вложенные запросы. Этого обычно достаточно, чтобы пройти собес.
Если планируете развиваться дальше в дата-инженера, то придется копать глубже.
1. Интерактивный тренажер SQL
2. Симулятор SQL
>>> Python >>>
Я бы проходил оба курса (для практики), но можно выбрать и один из них. Они дают одинаковую базу.
Как только почувствуете себя уверенными в задачках можно идти решать хэндбук от Яндекса - он посложнее и содержит меньше теории или продвиные курсы "Поколение Python"
1. Поколение Python
2. Karpov Courses - Основы Python
3. Хэндбук Яндекса
[Опционально: Алгоритмы]
Иногда задачки на алгоритмы любят давать на собесах. Но я лично считаю, что этот навык не требуется аналитику, поэтому ставлю этот навык опциональным.
Обычно спрашивают задачки уровня easy.
К ним можно подготовиться по материалам ниже:
1. Пройдя хэндбук Яндекса
2. Решая задачки уровня easy на leetcode
>>> BI >>>
BI систем на рынке очень много и на первый взгляд может показаться, что надо знать и все.
На самом деле это не так. Достаточно освоить один инструмент, т.к. концептуально они все одинаковые.
Самые популярные BI-системы в РФ на текущий момент: Yandex Datalens и Apache Superset. Поэтому лучше пройти курсы по ним:
1. Курс по Datalens от Яндекса
2. По суперсету бесплатных курсов нет, поэтому предлагаю ознакомиться с документацией и учиться делать дашборды на практике. Благо обе BI выше бесплатные.
Освоив навыки выше вы уже можете откликаться на первые вакансии в аналитике данных. Если хотите повысить свои шансы на оффер (и зп), то осваивайте навыки ниже
>>> Статистика >>>
Обычно я рекомендую 2 материала:
1. Курсы по статистике Анатолия Карпова
2. Книга Сары Бослаф - "Статистика для Всех"
>>> A/B >>>
Когда я начинал изучать A/B, в открытом доступе не было материалов с хорошей практикой, поэтому я опирался на теорию из материалов ниже и нарабатывал опыт на тестовых заданиях.
1. Лекции Глеба Михайлова по A/B
2. Книга Рона Кохави "Доверительное A/B Тестирование"
В комментах подсказали курс Яндекса по A/B. Кто проходил - поделитесь впечатлениями.
Что касается продвинутых методов A/B тестирования (методы снижения дисперсии, Causal Inference методы, SPRT и пр.) то в интернете довольно много статей на эту тему. Можете почиать Habr или профильные тг-каналы (например, у меня можно почитать про Causal Inference методы)
>>> ML >>>
Из бесплатных самый норм это курс ФКН ВШЭ.
В нем есть как теория в виде лекций на ютубе, так и практика.
!!Важно!!
Чем больше практики -> тем лучше результат.
Решайте как можно больше задач и будет вам счастье🌞
С момента, как только я задумался о переходе в аналитику данных по настоящее время, я прошел довольно много платных и бесплатных курсов по аналитике данных. Решил систематизировать эти знания и поделиться с вами.
Начну с того, что я выделяю 3 разных уровня знания хард-скиллов, которые могут быть у аналитика данных:
1. Необходимый минимум🖥: SQL + Python + BI.
Это база, необходимая каждому аналитику. Зная ее вы можете претендовать на стартовые роли и далее обрастать более профильными знаниями. Какими конкретно - зависит от вашей роли аналитика. Подробнее о ролях аналитика здесь
2. Базовый уровень🔫: SQL + Python + BI + Статистика + базовый A/B.
Тот стандарт, на который ориентируются большинство компаний.
На этом уровне вы справитесь с 80% задач аналитика данных (% оценил по личному опыту), что в целом достаточно для роли мидла в большинстве компаний.
3. Продвинутый 😎: SQL + Python + BI + Статистика + продвинутый A/B + ML.
Умеете все, что необходимо и даже больше. Справитесь с любыми техническими задачами. Рекрутеры будут гоняться за вами с предложениями пособеситься. Есть личное наблюдение, что этот уровень по-немногу становится базовым в большинстве компаний, т.к. уровень аналитики везде развивается.
Кроме того очень важно качать аналитическое мышление. Про это я также писал отдельный пост.
Теперь перейдем непосредственно к навыкам и где их изучать.
>> SQL >>
В большинстве случаев достаточно понимать план запроса, как работают джойны, оконки, CTE и вложенные запросы. Этого обычно достаточно, чтобы пройти собес.
Если планируете развиваться дальше в дата-инженера, то придется копать глубже.
1. Интерактивный тренажер SQL
2. Симулятор SQL
>>> Python >>>
Я бы проходил оба курса (для практики), но можно выбрать и один из них. Они дают одинаковую базу.
Как только почувствуете себя уверенными в задачках можно идти решать хэндбук от Яндекса - он посложнее и содержит меньше теории или продвиные курсы "Поколение Python"
1. Поколение Python
2. Karpov Courses - Основы Python
3. Хэндбук Яндекса
[Опционально: Алгоритмы]
Иногда задачки на алгоритмы любят давать на собесах. Но я лично считаю, что этот навык не требуется аналитику, поэтому ставлю этот навык опциональным.
Обычно спрашивают задачки уровня easy.
К ним можно подготовиться по материалам ниже:
1. Пройдя хэндбук Яндекса
2. Решая задачки уровня easy на leetcode
>>> BI >>>
BI систем на рынке очень много и на первый взгляд может показаться, что надо знать и все.
На самом деле это не так. Достаточно освоить один инструмент, т.к. концептуально они все одинаковые.
Самые популярные BI-системы в РФ на текущий момент: Yandex Datalens и Apache Superset. Поэтому лучше пройти курсы по ним:
1. Курс по Datalens от Яндекса
2. По суперсету бесплатных курсов нет, поэтому предлагаю ознакомиться с документацией и учиться делать дашборды на практике. Благо обе BI выше бесплатные.
Освоив навыки выше вы уже можете откликаться на первые вакансии в аналитике данных. Если хотите повысить свои шансы на оффер (и зп), то осваивайте навыки ниже
>>> Статистика >>>
Обычно я рекомендую 2 материала:
1. Курсы по статистике Анатолия Карпова
2. Книга Сары Бослаф - "Статистика для Всех"
>>> A/B >>>
Когда я начинал изучать A/B, в открытом доступе не было материалов с хорошей практикой, поэтому я опирался на теорию из материалов ниже и нарабатывал опыт на тестовых заданиях.
1. Лекции Глеба Михайлова по A/B
2. Книга Рона Кохави "Доверительное A/B Тестирование"
В комментах подсказали курс Яндекса по A/B. Кто проходил - поделитесь впечатлениями.
Что касается продвинутых методов A/B тестирования (методы снижения дисперсии, Causal Inference методы, SPRT и пр.) то в интернете довольно много статей на эту тему. Можете почиать Habr или профильные тг-каналы (например, у меня можно почитать про Causal Inference методы)
>>> ML >>>
Из бесплатных самый норм это курс ФКН ВШЭ.
В нем есть как теория в виде лекций на ютубе, так и практика.
!!Важно!!
Чем больше практики -> тем лучше результат.
Решайте как можно больше задач и будет вам счастье🌞
Telegram
Кусочек пиццы | Аналитика данных
Аналитики всякие нужны, аналитики всякие важны
Часто вижу на разных сайтах, что вакансии аналитиков сильно отличаются задачами, зонами ответственности и используемым стеком. Почему?
Для себя я объясняю это тем, что профессия аналитика ещё молодая, и требования…
Часто вижу на разных сайтах, что вакансии аналитиков сильно отличаются задачами, зонами ответственности и используемым стеком. Почему?
Для себя я объясняю это тем, что профессия аналитика ещё молодая, и требования…
🔥11👍3❤🔥2❤2⚡1 1
Оценка эффектов без A/B: разбираем Interrupted Time-Series Analysis
Продолжаю серию постов про методы оценки экспериментов при отсутствии контрольной группы. В прошлый раз разбирали Difference-in-Difference, сегодня поговорим про Interrupted Time-Series Analysis (ITSA) - метод анализа временных рядов.
Представьте ситуацию: ваша компания запустила новую программу лояльности для всех клиентов одновременно. Никакой контрольной группы нет - все получили изменения. Через месяц менеджмент спрашивает: “Сработала ли программа? Сколько выручки она принесла?”
Что делать?
Можно, конечно, просто сравнить средние показатели до и после. Но это примитивный подход - он не учитывает естественные тренды, сезонность и другие факторы. А можно применить ITSA.
В чем суть метода?
ITSA анализирует изменение временного ряда в момент вмешательства (intervention). Метод позволяет отделить эффект воздействия от естественной динамики показателя.
Ключевая идея: мы строим модель поведения метрики ДО вмешательства, а затем смотрим, насколько фактические значения ПОСЛЕ отклоняются от прогноза этой модели.
Метод оценивает два типа эффектов:
1. Немедленное изменение уровня (level change) - мгновенный скачок метрики сразу после вмешательства. Например, выручка выросла на 15% в первый же день после запуска программы.
2. Изменение тренда (slope change) - изменение скорости роста метрики. Например, до программы выручка росла на 2% в месяц, а после стала расти на 5% в месяц.
Базовая модель ITSA выглядит так:
Где:
- β0 - тренд до вмешательства
- β2 - немедленное изменение уровня
- β3 - изменение тренда после вмешательства
- Воздействие - бинарная переменная (0 до, 1 после)
- Время_после - количество периодов после вмешательства
Пример
Допустим, вы в компании запустили реферальную программу. У вас есть данные по количеству регистраций за 30 недель до запуска и 20 недель после.
До запуска регистрации росли линейно на ~50 пользователей в неделю. После запуска:
- Немедленный скачок: +300 регистраций в первую неделю (β₂)
- Изменение тренда: рост ускорился до +80 пользователей в неделю (β₃)
Модель показала статистически значимые изменения обоих параметров (p < 0.05), что подтвердило эффективность программы.
Условия применения метода
ITSA не универсален. Для корректного применения важно соблюдать несколько условий:
1. Достаточная длина временного ряда
Минимум 8-10 наблюдений до вмешательства и желательно столько же после. Чем больше данных - тем надежнее оценка.
2. Стабильный процесс генерации данных
До вмешательства метрика должна следовать предсказуемому паттерну. Если данные до воздействия хаотичны, модель не сможет выделить эффект.
3. Отсутствие других вмешательств
Критично важно: в момент "разрыва" не должно происходить других значимых событий. Если вы запустили программу лояльности 1 декабря, а это еще и начало новогодней распродажи - метод не сможет разделить эффекты.
4. Отсутствие автокорреляции остатков
Последовательные наблюдения не должны быть сильно коррелированы.
Когда ITSA работает лучше других методов?
Метод особенно полезен, когда:
- У вас нет возможности выделить контрольную группу
- Вмешательство применяется ко всей популяции одновременно
- Есть длинная история наблюдений до события
- Важно понять не только факт эффекта, но и его динамику
Ограничения метода
ITSA предполагает, что без вмешательства тренд продолжился бы таким же. Но это допущение может не выполняться. Например, если рынок внезапно изменился или конкурент запустил агрессивную акцию.
Кроме того, метод чувствителен к сезонности. Если ваши данные имеют сильные сезонные колебания - их нужно учитывать в модели, иначе оценка будет смещенной.
Как и любой инструмент причинно-следственного анализа, ITSA имеет свои сильные и слабые стороны. Он не заменяет рандомизированные эксперименты, но когда тест невозможен - это один из наиболее простых и доступных методов.
В следующих постах разберу более сложные методы, используемые для случаев, когда стандартных подходов недостаточно.
Продолжаю серию постов про методы оценки экспериментов при отсутствии контрольной группы. В прошлый раз разбирали Difference-in-Difference, сегодня поговорим про Interrupted Time-Series Analysis (ITSA) - метод анализа временных рядов.
Представьте ситуацию: ваша компания запустила новую программу лояльности для всех клиентов одновременно. Никакой контрольной группы нет - все получили изменения. Через месяц менеджмент спрашивает: “Сработала ли программа? Сколько выручки она принесла?”
Что делать?
Можно, конечно, просто сравнить средние показатели до и после. Но это примитивный подход - он не учитывает естественные тренды, сезонность и другие факторы. А можно применить ITSA.
В чем суть метода?
ITSA анализирует изменение временного ряда в момент вмешательства (intervention). Метод позволяет отделить эффект воздействия от естественной динамики показателя.
Ключевая идея: мы строим модель поведения метрики ДО вмешательства, а затем смотрим, насколько фактические значения ПОСЛЕ отклоняются от прогноза этой модели.
Метод оценивает два типа эффектов:
1. Немедленное изменение уровня (level change) - мгновенный скачок метрики сразу после вмешательства. Например, выручка выросла на 15% в первый же день после запуска программы.
2. Изменение тренда (slope change) - изменение скорости роста метрики. Например, до программы выручка росла на 2% в месяц, а после стала расти на 5% в месяц.
Базовая модель ITSA выглядит так:
Y = β0 + β1 * Время + β2 * Воздействие + β3 * Время_после + e
Где:
- β0 - тренд до вмешательства
- β2 - немедленное изменение уровня
- β3 - изменение тренда после вмешательства
- Воздействие - бинарная переменная (0 до, 1 после)
- Время_после - количество периодов после вмешательства
Пример
Допустим, вы в компании запустили реферальную программу. У вас есть данные по количеству регистраций за 30 недель до запуска и 20 недель после.
До запуска регистрации росли линейно на ~50 пользователей в неделю. После запуска:
- Немедленный скачок: +300 регистраций в первую неделю (β₂)
- Изменение тренда: рост ускорился до +80 пользователей в неделю (β₃)
Модель показала статистически значимые изменения обоих параметров (p < 0.05), что подтвердило эффективность программы.
Условия применения метода
ITSA не универсален. Для корректного применения важно соблюдать несколько условий:
1. Достаточная длина временного ряда
Минимум 8-10 наблюдений до вмешательства и желательно столько же после. Чем больше данных - тем надежнее оценка.
2. Стабильный процесс генерации данных
До вмешательства метрика должна следовать предсказуемому паттерну. Если данные до воздействия хаотичны, модель не сможет выделить эффект.
3. Отсутствие других вмешательств
Критично важно: в момент "разрыва" не должно происходить других значимых событий. Если вы запустили программу лояльности 1 декабря, а это еще и начало новогодней распродажи - метод не сможет разделить эффекты.
4. Отсутствие автокорреляции остатков
Последовательные наблюдения не должны быть сильно коррелированы.
Когда ITSA работает лучше других методов?
Метод особенно полезен, когда:
- У вас нет возможности выделить контрольную группу
- Вмешательство применяется ко всей популяции одновременно
- Есть длинная история наблюдений до события
- Важно понять не только факт эффекта, но и его динамику
Ограничения метода
ITSA предполагает, что без вмешательства тренд продолжился бы таким же. Но это допущение может не выполняться. Например, если рынок внезапно изменился или конкурент запустил агрессивную акцию.
Кроме того, метод чувствителен к сезонности. Если ваши данные имеют сильные сезонные колебания - их нужно учитывать в модели, иначе оценка будет смещенной.
Как и любой инструмент причинно-следственного анализа, ITSA имеет свои сильные и слабые стороны. Он не заменяет рандомизированные эксперименты, но когда тест невозможен - это один из наиболее простых и доступных методов.
В следующих постах разберу более сложные методы, используемые для случаев, когда стандартных подходов недостаточно.
🔥5
Кусочек пиццы | Аналитика данных pinned «Что и где учить, если решил стать аналитиком данных С момента, как только я задумался о переходе в аналитику данных по настоящее время, я прошел довольно много платных и бесплатных курсов по аналитике данных. Решил систематизировать эти знания и поделиться…»
О работе в бигтехе и небольших компаниях 🏢
Только что вернулся со съезда дата-офиса в Додо и решил поразмышлять о том, чем отличается работа аналитика в больших корпорациях и компаниях поменьше. Я работал в обоих типах компаний и у меня сформировались кое-какие наблюдения. Однако я постараюсь не привязываться к конкретным брендам, а дам общую оценку на основании своего опыта.
Инфраструктура: мощь🖥 vs гибкость 🛠
В бигтехе инфраструктура - это то, на что стоит равняться. A/B-платформы позволяют запускать эксперименты на миллионах пользователей в пару кликов. Автоматический расчет значимости, проверка SRM, детальная сегментация - все из коробки. Витрины данных содержат готовые портреты пользователей.
Нужен анализ сегмента? Пишешь запрос к витрине - готово. В небольших компаниях все иначе. Витрины содержат только базовую информацию. Портрет пользователя собираешь из CRM, данных о заказах, мобильного приложения. На тот же анализ уходит в разы больше времени.
Но есть плюс: ты сам строишь инфраструктуру. Видишь проблему - предлагаешь решение и внедряешь. Никаких согласований с тремя командами и архитекторами данных.
Процессы: хаос🔥 и структура 📋
В бигтехе процессы зависят от команды. Есть направления с отточенными процедурами: стандартные темплейты, обязательные пре- и пост-анализы. Но есть команды, где все держится на энтузиазме отдельных аналитиков.
В небольших компаниях процессы часто выстроены лучше, чем ожидаешь. Четкая методология, документированные подходы, структурированная отчетность.
Главное различие - в требованиях к результату. В бигтехе каждый анализ должен приводить к конкретному результату: рост метрик или экономия бюджета. "Просто посмотреть на данные" недостаточно - нужен actionable инсайт.
В небольших компаниях больше терпимости к исследовательским задачам. Можно изучать поведение ради понимания, а не только ради метрик.
Карьерные перспективы: винтик⚙️ или архитектор 🏗
В бигтехе легко стать винтиком в корпоративной машине. Отвечаешь за узкий кусок продукта, делаешь его хорошо, но видишь только свой участок.
Но есть обратная сторона: огромное количество направлений. Устал анализировать конверсию в e-commerce? Переходи в команду монетизации контента. Надоела продуктовая аналитика? Иди в маркетинговую. Внутренняя мобильность дает возможность расти горизонтально.
В небольших компаниях ты не винтик - ты архитектор. Отвечаешь за аналитику целого направления, влияешь на стратегию, видишь результат своих решений напрямую. Больше ответственности, больше свободы.
Но новых направлений открывается меньше. Если хочешь сменить фокус с продуктовой аналитики на что-то радикально другое - скорее всего, придется менять компанию.
Скорость🚀 и бюрократия 📝
В обоих типах компаний скорость принятия решений может быть высокой. Если есть данные, подтверждающие гипотезу - решение принимается быстро.
Разница в другом. В бигтехе бюрократия возникает на этапе доступа к данным. Нужны данные из смежной системы? Подавай заявку, обоснуй, жди апрува. В небольших компаниях меньше формальностей, но больше хаоса. Данные лежат где попало, документации мало.
Что выбрать? 🤔
Если ты начинающий аналитик - бигтех даст сильную техническую базу и покажет высокие стандарты. Научишься работать с большими данными, увидишь аналитику в масштабе. Правда, готовься к высокой конкуренции.
Если ты опытный специалист и хочешь влиять на продукт - в небольших компаниях больше свободы и ответственности. Но потребуется больше времени на техническую работу.
Идеальный путь - начать в бигтехе, получить сильную базу, а затем перейти в растущую компанию, где можно применить знания для создания процессов с нуля.
Парадокс в том, что многие мечтают о переходе в противоположную сторону. Те, кто в бигтехе, устают от бюрократии. Те, кто в небольших компаниях, мечтают о ресурсах. Трава всегда зеленее.
Только что вернулся со съезда дата-офиса в Додо и решил поразмышлять о том, чем отличается работа аналитика в больших корпорациях и компаниях поменьше. Я работал в обоих типах компаний и у меня сформировались кое-какие наблюдения. Однако я постараюсь не привязываться к конкретным брендам, а дам общую оценку на основании своего опыта.
Инфраструктура: мощь🖥 vs гибкость 🛠
В бигтехе инфраструктура - это то, на что стоит равняться. A/B-платформы позволяют запускать эксперименты на миллионах пользователей в пару кликов. Автоматический расчет значимости, проверка SRM, детальная сегментация - все из коробки. Витрины данных содержат готовые портреты пользователей.
Нужен анализ сегмента? Пишешь запрос к витрине - готово. В небольших компаниях все иначе. Витрины содержат только базовую информацию. Портрет пользователя собираешь из CRM, данных о заказах, мобильного приложения. На тот же анализ уходит в разы больше времени.
Но есть плюс: ты сам строишь инфраструктуру. Видишь проблему - предлагаешь решение и внедряешь. Никаких согласований с тремя командами и архитекторами данных.
Процессы: хаос🔥 и структура 📋
В бигтехе процессы зависят от команды. Есть направления с отточенными процедурами: стандартные темплейты, обязательные пре- и пост-анализы. Но есть команды, где все держится на энтузиазме отдельных аналитиков.
В небольших компаниях процессы часто выстроены лучше, чем ожидаешь. Четкая методология, документированные подходы, структурированная отчетность.
Главное различие - в требованиях к результату. В бигтехе каждый анализ должен приводить к конкретному результату: рост метрик или экономия бюджета. "Просто посмотреть на данные" недостаточно - нужен actionable инсайт.
В небольших компаниях больше терпимости к исследовательским задачам. Можно изучать поведение ради понимания, а не только ради метрик.
Карьерные перспективы: винтик⚙️ или архитектор 🏗
В бигтехе легко стать винтиком в корпоративной машине. Отвечаешь за узкий кусок продукта, делаешь его хорошо, но видишь только свой участок.
Но есть обратная сторона: огромное количество направлений. Устал анализировать конверсию в e-commerce? Переходи в команду монетизации контента. Надоела продуктовая аналитика? Иди в маркетинговую. Внутренняя мобильность дает возможность расти горизонтально.
В небольших компаниях ты не винтик - ты архитектор. Отвечаешь за аналитику целого направления, влияешь на стратегию, видишь результат своих решений напрямую. Больше ответственности, больше свободы.
Но новых направлений открывается меньше. Если хочешь сменить фокус с продуктовой аналитики на что-то радикально другое - скорее всего, придется менять компанию.
Скорость🚀 и бюрократия 📝
В обоих типах компаний скорость принятия решений может быть высокой. Если есть данные, подтверждающие гипотезу - решение принимается быстро.
Разница в другом. В бигтехе бюрократия возникает на этапе доступа к данным. Нужны данные из смежной системы? Подавай заявку, обоснуй, жди апрува. В небольших компаниях меньше формальностей, но больше хаоса. Данные лежат где попало, документации мало.
Что выбрать? 🤔
Если ты начинающий аналитик - бигтех даст сильную техническую базу и покажет высокие стандарты. Научишься работать с большими данными, увидишь аналитику в масштабе. Правда, готовься к высокой конкуренции.
Если ты опытный специалист и хочешь влиять на продукт - в небольших компаниях больше свободы и ответственности. Но потребуется больше времени на техническую работу.
Идеальный путь - начать в бигтехе, получить сильную базу, а затем перейти в растущую компанию, где можно применить знания для создания процессов с нуля.
Парадокс в том, что многие мечтают о переходе в противоположную сторону. Те, кто в бигтехе, устают от бюрократии. Те, кто в небольших компаниях, мечтают о ресурсах. Трава всегда зеленее.
🔥8
Нас 100!
Спасибо всем, что читаете мой канал🙏
Чтобы продолжать радовать вас еще более интересным контентом, давайте немного познакомимся.
Спасибо всем, что читаете мой канал🙏
Чтобы продолжать радовать вас еще более интересным контентом, давайте немного познакомимся.
🔥5
В какой сфере вы работаете?
Anonymous Poll
64%
Аналитика данных
18%
Другая сфера в ИТ
18%
Другая сфера не в ИТ
Удаленка vs неудаленка
Я встаю без будильника. И считаю это одним из тех благ, за которые надо ценить работу в IT - гибкий график.
Но вот че-то уже вторую неделю собираюсь в офис и никак до него не дойду. Каждый вечер думаю: “Ну вот завтра точно поеду” А потом просыпаюсь в 9:30, и понимаю - ехать уже нет смысла. Час в одну сторону, час обратно. Это ж два часа продуктивного времени.
Дома достаточно легко погрузиться на 3-4 часа в задачу, особенно, если нет созвонов среди дня. Плюс можно поработать вечером, если есть вдохновение. Вчера как раз был такой случай.
И вроде понятно, почему все так топят за удаленку. НО!
После 2+ недель дома в таком режиме я начинаю себя чувствовать то ли отшельником, то ли затворником, застрявшем в вечном дне сурка: кровать -> монитор -> кровать (ну и плюс прогулки до магазина и зала в промежутках).
В офисе как-то легче переключаться между режимами работа/ дом, т.к. обычно после того, как ты закрыл ноут в офисе, дома ты его уже не открываешь. Плюс неформальное общение помогает разгрузить голову между задачами. Дома с этим сложнее.
Но каждый день ходить в офис это конечно тоже нафиг надо. Слишком много времени тратится на поездки туда-обратно.
У вас как с этим?
Я встаю без будильника. И считаю это одним из тех благ, за которые надо ценить работу в IT - гибкий график.
Но вот че-то уже вторую неделю собираюсь в офис и никак до него не дойду. Каждый вечер думаю: “Ну вот завтра точно поеду” А потом просыпаюсь в 9:30, и понимаю - ехать уже нет смысла. Час в одну сторону, час обратно. Это ж два часа продуктивного времени.
Дома достаточно легко погрузиться на 3-4 часа в задачу, особенно, если нет созвонов среди дня. Плюс можно поработать вечером, если есть вдохновение. Вчера как раз был такой случай.
И вроде понятно, почему все так топят за удаленку. НО!
После 2+ недель дома в таком режиме я начинаю себя чувствовать то ли отшельником, то ли затворником, застрявшем в вечном дне сурка: кровать -> монитор -> кровать (ну и плюс прогулки до магазина и зала в промежутках).
В офисе как-то легче переключаться между режимами работа/ дом, т.к. обычно после того, как ты закрыл ноут в офисе, дома ты его уже не открываешь. Плюс неформальное общение помогает разгрузить голову между задачами. Дома с этим сложнее.
Но каждый день ходить в офис это конечно тоже нафиг надо. Слишком много времени тратится на поездки туда-обратно.
У вас как с этим?
👍5😁4
Навигатор по постам
Постов в канале стало больше, поэтому собрал небольшой пост-навигатор, чтобы проще в них ориентироваться.
Causal Inference методы
- Как оценивать эффекты, когда нет контрольной группы
- Difference-in-Differences (DiD) или Разница Разниц
- Interrupted Time-Series Analysis (ITSA)
- Propensity Score Matching (PSM)
Метрики
- Что такое иерархия метрик
- Как работать с метриками
- LTV и CAC
Кейсы с собесов
- Аномальная доля возвратов
- Выпуск промокода
- Падение метрики
Карьера
- Виды аналитиков
- Что учить, если решил стать аналитиком данных
- Как уровень вовлеченности в бизнес влияет на карьеру аналитика
- Мой опыт работы в Бигтехе и индустрии
- Мой опыт собеседований в зарубежные компании
- О необходимости джунов
- Заменит ли нас ИИ
Общее
- Есть ложь, есть наглая ложь, а есть статистика
- Про многозадачность
- Как статистика помогает не сдаваться
- Сколько знакомств надо совершить, чтобы найти идеального партнера?
- Интернет умер
[Со временем этот навигатор будет разрастаться, так что не теряйте его]
Постов в канале стало больше, поэтому собрал небольшой пост-навигатор, чтобы проще в них ориентироваться.
Causal Inference методы
- Как оценивать эффекты, когда нет контрольной группы
- Difference-in-Differences (DiD) или Разница Разниц
- Interrupted Time-Series Analysis (ITSA)
- Propensity Score Matching (PSM)
Метрики
- Что такое иерархия метрик
- Как работать с метриками
- LTV и CAC
Кейсы с собесов
- Аномальная доля возвратов
- Выпуск промокода
- Падение метрики
Карьера
- Виды аналитиков
- Что учить, если решил стать аналитиком данных
- Как уровень вовлеченности в бизнес влияет на карьеру аналитика
- Мой опыт работы в Бигтехе и индустрии
- Мой опыт собеседований в зарубежные компании
- О необходимости джунов
- Заменит ли нас ИИ
Общее
- Есть ложь, есть наглая ложь, а есть статистика
- Про многозадачность
- Как статистика помогает не сдаваться
- Сколько знакомств надо совершить, чтобы найти идеального партнера?
- Интернет умер
[Со временем этот навигатор будет разрастаться, так что не теряйте его]
Telegram
Кусочек пиццы | Аналитика данных
Аналитики всякие нужны, аналитики всякие важны
Часто вижу на разных сайтах, что вакансии аналитиков сильно отличаются задачами, зонами ответственности и используемым стеком. Почему?
Для себя я объясняю это тем, что профессия аналитика ещё молодая, и требования…
Часто вижу на разных сайтах, что вакансии аналитиков сильно отличаются задачами, зонами ответственности и используемым стеком. Почему?
Для себя я объясняю это тем, что профессия аналитика ещё молодая, и требования…
🔥3❤2