Так как лишь малая часть среди вас знает меня лично, появилась идея представить и написать про, свой бэкграунд. Что думаете?
Final Results
86%
Да, было бы интересно узнать
12%
Мне в целом без разницы
2%
Нет, я и так про тебя всё знаю.
#ресурсы
Polars🐻❄ vs Pandas🐼
Сейчас продолжаю пилить библиотеку для АБ тестов внутри компании и очень понадобилось мёрджить два дата фрейма в ходе симуляций, и дело в том что в Pandas 🐼 этой действие занимает ну прям много времени, поэтому пришлось искать альтернативу побыстрее. Единственная известная мне на сегодняшний день альтернатива - Polars🐻❄.
Polars🐻❄ это по функционалу тот же Pandas🐼, но написанный на Rust, когда Pandas🐼 был написан на наборе языков (Cython,Python,C), что даёт первому преимущество в скорости.
В принципе если вы работали с Pandas🐼, то с Polars🐻❄ тоже разберётесь быстро, но манипуляции со столбцами, мёрджи, создание новых столбцов делаются по другому с точки зрения кода.
Поэтому поделюсь с вами статьёй на Medium где описаны основные команды которые могут пригодиться, если решите попробовать.
P.S. прикладываю скрин перформанса Polars🐻❄ vs Pandas🐼 inner мёрджа двух датафреймов по 40 к в каждом. Побеждает 🐻❄ c двукратным преимуществом.
Polars🐻❄ vs Pandas🐼
Сейчас продолжаю пилить библиотеку для АБ тестов внутри компании и очень понадобилось мёрджить два дата фрейма в ходе симуляций, и дело в том что в Pandas 🐼 этой действие занимает ну прям много времени, поэтому пришлось искать альтернативу побыстрее. Единственная известная мне на сегодняшний день альтернатива - Polars🐻❄.
Polars🐻❄ это по функционалу тот же Pandas🐼, но написанный на Rust, когда Pandas🐼 был написан на наборе языков (Cython,Python,C), что даёт первому преимущество в скорости.
В принципе если вы работали с Pandas🐼, то с Polars🐻❄ тоже разберётесь быстро, но манипуляции со столбцами, мёрджи, создание новых столбцов делаются по другому с точки зрения кода.
Поэтому поделюсь с вами статьёй на Medium где описаны основные команды которые могут пригодиться, если решите попробовать.
P.S. прикладываю скрин перформанса Polars🐻❄ vs Pandas🐼 inner мёрджа двух датафреймов по 40 к в каждом. Побеждает 🐻❄ c двукратным преимуществом.
🔥12👍1😱1
Product analysis | Varsanovich
Так как лишь малая часть среди вас знает меня лично, появилась идея представить и написать про, свой бэкграунд. Что думаете?
Обо мне
Я Senior Product Analyst в компании Gett (ex. Gettaxi) , работаю в аналитике уже 5 лет, живу временно на Кипре 🏝
Из них 2 года я успел поработать в Билайне на позиции бизнес аналитика (занимался операционной аналитикой) и экспертом по фин анализу (прям в самом финансовом департаменте).
Ну и соответственно 3 года уже вовлечён в продуктовую аналитику, начал с МТС , там поработал 1 год, и вот уже 2 года таксую 🚕
Перебраться из фин аналитика в продуктового мне помог на тот момент Яндекс Практикум (я наверное был в одном из первых потоков), за что я ему благодарен 🙏
Но хочу честно добавить что в принципе мне он неплохо помог с Python и в целом свой путь в Python я начал с него, а вот SQL если я правильно помню у ребят тогда был слабый, и качался я по sql_ex
А статистику на первых порах по Карпову на Степике)
Но мой опыт по вкатыванию в прод аналитику не всем будет релевантен потому что как я написал выше, я уже работал на тот момент два года аналитиком, то есть навыки у меня были (эдхоки, визуализации, оценка потенциала для фичей и т.д.) , только инструментов не хватало. 🎸
Из интересного, в начале марта 2022 за 3 недели получил в оффер в Швецию в H&M 👕 , но в итоге не поехал потому что Gett предложил более хорошие условия и ребята из H&M отменили удалёнку, что для меня было критично... Но я надеюсь, что всё таки туда ещё доеду, когда нибудь 😁🤫
Из таких вот целей и мечт, хочу поработать в какой нибудь очень крутой компании типа уровня FAANG и помочь сделать что-то полезное для мира 🌍
Приятно со всеми познакомиться, пишите вопросы, если есть, рад буду обсудить 🙃
Я Senior Product Analyst в компании Gett (ex. Gettaxi) , работаю в аналитике уже 5 лет, живу временно на Кипре 🏝
Из них 2 года я успел поработать в Билайне на позиции бизнес аналитика (занимался операционной аналитикой) и экспертом по фин анализу (прям в самом финансовом департаменте).
Ну и соответственно 3 года уже вовлечён в продуктовую аналитику, начал с МТС , там поработал 1 год, и вот уже 2 года таксую 🚕
Перебраться из фин аналитика в продуктового мне помог на тот момент Яндекс Практикум (я наверное был в одном из первых потоков), за что я ему благодарен 🙏
Но хочу честно добавить что в принципе мне он неплохо помог с Python и в целом свой путь в Python я начал с него, а вот SQL если я правильно помню у ребят тогда был слабый, и качался я по sql_ex
А статистику на первых порах по Карпову на Степике)
Но мой опыт по вкатыванию в прод аналитику не всем будет релевантен потому что как я написал выше, я уже работал на тот момент два года аналитиком, то есть навыки у меня были (эдхоки, визуализации, оценка потенциала для фичей и т.д.) , только инструментов не хватало. 🎸
Из интересного, в начале марта 2022 за 3 недели получил в оффер в Швецию в H&M 👕 , но в итоге не поехал потому что Gett предложил более хорошие условия и ребята из H&M отменили удалёнку, что для меня было критично... Но я надеюсь, что всё таки туда ещё доеду, когда нибудь 😁🤫
Из таких вот целей и мечт, хочу поработать в какой нибудь очень крутой компании типа уровня FAANG и помочь сделать что-то полезное для мира 🌍
Приятно со всеми познакомиться, пишите вопросы, если есть, рад буду обсудить 🙃
👍17🔥12❤2👏1
#обзор_research_paper
Пост про кореллированную внутри себя выборку
Есть такая жизненная боль, друзья, называется анализ и дизайн АБ тестов, когда единица рандомизации юзер, а метрики которые ты сравниваешь - сессионные и как бы это просто дьявольская история. Почему?😈
(начинающие аналитики Heads up!!!) Причина в том что нарушается ЦПТ (надо что бы все точки в вашей выборки были независимы друг от друга) и уже нельзя использовать z-test, t-test для дизайна и анализа эксперимента, так как вероятность увидеть разницу там где её нет этими тестами возрастает. 🥲
На помощь приходят линеаризация и бутстрап(не люблю его), а их мощность можно оценивать только симуляциями Монте-Карло что долго и больно, а ещё само перемешивание таких выборок делается геморройно😡
Нашёл свежий research paper по АБ тестам от ребят из Apple (17 Aug 2023), в которым рассказывается как можно адаптировать дельта метод под эти нужды и внимание: оценивать мощность при помощи формулы. Приложил его сверху 🔝
С͓т͓а͓в͓ь͓т͓е͓ 🐳 если хотите что бы я сделал разбор этого метода в одном из следующих постов.
Пост про кореллированную внутри себя выборку
Есть такая жизненная боль, друзья, называется анализ и дизайн АБ тестов, когда единица рандомизации юзер, а метрики которые ты сравниваешь - сессионные и как бы это просто дьявольская история. Почему?😈
(начинающие аналитики Heads up!!!) Причина в том что нарушается ЦПТ (надо что бы все точки в вашей выборки были независимы друг от друга) и уже нельзя использовать z-test, t-test для дизайна и анализа эксперимента, так как вероятность увидеть разницу там где её нет этими тестами возрастает. 🥲
На помощь приходят линеаризация и бутстрап(не люблю его), а их мощность можно оценивать только симуляциями Монте-Карло что долго и больно, а ещё само перемешивание таких выборок делается геморройно😡
Нашёл свежий research paper по АБ тестам от ребят из Apple (17 Aug 2023), в которым рассказывается как можно адаптировать дельта метод под эти нужды и внимание: оценивать мощность при помощи формулы. Приложил его сверху 🔝
С͓т͓а͓в͓ь͓т͓е͓ 🐳 если хотите что бы я сделал разбор этого метода в одном из следующих постов.
🐳28👍5❤4
Product analysis | Varsanovich pinned «Обо мне Я Senior Product Analyst в компании Gett (ex. Gettaxi) , работаю в аналитике уже 5 лет, живу временно на Кипре 🏝 Из них 2 года я успел поработать в Билайне на позиции бизнес аналитика (занимался операционной аналитикой) и экспертом по фин анализу…»
#вакансии
Дружеский пост 🤝
Мой бывший руководитель в МТС Боря , ex Yandex, ex Sber (сейчас уже CPO HR-tech) ищет продуктового аналитика в направление HR-tech MTC. Конкретно про Борю скажу что он 100% адекватный и Data driven Product Manager с которым можно и в огонь и в воду.
Единственное что желателен человек с опытом , так как аналитические процессы придётся выстраивать самому и направлять Борю и его команду на новые крутые инсайты. Со своей стороны скажу, что у ребят из Big Data MTC есть неплохая ,как говорят, библиотека по АБ тестированию, значит всё таки по каким то техническим вопросам можно будет найти собеседника. И также повторю что Боря крутой продакт поэтому если в дальнейшем хотите сделать переход в Product Management, то тоже стоит обратить внимание на вакансию. Вот описание, отправляйте резюме вот сюда @Boris_Goncharov :
Про команду:
Мы - HR Tech стрим «Найм и Подбор». Нашими продуктами ежемесячно пользуются десятки тысяч кандидатов и тысячи сотрудников.
Мы строим крутой цифровой опыт наших новых коллег, их руководителей и рекрутеров, а так же формируем привлекательный бренд работодателя. Продуктовый аналитик в нашем стриме решает задачи, которые связаны с поиском точек роста и решением проблем в запущенных сервисах, а так же участвует проектировании нового функционала, запуске и анализе результатов A/B тестов.
Работать можно из любой точки РФ)
Наш кандидат:
- Проектировал ключевые и прокси-метрики продуктов
- Размечал событиями web – приложения
- Искал точки роста, основываясь на данных и формулировал продуктовые гипотезы
- Знаком с Python и SQL
- Имеет опыт создания отчетов в BI системах
- Имеет опыт работы с системами аналитики – такими, как Amplitude / Mixpanel / Yandex Metrica / Google Analytics / etc
- Имеет опыт проведения A/B, анализа продуктовых метрик
Опыт участия в формировании продуктовой стратегии или бизнес плана - как дополнительный плюс.
Пример задач, с которыми предстоит столкнуться:
- Сформировать дашборды с ключевыми продуктовыми метриками для карьерного сайта job.mts.ru и системы пребординга МТС Hello, построить регулярный репортинг этих метрик для стейкхолдеров и продуктовых команд
- Построить единую воронку из job-бордов в этапы собеседований, преборд и успешность адаптации
- Исследовать и предложить точки роста для job.mts.ru и онборд
Дружеский пост 🤝
Мой бывший руководитель в МТС Боря , ex Yandex, ex Sber (сейчас уже CPO HR-tech) ищет продуктового аналитика в направление HR-tech MTC. Конкретно про Борю скажу что он 100% адекватный и Data driven Product Manager с которым можно и в огонь и в воду.
Единственное что желателен человек с опытом , так как аналитические процессы придётся выстраивать самому и направлять Борю и его команду на новые крутые инсайты. Со своей стороны скажу, что у ребят из Big Data MTC есть неплохая ,как говорят, библиотека по АБ тестированию, значит всё таки по каким то техническим вопросам можно будет найти собеседника. И также повторю что Боря крутой продакт поэтому если в дальнейшем хотите сделать переход в Product Management, то тоже стоит обратить внимание на вакансию. Вот описание, отправляйте резюме вот сюда @Boris_Goncharov :
Про команду:
Мы - HR Tech стрим «Найм и Подбор». Нашими продуктами ежемесячно пользуются десятки тысяч кандидатов и тысячи сотрудников.
Мы строим крутой цифровой опыт наших новых коллег, их руководителей и рекрутеров, а так же формируем привлекательный бренд работодателя. Продуктовый аналитик в нашем стриме решает задачи, которые связаны с поиском точек роста и решением проблем в запущенных сервисах, а так же участвует проектировании нового функционала, запуске и анализе результатов A/B тестов.
Работать можно из любой точки РФ)
Наш кандидат:
- Проектировал ключевые и прокси-метрики продуктов
- Размечал событиями web – приложения
- Искал точки роста, основываясь на данных и формулировал продуктовые гипотезы
- Знаком с Python и SQL
- Имеет опыт создания отчетов в BI системах
- Имеет опыт работы с системами аналитики – такими, как Amplitude / Mixpanel / Yandex Metrica / Google Analytics / etc
- Имеет опыт проведения A/B, анализа продуктовых метрик
Опыт участия в формировании продуктовой стратегии или бизнес плана - как дополнительный плюс.
Пример задач, с которыми предстоит столкнуться:
- Сформировать дашборды с ключевыми продуктовыми метриками для карьерного сайта job.mts.ru и системы пребординга МТС Hello, построить регулярный репортинг этих метрик для стейкхолдеров и продуктовых команд
- Построить единую воронку из job-бордов в этапы собеседований, преборд и успешность адаптации
- Исследовать и предложить точки роста для job.mts.ru и онборд
GitHub
GitHub - MTSWebServices/Ambrosia: Ambrosia is a Python library for A/B tests design, split and result measurement
Ambrosia is a Python library for A/B tests design, split and result measurement - MTSWebServices/Ambrosia
🔥6❤2
#обзор_на_книжку
Книжка для знакомства и старта разработки на Python 🐍
В этом посте хотел поделиться и порекомендовать вам книжку по Python , а именно : "Изучаем Python" Эрик Мэтиз .
На самом деле много кто её рекомендовал в разных телеграмм каналах, но хотел тут выразить своё мнение и понимание ценности данной книги и в целом поделиться своим кейсом как я к ней пришёл. 🚶
Дело в том что как я писал выше, я начал своё знакомство с Python c Яндекс Практикума и по окончанию курса я достаточно свободно себя чувствовал с Pandas, но вот что-то разрабатывать на Python я просто не умел и не понимал как, то есть как создать библиотеку, что такое Объектно ориентированное программирование это всё для меня было мимо (для аналитика в начале пути это наверное всё и не нужно, поэтому ЯП я не закидываю тапками, не подумайте) , но по мере своего развития и чтения кода более опытных коллег понимание этих всех концептов становилось важным, так я и набрёл на "Изучаем Python" Эрика Мэтиза. 👨💻
Данная книжка это как бы учебник по Python для начинающих не аналитиков, а я бы сказал разработчиков, но написанная для людей без бэкграунда в IT . Она поделена на сегменты и предполагает выполнения заданий с вашей стороны после каждой главы и по прохождению теории вам будет предложено несколько глав с проектами, где вы разработаете игру для ПК , сделаете веб приложение на Django и повизуализируете данные при помощи Matplotlib и Plotly.
Но сразу вам говорю, что Pandas вы там не увидите. ‼
Если вы всё таки прочтёте мой пост и прочитаете - проработаете книжку, то вы сможете разобраться как создавать классы, напишите свою первую библиотеку, разберётесь получше с визуализацией и в целом разовьётесь с точки зрения разработки, что я считаю важным для Middle - Senior специалистов в аналитике. 👴
P.S. ссылка на книгу в магазине, но если не захотите покупать, то на просторах интернета она лежит бесплатно.
Книжка для знакомства и старта разработки на Python 🐍
В этом посте хотел поделиться и порекомендовать вам книжку по Python , а именно : "Изучаем Python" Эрик Мэтиз .
На самом деле много кто её рекомендовал в разных телеграмм каналах, но хотел тут выразить своё мнение и понимание ценности данной книги и в целом поделиться своим кейсом как я к ней пришёл. 🚶
Дело в том что как я писал выше, я начал своё знакомство с Python c Яндекс Практикума и по окончанию курса я достаточно свободно себя чувствовал с Pandas, но вот что-то разрабатывать на Python я просто не умел и не понимал как, то есть как создать библиотеку, что такое Объектно ориентированное программирование это всё для меня было мимо (для аналитика в начале пути это наверное всё и не нужно, поэтому ЯП я не закидываю тапками, не подумайте) , но по мере своего развития и чтения кода более опытных коллег понимание этих всех концептов становилось важным, так я и набрёл на "Изучаем Python" Эрика Мэтиза. 👨💻
Данная книжка это как бы учебник по Python для начинающих не аналитиков, а я бы сказал разработчиков, но написанная для людей без бэкграунда в IT . Она поделена на сегменты и предполагает выполнения заданий с вашей стороны после каждой главы и по прохождению теории вам будет предложено несколько глав с проектами, где вы разработаете игру для ПК , сделаете веб приложение на Django и повизуализируете данные при помощи Matplotlib и Plotly.
Но сразу вам говорю, что Pandas вы там не увидите. ‼
Если вы всё таки прочтёте мой пост и прочитаете - проработаете книжку, то вы сможете разобраться как создавать классы, напишите свою первую библиотеку, разберётесь получше с визуализацией и в целом разовьётесь с точки зрения разработки, что я считаю важным для Middle - Senior специалистов в аналитике. 👴
P.S. ссылка на книгу в магазине, но если не захотите покупать, то на просторах интернета она лежит бесплатно.
Литрес
Изучаем Python: программирование игр, визуализация данных, веб-приложения — Эрик Мэтиз | Литрес
«Изучаем Python» – это самое популярное в мире руководство по языку Python. Вы сможете максимально быстро освоить Python, научитесь писать программы, устранять ошибки и создавать работающие приложени…
🔥6👍3
#ресурсы
Много кто наверное слышал про YouTube канал Statquest, где весёлым образом рассказывают про статистику и ML (весёлым потому что песни поют в начале связанные с темой ролика 😂) , но я нигде не встречал что бы рассказывали про другой крутой канал 3BluesBrown.
Как мне кажется этот канал хорошо дополняет 1ый, так как на Statquest больше про статистику а тут Линал и Матан, но не на формулах, а скорее используют геометрический подход. 📈👨🏫
Насчёт Creditibillity, контенту канала можно доверять потому что автор выпускник Стэнфорда по математике 👨🎓
Ну и другие ребята которы помогают делать контент - профессоры из американских вузов.👨🏫
В общем если хотите вспомнить тему по статистике или терверу то вам на Statquest, если Линал, Матан то 3BluesBrown . 🤝
P.S. вот ссылка на 3BluesBrown на русском
Много кто наверное слышал про YouTube канал Statquest, где весёлым образом рассказывают про статистику и ML (весёлым потому что песни поют в начале связанные с темой ролика 😂) , но я нигде не встречал что бы рассказывали про другой крутой канал 3BluesBrown.
Как мне кажется этот канал хорошо дополняет 1ый, так как на Statquest больше про статистику а тут Линал и Матан, но не на формулах, а скорее используют геометрический подход. 📈👨🏫
Насчёт Creditibillity, контенту канала можно доверять потому что автор выпускник Стэнфорда по математике 👨🎓
Ну и другие ребята которы помогают делать контент - профессоры из американских вузов.👨🏫
В общем если хотите вспомнить тему по статистике или терверу то вам на Statquest, если Линал, Матан то 3BluesBrown . 🤝
P.S. вот ссылка на 3BluesBrown на русском
👍11
Добавить ли чат к каналу?
Final Results
48%
Да, буду рад пообщаться 👍
52%
Нет, и так много чатов в ленте❌
Хотелки ✍
У меня знаете есть несколько хотелок , которые есть желание реализовать за своё пребывание в Gett, начну от большего и приду к меньшему:
1) У нас есть Feature rollout система которая помогает раскатывать фичи на группу в определённых сегментах, как бы что уже хорошо, но под неё нет аналитической системы, что бы можно было запускать тест и оно всё автоматически считало по выбранным метрикам и что бы правильно с точки зрения статистики 🥸 Это наверное номер 1 что хочется сделать. 💯
2) Хочу что бы у нас появилась Global Holdout группа. Если кто не знает, то это сохранение части вашей аудитории девственно чистой (без фичей) в течении квартала-полугода, что бы потом можно было понять как ваши фичи повлияли на метрики в течении периода и оценить совокупное влияние ваших фичей. Мне кажется это сильно нам помогло бы даже с точки зрения репортинга 📈
3) Было бы круто добавить бакеты 🗑 в нашу Feature rollout систему. Это позволило бы перезапускать эксперименты, если мы не уверены в наших результатах по текущему АБ тесту, без вреда для наших пользователей. Мне кажется полезная штука, так как порой бывает что раскатали фичу, что-то поломалось но вот знаете вот так вот совсем чуть чуть - немного повлияло на UX и вот эта вся история (бесит конечно) , а так у нас есть ещё одна корзина свежих нетронутых юзеров. Или когда p-value = 0.05. В этом случае если зареранить эксперимент есть способ посчитать совокупный p-value по 2м экспериментам который придаст уверенности вашим результатам и поможет принять взвешенное решение. (вот вам ещё google sheet Рона Кохави где он это всё дело считает)
А какие у вас есть хотелки на работе?)😅
У меня знаете есть несколько хотелок , которые есть желание реализовать за своё пребывание в Gett, начну от большего и приду к меньшему:
1) У нас есть Feature rollout система которая помогает раскатывать фичи на группу в определённых сегментах, как бы что уже хорошо, но под неё нет аналитической системы, что бы можно было запускать тест и оно всё автоматически считало по выбранным метрикам и что бы правильно с точки зрения статистики 🥸 Это наверное номер 1 что хочется сделать. 💯
2) Хочу что бы у нас появилась Global Holdout группа. Если кто не знает, то это сохранение части вашей аудитории девственно чистой (без фичей) в течении квартала-полугода, что бы потом можно было понять как ваши фичи повлияли на метрики в течении периода и оценить совокупное влияние ваших фичей. Мне кажется это сильно нам помогло бы даже с точки зрения репортинга 📈
3) Было бы круто добавить бакеты 🗑 в нашу Feature rollout систему. Это позволило бы перезапускать эксперименты, если мы не уверены в наших результатах по текущему АБ тесту, без вреда для наших пользователей. Мне кажется полезная штука, так как порой бывает что раскатали фичу, что-то поломалось но вот знаете вот так вот совсем чуть чуть - немного повлияло на UX и вот эта вся история (бесит конечно) , а так у нас есть ещё одна корзина свежих нетронутых юзеров. Или когда p-value = 0.05. В этом случае если зареранить эксперимент есть способ посчитать совокупный p-value по 2м экспериментам который придаст уверенности вашим результатам и поможет принять взвешенное решение. (вот вам ещё google sheet Рона Кохави где он это всё дело считает)
А какие у вас есть хотелки на работе?)😅
Wikipedia
Fisher's method
statistical method for combining the probability values of independent tests
👍3❤2🔥1
Пообедали с подписчиком 🍕
Сегодня созванивались с подписчиком этого канала во время обеда, он пока что в раздумьях насчёт перехода в аналитику и в целом ему хотелось изнутри понять в чём вообще заключается работа , какие задачи, мои будни и так далее. По мимо этих моментов поговорили про управление командой и вообще карьере (у человека есть опыт руководства) , он поделился со мной своими взглядом на вещи. В общем отлично пообщались 😊
Я это всё к чему, если у вас есть какие-то вопросы или что-то хотите обсудить по теме аналитики-АБ тестов, не стесняйтесь , пишите в личку, буду рад пообщаться. Для меня это тоже своего рода развитие и может мне что-то интересное расскажите. Но конечно по возможности и загрузке 👍
На всякий случай подпишу что это бесплатно 😂
Сегодня созванивались с подписчиком этого канала во время обеда, он пока что в раздумьях насчёт перехода в аналитику и в целом ему хотелось изнутри понять в чём вообще заключается работа , какие задачи, мои будни и так далее. По мимо этих моментов поговорили про управление командой и вообще карьере (у человека есть опыт руководства) , он поделился со мной своими взглядом на вещи. В общем отлично пообщались 😊
Я это всё к чему, если у вас есть какие-то вопросы или что-то хотите обсудить по теме аналитики-АБ тестов, не стесняйтесь , пишите в личку, буду рад пообщаться. Для меня это тоже своего рода развитие и может мне что-то интересное расскажите. Но конечно по возможности и загрузке 👍
На всякий случай подпишу что это бесплатно 😂
❤7👍3
Почему считать MDE и мощность после эксперимента не имеет смысла и это в целом плохая идея ? 🤌 (часть 1)
Пока был в дороге , успел прочитать и разобрать research paper на тему если по русски: "Почему делать power analysis после проведённого эксперимента не нужно ?" Напоминаю что под Power analysis в индустрии подразумевают расчёт Minimum Detectable Effect (писал про него ранее в этом посте) и расчёт мощности.
Так вот собственно основные хайлайты статьи почему после проведённого эксперимента проводить этот вид анализа не нужно :
• Один из способов применения power analysis для анализа результата эксперимента не стат значимого изменения – расчёт вероятности отклонить нулевую гипотезу при полученных результатах . Данный подход используется для подтверждения нулевой гипотезы , аля если мы наблюдаем высокую мощность для нашего изменения , но всё равно видим что результат не стат значим, то нулевая гипотеза верна (разницы между двумя группами нет). В статье же доказывается что получить высокую мощность при большом p-value для одного и того же эффекта в принципе невозможно, так как мощность по сути напрямую зависит от p-value. – в целом никогда этим и не занимался 🤔
• Второй способ уже поинтереснее, порой мы считаем MDE на полученных не стат значимых результатах эксперимента , таким образом мы хотим сделать вывод что чем меньше у нас MDE, тем больше мы имеем подтверждение того что разницы между двумя группами на самом деле нет.
Так вот, в статье доказывается что данное утверждение не имеет смысла, так как возможна ситуация когда мы сравниваем два эксперимента и оба результата не стат значимы и у 1го эксперимента может быть MDE ниже чем у 2го, то есть следуя вышеупомянутой логике можно сделать вывод что результаты первого эксперимента свидетельствуют в пользу нулевой гипотезы больше чем результаты второго.
Данный вывод будет ложным, так как p-value 1го эксперимента может были меньше чем p-value второго (как мы помним p-value и мощность линейно зависят друг от друга) , что означает что ситуация на самом деле обратная. 1ый эксперимент наоборот меньше свидетельствует об отсутствии изменения, чем 2й эксперимент. Что опровергает вышеописанную гипотезу об статистическом выводе 🚫
Так ребят, это немного новый для меня формат, поэтому если хотите что бы продолжал разбирать для вас статьи , ставьте 🐳 (Сама статья выше 🔝)
К этому посту будет вторая часть где пойдёт речь о сравнении конф интервалов и MDE а также общий вывод, оставайтесь на связи 😊
Пока был в дороге , успел прочитать и разобрать research paper на тему если по русски: "Почему делать power analysis после проведённого эксперимента не нужно ?" Напоминаю что под Power analysis в индустрии подразумевают расчёт Minimum Detectable Effect (писал про него ранее в этом посте) и расчёт мощности.
Так вот собственно основные хайлайты статьи почему после проведённого эксперимента проводить этот вид анализа не нужно :
• Один из способов применения power analysis для анализа результата эксперимента не стат значимого изменения – расчёт вероятности отклонить нулевую гипотезу при полученных результатах . Данный подход используется для подтверждения нулевой гипотезы , аля если мы наблюдаем высокую мощность для нашего изменения , но всё равно видим что результат не стат значим, то нулевая гипотеза верна (разницы между двумя группами нет). В статье же доказывается что получить высокую мощность при большом p-value для одного и того же эффекта в принципе невозможно, так как мощность по сути напрямую зависит от p-value. – в целом никогда этим и не занимался 🤔
• Второй способ уже поинтереснее, порой мы считаем MDE на полученных не стат значимых результатах эксперимента , таким образом мы хотим сделать вывод что чем меньше у нас MDE, тем больше мы имеем подтверждение того что разницы между двумя группами на самом деле нет.
Так вот, в статье доказывается что данное утверждение не имеет смысла, так как возможна ситуация когда мы сравниваем два эксперимента и оба результата не стат значимы и у 1го эксперимента может быть MDE ниже чем у 2го, то есть следуя вышеупомянутой логике можно сделать вывод что результаты первого эксперимента свидетельствуют в пользу нулевой гипотезы больше чем результаты второго.
Данный вывод будет ложным, так как p-value 1го эксперимента может были меньше чем p-value второго (как мы помним p-value и мощность линейно зависят друг от друга) , что означает что ситуация на самом деле обратная. 1ый эксперимент наоборот меньше свидетельствует об отсутствии изменения, чем 2й эксперимент. Что опровергает вышеописанную гипотезу об статистическом выводе 🚫
Так ребят, это немного новый для меня формат, поэтому если хотите что бы продолжал разбирать для вас статьи , ставьте 🐳 (Сама статья выше 🔝)
К этому посту будет вторая часть где пойдёт речь о сравнении конф интервалов и MDE а также общий вывод, оставайтесь на связи 😊
Telegram
Product analysis | Dmitry Varsanovich
Пост про Minimum Detectable effect ( далее MDE)
Сначала напомню что такое MDE - это показатель который используется для определения минимального размера эффекта который можно объяснить при ваших вводных (количество объектов в ваших выборках , FPR , Power…
Сначала напомню что такое MDE - это показатель который используется для определения минимального размера эффекта который можно объяснить при ваших вводных (количество объектов в ваших выборках , FPR , Power…
🐳15👍2🤔1
Пост с монте карло ноутбуком 🎁
Какое-то время назад я учился у ребят из EXPF (experiment fest) что мне дало очень много полезности и вообще новых знаний по экспериментам, и как я писал ранее их ноутбуки и лекции я беру за основу в построении библиотеки по АБ тестам (конечно много дорабатываю, но в любом случае). В общем всем советую туда пойти отучиться. ❤️
Единственное что в ноутбуке с оценкой мощности через монте карло который со мной там пошерили закралась ошибка , а именно вместо случайной перемешки с повторением , там был случайный выбор из группы, что половинило оцениваемую мощность теста. 🌚
Поправил, шерю его с вами (вверху). Вдруг пригодится. Там внутри через монте карло оценивается t-test на примере двух выборок, но вы можете на его место подставить любой ваc интересующий тест (Манн Уитни например).💡
Да , забыл, если ещё такого нужно, кидайте реакции
Какое-то время назад я учился у ребят из EXPF (experiment fest) что мне дало очень много полезности и вообще новых знаний по экспериментам, и как я писал ранее их ноутбуки и лекции я беру за основу в построении библиотеки по АБ тестам (конечно много дорабатываю, но в любом случае). В общем всем советую туда пойти отучиться. ❤️
Единственное что в ноутбуке с оценкой мощности через монте карло который со мной там пошерили закралась ошибка , а именно вместо случайной перемешки с повторением , там был случайный выбор из группы, что половинило оцениваемую мощность теста. 🌚
Поправил, шерю его с вами (вверху). Вдруг пригодится. Там внутри через монте карло оценивается t-test на примере двух выборок, но вы можете на его место подставить любой ваc интересующий тест (Манн Уитни например).💡
Да , забыл, если ещё такого нужно, кидайте реакции
👍13🔥6🤩1
Нам тут нужны кружочки или сториз?
Мне если честно нравится как сейчас, но хочу вас услышать 😁
Мне если честно нравится как сейчас, но хочу вас услышать 😁
Final Results
12%
Видео кружочки ✅
2%
Сториз ✅
16%
И то и другое ✅✅
70%
Оставь как сейчас 🚫
Хочу поделиться с вами своей маленькой радостью. 😊
Вчера вечером выпустил в Бета версию первую мной написанную библиотеку по Экспериментам , назвал её Gett Lab 🧪
Захотелось назвать именно так а не как нибудь с припиской ab tests , потому что планирую что мы уйдем дальше чем просто АБ тесты, а еще будем заниматься тестированием гипотез при помощи инструментов Causual Inference , про них тоже буду писать здесь. ✅
Да, наверное это не повод прям гордиться с собой, так как Валерий Бабушкин недавно поднял систему АБ тестов за 4 часа, но я не Валерий Бабушкин, поэтому я всё равно доволен 😂
Ну и списываю ещё на то что я всё таки вообще что-то разрабатываю в первый раз, поэтому когда нибудь постараюсь уложиться в его тайминг, но это не точно 😁
Вообще зачем я решил в это впрячься ?
Да я знаю есть опен сорс решения, но во первых у нас метрики специфичные, во вторых я планирую потом использовать эту библиотеку для нашей системы АБ тестирования (аминь 🙏🏻) и мне кажется для таких глобальных масштабов надо знать от а до я что под капотом. Ну и в третьих всё таки это наша собственная библиотека и я думаю что учитывая этот факт остальные члены команды будут с большим желанием туда коммитить , чем сходу загорелся наш джун и уже почти начал пилить модули для А/А тестов (Артур, если читаешь , то знай что ты красавчик🔥)
Немного полезности для вас 🛎
Что бы этот пост все таки принес для вас хоть какую то полезность , добавлю что в Gett Lab я не стал использовать z-test из statsmodels ибо он у меня жутко сбоил 🚫, как само p-value , так и конф интервалы.(кто с ним работает, обратите внимание) В итоге я решил вытащить формулу из учебника 📚и переписать ее вручную, единственное что заюзал функцию cdf из scipy для расчёта p-value. Если кому надо вырезку из кода, пишите в личку. Не буду здесь этим спамить.
Также если интересно что и как там сбоит, пишите комменты, поделюсь с вами горьким опытом. 😐
Вчера вечером выпустил в Бета версию первую мной написанную библиотеку по Экспериментам , назвал её Gett Lab 🧪
Захотелось назвать именно так а не как нибудь с припиской ab tests , потому что планирую что мы уйдем дальше чем просто АБ тесты, а еще будем заниматься тестированием гипотез при помощи инструментов Causual Inference , про них тоже буду писать здесь. ✅
Да, наверное это не повод прям гордиться с собой, так как Валерий Бабушкин недавно поднял систему АБ тестов за 4 часа, но я не Валерий Бабушкин, поэтому я всё равно доволен 😂
Ну и списываю ещё на то что я всё таки вообще что-то разрабатываю в первый раз, поэтому когда нибудь постараюсь уложиться в его тайминг, но это не точно 😁
Вообще зачем я решил в это впрячься ?
Да я знаю есть опен сорс решения, но во первых у нас метрики специфичные, во вторых я планирую потом использовать эту библиотеку для нашей системы АБ тестирования (аминь 🙏🏻) и мне кажется для таких глобальных масштабов надо знать от а до я что под капотом. Ну и в третьих всё таки это наша собственная библиотека и я думаю что учитывая этот факт остальные члены команды будут с большим желанием туда коммитить , чем сходу загорелся наш джун и уже почти начал пилить модули для А/А тестов (Артур, если читаешь , то знай что ты красавчик🔥)
Немного полезности для вас 🛎
Что бы этот пост все таки принес для вас хоть какую то полезность , добавлю что в Gett Lab я не стал использовать z-test из statsmodels ибо он у меня жутко сбоил 🚫, как само p-value , так и конф интервалы.(кто с ним работает, обратите внимание) В итоге я решил вытащить формулу из учебника 📚и переписать ее вручную, единственное что заюзал функцию cdf из scipy для расчёта p-value. Если кому надо вырезку из кода, пишите в личку. Не буду здесь этим спамить.
Также если интересно что и как там сбоит, пишите комменты, поделюсь с вами горьким опытом. 😐
🔥14👍3❤2
Всем привет 👋🏻
Хотел выйти на связь и сказать что в ближайшие пару недель публиковать ничего не буду, не потому что бросаю канал, нет , а просто уехал в отпуск и решил устроить ретрит от аналитики (убрал все телеграмм каналы в архив и убираю свои пальцы от приложения линкедина 😂)🏝️
В общем не теряйте меня, как вернусь обязательно буду стараться радовать вас интересным контентом, ну а пока вот вам кусочек кипрского чилла в ленту , обнял приподнял 🤗
Хотел выйти на связь и сказать что в ближайшие пару недель публиковать ничего не буду, не потому что бросаю канал, нет , а просто уехал в отпуск и решил устроить ретрит от аналитики (убрал все телеграмм каналы в архив и убираю свои пальцы от приложения линкедина 😂)🏝️
В общем не теряйте меня, как вернусь обязательно буду стараться радовать вас интересным контентом, ну а пока вот вам кусочек кипрского чилла в ленту , обнял приподнял 🤗
🔥11🥰4😢1🙏1