Product analysis | Varsanovich
493 subscribers
17 photos
2 videos
5 files
60 links
Пишу про UX research, эксперименты и статистику, causaal inference и иногда сдабриваю мемчиками. 5 лет в аналитике. Связь: @DVars или linkedin.com/in/dmitry-varsanovich-2735aa147
Download Telegram
Продолжаем цикл образовательных постов. Решил отложить пока книжку по эконометрике, дочитаю, напишу про неё 😏

Но у меня для вас есть ещё кое что полезное и интересное, а именно курс от Cassie Kozyrkov по Machine Learning (называется: Making friends with Machine Learning).

Сначала расскажу немного о Cassie. Cassie - Chief Decision Scientist в Google , а также PhD по Psychology и Neuroscience и Ms in Statistics. И по моему у неё есть офигенный дар рассказывать про сложные вещи простыми и понятными словами (завидую таким людям 😒), ну и конечно же добавлять немного юмора 😁

Теперь про курс : Cassie описывает методологию построения ML систем (есть сегмент по нейросеткам) , а также в целом рассказывает как каждый алгоритм работает простым языком, что бы было понятно и менеджерам и любому слушателю который хочет разобраться как же эти магические алгоритмы работают.

Моё мнение : начну с того что я набрёл на этот курс когда у меня была идея пойти работать продактом в наш ML продукт и мне было нужно погрузиться как строятся ML системы и чуть подробнее разобраться как работают алгоритмы и я скажу что эту задачу курс для меня закрыл. То есть пойти начать строить системы ты после него не сможешь , но понимать что делают твои разрабы этого более чем достаточно. Это с точки зрения пользы для продакта.
Если брать пользу для аналитика, то я скажу так, когда я вплотную займусь прокачкой ML , я обязательно пересмотрю его ещё раз, так как в курсе очень круто описана сама концепция построения, тестирования моделей, дата майнинга и что очень важно интерпретация (мы аналитики должны уметь рассказывать как мы что-то сделали). В общем рекомендую 😊

И как обычно, если вам пост показался полезным , ставьте реакции 🙏
👍9🔥1
Пост про Minimum Detectable effect ( далее MDE)

Сначала напомню что такое MDE - это показатель который используется для определения минимального размера эффекта который можно объяснить при ваших вводных (количество объектов в ваших выборках , FPR , Power, Effect size) . Данный показатель используют как и во время дизайна эксперимента для определения его сроков, так и для финального анализа. В этом посте сконцентрируемся на 1ом случае.

Ошибки которые я иногда слышу и читаю от коллег:

1. MDE = Lift.

MDE - грубо говоря это нормализованный при помощи дисперсии лифт, то есть если вы видите где то в системе АБ тестирования MDE , знайте что это не минимальный лифт которые вы можете объяснить , а минимальный лифт который был грубо говоря нормализован на дисперсию разницы статистик двух ваших выборок.

2. MDE всегда считается одной формулой.

Нет, это не так. Для каждого параметрического статистического теста своя формула расчёта MDE. А для не параметрических тестов вообще формул нет, тут нужно использовать симуляции Монтекарло.

Как определять Lift для MDE ?

Сразу скажу что я сторонник обсуждать Lift с продактами.

Со своей стороны я выделяю три подхода (их можно миксовать, они не взаимоисключающие):

1. Исторический. Если у вас были эксперименты с похожими изменениями в прошлом, то вы можете посмотреть какое изменение вы получили ранее и взять какой-то % от ранее полученного изменения. Я бы в идеальном мире экспертно взял 50% , но тут всё зависит от ваших вводных по размерам выборки и прочего.

2. Экономический. Выпуск и поддержка вашей фичи обойдётся вам в дальнейшем в N денег. Исходя из этого можно посчитать минимальный Lift который окупит всё ваше предприятие.

3. Хронологический. (я его сам так назвал 😂, ибо нигде почему то не видел что бы о нём писали)
В данном подходе мы отталкиваемся от времени которое понадобится на проведение эксперимента при определённом лифте. То есть , мы знаем что для лифта в 2 процентных пункта нам нужно пол года держать эксперимент, а для 7 п.п. - месяц. То есть вы оперируете двумя вводными , сам лифт (деньги) и время которое вы готовы тестировать изменение.

Если есть ещё какие либо способы которые вы знаете, пишите в комментах буду рад взять на вооружение. 🙏

И как обычно ставьте реакции что бы я понимал, что инфа в посте полезна для вас. На текущий момент для меня это главная метрика для выбора направления контента для канала 😁
🔥11
Сорян, угораю весь день над этим сегодня, не могу не запостить
Forwarded from LEFT JOIN
This media is not supported in your browser
VIEW IN TELEGRAM
👀 Наверное, и мы, и вы уже пересмотрели все рилсы с Тиньковым…

Но версии про аналитику нам пока не встретились, а когда мы не видим какого-то безумия, то обязательно должны его возглавить!

@leftjoin
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣14😁1
Отвлечёмся немного от образовательных ресурсов. Пост для любителей ChatGPT 🤖

Делюсь с вами ссылкой на бота CRO Professor . Это бот построенный на базе ChatGPT , но обученный на Research Papers по АБ тестированию, я немного с ним поигрался , ерунду вроде не несёт.

Из плюсов
, каждый свой ответ он подкрепляет ссылками на Research Paper из которого он брал информацию, то есть становится понятнее ,что конкретно можно почитать по вашему вопросу, если хотите узнать больше инфы чем даёт бот.

Из минусов, он не сохраняет вкладки предыдущих чатов и думает дольше чем оригинал.

Моё мнение : можно поиграться, возможно обратиться с каким то проблемным вопросом, но я бы пару раз проверил бы сначала ответы этого бота в реальных Research papers которые он рекомендует.

В общем если решите поюзать, то буду благодарен если отпишитесь в комментах о своём опыте, особенно если он облажается 😁
👍4🤔1
Channel name was changed to «Product analysis | Dmitry Varsanovich»
Если вы хотите быть в курсе последних нововведений и трендов в сфере экспериментов, то стоит читать не только статьи на Medium, но и начать погружаться в чтение Research papers. Делюсь с вами Google sheets в котором Ronny Kohavi (Ex. VP Micosoft, Airbnb, Amazon) собирает самые цитируемые статьи по экспериментам и обновляет список раз в пару месяцев. Мне кажется что такой период это ок, всё таки статьи по экспериментам не так часто выходят как по нейронкам. В общем надеюсь вам это будет полезно.

И напоминаю ставить реакции если вам нравится контент, таким образом понимаю что вам пост показался полезным.

Ссылка на файл
👍13
Сегодня напишу про главные принципы классических АБ тестов , а именно - SUTVA (Stable Unit Treatment Assumption) 👨‍🔬

Что же это такое и о чём эти принципы , в целом их два (моя авторская интерпретация, поправляйте если где то не прав ) :

1. Наблюдаемое нами поведение или состояние объекта эксперимента не зависит от воздействия на других участников эксперимента. (сетевое воздействие)

2.
В ходе эксперимента мы предлагаем участникам один и тот же вариант воздействия. То есть в ходе эксперимента не могут быть предложены различные варианты воздействия которые вызовут у испытуемого (пользователя) разную реакцию.

Примеры нарушения каждого из принципов

Касательно первого принципа
Представьте что у вас есть таксопарк и вы решили случайным образом повысить стоимость км на счётчике для половины водителей такси, а половине оставили всё как есть. Ваша цель понять, улучшит ли поощрительная мера Retention в 1ый месяц. Но таксисты любят разговаривать в перерывах, поэтому узнают что кто то стал зарабатывать больше, а кто то нет, в результате ребята из контрольной группы обиделись и начали уходить больше. Очевидно что в сложившейся ситуации нам не удастся выяснить помогла ли наша мера улучшить Retention в 1ый месяц или всё дело в обиде водителей. 🤔

Касательно второго принципа
Представьте что вы владелец 2 магазинов продуктов и хотите проверить гипотезу будет ли музыка в зале способствовать повышению среднего чека для покупателей. В одном магазине вы не включаете музыку, а во втором играет 1 час Оксимирон 💽, второй час Бетховен 🎹 , в третий час AC/DC🎸. В результате вам будет достаточно сложно оценить какая же музыка заставила или не заставила людей покупать больше и скорее всего придётся перезапускать эксперимент , если люди ещё будут ходить в этот ваш магазин 😂
👍5🔥2🤣1
🛎 Пост про деливеринг результатов эксперимента (Часть 1)

Читал достаточно много постов на Linked in про то как надо делиться результатами экспериментов со стейкхолдарами и решил написать о своём видении.

Начну с того что я считаю правильным предоставлять результаты в нескольких форматах , а именно разницу между контрольной и тестовой группой , доверительный интервал этой самой разницы и собственно p-value (но не в числовом выражении а как категориальный параметр: высокая уверенность, слабая уверенность, не стат значимо).

Почему считаю правильным показывать именно эти метрики в таком формате ?

Разница между контрольной и тестовой группой.
Хотя с точки зрения статистики конкретная разница является только частью доверительного интервала возможной реальной разницы, считаю что важно её тоже подсвечивать, так как для людей без бэкграунда в статистике гораздо легче будет воспринимать более "сложные" понятия если они начинают знакомиться с результатами в том формате который для них близок, а именно разница между двумя группа x - y = z , а не сразу переходить к тому наша разница лежит где то вот в этом доверительном интервале 🤓

Доверительный интервал разницы статистик
Правильно подсветить коллегам, что всё таки реальное изменение метрики не обязательно равняется тому что мы наблюдаем в конкретном тесте, а лежит в интервале от (x до z) с высоким уровнем вероятности. Что бы подогреть интерес можно ещё добавить месячный прирост или убывание доходов от минимальной границы дов интервала до максимальной, если применимо.

p-value как категориальный параметр
Дело в том что во фреквентистком подходе к статистике смысл p-value достаточно не тривиален , поэтому грузить им неискушённую публику не вижу смысла. А донести до людей уровень уверенности в результатах всё таки хочется.

P.S. в следующей части расскажу про особенности интерпретации результатов и как вышеупомянутые метрики помогают в объяснении стат значимых и не стат значимых изменений стейкхолдерам.

Если есть какие-то идеи, предложения, буду рад узнать о них в комментах.
А также если было интересно или полезно ставьте реакции 🙏
🔥7👍2
В среду с 20:00 до 21:00 состоится мероприятие : Virtual Meetup: AMA with Ronny Kohavi (ex. VP Airbnb, Microsoft, Amazon и кстати один из людей придумавших CUPED), на котором можно будет задать вопрос Рони , ну и послушать как он отвечает на вопросы других участников.

Ссылка на регистрацию
🙏4
⚡ В Microsoft Excel появится Python.
Ребята из Microsoft совместно с Anaconda уже сделали эту доработку и уже вот вот скоро будет релиз. Обещают что в Microsoft Excel появится возможность использовать алгоритмы для ML, библиотеки визуализаций и так далее, в общем делать всё то что мы можем делать в Python.

P.S. я не думал что я когда нибудь вернусь в Excel после ухода из финансовой аналитики, но теперь я уже не уверен 😂

Читайте всё сами
🔥8😁3👍2😱1
#мысли
🛎 Пост про деливеринг результатов эксперимента (Часть 2)

Как обещал выше, в этой части поста расскажу про особенности интерпретации результатов эксперимента, а также ошибки и как доверительный интервал разницы статистик и категориальный p-value могут вас выручить в интерпретации результатов.

Основные ошибки по интерпретации результатов 🚫

Вот какую я разницу получил между двумя группами, вот на столько мы и улучшились/ухудшились 🤓
Нет, так как действительная разница (если она есть) между двумя группами лежит в определённом диапазоне с определённой вероятностью и мы не можем её определить одним конкретным числом и сказать, вот у нас разница N% и всё, так не получится.

Мы увидим после раскатки фичи то самое улучшение в метрики в конце дня/месяца/года. 🤌
Нет, не увидите. И это не произойдёт по многим причинам: сезонность, выкатывание друг фич в других домейнах, изменение маркетинговых каналов и так далее.

А теперь про интерпретацию 💯

Cтат. значимый результат 💥
Рассказывать стейкхолдерам про него проще конечно 😅
А именно: мы получили такое то изменение между двумя группами, когда мы раскатим изменение на остальных пользователей мы можем ожидать что эффект на метрики от данного изменения будет лежать в диапазоне от X до Y (ваш доверительный интервал разницы метрик). Также можете добавить, что имеете высокую или слабую уверенность что метрики двух групп отличаются друг от друга.

Не стат. значимый результат 🌚
Вот тут уже случай по интереснее, особенно когда не стат значимо положительный результат, так как уже разработали, потратили деньги и так далее.
Тут важно коллегам подсветить что хоть результат и положительный , но когда мы раскатим фичу на остальных пользователей мы можем ожидать изменение метрики в доверительном интервале той самой разницы метрик, а он , друзья , затрагивает отрицательные значения. Значит что если вы раскатываете такую фичу то есть вполне себе вероятность что вы ухудшите метрику. На сколько ? Это уже другой вопрос, но вы обязаны это подсветить .

Что же делать ?
Я обычно в таких спорных ситуациях ухожу считать деньги 💰. А именно говорю, ребят ну смотрите, если мы раскатим эту фичу, то есть шансы что мы ничего не потеряем и не заработаем, но также есть шансы что мы недополучим столько 💵 за месяц , и столько 💰 за год, но конечно мы может и что-то заработаем (тоже даю расклад по деньгам). После такого брифа коллеги начинают осознавать риск и думают чуть под другим углом..

Спасибо, что дочитали. Если вы с чем-то не согласны, хотите что-то добавить, то буду рад видеть вас в комментариях к этом посту.

Если же пост показался вам полезным, буду благодарен, если поставите реакции 🙏
🔥11❤4👍2
Всём продуктивной недели и стендапов 😂
😁12🔥3
Так как лишь малая часть среди вас знает меня лично, появилась идея представить и написать про, свой бэкграунд. Что думаете?
Final Results
86%
Да, было бы интересно узнать
12%
Мне в целом без разницы
2%
Нет, я и так про тебя всё знаю.
#ресурсы
Polars
🐻‍❄ vs Pandas🐼

Сейчас продолжаю пилить библиотеку для АБ тестов внутри компании и очень понадобилось мёрджить два дата фрейма в ходе симуляций, и дело в том что в Pandas 🐼 этой действие занимает ну прям много времени, поэтому пришлось искать альтернативу побыстрее. Единственная известная мне на сегодняшний день альтернатива - Polars🐻‍❄.

Polars🐻‍❄ это по функционалу тот же Pandas🐼, но написанный на Rust, когда Pandas🐼 был написан на наборе языков (Cython,Python,C), что даёт первому преимущество в скорости.

В принципе если вы работали с Pandas🐼, то с Polars🐻‍❄ тоже разберётесь быстро, но манипуляции со столбцами, мёрджи, создание новых столбцов делаются по другому с точки зрения кода.
Поэтому поделюсь с вами статьёй на Medium где описаны основные команды которые могут пригодиться, если решите попробовать.

P.S. прикладываю скрин перформанса Polars🐻‍❄ vs Pandas🐼 inner мёрджа двух датафреймов по 40 к в каждом. Побеждает 🐻‍❄ c двукратным преимуществом.
🔥12👍1😱1
Product analysis | Varsanovich
Так как лишь малая часть среди вас знает меня лично, появилась идея представить и написать про, свой бэкграунд. Что думаете?
Обо мне


Я Senior Product Analyst в компании Gett (ex. Gettaxi) , работаю в аналитике уже 5 лет, живу временно на Кипре 🏝

Из них 2 года я успел поработать в Билайне на позиции бизнес аналитика (занимался операционной аналитикой) и экспертом по фин анализу (прям в самом финансовом департаменте).

Ну и соответственно 3 года уже вовлечён в продуктовую аналитику, начал с МТС , там поработал 1 год, и вот уже 2 года таксую 🚕

Перебраться из фин аналитика в продуктового мне помог на тот момент Яндекс Практикум (я наверное был в одном из первых потоков), за что я ему благодарен 🙏
Но хочу честно добавить что в принципе мне он неплохо помог с Python и в целом свой путь в Python я начал с него, а вот SQL если я правильно помню у ребят тогда был слабый, и качался я по sql_ex
А статистику на первых порах по Карпову на Степике)

Но мой опыт по вкатыванию в прод аналитику не всем будет релевантен потому что как я написал выше, я уже работал на тот момент два года аналитиком, то есть навыки у меня были (эдхоки, визуализации, оценка потенциала для фичей и т.д.) , только инструментов не хватало. 🎸

Из интересного, в начале марта 2022 за 3 недели получил в оффер в Швецию в H&M 👕 , но в итоге не поехал потому что Gett предложил более хорошие условия и ребята из H&M отменили удалёнку, что для меня было критично... Но я надеюсь, что всё таки туда ещё доеду, когда нибудь 😁🤫

Из таких вот целей и мечт, хочу поработать в какой нибудь очень крутой компании типа уровня FAANG и помочь сделать что-то полезное для мира 🌍

Приятно со всеми познакомиться, пишите вопросы, если есть, рад буду обсудить 🙃
👍17🔥12❤2👏1
#обзор_research_paper
Пост про кореллированную внутри себя выборку


Есть такая жизненная боль, друзья, называется анализ и дизайн АБ тестов, когда единица рандомизации юзер, а метрики которые ты сравниваешь - сессионные и как бы это просто дьявольская история. Почему?😈

(начинающие аналитики Heads up!!!) Причина в том что нарушается ЦПТ (надо что бы все точки в вашей выборки были независимы друг от друга) и уже нельзя использовать z-test, t-test для дизайна и анализа эксперимента, так как вероятность увидеть разницу там где её нет этими тестами возрастает. 🥲

На помощь приходят линеаризация и бутстрап(не люблю его), а их мощность можно оценивать только симуляциями Монте-Карло что долго и больно, а ещё само перемешивание таких выборок делается геморройно😡

Нашёл свежий research paper по АБ тестам от ребят из Apple (17 Aug 2023), в которым рассказывается как можно адаптировать дельта метод под эти нужды и внимание: оценивать мощность при помощи формулы. Приложил его сверху 🔝

С͓т͓а͓в͓ь͓т͓е͓ 🐳 если хотите что бы я сделал разбор этого метода в одном из следующих постов.
🐳28👍5❤4
Product analysis | Varsanovich pinned «Обо мне Я Senior Product Analyst в компании Gett (ex. Gettaxi) , работаю в аналитике уже 5 лет, живу временно на Кипре 🏝 Из них 2 года я успел поработать в Билайне на позиции бизнес аналитика (занимался операционной аналитикой) и экспертом по фин анализу…»
#вакансии
Дружеский пост
🤝
Мой бывший руководитель в МТС Боря , ex Yandex, ex Sber (сейчас уже CPO HR-tech) ищет продуктового аналитика в направление HR-tech MTC. Конкретно про Борю скажу что он 100% адекватный и Data driven Product Manager с которым можно и в огонь и в воду.

Единственное что желателен человек с опытом , так как аналитические процессы придётся выстраивать самому и направлять Борю и его команду на новые крутые инсайты. Со своей стороны скажу, что у ребят из Big Data MTC есть неплохая ,как говорят, библиотека по АБ тестированию, значит всё таки по каким то техническим вопросам можно будет найти собеседника. И также повторю что Боря крутой продакт поэтому если в дальнейшем хотите сделать переход в Product Management, то тоже стоит обратить внимание на вакансию. Вот описание, отправляйте резюме вот сюда @Boris_Goncharov :

Про команду:
Мы - HR Tech стрим «Найм и Подбор». Нашими продуктами ежемесячно пользуются десятки тысяч кандидатов и тысячи сотрудников.
Мы строим крутой цифровой опыт наших новых коллег, их руководителей и рекрутеров, а так же формируем привлекательный бренд работодателя. Продуктовый аналитик в нашем стриме решает задачи, которые связаны с поиском точек роста и решением проблем в запущенных сервисах, а так же участвует проектировании нового функционала, запуске и анализе результатов A/B тестов.
Работать можно из любой точки РФ)

Наш кандидат:

- Проектировал ключевые и прокси-метрики продуктов
- Размечал событиями web – приложения
- Искал точки роста, основываясь на данных и формулировал продуктовые гипотезы
- Знаком с Python и SQL
- Имеет опыт создания отчетов в BI системах
- Имеет опыт работы с системами аналитики – такими, как Amplitude / Mixpanel / Yandex Metrica / Google Analytics / etc
- Имеет опыт проведения A/B, анализа продуктовых метрик
Опыт участия в формировании продуктовой стратегии или бизнес плана - как дополнительный плюс.

Пример задач, с которыми предстоит столкнуться:
- Сформировать дашборды с ключевыми продуктовыми метриками для карьерного сайта job.mts.ru и системы пребординга МТС Hello, построить регулярный репортинг этих метрик для стейкхолдеров и продуктовых команд
- Построить единую воронку из job-бордов в этапы собеседований, преборд и успешность адаптации
- Исследовать и предложить точки роста для job.mts.ru и онборд
🔥6❤2
#обзор_на_книжку
Книжка для знакомства и старта разработки на Python 🐍

В этом посте хотел поделиться и порекомендовать вам книжку по Python , а именно : "Изучаем Python" Эрик Мэтиз .

На самом деле много кто её рекомендовал в разных телеграмм каналах, но хотел тут выразить своё мнение и понимание ценности данной книги и в целом поделиться своим кейсом как я к ней пришёл. 🚶

Дело в том что как я писал выше, я начал своё знакомство с Python c Яндекс Практикума и по окончанию курса я достаточно свободно себя чувствовал с Pandas, но вот что-то разрабатывать на Python я просто не умел и не понимал как, то есть как создать библиотеку, что такое Объектно ориентированное программирование это всё для меня было мимо (для аналитика в начале пути это наверное всё и не нужно, поэтому ЯП я не закидываю тапками, не подумайте) , но по мере своего развития и чтения кода более опытных коллег понимание этих всех концептов становилось важным, так я и набрёл на "Изучаем Python" Эрика Мэтиза. 👨‍💻

Данная книжка это как бы учебник по Python для начинающих не аналитиков, а я бы сказал разработчиков, но написанная для людей без бэкграунда в IT . Она поделена на сегменты и предполагает выполнения заданий с вашей стороны после каждой главы и по прохождению теории вам будет предложено несколько глав с проектами, где вы разработаете игру для ПК , сделаете веб приложение на Django и повизуализируете данные при помощи Matplotlib и Plotly.

Но сразу вам говорю, что Pandas вы там не увидите. ‼

Если вы всё таки прочтёте мой пост и прочитаете - проработаете книжку, то вы сможете разобраться как создавать классы, напишите свою первую библиотеку, разберётесь получше с визуализацией и в целом разовьётесь с точки зрения разработки, что я считаю важным для Middle - Senior специалистов в аналитике. 👴

P.S. ссылка на книгу в магазине, но если не захотите покупать, то на просторах интернета она лежит бесплатно.
🔥6👍3