Product analysis | Varsanovich
493 subscribers
17 photos
2 videos
5 files
60 links
Пишу про UX research, эксперименты и статистику, causaal inference и иногда сдабриваю мемчиками. 5 лет в аналитике. Связь: @DVars или linkedin.com/in/dmitry-varsanovich-2735aa147
Download Telegram
Всем привет, хотел поделиться с вами книжкой по SQL. Да, согласен, название вызывающее , но по сути в книге описаны основы работы с базами данных и рассказывается не только как писать запросы, но и в целом на пальцах объясняется как создаются бд, каким образом администрируются и тд 🤔

В общем с дата инженерами общаться после прочтения должно стать легче, ненамного конечно, но разницу заметите точно😄

И в целом полезность таких знаний в том, что если хорошо разобрать материал в книге, то вас сложно будет удивить чем либо в теме БД (по крайней мере в реляционных, NOSQL немного другая история) 🧑🏻‍💻
👍2
Всем, привет!

В данный момент я работаю в веб сервисе и мы с командой столкнулись с проблемой с точки зрения взращивания продуктовых метрик, а именно периодического изменения качества трафика, который гонит нам маркетинг. 🧑🏻‍💻

Собственно в чем проблема:
разный трафик с точки зрения качества по разному себя ведёт внутри сервиса, то есть в продукте мы ничего не меняли, а метрики (например: конверсии, Retention) просели потому что изменилось качество трафика.

В app(приложении) такая проблема возникает реже ибо что бы попасть в продукт его надо установить (приложить некие усилия/ потратить время 1-2 мин), то есть пользователь который зашёл в сервис более мотивирован в нем что то делать, чем человек который просто кликнул на ссылку и попал на страницу в браузере (затрат времени 1-2 секунды).🤯

Пока из способов борьбы, из того что удалось придумать - это включать в когорту для расчета Retention не по старту сессии а по совершению целевого действия. Посмотрим что из этого выйдет.🤔

Может кто-то ещё сталкивался с такими проблемами? Буду рад если поделитесь опытом и способами решения 🙂
Mob_app_Ret_2020.xlsx
115.8 KB
Всем, привет!

Нашел отчет Appsflyer по бенчмарку Retention в моб приложениях от 2020 года по отраслям и странам. Excel приложил.
👍3
Всем привет!

Пост по книгам, недавно лазил по просторам инета и навёл прицел на следующие книги:

1) Тёмные данные (практическое руководство по принятию решений в мире недостающих данных), Дэвид Хелд.

2) Байесовская статистика, Уилл Курт. Если в двух словах, как работать с данными при помощи байесовской статистики 📚

Вроде названия достаточно интересные, и книжки в сети рекомендуют 🤔
Может кто-то что-то из этого читал? Буду благодарен за отзыв 🙂
👍3
С последнего поста уже прошло 2 года 😁

Время летит конечно незаметно , ладно, постараюсь без сантиментов.

Хочу обновить дату последнего поста что бы канал не выглядел мёртвым и постараюсь писать чаще чем раз в два года 😂

Вашему вниманию предлагаю серию подкаста с Роном Кохави (одна из самых популярных фигур АБ тестирования на текущий момент) ex VP of experimentation в Microsoft /Airbnb / Amazon . Да и в целом дядька с юмором. В этом выпуске он рассуждает про то как развивал культуру АБ тестирования в вышеупомянутых компаниях, немного рефлексирует и немного касается подводных камней в экспериментах которые он встречал на своём карьерном пути.
Язык конечно английский, но вроде можно субтитры русские включить, Надеюсь вам понравится.
Сылка на подкаст
👍15
Моя любимая часть этого выпуска, когда Ронни Кохави рассказывал о своих первых днях в Microsoft (это был примерно 2008 год) и про диалог с одним из топ-менеджеров, которым он поделился с интервьюером:

-- Топ-менеджер: Хорошо, Ронни, у тебя есть должность партнера в нашей компании, так что тебе решать, что делать. Итак, каковы ваши планы?
-- Ронни Кохави: Я считаю, что нам нужно создать платформу для экспериментов, потому что, исходя из моего опыта работы с Amazon, примерно 80 % новых идей терпят неудачу.
-- Топ-менеджер: Нет, ну такого у нас точно нет, у нас ПМы лучше.

Если вы посмотрите видео, то узнаете, что топ-менеджер Microsoft был прав, у них процент провала оказался 66 % . 😂
👍9
Я последние два года много читаю книжек, решаю задачки и занимаюсь на курсах связанных с мат дисциплинами. Какое то время писал всё в тетрадке , но в конце концов устал от того что через месяц не могу разобрать свой же почерк 😂

В итоге я стал иcпользовать Jupyter Notebooks для конспектов , решения задачек и так далее. Однозначно решает вышеупомянутые проблемы и ещё можно графики красивые строить, закидывать на гитхаб для хранения, а также есть мотивация сразу разбираться как можно посчитать то или иное в разных в библиотеках (мне кстати это сильно помогло когда я писал библиотеку для эксперимент дизайна в своей компании).

Единственная загвоздка была в том как отображать математические символы/знаки что бы это выглядело читабельно и симпатично. Тут на помощь мне пришёл Latex , ниже прикрепляю пару ссылок которые много раз меня выручали в этом вопросе :

+ Базовые мат символы
+ Как писать матрицы

Напоминаю что бы красота заработала надо переключить ячейку в режим Markdown и начинать запись c $ и заканчивать $ , то есть вот так : $\beta$ вы получите красивый знак Беты когда выполните ячейку.
👍6
#обучалка
По заявкам сделаю серию постов об обучалках/книгах которые я проходил, прохожу и буду проходить.

Дело в том что я по образованию экономист / финансист , который не сильно в ходе своего обучения в универе вкладывался в статистику, и работая продуктовым аналитиком по началу я пользовался принципом тут там посмотрел, вроде посчитало и норм (Пример: t-test можно использовать для любых выборок если больше 30 объектов, так в инете написано значит точно можно). Но чем больше я работал, тем сильнее меня раздражало что я не до конца понимаю что я делаю с точки зрения АБ тестов тех же и я решил, что хватит это терпеть , пора разобраться в фундаментальных вещах 🤓

Начал я с этих курсов на степике : https://stepik.mathfords.ru/ , не помню уже как наткнулся, но меня впечатлила программа и особенно то что курс реально про математику более менее с нуля к каким то более серьёзным вещам , и задачки есть на доказательства теорем. В целом как мне показалось курс даёт хорошую базу что бы пойти учиться на более продвинутые программы или читать серьёзные учебники (девочка вроде даже одна писала что в магу смогла поступить на Computer Vision при помощи этих курсов). Сам могу отметить что после этого курса начал читать и понимать Research papers связанные со статистикой (по АБ тестам тем же). В общем мой рекомендасьон, на курсе преподают как раз матан, линал ,статистику и тервер. В следующем посте напишу про книжку по эконометрике , stay tuned. ☺️

Ставьте реакции если вам зашла эта тема и стоит продолжать об этом писать 😊
🔥18
Продолжаем цикл образовательных постов. Решил отложить пока книжку по эконометрике, дочитаю, напишу про неё 😏

Но у меня для вас есть ещё кое что полезное и интересное, а именно курс от Cassie Kozyrkov по Machine Learning (называется: Making friends with Machine Learning).

Сначала расскажу немного о Cassie. Cassie - Chief Decision Scientist в Google , а также PhD по Psychology и Neuroscience и Ms in Statistics. И по моему у неё есть офигенный дар рассказывать про сложные вещи простыми и понятными словами (завидую таким людям 😒), ну и конечно же добавлять немного юмора 😁

Теперь про курс : Cassie описывает методологию построения ML систем (есть сегмент по нейросеткам) , а также в целом рассказывает как каждый алгоритм работает простым языком, что бы было понятно и менеджерам и любому слушателю который хочет разобраться как же эти магические алгоритмы работают.

Моё мнение : начну с того что я набрёл на этот курс когда у меня была идея пойти работать продактом в наш ML продукт и мне было нужно погрузиться как строятся ML системы и чуть подробнее разобраться как работают алгоритмы и я скажу что эту задачу курс для меня закрыл. То есть пойти начать строить системы ты после него не сможешь , но понимать что делают твои разрабы этого более чем достаточно. Это с точки зрения пользы для продакта.
Если брать пользу для аналитика, то я скажу так, когда я вплотную займусь прокачкой ML , я обязательно пересмотрю его ещё раз, так как в курсе очень круто описана сама концепция построения, тестирования моделей, дата майнинга и что очень важно интерпретация (мы аналитики должны уметь рассказывать как мы что-то сделали). В общем рекомендую 😊

И как обычно, если вам пост показался полезным , ставьте реакции 🙏
👍9🔥1
Пост про Minimum Detectable effect ( далее MDE)

Сначала напомню что такое MDE - это показатель который используется для определения минимального размера эффекта который можно объяснить при ваших вводных (количество объектов в ваших выборках , FPR , Power, Effect size) . Данный показатель используют как и во время дизайна эксперимента для определения его сроков, так и для финального анализа. В этом посте сконцентрируемся на 1ом случае.

Ошибки которые я иногда слышу и читаю от коллег:

1. MDE = Lift.

MDE - грубо говоря это нормализованный при помощи дисперсии лифт, то есть если вы видите где то в системе АБ тестирования MDE , знайте что это не минимальный лифт которые вы можете объяснить , а минимальный лифт который был грубо говоря нормализован на дисперсию разницы статистик двух ваших выборок.

2. MDE всегда считается одной формулой.

Нет, это не так. Для каждого параметрического статистического теста своя формула расчёта MDE. А для не параметрических тестов вообще формул нет, тут нужно использовать симуляции Монтекарло.

Как определять Lift для MDE ?

Сразу скажу что я сторонник обсуждать Lift с продактами.

Со своей стороны я выделяю три подхода (их можно миксовать, они не взаимоисключающие):

1. Исторический. Если у вас были эксперименты с похожими изменениями в прошлом, то вы можете посмотреть какое изменение вы получили ранее и взять какой-то % от ранее полученного изменения. Я бы в идеальном мире экспертно взял 50% , но тут всё зависит от ваших вводных по размерам выборки и прочего.

2. Экономический. Выпуск и поддержка вашей фичи обойдётся вам в дальнейшем в N денег. Исходя из этого можно посчитать минимальный Lift который окупит всё ваше предприятие.

3. Хронологический. (я его сам так назвал 😂, ибо нигде почему то не видел что бы о нём писали)
В данном подходе мы отталкиваемся от времени которое понадобится на проведение эксперимента при определённом лифте. То есть , мы знаем что для лифта в 2 процентных пункта нам нужно пол года держать эксперимент, а для 7 п.п. - месяц. То есть вы оперируете двумя вводными , сам лифт (деньги) и время которое вы готовы тестировать изменение.

Если есть ещё какие либо способы которые вы знаете, пишите в комментах буду рад взять на вооружение. 🙏

И как обычно ставьте реакции что бы я понимал, что инфа в посте полезна для вас. На текущий момент для меня это главная метрика для выбора направления контента для канала 😁
🔥11
Сорян, угораю весь день над этим сегодня, не могу не запостить
Forwarded from LEFT JOIN
This media is not supported in your browser
VIEW IN TELEGRAM
👀 Наверное, и мы, и вы уже пересмотрели все рилсы с Тиньковым…

Но версии про аналитику нам пока не встретились, а когда мы не видим какого-то безумия, то обязательно должны его возглавить!

@leftjoin
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣14😁1
Отвлечёмся немного от образовательных ресурсов. Пост для любителей ChatGPT 🤖

Делюсь с вами ссылкой на бота CRO Professor . Это бот построенный на базе ChatGPT , но обученный на Research Papers по АБ тестированию, я немного с ним поигрался , ерунду вроде не несёт.

Из плюсов
, каждый свой ответ он подкрепляет ссылками на Research Paper из которого он брал информацию, то есть становится понятнее ,что конкретно можно почитать по вашему вопросу, если хотите узнать больше инфы чем даёт бот.

Из минусов, он не сохраняет вкладки предыдущих чатов и думает дольше чем оригинал.

Моё мнение : можно поиграться, возможно обратиться с каким то проблемным вопросом, но я бы пару раз проверил бы сначала ответы этого бота в реальных Research papers которые он рекомендует.

В общем если решите поюзать, то буду благодарен если отпишитесь в комментах о своём опыте, особенно если он облажается 😁
👍4🤔1
Channel name was changed to «Product analysis | Dmitry Varsanovich»
Если вы хотите быть в курсе последних нововведений и трендов в сфере экспериментов, то стоит читать не только статьи на Medium, но и начать погружаться в чтение Research papers. Делюсь с вами Google sheets в котором Ronny Kohavi (Ex. VP Micosoft, Airbnb, Amazon) собирает самые цитируемые статьи по экспериментам и обновляет список раз в пару месяцев. Мне кажется что такой период это ок, всё таки статьи по экспериментам не так часто выходят как по нейронкам. В общем надеюсь вам это будет полезно.

И напоминаю ставить реакции если вам нравится контент, таким образом понимаю что вам пост показался полезным.

Ссылка на файл
👍13
Сегодня напишу про главные принципы классических АБ тестов , а именно - SUTVA (Stable Unit Treatment Assumption) 👨‍🔬

Что же это такое и о чём эти принципы , в целом их два (моя авторская интерпретация, поправляйте если где то не прав ) :

1. Наблюдаемое нами поведение или состояние объекта эксперимента не зависит от воздействия на других участников эксперимента. (сетевое воздействие)

2.
В ходе эксперимента мы предлагаем участникам один и тот же вариант воздействия. То есть в ходе эксперимента не могут быть предложены различные варианты воздействия которые вызовут у испытуемого (пользователя) разную реакцию.

Примеры нарушения каждого из принципов

Касательно первого принципа
Представьте что у вас есть таксопарк и вы решили случайным образом повысить стоимость км на счётчике для половины водителей такси, а половине оставили всё как есть. Ваша цель понять, улучшит ли поощрительная мера Retention в 1ый месяц. Но таксисты любят разговаривать в перерывах, поэтому узнают что кто то стал зарабатывать больше, а кто то нет, в результате ребята из контрольной группы обиделись и начали уходить больше. Очевидно что в сложившейся ситуации нам не удастся выяснить помогла ли наша мера улучшить Retention в 1ый месяц или всё дело в обиде водителей. 🤔

Касательно второго принципа
Представьте что вы владелец 2 магазинов продуктов и хотите проверить гипотезу будет ли музыка в зале способствовать повышению среднего чека для покупателей. В одном магазине вы не включаете музыку, а во втором играет 1 час Оксимирон 💽, второй час Бетховен 🎹 , в третий час AC/DC🎸. В результате вам будет достаточно сложно оценить какая же музыка заставила или не заставила людей покупать больше и скорее всего придётся перезапускать эксперимент , если люди ещё будут ходить в этот ваш магазин 😂
👍5🔥2🤣1
🛎 Пост про деливеринг результатов эксперимента (Часть 1)

Читал достаточно много постов на Linked in про то как надо делиться результатами экспериментов со стейкхолдарами и решил написать о своём видении.

Начну с того что я считаю правильным предоставлять результаты в нескольких форматах , а именно разницу между контрольной и тестовой группой , доверительный интервал этой самой разницы и собственно p-value (но не в числовом выражении а как категориальный параметр: высокая уверенность, слабая уверенность, не стат значимо).

Почему считаю правильным показывать именно эти метрики в таком формате ?

Разница между контрольной и тестовой группой.
Хотя с точки зрения статистики конкретная разница является только частью доверительного интервала возможной реальной разницы, считаю что важно её тоже подсвечивать, так как для людей без бэкграунда в статистике гораздо легче будет воспринимать более "сложные" понятия если они начинают знакомиться с результатами в том формате который для них близок, а именно разница между двумя группа x - y = z , а не сразу переходить к тому наша разница лежит где то вот в этом доверительном интервале 🤓

Доверительный интервал разницы статистик
Правильно подсветить коллегам, что всё таки реальное изменение метрики не обязательно равняется тому что мы наблюдаем в конкретном тесте, а лежит в интервале от (x до z) с высоким уровнем вероятности. Что бы подогреть интерес можно ещё добавить месячный прирост или убывание доходов от минимальной границы дов интервала до максимальной, если применимо.

p-value как категориальный параметр
Дело в том что во фреквентистком подходе к статистике смысл p-value достаточно не тривиален , поэтому грузить им неискушённую публику не вижу смысла. А донести до людей уровень уверенности в результатах всё таки хочется.

P.S. в следующей части расскажу про особенности интерпретации результатов и как вышеупомянутые метрики помогают в объяснении стат значимых и не стат значимых изменений стейкхолдерам.

Если есть какие-то идеи, предложения, буду рад узнать о них в комментах.
А также если было интересно или полезно ставьте реакции 🙏
🔥7👍2
В среду с 20:00 до 21:00 состоится мероприятие : Virtual Meetup: AMA with Ronny Kohavi (ex. VP Airbnb, Microsoft, Amazon и кстати один из людей придумавших CUPED), на котором можно будет задать вопрос Рони , ну и послушать как он отвечает на вопросы других участников.

Ссылка на регистрацию
🙏4
⚡ В Microsoft Excel появится Python.
Ребята из Microsoft совместно с Anaconda уже сделали эту доработку и уже вот вот скоро будет релиз. Обещают что в Microsoft Excel появится возможность использовать алгоритмы для ML, библиотеки визуализаций и так далее, в общем делать всё то что мы можем делать в Python.

P.S. я не думал что я когда нибудь вернусь в Excel после ухода из финансовой аналитики, но теперь я уже не уверен 😂

Читайте всё сами
🔥8😁3👍2😱1
#мысли
🛎 Пост про деливеринг результатов эксперимента (Часть 2)

Как обещал выше, в этой части поста расскажу про особенности интерпретации результатов эксперимента, а также ошибки и как доверительный интервал разницы статистик и категориальный p-value могут вас выручить в интерпретации результатов.

Основные ошибки по интерпретации результатов 🚫

Вот какую я разницу получил между двумя группами, вот на столько мы и улучшились/ухудшились 🤓
Нет, так как действительная разница (если она есть) между двумя группами лежит в определённом диапазоне с определённой вероятностью и мы не можем её определить одним конкретным числом и сказать, вот у нас разница N% и всё, так не получится.

Мы увидим после раскатки фичи то самое улучшение в метрики в конце дня/месяца/года. 🤌
Нет, не увидите. И это не произойдёт по многим причинам: сезонность, выкатывание друг фич в других домейнах, изменение маркетинговых каналов и так далее.

А теперь про интерпретацию 💯

Cтат. значимый результат 💥
Рассказывать стейкхолдерам про него проще конечно 😅
А именно: мы получили такое то изменение между двумя группами, когда мы раскатим изменение на остальных пользователей мы можем ожидать что эффект на метрики от данного изменения будет лежать в диапазоне от X до Y (ваш доверительный интервал разницы метрик). Также можете добавить, что имеете высокую или слабую уверенность что метрики двух групп отличаются друг от друга.

Не стат. значимый результат 🌚
Вот тут уже случай по интереснее, особенно когда не стат значимо положительный результат, так как уже разработали, потратили деньги и так далее.
Тут важно коллегам подсветить что хоть результат и положительный , но когда мы раскатим фичу на остальных пользователей мы можем ожидать изменение метрики в доверительном интервале той самой разницы метрик, а он , друзья , затрагивает отрицательные значения. Значит что если вы раскатываете такую фичу то есть вполне себе вероятность что вы ухудшите метрику. На сколько ? Это уже другой вопрос, но вы обязаны это подсветить .

Что же делать ?
Я обычно в таких спорных ситуациях ухожу считать деньги 💰. А именно говорю, ребят ну смотрите, если мы раскатим эту фичу, то есть шансы что мы ничего не потеряем и не заработаем, но также есть шансы что мы недополучим столько 💵 за месяц , и столько 💰 за год, но конечно мы может и что-то заработаем (тоже даю расклад по деньгам). После такого брифа коллеги начинают осознавать риск и думают чуть под другим углом..

Спасибо, что дочитали. Если вы с чем-то не согласны, хотите что-то добавить, то буду рад видеть вас в комментариях к этом посту.

Если же пост показался вам полезным, буду благодарен, если поставите реакции 🙏
🔥11❤4👍2