Мир IT — отдельная параллельная вселенная. Она существует рядом с обычным миром, но в ней свой язык, свои правила и огромное количество непонятных аббревиатур.
Со стороны иногда кажется, что это и правда волшебный мир: в офисах стоят массажные кресла, на кухнях всегда есть фрукты, а люди произносят слова «деплой», «пайплайн» и «прод» — и каким-то образом заставляют всё работать.
Давайте представим, кем работали бы персонажи «Гарри Поттера», если бы вместо Хогвартса оказались в современной IT-компании.
🧙♀️ Сегодня Распределяющая шляпа будет отправлять героев не на факультеты, а в IT-профессии.
P. S. В какой-то момент поняла, что пишу уже не пост для канала аналитиков, а фанфик по «Гарри Поттеру» в мире IT, и решила не останавливаться…
Со стороны иногда кажется, что это и правда волшебный мир: в офисах стоят массажные кресла, на кухнях всегда есть фрукты, а люди произносят слова «деплой», «пайплайн» и «прод» — и каким-то образом заставляют всё работать.
Давайте представим, кем работали бы персонажи «Гарри Поттера», если бы вместо Хогвартса оказались в современной IT-компании.
🧙♀️ Сегодня Распределяющая шляпа будет отправлять героев не на факультеты, а в IT-профессии.
P. S. В какой-то момент поняла, что пишу уже не пост для канала аналитиков, а фанфик по «Гарри Поттеру» в мире IT, и решила не останавливаться…
😁21❤9🔥7👎2
Спрашивает меня как-то подруга-аналитик: «Слушай, как посчитать эффект от выкатки нового тарифа в новом городе? Чтобы посмотреть каннибализацию других тарифов».
(Продукт существует, но в новом городе выкатили новый тариф, который уже раскатан в нескольких других городах)
Тут важно сказать, что не стоит просто сравнивать пользователей «до порога» и «после порога». Человек, который пользовался сервисом 2 раза, и человек, который пользовался им 50 раз, очевидно, отличаются не только наличием нового тарифа. Они и без всякой выкатки могли бы по-разному пользоваться остальными тарифами.
Но здесь есть условная граница, и можно найти пользователей, которые плюс-минус похожи, но при этом в разных группах: кто увидел новый тариф, и кому он недоступен. Если тариф становился доступен после 10 использований сервиса, можно сравнить, например:
8–10 использований➡️ тарифа ещё нет
11–13 использований➡️ тариф уже есть
Это уже гораздо более похожие пользователи. В идеальном мире единственное значимое отличие между ними — это доступность нового тарифа. А дальше смотрим, начали ли пользователи справа от порога реже выбирать старые тарифы.
И обязательно проверяем устойчивость результата: берём окно поуже — например, 9–10 vs 11–12, потом пошире — 7–10 vs 11–14. Если вывод каждый раз примерно один и тот же, доверия к нему становится сильно больше.
Если вам это что-то напоминает — да, это Regression Discontinuity Design, про который я уже писала в отдельном посте 👀
Что интересно, именно в момент этого разговора я сидела и считала по такому же методу свой «псевдотест». Изначально это не планировалось как АБ-тест, а просто было плавной раскаткой коммуникации на пользователей. Но в механике раскатки тоже нашлась условная граница, вокруг которой можно было сравнить очень похожих пользователей.
Спойлер, мой «псевдотест»не показал никаких аплифтов. Я проверила на разных границах (брала пользователей и поближе к границе, и подальше, разницы не было никакой), а у подруги-аналитика как раз такое исследование показало жёсткую каннибализацию других тарифов.
Дальше, конечно, стоит сделать обратный АБ, чтобы точно замерить негативный эффект на метрики других тарифов и получить данные для принятия решения. Ну или понять, что совсем всё плохо, и не катить тариф в этом городе :)
Вот так и поговорили.
Ну делитесь, а как бы вы попробовали обсчитать такой запуск?
(Продукт существует, но в новом городе выкатили новый тариф, который уже раскатан в нескольких других городах)
😊 «А есть похожий город, где вы уже были раскатаны?» — спрашиваю я
👩💻 «Ну они сильно другие»😊 «Окей, выкатывали ли вы на всех пользователей эту фичу?»
👩💻 «Исключали новичков — тех, кто сделал менее 10 пользований сервиса, — а так на всех, да»😊 «Ага, супер. Тогда можно сравнить 2 группы и то, как они пользовались другими тарифами»
Тут важно сказать, что не стоит просто сравнивать пользователей «до порога» и «после порога». Человек, который пользовался сервисом 2 раза, и человек, который пользовался им 50 раз, очевидно, отличаются не только наличием нового тарифа. Они и без всякой выкатки могли бы по-разному пользоваться остальными тарифами.
Но здесь есть условная граница, и можно найти пользователей, которые плюс-минус похожи, но при этом в разных группах: кто увидел новый тариф, и кому он недоступен. Если тариф становился доступен после 10 использований сервиса, можно сравнить, например:
8–10 использований
11–13 использований
Это уже гораздо более похожие пользователи. В идеальном мире единственное значимое отличие между ними — это доступность нового тарифа. А дальше смотрим, начали ли пользователи справа от порога реже выбирать старые тарифы.
И обязательно проверяем устойчивость результата: берём окно поуже — например, 9–10 vs 11–12, потом пошире — 7–10 vs 11–14. Если вывод каждый раз примерно один и тот же, доверия к нему становится сильно больше.
Если вам это что-то напоминает — да, это Regression Discontinuity Design, про который я уже писала в отдельном посте 👀
Что интересно, именно в момент этого разговора я сидела и считала по такому же методу свой «псевдотест». Изначально это не планировалось как АБ-тест, а просто было плавной раскаткой коммуникации на пользователей. Но в механике раскатки тоже нашлась условная граница, вокруг которой можно было сравнить очень похожих пользователей.
Спойлер, мой «псевдотест»
Дальше, конечно, стоит сделать обратный АБ, чтобы точно замерить негативный эффект на метрики других тарифов и получить данные для принятия решения. Ну или понять, что совсем всё плохо, и не катить тариф в этом городе :)
Вот так и поговорили.
Ну делитесь, а как бы вы попробовали обсчитать такой запуск?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤15👍2👎2
Если работаете в горизонтальной команде, после хорошего A/B почти всегда прилетает вопрос:
И вопрос справедливый. Общий эффект может быть положительным, а внутри отдельной вертикали или категории что-то могло просесть.
Самое очевидное решение — посчитать эффект отдельно по всем вертикалям и логическим категориям. Только разрезов обычно много, выборки становятся меньше, а вместе с количеством проверок растёт шанс найти случайную просадку.
Поэтому мы смотрим не только на общий эффект, но и на перцентили total-метрики: от P10 до P90. Так можно понять, не получился ли хороший средний результат за счёт верхней части распределения, пока нижний хвост уехал вниз.
Это, конечно, не ответ на вопрос «в каждой ли вертикали всё идеально?». Скорее ранний сигнал. Если среднее растёт и нижние перцентили ведут себя нормально, причин копать каждый разрез подряд меньше. Если хвост начинает проседать, уже есть повод идти глубже и искать, где именно появилась проблема.
Мне этот подход нравится тем, что он не превращает один эксперимент в десятки отдельных тестов и при этом не оставляет нас с ответом «ну в среднем же всё хорошо».
А как вы проверяете, что хороший общий результат не скрывает проблемы в отдельных маленьких срезах?
А у нашей вертикали точно всё хорошо?
И вопрос справедливый. Общий эффект может быть положительным, а внутри отдельной вертикали или категории что-то могло просесть.
Самое очевидное решение — посчитать эффект отдельно по всем вертикалям и логическим категориям. Только разрезов обычно много, выборки становятся меньше, а вместе с количеством проверок растёт шанс найти случайную просадку.
Поэтому мы смотрим не только на общий эффект, но и на перцентили total-метрики: от P10 до P90. Так можно понять, не получился ли хороший средний результат за счёт верхней части распределения, пока нижний хвост уехал вниз.
Это, конечно, не ответ на вопрос «в каждой ли вертикали всё идеально?». Скорее ранний сигнал. Если среднее растёт и нижние перцентили ведут себя нормально, причин копать каждый разрез подряд меньше. Если хвост начинает проседать, уже есть повод идти глубже и искать, где именно появилась проблема.
Мне этот подход нравится тем, что он не превращает один эксперимент в десятки отдельных тестов и при этом не оставляет нас с ответом «ну в среднем же всё хорошо».
А как вы проверяете, что хороший общий результат не скрывает проблемы в отдельных маленьких срезах?
❤14🤔3🆒3✍2👎2👌2👨💻2👍1🔥1
1 октября пройдёт первый митап Trisigma в Ташкенте 🚀
Команда Trisigma собрала экспертов и коллег из TBC и Uzum, чтобы обсудить, как data-driven подход работает за пределами вайт-пейперов, в разных компаниях и разных контекстах.
➡️ Как культура экспериментов превращает продуктовую команду в data-driven, а не data-informed.
➡️ Как выстроить аналитику так, чтобы она помогала, а не мешала бизнесу.
➡️ Как в разных компаниях устроен процесс работы с данными — и почему в одной он работает как нужно, а в другой нет.
➡️ Как оценить экономический эффект от внедрения A/B-культуры в бизнесе.
🔴 Регистрируйтесь на офлайн-встречу в Ташкенте или на онлайн-трансляцию 🔴
Команда Trisigma собрала экспертов и коллег из TBC и Uzum, чтобы обсудить, как data-driven подход работает за пределами вайт-пейперов, в разных компаниях и разных контекстах.
И, конечно, будут говорить про A/B-инструменты в целом, в том числе про Trisigma: как она устроена, в каких компаниях используется уже сейчас. И к каким результатам эти компании пришли за последний год.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7👍3👏3