Зелёные тесты и сырники, рассказываем про кайфушечки аналитиков
❤️ Когда чей-то дэш помог ответить на все вопросы за 2 минуты
❤️ Задачу, рассчитанную на день, получилось сделать за полчаса
❤️ Скрипт, обрабатывающийся обычно час, выполнился за 5 минут — и как будто ничего оптимизировать уже не надо
❤️ Тест оказался зелёным, и можно не копать дальше
❤️ Расчёты, сделанные по разным методологиям, сошлись
❤️ Заказчики решили, что больше не нужна выгрузка
❤️ На кухне дают сырки
❤️ Встречу на час закончили за 20 минут
❤️ Аналитическое исследование действительно прочитали до конца и задали актуальные вопросы по нему
❤️ Не получилось подключиться на собес, но нашёлся коллега, готовый подхватить
❤️ Причину просадки метрики поняли за первые пять минут
❤️ Скинули код другого аналитика — и в нём ничего не нужно было чинить
Что забыли?)
Что забыли?)
Please open Telegram to view this post
VIEW IN TELEGRAM
❤27🔥18😁7👎2🤔1
Зачем ходить на офлайн-конференции?
Да чтобы поиграть в управленческий покер, получить разборы проблем от лидов Авито и посидеть с коллегами по индустрии в нишевом баре.
Подробности в карточках, а регистрация➡️ по ссылке ⬅️
Да чтобы поиграть в управленческий покер, получить разборы проблем от лидов Авито и посидеть с коллегами по индустрии в нишевом баре.
Подробности в карточках, а регистрация
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤4
В последнее время поднялся очередной шум вокруг ИИ — на этот раз из-за математики. OpenAI заявила, что её внутренняя AI-система предложила решение задачи Навье — Стокса — одной из знаменитых открытых математических задач. В решение был включён текст доказательства и формализация на Lean (языке для формальной проверки математических доказательств).
На этом фоне Теренс Тао, один из ведущих современных математиков, опубликовал заявление A Severe Misalignment of AI in Mathematics, подписанное 25 лауреатами Филдсовской премии.
И мне кажется, что в аналитике прослеживается что-то похожее.
➡️ Если ИИ способен подходить к таким сложным задачам, то агентские системы будут всё лучше строить большие цепочки рассуждений и самостоятельно «копать данные»: искать сегменты, замечать аномалии, предлагать объяснения и формулировать инсайты. Вероятно, таких инсайтов будет становиться всё больше и больше.
Но, как и с большими математическими результатами, сам факт появления ответа ещё не всегда закрывает вопрос. Нужно понимать, как именно возникло исследование: какие гипотезы проверялись, какие шаги привели к выводу, что было отброшено, где осталась неопределённость и какое решение из этого действительно следует.
➡️ Возможно, роль аналитика будет смещаться не только в сторону поиска инсайтов, но и в сторону их валидации. Нужно будет следить за путём решения, проверять ограничения и объяснять, почему найденному выводу можно или нельзя доверять.
А как вы думаете: если ИИ будет приносить всё больше готовых инсайтов, что станет главным навыком аналитика — находить ответы, проверять путь к ним или превращать их в правильные решения для бизнеса?
#АрменЕс
На этом фоне Теренс Тао, один из ведущих современных математиков, опубликовал заявление A Severe Misalignment of AI in Mathematics, подписанное 25 лауреатами Филдсовской премии.
Главная мысль, как я её понял: в математике важен не только финальный ответ. Решение большой задачи ценно ещё и тем, какие идеи, методы и обсуждения появляются по пути.
И мне кажется, что в аналитике прослеживается что-то похожее.
Но, как и с большими математическими результатами, сам факт появления ответа ещё не всегда закрывает вопрос. Нужно понимать, как именно возникло исследование: какие гипотезы проверялись, какие шаги привели к выводу, что было отброшено, где осталась неопределённость и какое решение из этого действительно следует.
А как вы думаете: если ИИ будет приносить всё больше готовых инсайтов, что станет главным навыком аналитика — находить ответы, проверять путь к ним или превращать их в правильные решения для бизнеса?
#АрменЕс
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔17🔥9👎2❤1🤩1
Мир IT — отдельная параллельная вселенная. Она существует рядом с обычным миром, но в ней свой язык, свои правила и огромное количество непонятных аббревиатур.
Со стороны иногда кажется, что это и правда волшебный мир: в офисах стоят массажные кресла, на кухнях всегда есть фрукты, а люди произносят слова «деплой», «пайплайн» и «прод» — и каким-то образом заставляют всё работать.
Давайте представим, кем работали бы персонажи «Гарри Поттера», если бы вместо Хогвартса оказались в современной IT-компании.
🧙♀️ Сегодня Распределяющая шляпа будет отправлять героев не на факультеты, а в IT-профессии.
P. S. В какой-то момент поняла, что пишу уже не пост для канала аналитиков, а фанфик по «Гарри Поттеру» в мире IT, и решила не останавливаться…
Со стороны иногда кажется, что это и правда волшебный мир: в офисах стоят массажные кресла, на кухнях всегда есть фрукты, а люди произносят слова «деплой», «пайплайн» и «прод» — и каким-то образом заставляют всё работать.
Давайте представим, кем работали бы персонажи «Гарри Поттера», если бы вместо Хогвартса оказались в современной IT-компании.
🧙♀️ Сегодня Распределяющая шляпа будет отправлять героев не на факультеты, а в IT-профессии.
P. S. В какой-то момент поняла, что пишу уже не пост для канала аналитиков, а фанфик по «Гарри Поттеру» в мире IT, и решила не останавливаться…
😁21❤9🔥7👎2
Спрашивает меня как-то подруга-аналитик: «Слушай, как посчитать эффект от выкатки нового тарифа в новом городе? Чтобы посмотреть каннибализацию других тарифов».
(Продукт существует, но в новом городе выкатили новый тариф, который уже раскатан в нескольких других городах)
Тут важно сказать, что не стоит просто сравнивать пользователей «до порога» и «после порога». Человек, который пользовался сервисом 2 раза, и человек, который пользовался им 50 раз, очевидно, отличаются не только наличием нового тарифа. Они и без всякой выкатки могли бы по-разному пользоваться остальными тарифами.
Но здесь есть условная граница, и можно найти пользователей, которые плюс-минус похожи, но при этом в разных группах: кто увидел новый тариф, и кому он недоступен. Если тариф становился доступен после 10 использований сервиса, можно сравнить, например:
8–10 использований➡️ тарифа ещё нет
11–13 использований➡️ тариф уже есть
Это уже гораздо более похожие пользователи. В идеальном мире единственное значимое отличие между ними — это доступность нового тарифа. А дальше смотрим, начали ли пользователи справа от порога реже выбирать старые тарифы.
И обязательно проверяем устойчивость результата: берём окно поуже — например, 9–10 vs 11–12, потом пошире — 7–10 vs 11–14. Если вывод каждый раз примерно один и тот же, доверия к нему становится сильно больше.
Если вам это что-то напоминает — да, это Regression Discontinuity Design, про который я уже писала в отдельном посте 👀
Что интересно, именно в момент этого разговора я сидела и считала по такому же методу свой «псевдотест». Изначально это не планировалось как АБ-тест, а просто было плавной раскаткой коммуникации на пользователей. Но в механике раскатки тоже нашлась условная граница, вокруг которой можно было сравнить очень похожих пользователей.
Спойлер, мой «псевдотест»не показал никаких аплифтов. Я проверила на разных границах (брала пользователей и поближе к границе, и подальше, разницы не было никакой), а у подруги-аналитика как раз такое исследование показало жёсткую каннибализацию других тарифов.
Дальше, конечно, стоит сделать обратный АБ, чтобы точно замерить негативный эффект на метрики других тарифов и получить данные для принятия решения. Ну или понять, что совсем всё плохо, и не катить тариф в этом городе :)
Вот так и поговорили.
Ну делитесь, а как бы вы попробовали обсчитать такой запуск?
(Продукт существует, но в новом городе выкатили новый тариф, который уже раскатан в нескольких других городах)
😊 «А есть похожий город, где вы уже были раскатаны?» — спрашиваю я
👩💻 «Ну они сильно другие»😊 «Окей, выкатывали ли вы на всех пользователей эту фичу?»
👩💻 «Исключали новичков — тех, кто сделал менее 10 пользований сервиса, — а так на всех, да»😊 «Ага, супер. Тогда можно сравнить 2 группы и то, как они пользовались другими тарифами»
Тут важно сказать, что не стоит просто сравнивать пользователей «до порога» и «после порога». Человек, который пользовался сервисом 2 раза, и человек, который пользовался им 50 раз, очевидно, отличаются не только наличием нового тарифа. Они и без всякой выкатки могли бы по-разному пользоваться остальными тарифами.
Но здесь есть условная граница, и можно найти пользователей, которые плюс-минус похожи, но при этом в разных группах: кто увидел новый тариф, и кому он недоступен. Если тариф становился доступен после 10 использований сервиса, можно сравнить, например:
8–10 использований
11–13 использований
Это уже гораздо более похожие пользователи. В идеальном мире единственное значимое отличие между ними — это доступность нового тарифа. А дальше смотрим, начали ли пользователи справа от порога реже выбирать старые тарифы.
И обязательно проверяем устойчивость результата: берём окно поуже — например, 9–10 vs 11–12, потом пошире — 7–10 vs 11–14. Если вывод каждый раз примерно один и тот же, доверия к нему становится сильно больше.
Если вам это что-то напоминает — да, это Regression Discontinuity Design, про который я уже писала в отдельном посте 👀
Что интересно, именно в момент этого разговора я сидела и считала по такому же методу свой «псевдотест». Изначально это не планировалось как АБ-тест, а просто было плавной раскаткой коммуникации на пользователей. Но в механике раскатки тоже нашлась условная граница, вокруг которой можно было сравнить очень похожих пользователей.
Спойлер, мой «псевдотест»
Дальше, конечно, стоит сделать обратный АБ, чтобы точно замерить негативный эффект на метрики других тарифов и получить данные для принятия решения. Ну или понять, что совсем всё плохо, и не катить тариф в этом городе :)
Вот так и поговорили.
Ну делитесь, а как бы вы попробовали обсчитать такой запуск?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤15👍2👎2
Если работаете в горизонтальной команде, после хорошего A/B почти всегда прилетает вопрос:
И вопрос справедливый. Общий эффект может быть положительным, а внутри отдельной вертикали или категории что-то могло просесть.
Самое очевидное решение — посчитать эффект отдельно по всем вертикалям и логическим категориям. Только разрезов обычно много, выборки становятся меньше, а вместе с количеством проверок растёт шанс найти случайную просадку.
Поэтому мы смотрим не только на общий эффект, но и на перцентили total-метрики: от P10 до P90. Так можно понять, не получился ли хороший средний результат за счёт верхней части распределения, пока нижний хвост уехал вниз.
Это, конечно, не ответ на вопрос «в каждой ли вертикали всё идеально?». Скорее ранний сигнал. Если среднее растёт и нижние перцентили ведут себя нормально, причин копать каждый разрез подряд меньше. Если хвост начинает проседать, уже есть повод идти глубже и искать, где именно появилась проблема.
Мне этот подход нравится тем, что он не превращает один эксперимент в десятки отдельных тестов и при этом не оставляет нас с ответом «ну в среднем же всё хорошо».
А как вы проверяете, что хороший общий результат не скрывает проблемы в отдельных маленьких срезах?
А у нашей вертикали точно всё хорошо?
И вопрос справедливый. Общий эффект может быть положительным, а внутри отдельной вертикали или категории что-то могло просесть.
Самое очевидное решение — посчитать эффект отдельно по всем вертикалям и логическим категориям. Только разрезов обычно много, выборки становятся меньше, а вместе с количеством проверок растёт шанс найти случайную просадку.
Поэтому мы смотрим не только на общий эффект, но и на перцентили total-метрики: от P10 до P90. Так можно понять, не получился ли хороший средний результат за счёт верхней части распределения, пока нижний хвост уехал вниз.
Это, конечно, не ответ на вопрос «в каждой ли вертикали всё идеально?». Скорее ранний сигнал. Если среднее растёт и нижние перцентили ведут себя нормально, причин копать каждый разрез подряд меньше. Если хвост начинает проседать, уже есть повод идти глубже и искать, где именно появилась проблема.
Мне этот подход нравится тем, что он не превращает один эксперимент в десятки отдельных тестов и при этом не оставляет нас с ответом «ну в среднем же всё хорошо».
А как вы проверяете, что хороший общий результат не скрывает проблемы в отдельных маленьких срезах?
❤14🤔3🆒3✍2👎2👌2👨💻2👍1🔥1