Анатолий Карпов | Data
943 subscribers
11 photos
1 video
10 links
Основатель karpov.courses, самый читаемый аналитик по версии NewHR. Тот самый автор статистики на Stepik. Чат для общения @karpovdatachat
Для связи по сотрудничеству и спецпроектам @https://t.me/karpovdata?direct
Download Telegram
Пока все следят за выходом новых LLM, давайте не будем забывать про истоки - в январе вышла новая версия Pandas 3. Из интересного:

1. Строки наконец-то стали строками
Спустя 11 лет текстовые колонки в датафрейме наконец-то имеют тип данных str, а не object. Дождались!

2. Новый способ ссылаться на колонки
Выглядит как в data.table в R (олды поймут):

df.assign(
total=pd.col("price") * pd.col("qty")
)


3. Больше никакого SettingWithCopyWarning
Если вы, как и я, каждый раз с недоумением смотрели на warning:

A value is trying to be set on a copy of a slice from a DataFrame. Try using .loc[row_indexer, col_indexer] = value instead

пытаясь понять, что сделали не так, - поздравляю, в новой версии теперь гарантированно создается копия датафрейма, и такого ворнинга не будет.

Вообще хотелось бы увидеть эти обновления лет 7 назад, но лучше поздно, чем никогда! Что вас все еще бесит в Pandas, что до сих пор не пофиксили?
🔥32
Позвали ведущим на конференцию, согласился провести!
Если хотите послушать, как Т-Банк, Авиасейлс, Магнит и другие компании меняют ландшафт современного анализа данных, подключайтесь завтра к KARPOV.CONF. Собирали программу из реальных кейсов, обсудим, что работает и что не менее интересно пока не работает с ИИ.

Полный список докладов и спикеров на сайте, регистрируйтесь, ждем!
🔥135😁3👍2
Итак, побывал на KARPOV.CONF «ИИ, который работает». Во-первых, это было очень круто, посмотрите доклады, если еще не видели. Ребята из Магнита, Aviasales, Avito, Т-Банка и не только рассказывали, как и зачем внедряют ИИ в продакшн.

Кажется, получилось сформулировать ответ на вопрос: заменит ли ИИ аналитиков и датасаентистов? Не заменит, пока. Но значительно изменит роль аналитиков — точнее, уже изменило, и скорость, конечно, поражает. 12 лет назад, когда я устраивался аналитиком, писал в резюме: pandas, SQL, BI. И в целом стек не менялся вплоть до последних событий, связанных с прогрессом LLM. Основной задачей аналитиков было строить дата-платформы, BI-экосистемы и помогать инженерам с DWH. Достроили. Почти во всех бигтехах с этим уровнем работы с данными разобрались, и сейчас активно строят следующий — AI-слой, все тоже самое как и раньше, только теперь вместо аналитиков AI агенты сами все делают.

Хорошая новость: в ближайшее время в области DS будет спрос на специалистов, которые одинаково уверенно разбираются как в классическом датасайнс, так и в технологиях «на кончиках» современного ИИ. Не в формате «использую курсор для написания кода» (этим уже никого не удивишь), а когда понимаешь, как встраивать DS-решения в AI-слой. Кстати, кодить придется так же много (зато с курсором).

Так что «Аналитики 2.0» компаниям очень нужны — именно они строят новый слой работы с данными.

Плохая новость: если вы аналитик и не узнаете себя в правой части картинки, вас заменит не ИИ, а как раз аналитики, которые все это уже умеют. Но это решаемо — например, приходите к нам учиться внедрять AI в прод.

Другой вопрос: чем будут заниматься аналитики, когда достроят систему AI-аналитики? Практика показывает, что мы мутируем в «Аналитиков 3.0». Кто это такие — пока можно только пофантазировать.
🔥175👍5
В прошлом посте мы обсудили, что из себя представляет Аналитика 2.0, и закончили на вопросе: что будет с аналитиками и DS, когда они такую систему достроят? Один из вариантов ответа предложил Oracle:

Американский IT-гигант Oracle за месяц уволил 30 000 сотрудников — их заменила нейросеть, которую часть из уволенных сотрудников и обучала, пишет Time.


Звучит тревожно и кажется логичным, что в мире Аналитики 2.0, где всю ручную работу на себя забирают агенты, такое число аналитиков и продактов более не потребуется. С другой стороны, важно помнить, что сейчас крупные сокращения компании будут преподносить как максимально эффективное мероприятие по автоматизации и внедрению AI, а вовсе не как затыкание дыр в бюджете.

В любом случае одно очевидно. Когда я начинал карьеру в аналитике, старшие коллеги шутили: стать сеньором на самом деле очень просто — достаточно не увольняться лет пять с текущего места работы, и ты превратишься в живую базу знаний, в единственного человека, который знает, как тут всё устроено, так сказать, в ключевого сотрудника. Сейчас многие пишут, что с приходом агентов джуны не нужны. У меня плохая новость и для сеньоров: если ваша основная ценность была в «базе знаний», то RAG-боты дышат в спину и вам!

Какие хорошие новости? Люди, которые внедряют AI, автоматизируют процессы и решают сложные инженерные задачи (тут и ML, и Data), надеюсь, ещё долго будут востребованы на рынке.
23
Вакансия Senior Designer в Karpov.Courses

Мы тут часто обсуждаем, как ИИ заменит людей. Я скорее верю, что он не заменит людей полностью, но драматически изменит профессии и привычные инструменты.

Возьмём, к примеру, дизайн. Я уже начинаю явно писать в требованиях к дизайнерам: умение собирать лендинги и создавать креативы с помощью AI-инструментов.

Если вы такой дизайнер или ваш знакомый ищет работу — пишите мне!

Ищем Senior Designer в Karpov.Courses, онлайл школу по Data Science.

Ожидаем, что ты умеешь работать с нейросетями (мы быстро тестируем и запускаем продукты), Tilda, а также готов помогать junior-коллегам с их задачами. С нас — крутой продукт на стыке AI и Data Science, много интересных и нетипичных задач, возможность удалённой работы.
8👍1
Эволюция А/Б-тестов

В математической статистике не так часто выкатывают обновления: базовые критерии, разработанные Фишером и Пирсоном более 100 лет назад, до сих пор активно используются в работе. Хотя есть и исключения — например, мой коллега Ян Пиле недавно доказал теорему про бутстреп. Несмотря на то, что статистический аппарат остается практически неизменным, существует несколько уровней эффективности экспериментов.

Уровень 1. Сравниваем две выборки

Этот уровень, который, к сожалению, часто встречается в академической среде, предполагает примерно следующий дизайн. У исследователя — психолога/социолога/биолога — появляется гипотеза, он решает проверить её в эксперименте (на этой стадии методологически всё безупречно). Дальше всё плохо: набирается выборка, желательно по 30 объектов в каждой группе, применяется стат. тест, и если p < 0.05, результат трактуется в пользу гипотезы, а работа — в пользу публикации.

Не стоит объяснять и так подготовленной публике этого уютного канала, что здесь не так. Именно поэтому в академических публикациях так много споров о том, что лучше — частотный или байесовский подход, чем плох p-value, как нельзя интерпретировать доверительные интервалы, когда можно и нельзя применять t-test, быть или не быть поправкам на множественные сравнения и т.д. Когда нет системы, часто инструмент становится проблемой, а метрика — самоцелью. Так, например, случилось с p-value. Некоторые журналы уже предлагают отказаться от p-value вовсе, чем терпеть массовый p-hacking.

Однако у грамотных учёных и на этом уровне всё прекрасно работает, так как они по сути внедрили в свою работу уровень два.

Уровень 2. Платформа А/Б-тестирования

Справедливости ради, на заре своей карьеры в аналитике я и в индустрии сталкивался с ситуацией сравнения двух выборок — чисто чтобы p посчитать. Но так как в индустрии собирать данные сильно проще, чем в академии, аналитики быстро сообразили: чтобы p-value работал, нужен системный подход. И начали строить системы А/Б-тестов — с понятной А/А-составляющей, фиксацией заранее ожидаемого размера эффекта и длительности теста, эмпирической валидацией критериев на больших данных. В итоге выяснилось, что если вы корректно собрали платформу А/Б-тестов (что очень непросто), то, зная все проблемы p-value, ненормальных распределений и т. д., мы можем надёжно гарантировать долю ошибок первого рода — чего в целом хватает для data-driven подхода к проверке гипотез. Хотя проблемы остаются.

Уровень 3. Быстрая и гибкая платформа А/Б-тестирования

Проблема уровня 2 в том, что классические А/Б-тесты могут быть медленными для индустрии и не всегда применимы к квазиэкспериментальным гипотезам — например, в офлайн-ритейле. Однако и для этих проблем быстро нашли решения. Практически во всех крупных IT-компаниях уже не только есть своя система А/Б, но и внедрены подходы по ускорению тестов: снижение дисперсии — CUPED, подбор прокси-метрик. А также автоматизирован подход к А/Б-тестам без А/Б-тестов: causal inference и другие методы.

Итого, пользователи могут участвовать в нескольких экспериментах одновременно, тесты работают быстро, все продуктовые метрики покрыты экспериментами, в админке можно запустить А/Б практически любой сложности. Вот тут примерно и остановились мои практические знания об А/Б-тестировании.

Но какой бы это был пост, если бы не ИИ и его влияние — в том числе и на А/Б-тесты? А вот что изменилось с приходом агентов — обсудим в следующем посте!
231👍1🌭1
Вертикальный контент и ИИ создают новый формат обучения. Интересно, смогут ли ролики по программированию конкурировать с Reels и TikTok за внимание пользователей.

Тем временем классическое онлайн-образование все больше напоминает кинотеатр, который конкурирует со стримингами и тем же вертикальным форматом. Чтобы выживать в этой новой конкуренции, кинотеатры зарабатывают не только на фильмах, но и на сопутствующих услугах.

Интересно, какой «попкорн» может предложить классическое онлайн-образование?
Forwarded from EDU Trends&Analytics
This media is not supported in your browser
VIEW IN TELEGRAM
🔤🔤🔤 🔤🔤🔤🔤
#мнениеэксперта

Инициативу Coursera прокомментировал
Анатолий Карпов,
CEO ООО Карпов Курсы, автор и преподаватель курсов по аналитике данных, машинному обучению и экспериментальному дизайну. Автор канала Анатолий Карпов | Data

EDU Trends&Analytics

🇷🇺 EDU Trends&Analytics в MАХ

#дайджест #edu_trends #karpovcourses
Please open Telegram to view this post
VIEW IN TELEGRAM
6👍2
Итак, продолжение про эволюцию А/Б-тестов.

Чтобы ещё лучше разобраться, что из себя представляют современные системы А/Б, советую послушать свежий выпуск недушного подкаста о data science, где руководители А/Б-платформ в Озоне, Т-Банке и Авито рассказывают про устройство и эволюцию платформы АБ в компаниях.

Зачем слушать: во-первых, если вы хотите понимать, что сейчас ожидается от аналитика в вопросах А/Б — это must have. Во-вторых, всегда очень круто слушать таких людей, особенно про наши любимые эксперименты.
Но что там с AI? На самом деле не так много, как можно было бы ожидать — чуда пока не произошло, и аналитики всё ещё очень нужны для управления экспериментами и помощи продуктовым командам. Однако фазовый переход уже начался.

1. AI как генератор гипотез
Уже сейчас AI не просто берёт на себя техническую работу по написанию кода, но и помогает продактам формулировать гипотезы — особенно в контексте многомерных гипотез, когда мы катим что-нибудь по разному на разные сегменты пользователей. Людям тут тяжело: мы физически не можем смотреть на данные в разрезе 100 группировок и их взаимодействий. А для AI это не особая проблема.

2. Технический слой меняет интерфейс
Сама техническая работа тоже трансформируется: AI меняет интерфейс, написание кода уходит, приходит выдача инструкций. Всё больше задач можно доверить копилоту. AI — это новый уровень абстракции, человек остаётся во главе, просто с новым интерфейсом.

3. Но AI не делает креативного из некреативного
Особенно понравилась мысль: AI — это инструмент, и не каждый человек с AI становится эффективным. Он не добавляет креативности человеку, у которого её не было. Хотя уже сейчас самые сильные модели начинают спорить с этим тезисом.
Главный вопрос — сможет ли революция AI переломить эту систему и дать инструмент, который из любого человека сделает senior продакта с абсолютными познаниями в А/Б-тестировании.

Одно очевидно: аналитики, которые служили туннелем между бизнесом и разработкой (писали код на питоне, SQL и строили дашборды), уходят в прошлое уже прямо сейчас. Надо меняться, чтобы оставаться в игре!
8
Привет! Буду выступать на https://id-reglament-event.timepad.ru/event/4017555/.
Кто в Москве, приходите, пообщаемся!
🔥10
За плечами 6 лет работы CEO, почти 10 лет в аналитике и вышка по психологии, где я годами изучал, как люди неверно оценивают вероятности. Самым сложным в реальной работе так и осталось — оценивать вероятности резких одномоментных изменений.

Вот, например: какова вероятность, что я буду ходить с тростью? Сделал операцию на колене — хожу с тростью (хорошая новость, трость не надолго). Вчера не ходил, сегодня хожу. Поймал себя на том, как именно мы оцениваем такие события: берём точку «сегодня», точку «прогноз» и соединяем их плюс-минус гладкой линией.

Практика же показывает: часто самые важные события — что в жизни, что в метриках — случаются «одним днём». Это, кстати, совсем не отрицает того, что необходимым условием была та самая монотонная плавная подводка: месяцы, а то и годы работы. Но случается всё равно неожиданно и сразу.

Тут положено вспомнить Талеба с его чёрным лебедем, но мне эта концепция скорее не нравится. Слишком удобно любую просадку задним числом объявлять НЕОЖИДАННЫМ ЧЁРНЫМ ЛЕБЕДЕМ — хотя чаще всего она была максимально ожидаемой и закономерной. Условно: если не заниматься спортом, проблема со здоровьем случится обязательно. Лебединость тут только в том, что случится она одним днём. Справедливости ради: сам я хожу с тростью как раз потому, что спортом перезанимался. Чёрные лебеди — они такие.

В общем, пойду перечитывать Канемана — видимо, с первого раза не понял. И вам советую: если вдруг ещё не читали «Думай медленно… решай быстро» — это must have. На фоне того же Талеба — гораздо более глубокая и полезная книга, которая действительно готовит к оценке маловероятных событий и в работе, и в жизни. Талеба тоже советую, будет о чем подискутировать, он еще и статистику обижает постоянно.
43👍4🙏3😁1
Forwarded from Masha K
Коллеги, привет. Работаю Т банке, у нас супер активный найм продуктовых аналитиков уровня выше middle, senior. Очень нужны крепкие спецы, которые умеют ML качественно a/bшить, отделять качество модели от продуктовых метрик и находить правильные формулы влияния, ставлю тут свою рефералку https://tbank.ru/career/friends/6mn838VZCJ отзовитесь хорошие аналитики, без вас никак 🍀
Please open Telegram to view this post
VIEW IN TELEGRAM
2