Практика: прокачиваем SQL на реальных задачах
Приготовили для вас новый формат эфиров! На практическом стриме с Евгением Буториным, ментором курса «Аналитик данных» и руководителем CRM-аналитики в Альфа Банке, разберём четыре реальные задачи, которые часто встречаются в работе аналитика. Вы увидите живые примеры кода и подходы к оптимизации сложных запросов.
На стриме разберём:
🟠 Как посчитать количество и прибыльность анализов по наименованиям, определить самый доходный и убыточный;
🟠 Как провести ABC-анализ дистрибьюторов — построить отчёт по прибыли и выручке с фильтрацией по продуктам и производителям;
🟠 Как проанализировать сочетаемость товаров в аптечной сети — выявить самые востребованные продукты по часам и дням недели;
🟠 А также ответим на ваши вопросы про реальные рабочие кейсы.
❗️ 30 апреля, 19:00 МСК, онлайн
➡️ Зарегистрироваться на стрим
Присоединяйтесь — от вашей обратной связи зависит, будем ли продолжать делать этот формат🧡
📈 Симулейтив | ВК | YouTube
Приготовили для вас новый формат эфиров! На практическом стриме с Евгением Буториным, ментором курса «Аналитик данных» и руководителем CRM-аналитики в Альфа Банке, разберём четыре реальные задачи, которые часто встречаются в работе аналитика. Вы увидите живые примеры кода и подходы к оптимизации сложных запросов.
На стриме разберём:
Присоединяйтесь — от вашей обратной связи зависит, будем ли продолжать делать этот формат
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤3 2
Давно не проводили для вас Q&A-сессии, и рады сообщить, что на связь с вами выйдет Андрон Алексанян!
Андрон более 8 лет выстраивает аналитику крупнейшим компаниям России и мира: Сбер, Mail, Skyeng, Coding Invaders и др. В 2023 году основал онлайн-университет Симулейтив, где также является преподавателем и спикером курсов. Постоянный спикер и участник наших вебинаров, а ещё активно отвечает студентам в чате!
Если у вас есть любые вопросы по профессиям в аналитике, кейсам да и вообще любые — самое время его задать! 30 апреля Андрон выберет самые интересные и разберёт их в наших каналах:
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2👍1
Forwarded from Модель предскажет
Как автоматически находить ошибки в разметке и чистить датасеты
Привет! На связи Мария Жарова, ML-инженер в команде рекомендаций в Wildberries и ментор курса «Инженер машинного обучения» 👋🏻
Если вы когда-нибудь обучали модели, то знаете: качество данных почти всегда важнее самой модели. Неверная разметка, дубликаты, пропуски, дрейф — всё это незаметно «ломает» метрики и приводит к странным предсказаниям.
Хорошая новость — часть этих проблем можно находить автоматически!
Для этого есть библиотека Cleanlab — инструмент для анализа качества данных и поиска скрытых ошибок в датасетах🧹
Что умеет этот инструмент:
🟠 Находить потенциально неверно размеченные объекты и оценивать «уверенность» в разметке;
🟠 Искать шумные классы и пересечения между ними;
🟠 Выявлять дубликаты и аномалии;
🟠 Анализировать пропуски и проблемы в признаках;
🟠 Проверять дрейф данных между выборками.
А также Cleanlab полностью совместим со sklearn «из коробки» и умеет работать поверх любой модели.
Как это работает?
Cleanlab использует вероятностные предсказания модели, чтобы оценить, насколько разметка согласуется с паттернами в данных. Если модель стабильно «не согласна» с label’ом, объект помечается как подозрительный. Это особенно полезно для:
🟠 больших датасетов с ручной разметкой, особенно при крауд-сорсинге;
🟠 CV / NLP-задач;
🟠 пользовательских событий (где много шума).
Быстрый старт
Установка:
Пример №1 — поиск ошибок разметки для классификации:
На выходе получаем строки датасета, где разметка, вероятно, ошибочная — их можно перепроверить вручную, удалить или переразметить.
Пример №2 — автоматическая очистка датасета:
Также среди возможностей библиотеки — оценка качества разметки по классам (можно понять, какие классы путают чаще всего), а также работа с текстами и изображениями — достаточно подать эмбеддинги или вероятности любой модели.
Быстрые ссылки
➡️ Официальная документация
➡️ Страничка на PyPI с примерами
Ставьте❤️ , если было полезно — и сохраняйте, чтобы протестировать на своих датасетах!
Привет! На связи Мария Жарова, ML-инженер в команде рекомендаций в Wildberries и ментор курса «Инженер машинного обучения» 👋🏻
Если вы когда-нибудь обучали модели, то знаете: качество данных почти всегда важнее самой модели. Неверная разметка, дубликаты, пропуски, дрейф — всё это незаметно «ломает» метрики и приводит к странным предсказаниям.
Хорошая новость — часть этих проблем можно находить автоматически!
Для этого есть библиотека Cleanlab — инструмент для анализа качества данных и поиска скрытых ошибок в датасетах
Что умеет этот инструмент:
А также Cleanlab полностью совместим со sklearn «из коробки» и умеет работать поверх любой модели.
Как это работает?
Cleanlab использует вероятностные предсказания модели, чтобы оценить, насколько разметка согласуется с паттернами в данных. Если модель стабильно «не согласна» с label’ом, объект помечается как подозрительный. Это особенно полезно для:
Быстрый старт
Установка:
pip install cleanlab
Пример №1 — поиск ошибок разметки для классификации:
# ищем подозрительно размеченные объекты
label_issues = find_label_issues(
labels=y_train,
pred_probs=pred_probs
)
На выходе получаем строки датасета, где разметка, вероятно, ошибочная — их можно перепроверить вручную, удалить или переразметить.
Пример №2 — автоматическая очистка датасета:
from cleanlab.classification import CleanLearning
cl = CleanLearning(model)
cl.fit(X_train, y_train)
# уже очищенное обучение
preds = cl.predict(X_test)
Также среди возможностей библиотеки — оценка качества разметки по классам (можно понять, какие классы путают чаще всего), а также работа с текстами и изображениями — достаточно подать эмбеддинги или вероятности любой модели.
Быстрые ссылки
Ставьте
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8🔥4👍2🤩1
Хотите прокачаться в Симулейтив, но ещё оцениваете свой бюджет?
Есть способ учиться без личных расходов, о котором вы, возможно, не знали — за счёт компании, в которой вы работаете🧡
Что это значит для вас:
➖ Вы прокачиваете скилл — SQL, Python, BI, ML, аналитика данных;
➖ Получаете диплом о профпереподготовке или сертификат;
➖ Итоговый проект — на задачах вашего реального бизнеса;
➖ Бессрочный доступ к материалам.
Оставьте заявку и получите бесплатную консультацию — вместе разберём, как оформить обучение в вашей компании.
➡️ Оставить заявку: simulative.ru/korporativnoe-obuchenie
📈 Симулейтив | ВК | YouTube
Есть способ учиться без личных расходов, о котором вы, возможно, не знали — за счёт компании, в которой вы работаете
Мы запустили корпоративные программы повышения квалификации — и теперь они доступны даже от одного специалиста. Не нужно ждать, пока весь отдел соберётся учиться 😁
Что это значит для вас:
Оставьте заявку и получите бесплатную консультацию — вместе разберём, как оформить обучение в вашей компании.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍3🔥2
Симулейтив
Начинаем Q&A с Андроном!
Вопрос от Ильдара:
Вопрос от Ильдара:
Очень сомневаюсь, что профессия аналитика будет востребованной спустя 3-5 лет из-за кризиса в экономике и использования нейросетей. Как вы считаете, стоит ли вообще вкатываться сейчас в профессию и каким образом?
❤1🔥1 1
Вопрос от Дмитрия:
У меня вопрос, куда лучше сейчас идти — в ДА или МЛ и почему?
Вопрос:
Что лучше — быть универсалом или хорошим в какой-то одной области в аналитике?
Please open Telegram to view this post
VIEW IN TELEGRAM
Следующий вопрос от Елены:
Как видите развитие аналитической сферы в России? Условно, на ближайший год