Media is too big
VIEW IN TELEGRAM
Сегодня в 19:00 МСК ждём вас на вебинаре — Павел Беляев разберет тестовое задание от крупнейшей ритейл-сети «Магнит». Мы познакомимся с тренажёром и приступим к решению, а потом ещё бонусом разберём тестовое по SQL от eLama.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤2👍1
Секрет сложной сезонности
Всем привет, на связи Павел Беляев, ведущий канала Тимлидское об аналитике и автор курса «Временные ряды» 👋🏻
Предсказание будущего — штука крайне желанная для бизнеса, но коварная и полная неочевидных нюансов (как и сама жизнь). Расскажу об одной ловушке, в которую попадают даже опытные аналитики.
Данные чистые, история длинная — 4 года. Аналитик строит классическую модель с сезонностью, всё красиво. Июль традиционно слабый, август чуть лучше, октябрь — пик. Модель обучена, метрики хорошие. Прогноз готов.
А потом октябрь оказался сухим, без дождей!
Ошибка прогноза — 40%. Склад затоварен, деньги заморожены, все недовольны.
Что пошло не так? Модель всё делала правильно — она честно выучила исторический паттерн. Проблема в другом: сезонность продаж зонтов — это не календарная сезонность, это сезонность осадков.
А осадки и календарь связаны лишь статистически, но не причинно. Когда погода ведёт себя «по учебнику» — модель работает. Когда нет — рассыпается.
Как это чинится?
Добавляем внешний регрессор — прогноз осадков на горизонт планирования. В Prophet это параметр add_regressor(), в SARIMA — экзогенные переменные (SARIMAX), в градиентном бустинге — просто ещё один признак.
Но здесь начинается самое интересное. Нельзя просто взять данные об осадках и скормить их модели. Нужно ответить на три вопроса:
➡️ С каким лагом осадки влияют на продажи? Люди покупают зонт не в ливень, а накануне;
➡️ Как агрегировать — суммарные осадки за неделю или количество дождливых дней?
➡️ Что делать на горизонте прогноза, где у нас уже не факт, а прогноз погоды — то есть переменная с собственной ошибкой?
Таких внешних факторов в реальных задачах — десятки. Курс валют, праздники со смещёнными датами, школьные каникулы, спортивные события, промоакции конкурентов. Каждый из них потенциально ломает вашу красивую сезонную модель.
Хороший аналитик временных рядов — это тот, кто умеет думать о природе данных и понимает, какие силы на самом деле двигают ряд. Но начать надо всё же с алгоритма, научиться его применять, тогда и опыт подтянется!
⭐️ Курс «Временные ряды» стартует уже в пятницу, 15 мая, присоединяйтесь: simulative.ru/time-series
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Всем привет, на связи Павел Беляев, ведущий канала Тимлидское об аналитике и автор курса «Временные ряды» 👋🏻
Предсказание будущего — штука крайне желанная для бизнеса, но коварная и полная неочевидных нюансов (как и сама жизнь). Расскажу об одной ловушке, в которую попадают даже опытные аналитики.
Задача: спрогнозировать продажи зонтов на 3 месяца вперёд.
Данные чистые, история длинная — 4 года. Аналитик строит классическую модель с сезонностью, всё красиво. Июль традиционно слабый, август чуть лучше, октябрь — пик. Модель обучена, метрики хорошие. Прогноз готов.
А потом октябрь оказался сухим, без дождей!
Ошибка прогноза — 40%. Склад затоварен, деньги заморожены, все недовольны.
Что пошло не так? Модель всё делала правильно — она честно выучила исторический паттерн. Проблема в другом: сезонность продаж зонтов — это не календарная сезонность, это сезонность осадков.
А осадки и календарь связаны лишь статистически, но не причинно. Когда погода ведёт себя «по учебнику» — модель работает. Когда нет — рассыпается.
Как это чинится?
Добавляем внешний регрессор — прогноз осадков на горизонт планирования. В Prophet это параметр add_regressor(), в SARIMA — экзогенные переменные (SARIMAX), в градиентном бустинге — просто ещё один признак.
Но здесь начинается самое интересное. Нельзя просто взять данные об осадках и скормить их модели. Нужно ответить на три вопроса:
Последний пункт особенно коварен. Вы строите прогноз на основе прогноза. Ошибки перемножаются. Это нужно явно учитывать в доверительных интервалах — иначе вы будете уверены в числе, которое на самом деле очень нечёткое.
Таких внешних факторов в реальных задачах — десятки. Курс валют, праздники со смещёнными датами, школьные каникулы, спортивные события, промоакции конкурентов. Каждый из них потенциально ломает вашу красивую сезонную модель.
Хороший аналитик временных рядов — это тот, кто умеет думать о природе данных и понимает, какие силы на самом деле двигают ряд. Но начать надо всё же с алгоритма, научиться его применять, тогда и опыт подтянется!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4🔥4 1
Запускаем тренажёр для аналитика 💪🏻
Знать SQL, Python и Excel необходимо, но недостаточно. На собеседованиях и в реальной работе аналитика оценивают по другому: умеешь ли ты разобраться в бизнес-задаче, выбрать нужный инструмент и дать ответ, который будет полезен заказчику. Именно этот навык сложнее всего прокачать по учебникам и статьям — и именно его мы вынесли в основу курса.
5 июня стартует тренажёр аналитика данных от Михаила Строганова — продуктового аналитика в Magnit OMNI с более чем пятилетним опытом в аналитике данных, автора более 40 A/B-тестов и преподавателя курсов на SkyPro и Hexlet. Михаил знает, как выглядят реальные задачи бизнеса изнутри — и собрал их в одном курсе.
За 2-3 месяца вы:
🔶 Решите 15 объёмных кейсов из eCommerce, FinTech, маркетинга, RideTech и стриминга — задачи уровней от джуна до сеньора и основаны на реальных бизнес-запросах;
🔶 Научитесь понимать запрос заказчика и выбирать подходящий инструмент под конкретную задачу — SQL, Python или Excel;
🔶 Получите разбор ваших решений от преподавателя с развёрнутой обратной связью;
🔶 Соберёте портфолио из кейсов разного уровня сложности — от джуна до сеньора.
После курса у вас будет не просто набор инструментов, а понимание, как их применять. Это то, что отличает кандидата, которому дают оффер, от кандидата, которому отказывают.
➡️ Подробности и запись: simulative.ru/da-practice
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Знать SQL, Python и Excel необходимо, но недостаточно. На собеседованиях и в реальной работе аналитика оценивают по другому: умеешь ли ты разобраться в бизнес-задаче, выбрать нужный инструмент и дать ответ, который будет полезен заказчику. Именно этот навык сложнее всего прокачать по учебникам и статьям — и именно его мы вынесли в основу курса.
5 июня стартует тренажёр аналитика данных от Михаила Строганова — продуктового аналитика в Magnit OMNI с более чем пятилетним опытом в аналитике данных, автора более 40 A/B-тестов и преподавателя курсов на SkyPro и Hexlet. Михаил знает, как выглядят реальные задачи бизнеса изнутри — и собрал их в одном курсе.
За 2-3 месяца вы:
После курса у вас будет не просто набор инструментов, а понимание, как их применять. Это то, что отличает кандидата, которому дают оффер, от кандидата, которому отказывают.
🎁 Специальное предложение: до 25 мая действует скидка 20% на курс!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤3 2
Резюме инженера данных: как оформить опыт, если коммерческого ещё не было
Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻
Половина успеха в поисках первой работы — правильно оформленное резюме. Особенно если вы только входите в дата-инжиниринг. Хорошая новость: в нашей сфере ценят не строчки в дипломе и формальные регалии, а то, как вы мыслите и что уже собрали руками. На старте важно показать, что вы готовы к реальным проектам.
Ниже 5 советов, как правильно оформить резюме для поиска первой работы:
1️⃣ Проекты важнее обучения
Не стоит прятать учебные работы в блок курсов. Лучше вынести их в отдельный раздел «Проекты». Описывайте каждый по схеме:
➖ Что сделали: настроил ETL-пайплайн загрузки данных из PostgreSQL в S3
➖ Зачем: это позволило избавиться от ручных выгрузок и автоматизировать построение отчётов.
➖ Стек: Airflow, SQL, Python, Docker
➖ Ссылка: GitHub
2️⃣ Пишите через глаголы действия
Забудьте про «мои задачи включали», «участвовал в». Смело пишите «спроектировал», «реализовал», «оптимизировал», «вывел в прод». Это сразу показывает ownership и инженерный подход.
3️⃣ Скиллы — только актуальные
Лучшее стратегическое решение перед откликами — анализ рынка. Откройте 5-10 вакансий, куда хотите податься. Выпишите повторяющиеся требования к навыкам (Kafka, Spark, RabbitMQ, CI/CD, Graphana). В резюме оставьте только то, с чем реально работали руками. Идеально, если каждый навык из этого блока будет виден и в описании ваших проектов.
4️⃣ GitHub — ваш лучший рекламный агент
Если вы сомневаетесь, стоит ли прикладывать ссылку на GitHub, то не сомневайтесь, обязательно включите его в шапку в резюме. Но заранее оформите его. Репозиторий должен быть чистым, а код запускаемым. Добавьте
5️⃣ Тестовое — это новый опыт для резюме
Каждое тестовое задание оформляйте как отдельный проект на GitHub. Как правило, тестовые строятся на реальных бизнес-кейсах. Используйте это! Опишите бизнес-задачу в
⭐️ Записывайтесь на курс «Инженер данных» — поможем и с составлением резюме, и с наполнением портфолио: simulative.ru/data-engineer
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻
Половина успеха в поисках первой работы — правильно оформленное резюме. Особенно если вы только входите в дата-инжиниринг. Хорошая новость: в нашей сфере ценят не строчки в дипломе и формальные регалии, а то, как вы мыслите и что уже собрали руками. На старте важно показать, что вы готовы к реальным проектам.
Ниже 5 советов, как правильно оформить резюме для поиска первой работы:
Не стоит прятать учебные работы в блок курсов. Лучше вынести их в отдельный раздел «Проекты». Описывайте каждый по схеме:
Забудьте про «мои задачи включали», «участвовал в». Смело пишите «спроектировал», «реализовал», «оптимизировал», «вывел в прод». Это сразу показывает ownership и инженерный подход.
Лучшее стратегическое решение перед откликами — анализ рынка. Откройте 5-10 вакансий, куда хотите податься. Выпишите повторяющиеся требования к навыкам (Kafka, Spark, RabbitMQ, CI/CD, Graphana). В резюме оставьте только то, с чем реально работали руками. Идеально, если каждый навык из этого блока будет виден и в описании ваших проектов.
Если вы сомневаетесь, стоит ли прикладывать ссылку на GitHub, то не сомневайтесь, обязательно включите его в шапку в резюме. Но заранее оформите его. Репозиторий должен быть чистым, а код запускаемым. Добавьте
README.md: что это за проект, как развернуть локально, примеры входных/выходных данных.Каждое тестовое задание оформляйте как отдельный проект на GitHub. Как правило, тестовые строятся на реальных бизнес-кейсах. Используйте это! Опишите бизнес-задачу в
README.md, приложите код и конфиги, покажите результаты (логи, тесты или скрины). И включайте его в проекты. Так вы быстро получите дополнительный опыт уже на этапе поиска работы.Правильно составленное резюме — ваш путь к техническому собеседованию, и его главная цель — продать вашу способность решать инженерные задачи.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥2
Симулейтив
Вебинары этой недели Разбираем очередное тестовое задание на аналитика и рассказываем, почему SQL и Python недостаточно для успешной карьеры ❤️ 🛎️ 11 мая, 19:00 МСК — «Разбираем тестовое на аналитика данных в Магнит Tech» С помощью SQL потренируемся искать…
Вместе с Алексеем Евченко из Альфа-Банка разберём, почему знать SQL и Python сегодня недостаточно и что реально отделяет аналитика, которого нанимают и растят, от того, кто годами сидит на одной позиции.
Будет полезно, если вы:
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5❤2👍2
Возвращаем контентные стримы без регистрации и смс! Надеемся, вы этого ждали
Сегодня, 15 мая в 18:00 по МСК к вам придёт Валерия Елпатьевская — инженер данных в Альфа-Банке.
💡 О чём поговорим?
Посмотрим, как на практике выглядят ETL-пайплайны дата-инженеров. Валерия проведёт лайв-демо: за 15 минут соберёт рабочий пайплайн от сырого CSV до готовой аналитической витрины.
Никаких кластеров, Airflow и облачных хранилищ. Весь код будет в Jupyter-ноутбуке — вы сможете повторить его у себя.
Что сделаем:1️⃣ Загрузим CSV из открытых источников;2️⃣ Разобьём плоскую таблицу на 3 сущности и сохраним в Parquet;3️⃣ Соберём витрину, посчитаем метрики и построим график.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥5👍3
Симулейтив
Подключайтесь, чтобы вживую увидеть, как дата-инженер Альфа-Банка собирает рабочий ETL-пайплайн — от сырого CSV до аналитической витрины — прямо в Jupyter-ноутбуке за 15 минут.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥3👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Друзья, стрим с Валерией уже идёт!
Вы ещё успеваете — заходите, смотрите, как собирается ETL-пайплайн в прямом эфире, и задавайте вопросы.
➡️ Подключиться к трансляции ⬅️
Вы ещё успеваете — заходите, смотрите, как собирается ETL-пайплайн в прямом эфире, и задавайте вопросы.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5❤4👍1
Симулейтив
Вчера мы в прямом эфире собирали за 15 минут рабочий пайплайн от сырого CSV до готовой аналитической витрины. Если пропустили, ловите запись:
Если после эфира вы подумали: «Хочу так же уверенно разбираться в данных» или «Как бы потренироваться на реальных задачах?» — у нас как раз стартовал курс, где вы сможете прокачать навыки в безопасной среде и на реальных бизнес-кейсах.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7❤4👍2
Сегодня вместе с Марией Жаровой, ML-инженером команды рекомендаций в Wildberries, разберёмся, чем Data Science отличается от Machine и Deep Learning — через сравнение на реальной задаче.
Возьмём датасет и обучим две модели: сначала классическим алгоритмом, затем простой нейросетью. Сравним качество, разберём принцип работы и посмотрим, что окажется лучше и при каких условиях.
На вебинаре вы:
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥4 3
Симулейтив
Присоединяйтесь в 19:00 по МСК к вебинару — Мария Жарова, ML-инженер команды рекомендаций в Wildberries, объяснит, чем отличаются Data Science, Machine Learning и Deep Learning и покажет, как выбор метода влияет на результат.
На примере датасета вы увидите, как одну и ту же задачу решают классический ML-алгоритм и нейросеть — и сами сделаете вывод, когда что работает лучше.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥2 2
Как мы спасли текст, который съедала LLMSherpa: гибрид для парсинга
Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻
Делюсь кейсом, который отлично показывает, что в обработке документов нет универсального инструмента.
Для сервиса парсинга мы взяли библиотеку
Терять структуру нельзя. Терять содержимое — тем более. Как быть?
Пришлось писать кастомный парсер-гибрид:
➖ Взяли
➖ Подключили сырой экстрактор (
➖ Написали алгоритм мержа: если расхождение по длине выводов превышает порог (например,
В результате у нас получились чанки с идеальной структурой и ~100% покрытием текста. Мы перестали терять контекст на стыках страниц, сохранив при этом представление о форматировании документа.
Какие выводы из этого можно сделать:
🔶 Ни одна библиотека не универсальна. Структурный парсер вместе с сырым экстрактором оказались надёжнее, чем по отдельности.
🔶 Нужна валидация на стыке компонентов. Сравнение длины, хэши или посимвольный чек экономят часы дебага в проде.
🔶 Кастомный мерж-алгоритм иногда проще и быстрее, чем ожидание обновления библиотеки. Не бойтесь строить обвязку самостоятельно!
А вы сталкивались с тем, что готовые инструменты теряли часть данных? Делитесь кейсами в комментариях⬇️
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Привет! На связи Валерия Елпатьевская, ментор курса «Инженер данных» 👋🏻
Делюсь кейсом, который отлично показывает, что в обработке документов нет универсального инструмента.
Для сервиса парсинга мы взяли библиотеку
LLMSherpa. Она идеально считывала заголовки, таблицы, списки и сохраняла логическую структуру текста. Это казалось идеальным решением, но со временем мы обнаружили неочевидную вещь. Часть текста просто пропадала, если фрагмент переходил на следующую страницу и был небольшим.Терять структуру нельзя. Терять содержимое — тем более. Как быть?
Пришлось писать кастомный парсер-гибрид:
LLMSherpa как источник структурного скелета.pdfplumber/textract/python-docx) для полного покрытия текста.>= 30 символов), скрипт построчно сравнивает результаты двух библиотек, находит совпадения, а пропуски заполняет текстом из сырого источника, строго сохраняя порядок строк.В результате у нас получились чанки с идеальной структурой и ~100% покрытием текста. Мы перестали терять контекст на стыках страниц, сохранив при этом представление о форматировании документа.
Какие выводы из этого можно сделать:
А вы сталкивались с тем, что готовые инструменты теряли часть данных? Делитесь кейсами в комментариях
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4 3❤2
Стрим: рецепты подготовки данных для ML-моделей
Продолжаем наши контентные стримы! 20 мая в 18:00 по МСК к нам снова придёт Мария Жарова — ML-инженер в команде рекомендаций в Wildberries.
💡 О чём поговорим?
Данные в ML решают больше, чем кажется на первый взгляд. Разберём, как выглядит подготовка датасетов в реальных проектах — без теории, только практический взгляд изнутри.
Пошагово пройдём по базовой «рутине» дата-сайентиста:
1️⃣ Дубликаты, пропуски, выбросы — что с ними делать на практике;
2️⃣ Подготовка признаков для модели — кодирование и масштабирование;
3️⃣ Частые ошибки — утечки данных, мультиколлинеарность, нестабильность и другие вещи, которые тихо ломают качество модели.
Мария поделится лайфхаками и разберёт реальные кейсы из своей работы в команде рекомендаций. Будет много практики, примеров и ответов на ваши вопросы.
❗️ Не пропустите! Ссылку на подключение к трансляции пришлём за 1 час до её начала.
📈 Симулейтив | 📱 ВК | 📱 YouTube | 📱 Канал о DS
Продолжаем наши контентные стримы! 20 мая в 18:00 по МСК к нам снова придёт Мария Жарова — ML-инженер в команде рекомендаций в Wildberries.
💡 О чём поговорим?
Данные в ML решают больше, чем кажется на первый взгляд. Разберём, как выглядит подготовка датасетов в реальных проектах — без теории, только практический взгляд изнутри.
Пошагово пройдём по базовой «рутине» дата-сайентиста:
Мария поделится лайфхаками и разберёт реальные кейсы из своей работы в команде рекомендаций. Будет много практики, примеров и ответов на ваши вопросы.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥4👍2
Симулейтив
Стрим: рецепты подготовки данных для ML-моделей Продолжаем наши контентные стримы! 20 мая в 18:00 по МСК к нам снова придёт Мария Жарова — ML-инженер в команде рекомендаций в Wildberries. 💡 О чём поговорим? Данные в ML решают больше, чем кажется на первый…
Мария Жарова расскажет, как на практике выглядит подготовка данных для ML-моделей: дубликаты, пропуски, выбросы, кодирование признаков и типичные ошибки, которые незаметно роняют качество модели.
Подключайтесь — будет практично и по делу!
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤2🔥2