Please open Telegram to view this post
VIEW IN TELEGRAM
😁51❤8
Ребят, а тут есть такие, кто идет на дата конфу в Лондоне?
https://www.bigdataldn.com
Она бесплатная, нужно просто прилететь🙂 По темам очень похоже: лейкхаус, AI агенты, data fabric, data governance. И сессии от топовых компаний: Databricks, Microsoft, Google, JetBrains, dbt Labs, Snowflake…
Я вот зарегалась и даже на некоторое время задумалась над подачей визы🤭 Но потом как вспомнила, что ИМЕННО В ЭТИ ДАТЫ у меня конфа в Москве
Так что ищу шпиониро😎
Полную программу конференции можно хотя бы полистать тут
@data_engineerette
https://www.bigdataldn.com
Она бесплатная, нужно просто прилететь
Я вот зарегалась и даже на некоторое время задумалась над подачей визы
Так что ищу шпиониро
Полную программу конференции можно хотя бы полистать тут
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
😁15💅4❤2
Анти чек-лист работы в DE
По ходу жизни собрала список того, что мне не очень нравится в работе. И вот что в него вошло:
1️⃣ Канбан
У вас нет пула задач на ближайшее время. К вам могут приходить аналитики и менеджеры с адхоками, которым нужны отчеты еще вчера. Вы не можете спокойно распределить время на свои задачи. В канбане будут всегда прилетать новые задачи, которые нужно взять, как только закончите предыдущую. И вместе с этим постоянное ощущение напряга
2️⃣ Проектная работа
Проекты заканчиваются. Допустим, он длится год, потом вам обещают найти другой. А если проект свернут раньше года? А если другой проект не найдется?
3️⃣ Срочный трудовой договор
Он может быть короче даже самого проекта. А если договор не продлят? Не проще ли сразу найти нормальное место и не жить в страхе от приближения того самого дня?
4️⃣ Ты - единственный DE
Я в такое лезть не пробовала, но внутренне становится некомфортно. Представь, у тебя больше нет DEшной экспертизы в команде. Если не получается - надеешься только на себя (ну и на иишку)
5️⃣ В стеке только 3 инструмента
На рынке де столько всего требуется, как потом красиво преподать свой опыт, когда ты все последнее время писал только SQL и YAML?
6️⃣ Очень сложные задачи
А это я бы назвала другой крайностью 5го пункта) Делать настолько уникальное, что в других местах абсолютно не нужно. Или просто лично для меня непонятное, например, писать заливку данных на Rust
7️⃣ Уникальный стек
Молодец, ты освоишь инструмент, который нигде больше не используется
8️⃣ Нет созвонов
Вот вообще. Хотя бы раз в несколько дней. Просто заканчиваешь одну задачку и берешь следующую. В такие моменты складывается ощущение, что члены команды между собой не общаются. У кого-то такой подход может вызывать лишь восторг) Но для меня общение с коллегами - реально важная часть и чего не хватает на удаленке
9️⃣ Нет чатика с мемами
Это тоже в тему общения с командой и создания более прочных коммуникативных связей
💫 💫 💫 💫 💫 💫 💫 💫 💫 💫 💫
Здесь я привела свое субъективное мнение, вы можете поспорить или дополнить своими пунктами🥺
@data_engineerette
По ходу жизни собрала список того, что мне не очень нравится в работе. И вот что в него вошло:
У вас нет пула задач на ближайшее время. К вам могут приходить аналитики и менеджеры с адхоками, которым нужны отчеты еще вчера. Вы не можете спокойно распределить время на свои задачи. В канбане будут всегда прилетать новые задачи, которые нужно взять, как только закончите предыдущую. И вместе с этим постоянное ощущение напряга
Проекты заканчиваются. Допустим, он длится год, потом вам обещают найти другой. А если проект свернут раньше года? А если другой проект не найдется?
Он может быть короче даже самого проекта. А если договор не продлят? Не проще ли сразу найти нормальное место и не жить в страхе от приближения того самого дня?
Я в такое лезть не пробовала, но внутренне становится некомфортно. Представь, у тебя больше нет DEшной экспертизы в команде. Если не получается - надеешься только на себя (ну и на иишку)
На рынке де столько всего требуется, как потом красиво преподать свой опыт, когда ты все последнее время писал только SQL и YAML?
А это я бы назвала другой крайностью 5го пункта) Делать настолько уникальное, что в других местах абсолютно не нужно. Или просто лично для меня непонятное, например, писать заливку данных на Rust
Молодец, ты освоишь инструмент, который нигде больше не используется
Вот вообще. Хотя бы раз в несколько дней. Просто заканчиваешь одну задачку и берешь следующую. В такие моменты складывается ощущение, что члены команды между собой не общаются. У кого-то такой подход может вызывать лишь восторг) Но для меня общение с коллегами - реально важная часть и чего не хватает на удаленке
Это тоже в тему общения с командой и создания более прочных коммуникативных связей
Здесь я привела свое субъективное мнение, вы можете поспорить или дополнить своими пунктами
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥34 12👍11
Походу салон нанял себе дата аналитика🤭
Или можно подключить аналитику у самого сервиса по записи?
В любом случае я теперь переживаю, что, если не запишусь сейчас, кому-то на дейли придется объяснять просадку retention rate😕
@data_engineerette
Или можно подключить аналитику у самого сервиса по записи?
В любом случае я теперь переживаю, что, если не запишусь сейчас, кому-то на дейли придется объяснять просадку retention rate
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
😁65🤔2🌚2❤1 1
В начале лета я рассказывала, как начала проходить курс по алгосам, сейчас делюсь с вами промежуточными впечатлениями🙂
👩💻 Первый месяц я активно садилась за задачи раз или два в неделю - этого было вполне достаточно. Сам смысл курса подается не как "пока самостоятельно не решите 100 задач на литкоде, из-за компа не выходите", а как "сначала смотрим объяснение и решение, потом идем кодить, если не запомнили - смотрим еще раз и повторяем"
В рамках одного 10-минутного видоса разбирается одна задача, иногда с несколькими вариантами решения, в конце анализируется сложность по времени и памяти. Что я заметила - когда мне голосом объясняют суть задачи, мне становится в разы понятнее. Поэтому мой типичный флоу занятий такой: я смотрю 1-2 минутки с объяснением условия, иду решать сама, потом досматриваю
С какого-то момента действительно появился азарт, хочется решить как можно больше задач до момента усталости) Пока я отметила для себя всего 2 задачки, которые вызвали трудности, и я оценила их по сложности на 5/10 по сравнению со всеми остальными
📊 Для трекинга прогресса нам рекомендовали завести гугл табличку с решенными задачами, затраченным временем и комментами. Я туда еще вписываю свои впечатления по задаче, новые синтаксические конструкции и инсайты после объяснений. Пока из интересного - идея с выделением виртуального места в массиве, иногда полезно идти с конца, также понравился мой собственный подход с просмотром только 1/4 матрицы
📞 Лайв созвоны случаются в конце спринта, где кураторы вместе с учениками разбирают задачи на самостоятельное прорешивание, отвечают на вопросы. Но вопросы можно задавать и в чатике, там все очень активные, периодически кураторы присылают разборы на задачи с собесов
В июле с отпусками я подзабросила курс🤩 В текущем спринте начали темы связных список и стека, но я надеюсь быстренько все догнать
@data_engineerette
В рамках одного 10-минутного видоса разбирается одна задача, иногда с несколькими вариантами решения, в конце анализируется сложность по времени и памяти. Что я заметила - когда мне голосом объясняют суть задачи, мне становится в разы понятнее. Поэтому мой типичный флоу занятий такой: я смотрю 1-2 минутки с объяснением условия, иду решать сама, потом досматриваю
С какого-то момента действительно появился азарт, хочется решить как можно больше задач до момента усталости) Пока я отметила для себя всего 2 задачки, которые вызвали трудности, и я оценила их по сложности на 5/10 по сравнению со всеми остальными
В июле с отпусками я подзабросила курс
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
дата инженеретта
На пути к гуру алгосов
01.06 стартует новый поток курса от Глеба Михайлова, и я на него иду! Алгосы — это точно мое слабое место, и я прямо в превкушении почувствовать «азарт охотника, а не ужас жертвы»🐆
Я уже зарегалась на платформе, добавилась в чатик…
01.06 стартует новый поток курса от Глеба Михайлова, и я на него иду! Алгосы — это точно мое слабое место, и я прямо в превкушении почувствовать «азарт охотника, а не ужас жертвы»🐆
Я уже зарегалась на платформе, добавилась в чатик…
❤11🔥7 2
Как забытый ON CLUSTER поставил меня в тупик
Я создала таблицу ReplicatedReplacingMergeTree, потом переделала на обычный ReplicatedMergeTree. Дропнула таблицы, но тупо забыла ON CLUSTER, и вот что из этого вышло
🫤 Запускаю загрузку, она падает, я чищу табличку и гружу заново. Казалось бы, проблемы больше нет? Сверяюсь по каунтам - сильно отличается. Снова перезагружаю - вообще другие каунты стали. Что происходит? Смотрю инфу по репликам:
На двух хостах сходится, на третьем сильно меньше данных и вообще нет большого куска, при этом все цифры разъезжаются с источником…
Я делаю truncate - а с третьего хоста данные вообще не удаляются. Делаю truncate sync - снова ничего не происходит. SYSTEM SYNC REPLICA schema.table - то же самое
🤔 Иишка советует заглянуть в system.distributed_ddl_queue - но там все Finished. Потом смотрю zookeeper_path:
Первые 2 хоста в одной репликационной группе:
/clickhouse/tables/9e0fe594-04f6-41ad-8137-385f08c2fbe5/shard1
total_replicas = 2
А третья живет отдельно:
/clickhouse/tables/faee8477-d2a6-47c9-8cc9-8a3f44972612/shard1
total_replicas = 1
Дальше смотрю DDL на разных хостах:
Первые две - ReplicatedReplacingMergeTree
Третья - ReplicatedMergeTree
Поверх этих таблиц еще была Distributed, а она читает табличку на основе параметра load_balancing:
В моем случае там был random, и он постоянно возвращал данные с третьей реплики (кроме random, есть еще несколько)
А почему данных на третьей реплике было меньше? Все еще помните про самый первый процесс, который упал? Так вот он записал кусок данных, но почистить их кх уже не смог. А при следующем запуске запись пошла в другую реплику
В общем, два забытых слова привели к тотальной смеси двух миров
@data_engineerette
Я создала таблицу ReplicatedReplacingMergeTree, потом переделала на обычный ReplicatedMergeTree. Дропнула таблицы, но тупо забыла ON CLUSTER, и вот что из этого вышло
SELECT hostName(), pid, count()
FROM clusterAllReplicas('default', schema.table)
GROUP BY hostName(), pid
ORDER BY pid, hostName();
На двух хостах сходится, на третьем сильно меньше данных и вообще нет большого куска, при этом все цифры разъезжаются с источником…
Я делаю truncate - а с третьего хоста данные вообще не удаляются. Делаю truncate sync - снова ничего не происходит. SYSTEM SYNC REPLICA schema.table - то же самое
SELECT
hostName(),
zookeeper_path,
total_replicas,
active_replicas,
last_queue_update_exception
FROM clusterAllReplicas('default', system.replicas)
WHERE database = 'schema'
AND table = 'table';
Первые 2 хоста в одной репликационной группе:
/clickhouse/tables/9e0fe594-04f6-41ad-8137-385f08c2fbe5/shard1
total_replicas = 2
А третья живет отдельно:
/clickhouse/tables/faee8477-d2a6-47c9-8cc9-8a3f44972612/shard1
total_replicas = 1
Дальше смотрю DDL на разных хостах:
SELECT hostName(), create_table_query
FROM clusterAllReplicas('default', system.tables)
WHERE database = 'schema'
AND name = 'table';
Первые две - ReplicatedReplacingMergeTree
Третья - ReplicatedMergeTree
Поверх этих таблиц еще была Distributed, а она читает табличку на основе параметра load_balancing:
SELECT value
FROM system.settings
WHERE name = 'load_balancing';
В моем случае там был random, и он постоянно возвращал данные с третьей реплики (кроме random, есть еще несколько)
А почему данных на третьей реплике было меньше? Все еще помните про самый первый процесс, который упал? Так вот он записал кусок данных, но почистить их кх уже не смог. А при следующем запуске запись пошла в другую реплику
В общем, два забытых слова привели к тотальной смеси двух миров
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔9👍8💅4❤2
Iceberg — это внезапный бум или планомерная подготовка?
Заметили, как с определенного момента стало много айсберга в DE? Хотя я сейчас зашла чекнуть вакансии на hh, и iceberg упоминается в 68 из 455 дата инженерских вакансий - что около 15%. Но у меня есть стойкое ощущение, что все про него говорят, всем он нужен и везде его используют
🐱 Последний раз я обращала на это внимание в марте. Тогда мне казалось, что компании только-только переходят на лейкхаус и начали строить его 1 или 2 года назад. Но на самом деле это было гораздо раньше
Недавно я узнала, что в Т-банке развитие в сторону лейкхауса началось еще тогда, когда меня не было в де🥺 Да и MWS не смогли бы выкатить свою лейкхаус-платформу в середине 2025 года, если бы не стартовали еще тогда
☕️ Мы в Сбере тоже обсуждали табличные форматы, но мне казалось это таким нишевым и далеким от индустрии, поэтому я особо не изучала всякие айсберги/худи/дельты и отличия одного от другого. А ведь в то же самое время все остальные уже готовились...
🌱 🌱 🌱 🌱
Так что получается, мы узнаем о технологическом тренде, когда другие уже презентовали свои результаты раньше всех. И теперь мне интересно: что прямо сейчас кажется нишевой штукой, на которую мы не особо обращаем внимание, но через год оно будет везде?
@data_engineerette
Заметили, как с определенного момента стало много айсберга в DE? Хотя я сейчас зашла чекнуть вакансии на hh, и iceberg упоминается в 68 из 455 дата инженерских вакансий - что около 15%. Но у меня есть стойкое ощущение, что все про него говорят, всем он нужен и везде его используют
Недавно я узнала, что в Т-банке развитие в сторону лейкхауса началось еще тогда, когда меня не было в де
Так что получается, мы узнаем о технологическом тренде, когда другие уже презентовали свои результаты раньше всех. И теперь мне интересно: что прямо сейчас кажется нишевой штукой, на которую мы не особо обращаем внимание, но через год оно будет везде?
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
26 сентября иду на Data Driven от Яндекса — конференции в этом году исполняется 10 лет, и это чувствуется по размаху программы.
Тема — AI-first-аналитика: как AI меняет саму профессию, а не просто добавляет ещё один инструмент в стек. Два трека докладов: про AI-инструменты, которые реально экономят время, про генеративный AI в работе с данными и про то, какой будет роль аналитика через пару лет.
Из спикеров особенно интересны — Роман Халкечев (CDO Поисковых сервисов и ИИ Яндекса) — про то, как AI переписывает правила игры при работе с данными, Александр Самусенко (CDO Alice AI и Умных устройств) — про построение аналитики под эффективное использование AI-инструментов и Максим Стаценко с супер-темой, как собрать агента-аналитика, которому можно доверять.
Ещё будет Random Coffee с топовыми аналитиками, разбор резюме и карьерные консультации, а вечером — афтерпати в честь дня рождения конференции с музыкой и IT stand-up.
📍Москва + онлайн, 26 сентября. Регистрируйтесь по ссылке
👉Новости конференции
Тема — AI-first-аналитика: как AI меняет саму профессию, а не просто добавляет ещё один инструмент в стек. Два трека докладов: про AI-инструменты, которые реально экономят время, про генеративный AI в работе с данными и про то, какой будет роль аналитика через пару лет.
Из спикеров особенно интересны — Роман Халкечев (CDO Поисковых сервисов и ИИ Яндекса) — про то, как AI переписывает правила игры при работе с данными, Александр Самусенко (CDO Alice AI и Умных устройств) — про построение аналитики под эффективное использование AI-инструментов и Максим Стаценко с супер-темой, как собрать агента-аналитика, которому можно доверять.
Ещё будет Random Coffee с топовыми аналитиками, разбор резюме и карьерные консультации, а вечером — афтерпати в честь дня рождения конференции с музыкой и IT stand-up.
📍Москва + онлайн, 26 сентября. Регистрируйтесь по ссылке
👉Новости конференции
👍8
Mermaid-диаграммы
Наконец-то дошли руки поковыряться в mermaid-диаграммах, это что за имба вообще🔥 🔥 По сути это своего рода DaaS - Diagram as a Code, вы описываете диаграмму в нужном синтаксисе, потом она отрисовывается
Я полистала, что mermaid умеет вообще рисовать - там из прикольного: очень красивая диаграмма Ганта, граф с гит-коммитами, диаграмма Cynefin для принятия решений. Ну и всякие UML-ки, ER там тоже есть
Диаграммы имеют особый синтаксис, например, для ER-модели связи обозначаются вот так:
Напоминает корейский алфавит🇰🇷 А если нарисовать связь между двумя сущностями, то вообще получаются какие-то смайлики:
В общем, удобная и полезная штука - не нужно рисовать самому в draw.io или где-то еще, оно само красиво отрендерится💅
@data_engineerette
Наконец-то дошли руки поковыряться в mermaid-диаграммах, это что за имба вообще
Я полистала, что mermaid умеет вообще рисовать - там из прикольного: очень красивая диаграмма Ганта, граф с гит-коммитами, диаграмма Cynefin для принятия решений. Ну и всякие UML-ки, ER там тоже есть
Диаграммы имеют особый синтаксис, например, для ER-модели связи обозначаются вот так:
|o - 0/1
|| - 1
}o - >= 0
}| - >= 1
Напоминает корейский алфавит🇰🇷 А если нарисовать связь между двумя сущностями, то вообще получаются какие-то смайлики:
}o..o{
||--o{
|o--o{
В общем, удобная и полезная штука - не нужно рисовать самому в draw.io или где-то еще, оно само красиво отрендерится💅
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
Из аналитика в дата-инженеры: а оно мне вообще надо? 🤔
Я в последнее время все чаще замечаю, что дата-инженерия для аналитиков выглядит одновременно привлекательно и немного страшно.
С одной стороны, хочется понимать не только то, что происходит с данными, но и как эти данные вообще доезжают до нас. Откуда берутся, где хранятся, как обновляются, почему сегодня в витрине 10 млн строк, а завтра 8 млн и кто опять сломал загрузку🥲
С другой — открываешь вакансию DE, а там SQL, Python, Airflow, Kafka, Spark, DWH и еще 17 технологий, которые ты когда-то видел в вакансии, но решил пока не трогать.
И получается классическая ситуация: вроде хочется попробовать, но непонятно, с чего начинать и сколько лет на это закладывать.
Поэтому мне понравилось, как Симулейтив пересобрали свой буткемп «Инженер данных».
Там обучение разделено на два этапа: первые 10 недель — база и выход на junior, а дальше — более глубокое погружение в ключевые инструменты и развитие до middle.
Причем курс подойдет не только тем, кто приходит в DE с нуля, но и аналитикам, которые хотят перейти в инженерию.
В программе как раз то, без чего никуда:
➖ SQL и Python
➖ пайплайны сбора и обновления данных
➖ хранение и обработка данных
➖ DWH
➖ живые занятия с ментором каждую неделю
➖ подготовка к собеседованиям с первых недель
➖ ИИ-инструменты в обучении
➖ гостевые лекции от дата-инженеров из Яндекса, Т-Банка, Авито, Сбера и Ozon
И вот идея готовиться к собесам с первых недель мне кажется особенно здравой.
Потому что можно полгода героически изучать очередной инструмент, а потом на собесе получить вопрос уровня «а почему вы вообще так спроектировали этот пайплайн?» и обнаружить, что уверенности в себе осталось примерно на два SQL-запроса🥲
Еще из интересного — после обучения выдают диплом о профессиональной переподготовке.
Ну и вишенка: сейчас у Симулейтива есть гранты на обучение и гарантия трудоустройства для студентов.
Грантов ограниченное количество, а до завтра включительно можно успеть подать заявку на одно из 5 оставшихся мест нового потока.
Если вы аналитик и давно поглядываете в сторону DE, возможно, это как раз тот случай, когда имеет смысл не просто сохранить пост в закладки, а наконец разобраться, хотите ли вы туда переходить.
Потому что «когда-нибудь изучу Airflow» — это, конечно, тоже карьерный план.
Но мы оба понимаем, чем обычно заканчиваются такие планы☺️
🔗 ЗАБРОНИРОВАТЬ МЕСТО
Я в последнее время все чаще замечаю, что дата-инженерия для аналитиков выглядит одновременно привлекательно и немного страшно.
С одной стороны, хочется понимать не только то, что происходит с данными, но и как эти данные вообще доезжают до нас. Откуда берутся, где хранятся, как обновляются, почему сегодня в витрине 10 млн строк, а завтра 8 млн и кто опять сломал загрузку🥲
С другой — открываешь вакансию DE, а там SQL, Python, Airflow, Kafka, Spark, DWH и еще 17 технологий, которые ты когда-то видел в вакансии, но решил пока не трогать.
И получается классическая ситуация: вроде хочется попробовать, но непонятно, с чего начинать и сколько лет на это закладывать.
Поэтому мне понравилось, как Симулейтив пересобрали свой буткемп «Инженер данных».
Там обучение разделено на два этапа: первые 10 недель — база и выход на junior, а дальше — более глубокое погружение в ключевые инструменты и развитие до middle.
Причем курс подойдет не только тем, кто приходит в DE с нуля, но и аналитикам, которые хотят перейти в инженерию.
В программе как раз то, без чего никуда:
И вот идея готовиться к собесам с первых недель мне кажется особенно здравой.
Потому что можно полгода героически изучать очередной инструмент, а потом на собесе получить вопрос уровня «а почему вы вообще так спроектировали этот пайплайн?» и обнаружить, что уверенности в себе осталось примерно на два SQL-запроса🥲
Еще из интересного — после обучения выдают диплом о профессиональной переподготовке.
Ну и вишенка: сейчас у Симулейтива есть гранты на обучение и гарантия трудоустройства для студентов.
Грантов ограниченное количество, а до завтра включительно можно успеть подать заявку на одно из 5 оставшихся мест нового потока.
Если вы аналитик и давно поглядываете в сторону DE, возможно, это как раз тот случай, когда имеет смысл не просто сохранить пост в закладки, а наконец разобраться, хотите ли вы туда переходить.
Потому что «когда-нибудь изучу Airflow» — это, конечно, тоже карьерный план.
Но мы оба понимаем, чем обычно заканчиваются такие планы
🔗 ЗАБРОНИРОВАТЬ МЕСТО
Please open Telegram to view this post
VIEW IN TELEGRAM
😁4🤷4👍3🌚1