Походу салон нанял себе дата аналитика🤭
Или можно подключить аналитику у самого сервиса по записи?
В любом случае я теперь переживаю, что, если не запишусь сейчас, кому-то на дейли придется объяснять просадку retention rate😕
@data_engineerette
Или можно подключить аналитику у самого сервиса по записи?
В любом случае я теперь переживаю, что, если не запишусь сейчас, кому-то на дейли придется объяснять просадку retention rate
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
😁66🤔2🌚2❤1 1
В начале лета я рассказывала, как начала проходить курс по алгосам, сейчас делюсь с вами промежуточными впечатлениями🙂
👩💻 Первый месяц я активно садилась за задачи раз или два в неделю - этого было вполне достаточно. Сам смысл курса подается не как "пока самостоятельно не решите 100 задач на литкоде, из-за компа не выходите", а как "сначала смотрим объяснение и решение, потом идем кодить, если не запомнили - смотрим еще раз и повторяем"
В рамках одного 10-минутного видоса разбирается одна задача, иногда с несколькими вариантами решения, в конце анализируется сложность по времени и памяти. Что я заметила - когда мне голосом объясняют суть задачи, мне становится в разы понятнее. Поэтому мой типичный флоу занятий такой: я смотрю 1-2 минутки с объяснением условия, иду решать сама, потом досматриваю
С какого-то момента действительно появился азарт, хочется решить как можно больше задач до момента усталости) Пока я отметила для себя всего 2 задачки, которые вызвали трудности, и я оценила их по сложности на 5/10 по сравнению со всеми остальными
📊 Для трекинга прогресса нам рекомендовали завести гугл табличку с решенными задачами, затраченным временем и комментами. Я туда еще вписываю свои впечатления по задаче, новые синтаксические конструкции и инсайты после объяснений. Пока из интересного - идея с выделением виртуального места в массиве, иногда полезно идти с конца, также понравился мой собственный подход с просмотром только 1/4 матрицы
📞 Лайв созвоны случаются в конце спринта, где кураторы вместе с учениками разбирают задачи на самостоятельное прорешивание, отвечают на вопросы. Но вопросы можно задавать и в чатике, там все очень активные, периодически кураторы присылают разборы на задачи с собесов
В июле с отпусками я подзабросила курс🤩 В текущем спринте начали темы связных список и стека, но я надеюсь быстренько все догнать
@data_engineerette
В рамках одного 10-минутного видоса разбирается одна задача, иногда с несколькими вариантами решения, в конце анализируется сложность по времени и памяти. Что я заметила - когда мне голосом объясняют суть задачи, мне становится в разы понятнее. Поэтому мой типичный флоу занятий такой: я смотрю 1-2 минутки с объяснением условия, иду решать сама, потом досматриваю
С какого-то момента действительно появился азарт, хочется решить как можно больше задач до момента усталости) Пока я отметила для себя всего 2 задачки, которые вызвали трудности, и я оценила их по сложности на 5/10 по сравнению со всеми остальными
В июле с отпусками я подзабросила курс
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
дата инженеретта
На пути к гуру алгосов
01.06 стартует новый поток курса от Глеба Михайлова, и я на него иду! Алгосы — это точно мое слабое место, и я прямо в превкушении почувствовать «азарт охотника, а не ужас жертвы»🐆
Я уже зарегалась на платформе, добавилась в чатик…
01.06 стартует новый поток курса от Глеба Михайлова, и я на него иду! Алгосы — это точно мое слабое место, и я прямо в превкушении почувствовать «азарт охотника, а не ужас жертвы»🐆
Я уже зарегалась на платформе, добавилась в чатик…
❤12🔥7 2
Как забытый ON CLUSTER поставил меня в тупик
Я создала таблицу ReplicatedReplacingMergeTree, потом переделала на обычный ReplicatedMergeTree. Дропнула таблицы, но тупо забыла ON CLUSTER, и вот что из этого вышло
🫤 Запускаю загрузку, она падает, я чищу табличку и гружу заново. Казалось бы, проблемы больше нет? Сверяюсь по каунтам - сильно отличается. Снова перезагружаю - вообще другие каунты стали. Что происходит? Смотрю инфу по репликам:
На двух хостах сходится, на третьем сильно меньше данных и вообще нет большого куска, при этом все цифры разъезжаются с источником…
Я делаю truncate - а с третьего хоста данные вообще не удаляются. Делаю truncate sync - снова ничего не происходит. SYSTEM SYNC REPLICA schema.table - то же самое
🤔 Иишка советует заглянуть в system.distributed_ddl_queue - но там все Finished. Потом смотрю zookeeper_path:
Первые 2 хоста в одной репликационной группе:
/clickhouse/tables/9e0fe594-04f6-41ad-8137-385f08c2fbe5/shard1
total_replicas = 2
А третья живет отдельно:
/clickhouse/tables/faee8477-d2a6-47c9-8cc9-8a3f44972612/shard1
total_replicas = 1
Дальше смотрю DDL на разных хостах:
Первые две - ReplicatedReplacingMergeTree
Третья - ReplicatedMergeTree
Поверх этих таблиц еще была Distributed, а она читает табличку на основе параметра load_balancing:
В моем случае там был random, и он постоянно возвращал данные с третьей реплики (кроме random, есть еще несколько)
А почему данных на третьей реплике было меньше? Все еще помните про самый первый процесс, который упал? Так вот он записал кусок данных, но почистить их кх уже не смог. А при следующем запуске запись пошла в другую реплику
В общем, два забытых слова привели к тотальной смеси двух миров
@data_engineerette
Я создала таблицу ReplicatedReplacingMergeTree, потом переделала на обычный ReplicatedMergeTree. Дропнула таблицы, но тупо забыла ON CLUSTER, и вот что из этого вышло
SELECT hostName(), pid, count()
FROM clusterAllReplicas('default', schema.table)
GROUP BY hostName(), pid
ORDER BY pid, hostName();
На двух хостах сходится, на третьем сильно меньше данных и вообще нет большого куска, при этом все цифры разъезжаются с источником…
Я делаю truncate - а с третьего хоста данные вообще не удаляются. Делаю truncate sync - снова ничего не происходит. SYSTEM SYNC REPLICA schema.table - то же самое
SELECT
hostName(),
zookeeper_path,
total_replicas,
active_replicas,
last_queue_update_exception
FROM clusterAllReplicas('default', system.replicas)
WHERE database = 'schema'
AND table = 'table';
Первые 2 хоста в одной репликационной группе:
/clickhouse/tables/9e0fe594-04f6-41ad-8137-385f08c2fbe5/shard1
total_replicas = 2
А третья живет отдельно:
/clickhouse/tables/faee8477-d2a6-47c9-8cc9-8a3f44972612/shard1
total_replicas = 1
Дальше смотрю DDL на разных хостах:
SELECT hostName(), create_table_query
FROM clusterAllReplicas('default', system.tables)
WHERE database = 'schema'
AND name = 'table';
Первые две - ReplicatedReplacingMergeTree
Третья - ReplicatedMergeTree
Поверх этих таблиц еще была Distributed, а она читает табличку на основе параметра load_balancing:
SELECT value
FROM system.settings
WHERE name = 'load_balancing';
В моем случае там был random, и он постоянно возвращал данные с третьей реплики (кроме random, есть еще несколько)
А почему данных на третьей реплике было меньше? Все еще помните про самый первый процесс, который упал? Так вот он записал кусок данных, но почистить их кх уже не смог. А при следующем запуске запись пошла в другую реплику
В общем, два забытых слова привели к тотальной смеси двух миров
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔9👍8💅4❤2
Iceberg — это внезапный бум или планомерная подготовка?
Заметили, как с определенного момента стало много айсберга в DE? Хотя я сейчас зашла чекнуть вакансии на hh, и iceberg упоминается в 68 из 455 дата инженерских вакансий - что около 15%. Но у меня есть стойкое ощущение, что все про него говорят, всем он нужен и везде его используют
🐱 Последний раз я обращала на это внимание в марте. Тогда мне казалось, что компании только-только переходят на лейкхаус и начали строить его 1 или 2 года назад. Но на самом деле это было гораздо раньше
Недавно я узнала, что в Т-банке развитие в сторону лейкхауса началось еще тогда, когда меня не было в де🥺 Да и MWS не смогли бы выкатить свою лейкхаус-платформу в середине 2025 года, если бы не стартовали еще тогда
☕️ Мы в Сбере тоже обсуждали табличные форматы, но мне казалось это таким нишевым и далеким от индустрии, поэтому я особо не изучала всякие айсберги/худи/дельты и отличия одного от другого. А ведь в то же самое время все остальные уже готовились...
🌱 🌱 🌱 🌱
Так что получается, мы узнаем о технологическом тренде, когда другие уже презентовали свои результаты раньше всех. И теперь мне интересно: что прямо сейчас кажется нишевой штукой, на которую мы не особо обращаем внимание, но через год оно будет везде?
@data_engineerette
Заметили, как с определенного момента стало много айсберга в DE? Хотя я сейчас зашла чекнуть вакансии на hh, и iceberg упоминается в 68 из 455 дата инженерских вакансий - что около 15%. Но у меня есть стойкое ощущение, что все про него говорят, всем он нужен и везде его используют
Недавно я узнала, что в Т-банке развитие в сторону лейкхауса началось еще тогда, когда меня не было в де
Так что получается, мы узнаем о технологическом тренде, когда другие уже презентовали свои результаты раньше всех. И теперь мне интересно: что прямо сейчас кажется нишевой штукой, на которую мы не особо обращаем внимание, но через год оно будет везде?
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
Mermaid-диаграммы
Наконец-то дошли руки поковыряться в mermaid-диаграммах, это что за имба вообще🔥 🔥 По сути это своего рода DaaS - Diagram as a Code, вы описываете диаграмму в нужном синтаксисе, потом она отрисовывается
Я полистала, что mermaid умеет вообще рисовать - там из прикольного: очень красивая диаграмма Ганта, граф с гит-коммитами, диаграмма Cynefin для принятия решений. Ну и всякие UML-ки, ER там тоже есть
Диаграммы имеют особый синтаксис, например, для ER-модели связи обозначаются вот так:
Напоминает корейский алфавит🇰🇷 А если нарисовать связь между двумя сущностями, то вообще получаются какие-то смайлики:
В общем, удобная и полезная штука - не нужно рисовать самому в draw.io или где-то еще, оно само красиво отрендерится💅
@data_engineerette
Наконец-то дошли руки поковыряться в mermaid-диаграммах, это что за имба вообще
Я полистала, что mermaid умеет вообще рисовать - там из прикольного: очень красивая диаграмма Ганта, граф с гит-коммитами, диаграмма Cynefin для принятия решений. Ну и всякие UML-ки, ER там тоже есть
Диаграммы имеют особый синтаксис, например, для ER-модели связи обозначаются вот так:
|o - 0/1
|| - 1
}o - >= 0
}| - >= 1
Напоминает корейский алфавит🇰🇷 А если нарисовать связь между двумя сущностями, то вообще получаются какие-то смайлики:
}o..o{
||--o{
|o--o{
В общем, удобная и полезная штука - не нужно рисовать самому в draw.io или где-то еще, оно само красиво отрендерится💅
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
Каким должен быть хороший DE?
Меня однажды спросили на собесе:
🤩 Какие 3 качества важны для де?
В том числе:
🤩 абстрактные качества, которые помогают в работе
🤩 собственные качества, сильные стороны
🤩 качества кандидата при собеседовании к вам в команду
Тогда я сильно замялась, потому что никогда мне такого вопроса не задавали и он прям заставил задуматься)) По-моему, я сказала что-то вроде:
🤩 широкий кругозор, чтобы можно было критически оценивать и предлагать технические решения
🤩 желание разобраться в проблеме и найти причину, поковыряться в логах, выяснить, почему упало
🤩 третье я капитально забыла🙂
А как бы вы ответили на этот вопрос?
@data_engineerette
Меня однажды спросили на собесе:
В том числе:
Тогда я сильно замялась, потому что никогда мне такого вопроса не задавали и он прям заставил задуматься)) По-моему, я сказала что-то вроде:
А как бы вы ответили на этот вопрос?
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
Исследование data-people
Тут ребята из DevCrowd запустили ежегодное исследование специалистов по работе с данными и попросили поделиться, чтобы охватить больше крутых спецов😎 😎
Отчеты у них получаются очень красивошные💅 Вот здесь можете глянуть за прошлый год: https://devcrowd.ru/ds25/
📒 Если не знакомы: DevCrowd делают независимые исследования IT-профессий уже несколько лет, за это время опросили больше 15 000 человек, отчеты выкладывают в открытый доступ
В этом году они смотрят на самое актуальное: что AI реально изменил в работе, где проходят границы в обязанностях между ролями, изменились ли наборы инструментов и задачи
✏️ Опрос анонимный и займет 12–15 минут. В ноябре ребята опубликуют отчет со всеми данными, а также списками рекомендованных телеграм-каналов и курсов, собранными из ответов участников
Опрос тут: https://survey.devcrowd.ru/data-2026
@data_engineerette
Тут ребята из DevCrowd запустили ежегодное исследование специалистов по работе с данными и попросили поделиться, чтобы охватить больше крутых спецов
Отчеты у них получаются очень красивошные💅 Вот здесь можете глянуть за прошлый год: https://devcrowd.ru/ds25/
В этом году они смотрят на самое актуальное: что AI реально изменил в работе, где проходят границы в обязанностях между ролями, изменились ли наборы инструментов и задачи
Опрос тут: https://survey.devcrowd.ru/data-2026
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3 1
Как прошла SmartData 2026?
Я вот перечитываю свои впечатления от прошлого года и понимаю, что в этом году было совсем не так🥲 Вижу, что писала про
А в этом году не было ни одного доклада про StarRocks или Polars
📚 Доклады
Конфу объединили с DS/ML, поэтому значительная часть докладов сразу отсеклась. Часть была супер нишевой: про китайский CubeFS, внутрянку pgvector, утечки памяти на контроллерах😫
Поэтому лично мне понравились всего 2 доклада:
1️⃣ "Витрины данных на Data Lakehouse: маленькая история про большой переезд с Greenplum", Лемана Тех
Очень крутой чел рассказал про миграцию с Greenplum на dbt с yaml дагогенерацией, сэндбоксы, настройку ролевки, мониторинга, обслуживания. Пока они перенесли совсем немного и такое ощущение, что с многими проблемами просто не столкнулись
Вывод такой: витрины собираются дольше, функционала компонентов DLH не хватает, проблем и вопросов больше, чем решений и ответов
2️⃣ "Контракты данных: когда схема становится договором", Uzum Market
Практически весь доклад мне казалось, что они живут в сказочном мире с единорогами и розовыми пони, настолько так все классно работает. На самом деле очень прикольно: сначала заводятся контракты данных, потом генерятся DDL, конфиги развертывания, автоматически разворачиваются кафка-топики, выставляются MR. DQ, Lineage - тоже все есть
На дискуссия была жесткая заруба по поводу ломающих изменений в контракте
Мне от спикера так понравились две фразы, пусть они тут останутся:
❓ Что по AI?
Опишите красиво ваши метрики и данные, сделайте семантический слой - и будет классный контекст для ваших агентов (база)
📍 Новости и ссылочки
Статья: How Anthropic enables self-service data analytics with Claude
Дэш из доклада про ADBC (Arrow Database Connectivity)
Яндекс вписался в разработку китайского Greenplum - Cloudberry, в который они добавили поддержку Iceberg
Одни ребята переехали на StarRocks уже в 2023 году
В Магните в июне были сокращения
Мысль - сейчас многие делают статичные AI-дэши, а что если навайбкодить BI, который реальными запросами ходит в данные?
21.10.2026 выходит DuckDB 2.0
AWS купили DuckLabs
@data_engineerette
Я вот перечитываю свои впечатления от прошлого года и понимаю, что в этом году было совсем не так
Текущее состояние рынка даты
Presto/Trino + K8s + S3, Iceberg, StarRocks, Polars - движется сюда
А в этом году не было ни одного доклада про StarRocks или Polars
Конфу объединили с DS/ML, поэтому значительная часть докладов сразу отсеклась. Часть была супер нишевой: про китайский CubeFS, внутрянку pgvector, утечки памяти на контроллерах
Поэтому лично мне понравились всего 2 доклада:
Очень крутой чел рассказал про миграцию с Greenplum на dbt с yaml дагогенерацией, сэндбоксы, настройку ролевки, мониторинга, обслуживания. Пока они перенесли совсем немного и такое ощущение, что с многими проблемами просто не столкнулись
Вывод такой: витрины собираются дольше, функционала компонентов DLH не хватает, проблем и вопросов больше, чем решений и ответов
Практически весь доклад мне казалось, что они живут в сказочном мире с единорогами и розовыми пони, настолько так все классно работает. На самом деле очень прикольно: сначала заводятся контракты данных, потом генерятся DDL, конфиги развертывания, автоматически разворачиваются кафка-топики, выставляются MR. DQ, Lineage - тоже все есть
На дискуссия была жесткая заруба по поводу ломающих изменений в контракте
Мне от спикера так понравились две фразы, пусть они тут останутся:
россыпь SDK
data quality ассорти
Опишите красиво ваши метрики и данные, сделайте семантический слой - и будет классный контекст для ваших агентов (база)
Статья: How Anthropic enables self-service data analytics with Claude
Дэш из доклада про ADBC (Arrow Database Connectivity)
Яндекс вписался в разработку китайского Greenplum - Cloudberry, в который они добавили поддержку Iceberg
Одни ребята переехали на StarRocks уже в 2023 году
В Магните в июне были сокращения
Мысль - сейчас многие делают статичные AI-дэши, а что если навайбкодить BI, который реальными запросами ходит в данные?
21.10.2026 выходит DuckDB 2.0
AWS купили DuckLabs
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8❤7 3
5 октября начнется 19-й поток программы Data Engineer от Newprolab
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Реклама. НОЧУ ДПО «НЬЮПРОЛАБ», ИНН 7729461098, erid: CQH36pWzJqVKq9rQaHuCzeGVyN7t33BtnXkZHE54vj73iv
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Реклама. НОЧУ ДПО «НЬЮПРОЛАБ», ИНН 7729461098, erid: CQH36pWzJqVKq9rQaHuCzeGVyN7t33BtnXkZHE54vj73iv
👍4🔥4😁2
Lance
Недавно ковырялась в инструменте для обслуживания таблиц Apache Amoro и наткнулась на новый для меня термин - формат данных Lance
Lance - это колоночный формат хранения данных, созданный для AI/ML задач в лейкхаусе
⏰ Он появился еще в 2022 году, а первая стабильная версия вышла в декабре 2025. Примерно с того же времени нашла дискуссии в де сообществе. Разрабатывают ребята, которые создали LanceDB
Главные особенности:
🤩 оптимизация под AI и векторный поиск
🤩 доступ к данным за О(1)
🤩 в одной таблице можно хранить обычные данные + медиа + векторы
🤩 ядро написано на Rust
🤩 построен поверх Apache Arrow
🤩 time travel
🤩 acid
🤩 update/delete так же поддерживается
Lance позиционирует себя как замена Parquet, но к данным можно достучаться в 100 раз быстрее
Поддерживается много интеграций: DuckDB, Polars, Data Fusion, Spark, Doris, Trino, PyTorch, Flink. Но, например, Lance-Trino интеграция вышла из беты только 31 марта этого года, а Spark появился еще позднее, поэтому многие компоненты еще достаточно свежие
А помимо Lance, еще есть Nimble, Vortex, BtrBlocks, FastLanes😯
@data_engineerette
Недавно ковырялась в инструменте для обслуживания таблиц Apache Amoro и наткнулась на новый для меня термин - формат данных Lance
Lance - это колоночный формат хранения данных, созданный для AI/ML задач в лейкхаусе
Главные особенности:
Lance позиционирует себя как замена Parquet, но к данным можно достучаться в 100 раз быстрее
Поддерживается много интеграций: DuckDB, Polars, Data Fusion, Spark, Doris, Trino, PyTorch, Flink. Но, например, Lance-Trino интеграция вышла из беты только 31 марта этого года, а Spark появился еще позднее, поэтому многие компоненты еще достаточно свежие
А помимо Lance, еще есть Nimble, Vortex, BtrBlocks, FastLanes
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍2 2