Инжиниринг Данных
23.8K subscribers
2.26K photos
63 videos
194 files
3.34K links
Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Download Telegram
From Vibe Coding to the AI Software Factory - статья Seattle Data Guy, в которой он описывает как инженерные команды эволюционируют в использовании AI и больших языковых моделей для разработки.

Автор описывает 5 уровней зрелости использования ИИ в командах — от хаотичных экспериментов до выстроенной «фабрики по производству ПО».

Уровень 1 — Гараж. Личные эксперименты и хобби-проекты, которые никогда не доходят до продакшена.

Уровень 2 — Верстак с макросами. Небольшие скрипты и мини-приложения, решающие конкретные задачи, но всё ещё далёкие от полноценного производства.

Уровень 3 — Мастерская. Команды начинают стандартизировать промпты, шаблоны и агентов, но это всё ещё лишь точечные улучшения.

Уровень 4 — Конвейер. Появляются повторяемые системы, стейт-машины, отслеживание метрик и токеномики. Можно реально измерять эффективность.

Уровень 5 — Фабрика ценности. Всё вышеперечисленное связывается с реальной бизнес-ценностью — иначе это просто «производство виджетов ради виджетов».


Максимум, что мне доводилось видеть для инжиниринга данных это между уровнем 2 и 3. Для разработки ПО, конечно же, это все двигается в сторону уровня 4, 5. Паттерны AI разработки уже вырисовываются и есть свои best practices - бери и делай, по ходу адаптируй.

Думая об уровнях и адаптации ИИ в компаниях, мне вспоминается мем “можно, а зачем?

PS вообще SeattleDataGuy что-то сдулся🪦
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥42🐳2
Так как тильда у нас умерла для Data Learn, я скопировал сайт на Github pages и почистил его.

https://datalearn.ru/

Чат в телеграмм теперь должен иметь нового админа с правами на добавление спам ботов.

PS
1) хотите быть активном в чате и помогать другим? Welcome.
2) хотите добавить бесплатный курс? Welcome.
3) хотите провести вебинар на всю аудиторию (20к в YouTube, 23k в tg)? Welcome.
❤‍🔥36💯2
Давно мечтал добавить сайт про музей прадеда, наконец старший сын подрос и научился пользоваться Claude Code (14 лет) и создал сайт, я по смыслу поправил и показал как подключить домен.


Сентябрь 1812 года. Москва оставлена, армия отступает, война выглядит проигранной. Через полтора месяца Наполеон побежит из России — и первый толчок к этому был дан здесь, на поле у Тарутина.

https://tarutino-museum.ru/

Фотограф Екатерина Советкина, она же снимала дата-завтрак в Т-Банк, где я рассказывал про дата инжиниринг.

PS сайт на Github Pages, и если они не работают в РФ, значит нужно поискать альтернативу.

Если кому-то нужно простой сайт для некоммерческой организации, пишите.
❤‍🔥34🐳41💯1🙈1
На SmallSat нашел единственную компания, которая создает дата платформа as a service для телеметрии. То есть ничего принципиально нового, но есть конкретный фокус на AeroSpace и у них уже есть серьезные клиенты.

Они объединили хранение, интеграцию и “бизнес” метрики + красивый UI.

То есть вместо того, чтобы самому строить в Elastic Search, Prometheus - предлагают готовый продукт.

Компания называется Sift. Claude Design добавил карточку с описанием.

https://www.siftstack.com/

PS если вы ex-SpaceX, то вам дадут миллионы инвестиций на любую идею📈
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3🦄1
Как построить управляемый Data Lakehouse за неделю на Evolution Data Platform ⤵️

На вебинаре 8 сентября эксперты Cloud.​ru покажут, как за неделю с нуля построить архитектуру Data Lakehouse на Evolution Data Platform — от загрузки сырых данных до курированных витрин — с помощью управляемых сервисов, без эксплуатационной нагрузки и с фокусом на бизнес-результат.

В программе:
▶️принципы построения Lakehouse-архитектуры с единым слоем хранения в S3 в формате Apache Iceberg с поддержкой ACID-гарантий и версионирования;

▶️подходы к централизованному управлению метаданными и происхождением данных через Managed Metastore;

▶️способы реализации контроля качества данных в Managed Spark без остановки пайплайнов;

▶️методы организации хранения данных с разным уровнем доверия: партиционирование по качеству, time travel и разделение слоев хранения;

▶️принципы настройки единого SQL-слоя через Managed Trino с разграничением доступа;

▶️инструменты автоматизации оркестрации и мониторинга пайплайнов в Managed Airflow;

▶️возможности визуализации качества и происхождения данных в Managed BI.
➡️ Регистрация — по ссылке
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥41😭1
Никогда не думал, что заведём кота. Я себя больше относил к собачникам. Но семья решила по-другому.

Возможно, у кота есть немного собачьих привычек — бегать, прыгать, а возможно, он ещё молодой.

Назвал я его Claude Кот. Когда никого нет дома, он лежит рядом и даёт добро на сжигание сотни тысяч токенов.
❤‍🔥18412💯12
Diversity для LLMs

В одном стартапе, про который я недавно писал, все используют Claude Code.

Claude Code подключён к MCPs:
• dbt Cloud
• Snowflake
• Omni BI

С помощью Claude Desktop и Claude Code любой желающий (с доступом) может писать код, открывать PR. Как правило, всё это происходит в dbt или Omni.

То есть все поголовно стали Analytics Engineers. Даже если вы с компьютером на «вы», теперь даже с iPad'а можно заменить BI- и Analytics Engineer. Ведь основным языком программирования, как говорят, стал English. Даже если вы не согласны с этим (как и я), то ваш руководитель может считать по другому, а его мнение имеет бОльший вес, поэтому по факту будет так, как начальство скажет.

В отдельном посте я расскажу, как мы перешли к data model-oriented development (именно бизнес-модель данных, ER-диаграмма по Кимбаллу).

Так вот, суть проблемы такова: у всех Claude Code (не путать с Claude Котом из поста выше), и все работают не покладая рук. Коммит за коммитом, комментарий за комментарием и т. п. Агент пишет код, создаёт документацию, формирует описание PR, тестирует код. Другой человек с таким же агентом пытается код проверить, оставляет комментарии.

В последнее время у Claude прямо беда с написанием английского текста — он пишет размашисто и непонятно, оставляет большие и бесполезные комментарии в коде, вообще стал чудить. Также появилась новая фича — Watermark, которая осознанно заменяет слова на синонимы.

Поэтому работать всей командой, используя одни и те же модели, стало сложно. Я провёл эксперимент: стал использовать Cursor для проверки кода и текста. Оказалось, что Cursor понимает мою проблему и с удовольствием почистил PR, подсказал, где урезать код и текст, где не применились best practices и т. п. В целом могу сказать, что Cursor достаточно хорошо прокачался за последнее время — теперь у них есть Grok.

Таким образом, с одной моделью далеко не уедешь, если создаёшь серьёзный продукт. Всегда полезно добавить второе мнение от другой модели. Насколько я понимаю, в AI4SDLC это уже закладывается на входе, поэтому можно смело планировать использование нескольких моделей и агентов для повышения качества кода и документации и снижения когнитивной нагрузки на оператора AI. Мы же теперь операторы, а не инженеры?🎮
Please open Telegram to view this post
VIEW IN TELEGRAM
🙈11❤‍🔥7🌚2
Azure DP 750 или типа того.

Для работы нужно было сдать экзамен, пришлось попросить «крышевать», как результат 942 из 1000🤴.

Все вопросы были про Azure Databricks.

Хотите сдать также хорошо экзамен? Есть варианты -> дорого, быстро, надежно😎
Please open Telegram to view this post
VIEW IN TELEGRAM
12❤‍🔥6💯2
Цены на составляющие улетели в космос. Заказал NX Jetson, за 2600, хотя думал он будет стоить долларов 500.


Так же смотрим AI сервер для обучения алгоритмов компьютерного зрения, в планах было взять:
Threadripper 7960X (24 ядра), 256 GB DDR5 ECC, 2× RTX 5090 32 GB, 10 TB NVMe, 1600 W


Задача:

Обучение с учителем на синтетике: дистилляция учитель–ученик для детекции, transfer learning от предобученного ViT для позы, доменная адаптация против sim-to-real разрыва. RL не в критическом пути.


Цена за сервер получается тысяч 30-40, да еще нужна промышленная розетка и охлаждение.

Кто-нибудь, что нибудь собирал в последнее время?
😭223🫡2
В посте From Data Engineer To ?? Engineer автор затронул тему изменений в дата инжиниринге, связанных с развитием AI.

Автор является практикующим инженером, поэтому ему есть, что рассказать.

1. От Data Engineer → Landing Engineer

Что изменилось:
• Раньше пользователи хотели готовые дашборды, витрины данных (data marts) и полностью смоделированный BI-слой
• Теперь запрос стал проще: «просто дай мне сырые данные»

Почему: Пользователи сами «вайб-кодят» последнюю милю с помощью Claude, Codex и подобных инструментов

Следствие для стека:
• Дорогие Snowflake/Databricks нужны лишь для хранения и контроля доступа
• Альтернатива: партиционированные Parquet/Iceberg/DuckLake + несколько DuckDB-трансформаций
• Документация схемы в Markdown — и пользователи готовы к работе

Тут я бы добавил, что просто так вряд ли всё заработает без хорошего семантического слоя. Хороший семантический слой — это модель данных (например, по Кимбалу) и описание каждой таблицы, каждого поля, каждого соединения между таблицами. По моему опыту, это самое сложное. Возможно, когда у вас 1–2 датасета, ИИ сможет понять, что и как, но такой подход не масштабируется. А главное — ИИ может легко накосячить.

Важно понимать, что желание использовать ИИ в аналитике для поиска инсайтов и реальные возможности компании не совпадают. Купить подписку на Claude или Codex не решит накопившиеся проблемы, а только усугубит их. Чем больше legacy и tech debt, тем сложнее проверить такой «фокус».

Но если у вас заведётся, то, как я писал раньше, С-уровень будет в восторге, и у вас появятся бюджеты на новые инструменты, а вас будут ценить как никогда. Можно смело сказать, что ИИ-аналитика сейчас является одним из самых впечатляющих достижений, поэтому я всех прошу добавлять такой кейс в резюме и делать подобные пет-проекты — hiring manager оценит такой бонус.

2. От Data Engineer → DevOps Engineer

Что изменилось:
• Data engineering децентрализуется: инженер создаёт центральные артефакты, а команды сами строят свои пайплайны
• Пользователи хотят запускать агентов для построения дашбордов

Новая инфраструктура, которую нужно поднимать:
• Cloud sandboxes — среда для агентов
• Data storage (bucket) — хранение данных
• LLM governance — контроль затрат и безопасности
• Best practices — стандарты для агентного кода

Вывод: ~90% этой работы — чистый DevOps


Всё, что касается инфраструктуры, для меня всегда было приоритетом, поэтому тут ничего нового — просто стало проще и удобнее. ИИ может писать скрипты для Terraform, и они достаточно простые и надёжные. А вот про LLM governance и sandboxes для агентов я не подскажу — как-то не доводилось.

Обычно в дата-инжиниринге инфраструктура и среды (dev/test/prod) — не проблема. Проблема — иметь свежие данные в среде разработки. Ведь не хочется дублировать все data pipelines на все среды.

Главный бонус DevOps — менеджеры с Claude туда не полезут. Поэтому у вас остаётся хоть немного задач, где вы сами себе хозяин: сами придумываете сроки и сами решаете, как лучше сделать.

3. От Data Engineer → Software Engineer

Что изменилось:
Пользователи с доступом к данным, агенту и sandbox-у неизбежно строят прототипы приложений
И затем просят «просто поднять это в прод» — что, конечно, совсем не просто

Два пути для инженера:
Go Deep — стать специалистом (Streaming, Iceberg и т.д.), скорее всего в software vendor
Go Wide — стать DevOps-data-software инженером, владеющим всем циклом внутри компании


Безусловно, для пет-проектов я теперь Software Engineer. Для компании — я не хочу быть SDE, но с помощью агентов я могу найти исходный код и использовать его в решениях дата-инжиниринга. Или попробовать докопаться до бага в данных.

Есть и примеры, когда продуктовые менеджеры не хотят ждать дата-команду и сами создают аналитические решения. Они решают задачи, но не в долгосрочной перспективе — скорее как поделка. Зато возможности у всех стали безграничными.
30💯8🌚1