Data Engineer
477 subscribers
185 photos
3 videos
123 links
Дата-инженерия в схемах и мемах

По всем вопросам — @mobiledeveloper_bot
Download Telegram
«Ну, что сказать, ну, что сказать, устроены так люди…» - пела великая Жанна Рождественская.

Пора уже, что ли, и Кэпу высказаться на злободневную тему, поднятую рядом уважаемых товарищей. Ранее Кэп уже писал очевидные (как оказалось только ему) вещи и даже давал подсказку, куда смотреть, чтобы, в конце концов, не оказаться с шестерками на погонах.
Тем более, что в этой области в новогодние каникулы произошли очень интересные события, которые, несомненно, повлияют на ход истории, за развитием которых Кэп очень внимательно следит.

Сам же Кэп вовремя подстелил соломку и сбежал с корабля, едва почуяв первые признаки надвигающейся течи. А после новогодне-каникульных событий даже решил впервые за долгое время пойти поучиться, чтобы быть готовым к следующей волне. И в очередной раз напоминает, если хотите знать, куда двинется мир данных, во избежание, так сказать, «трагических ошибок», нужно выйти за его пределы и смотреть, что происходит вокруг.

Ну, и в заключение представляю «дайджест советской прессы» - сборник лучших публикаций на заданную тему:

▪️Топикстартер
▪️Товарищ Архитектор
▪️
Nik в мире данных
▪️Стас, он же « StarRocks»

С уважением, ваш Кэп, который всегда прав.
😁3
В продолжение темы.

Я, вот, хоть и писал ранее в комментариях, что уверенный «мидл» с ИИ заменит «сеньора-архитектора», теперь склоняюсь к тому, что те, кто считает, что «сеньор-архитектор» с ИИ заменит команду «мидл-разработчиков», тоже правы.

«На войне,» - как говорят англичане - «пули летают в обе стороны». В «схватке двух йокодзун» выживет тот, кто первым докажет свою ценность для бизнеса, а итоговый результат сведется, скорее всего, к банальной разнице зарплат. Кто дешевле, тот и останется. А победителем будет «big business», который, как известно благодаря Джону
Лайдону, «is very wise».

Так что, самая правильная стратегия - вовремя выйти из противостояния, «не участвовать в военной игре» (Летов-младший) и смотреть за происходящим с попкорном со стороны.

«За крушением империй лучше всего наблюдать, не выходя из дома.» (Тибор Фишер - «Философы с большой дороги»)
Спортс порадовал роскошным текстом про «Комо» и Сеска Фабрегаса. Ни одного матча их я, конечно же, не видел, но и текст мой не о футболе вовсе, а о руководителях дата-команд.


Сеск Фабрегас начинает с того, с чего и должен начинать любой современный тренер: со стиля, с философии, с идентичности.



Идеальный совет. Очень рекомендую обратить на него внимание, ибо путь успешного лидера начинается с получения ответа на ключевой вопрос: «А кто ты ваще такой по жизни?»

Я, вот, к примеру, ни разу не тренер - пожарный вроде легендарного Александра Ирхина, за быстрым эффектом - это не ко мне.

Я за «бесковский футбол - от игры к результату»,
предпочитаю системный подход, отремонтировать кран в раздевалке мне гораздо важнее

Эта, уже ставшая культовой цитата, тоже про меня:

«Меня не волнуют победы и поражения. Я помогаю ребятам стать лучшей версией себя на поле и вне
его. Это самая важная вещь»



P.S. Усы, что ли, уже отрастить, чтоб всем сразу понятно было...
👍3
Фабрика архитекторов зеленого поля

Хорошее название - половина статьи.

Идея написать о сходстве мира данных и футбола появилась у меня давно, отдельные куски я здесь выкладывал. Существовало даже рабочее название - «Все о данных для настоящих мужиков» - однако моего внутреннего перфекциониста оно не удовлетворяло, хотя, без сомнения, является сутевым. Хотелось чего-то более четкого и, вместе с тем, емкого… Поиски идеального названия отвлекали от самого процесса написания статьи.

И вот она, «эврика автора»: «Greenfield Architects». Возможность начать проект с нуля, без «тяжкого легаси предыдущих режимов» - мечта любого настоящего архитектора, к сожалению, для многих остающаяся несбыточной на протяжении всей карьеры.

Занимательный факт: «донором» послужило название фильма, снятого по сценарию автора книги, которая послужила «донором» названию рабочему.

Сама статья, как обычно, будет написана в «несвойственной мне манере c использованием хеви-метла, кантри и чуть-чуть джаза», квеста, в общем, для «посвященных» с множеством цитат и отсылок, а также непременными авторскими импровизациями.

Все ради того, чтобы никто не подумал, что дедушка яблочки гадостью поливал тексты свои при помощи ИИ генерит.

«Это присказка, не сказка. Сказка будет впереди…»
🔥6
Еще один экземпляр из бумажной коллекции. Начал читать.
👍3🔥1
Нашел, наконец-то, применение ИИ в своей жизнедеятельности - назначил его смотрящим за моей беговой активностью. Прогнозы выглядят пока очень оптимистичными, за год Клодик обещает меня сделать чемпионом России по легкой атлетике в моей возрастной категории.

Проверим-проверим…

Подписывайтесь, в общем, кому интересно следить за экспериментом😁

https://t.me/runningwithai/3
🎉6😁1
Forwarded from tl;dr data
Launching Polars Distributed on Kubernetes

С сегодняшнего дня, Polars также доступен как распределённый движок (Distributed Engine) для Kubernetes.

Цель Polars всегда заключалась в том, чтобы сделать обработку данных на одном узле максимально производительной и удобной. Теперь Polars хочет распространить этот подход и на распределённые вычисления.

https://pola.rs/posts/polars-distributed-available-on-kubernetes/

@tldr_data
👍5
Forwarded from tl;dr data
Anthropic наконец-то опубликовали свой секретный рецепт для агентной аналитики, и это…

Моделирование данных по Кимбаллу (Kimball Data Modeling)

Шутка здесь в том, что многие ожидают увидеть какой-то революционный AI-фреймворк, сложную агентную архитектуру или новый research paper, а оказывается, что в основе агентной аналитики лежат старые добрые принципы построения аналитических хранилищ данных по Кимбаллу: факты, измерения, схема звезда, понятные бизнес-сущности и качественно подготовленные данные.

Для дата-инженеров и аналитиков это примерно звучит как:

Секрет успешных AI-агентов? Сделайте нормальный DWH

@tldr_data
👍8😁6
Forwarded from tl;dr data
Amazon S3 annotations: attach rich, queryable context directly to your objects

Amazon S3 представил Annotations — новую функцию метаданных, которая позволяет пользователям прикреплять к каждому объекту до 1 ГБ бизнес-контекста, распределённого по 1 000 именованным аннотациям. Эти аннотации можно изменять без перезаписи самого объекта, а также они автоматически индексируются в таблицы Apache Iceberg, доступные для запросов.

Функция уже доступна во всех регионах AWS и предназначена для поддержки AI-агентов и автономных рабочих процессов. Она позволяет хранить расширенные метаданные — например, транскрипты, возрастные рейтинги контента, технические характеристики и другую контекстную информацию — непосредственно рядом с объектами в S3.

Все аннотации можно искать и анализировать через Amazon Athena, что избавляет от необходимости поддерживать отдельные базы данных для хранения метаданных.

@tldr_data
👍21
Forwarded from tl;dr data
Databricks объявил конец эпохи пайплайнов.

На Data + AI Summit 2026 компания представила новую архитектуру LTAP (Lake Transactional/Analytical Processing), которая должна объединить транзакционные системы, аналитику, стриминг и AI на одной копии данных. Идея радикальная: приложения, BI-системы и AI-агенты работают с одним источником данных напрямую, без CDC, ETL и бесконечных репликаций между OLTP и аналитическими хранилищами.

Последние двадцать лет типичная архитектура выглядела примерно так:

PostgreSQL → CDC → Kafka → ETL → Data Warehouse → BI → AI

Каждый новый слой добавлял задержки, повышал стоимость владения и создавал новые точки отказа. Особенно болезненно это стало с появлением AI-агентов, которым нужны актуальные данные в реальном времени, а не копия пятиминутной давности.

Ответ Databricks — хранить операционные и аналитические данные в одном месте. В основе подхода лежит Lakebase, PostgreSQL-совместимая система, работающая поверх объектного хранилища и интегрированная с Lakehouse. Компания называет это первым LTAP-подходом, который должен заменить как традиционные ETL-процессы, так и многочисленные реплики баз данных.

Конечно, заявления о «смерти пайплайнов» стоит воспринимать осторожно. Интеграции между компаниями, обмен данными с внешними системами, специализированные стриминговые сценарии и гибридные архитектуры никуда не денутся.

Но сам тренд выглядит очень интересным. Если раньше индустрия спорила, что лучше — Data Lake или Data Warehouse, то теперь главный вопрос звучит иначе:

Нужно ли вообще перемещать данные между системами, если все сервисы, аналитика и AI могут работать поверх одной копии данных?

Похоже, именно вокруг этого вопроса и будет строиться следующая большая битва в мире Data Engineering.

@tldr_data
🔥5👍1
AI-эра тех собесов

💻 Теперь вместе с sql/python-задачками на тех собесе могут дать создание мини-проекта за 20 минут

Разрешается использовать все, что угодно, любые ллм. (Только подумайте над тем, что будет работать, когда вы на созвоне на внутренней платформе.) Есть только одно условие — шерить экран

Примеры заданий

➡️Для де: написать ddl таблиц, sql-запросы по сборке витрин, несколько дагов

➡️Для разраба: придумать архитектуру микросервиса и реализовать его

➡️Разобраться в коде и найти баги

Сгенерили, а дальше?

🙂 Интервьюеры могут сами пока не до конца понимать, что делать после генерации кода) Они просто сидят и смотрят, как ты будешь разбираться, что происходит, просят внести правки или объяснить кусок кода

Пока такое замечено в WB в последние 2 месяца, но могут подтянуться и остальные. Особенно после этого поста😁

@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
DEMate - тот, кто тебя заменит

Meta пошарила статью про DEmate - внутреннего AI-ассистента для data engineering, который не просто SQL / питон генератор кода, а готовый AI-слой для полноценного цикла разработки (ака накидаем md в контекст в первых версиях😂), учитывающим специфику внутренних систем Meta (а там без пол-литра иногда и не разобраться 🍺). Главный поинт в том, что LLM становятся полезными в enterprise-инженерии не тогда, когда им дают полный yolo, а когда их ограничивают контекстом, проверками, рецептами и автоматической валидацией (вот это поворот 🤯)

https://medium.com/@AnalyticsAtMeta/how-we-built-demate-taming-llms-for-data-engineering-at-meta-d134e69637c5

Один из уровней это Recipe Architecture - архитектура “рецептов”, которая направляет LLM через структурированный процесс. Когда ленивый дата инженер (то есть я 🧐) просит модель “сделай pipeline” и надеется на хороший результат, DEmate выбирает подходящий рецепт, подставляет нужный контекст, генерирует изменения и затем прогоняет проверки. На выходе не просто сгенерированный код, а уже проверенный результат, адаптированный под внутренние стандарты.

Еще сделан Recipe Chaining, или цепочка рецептов. Реальная engineering-задача состоит из набора шагов: сначала нужно построить pipeline, затем добавить data quality checks, потом оптимизировать SQL или подготовить тесты 😺. DEmate не загружает модель огромным md сразу, а постепенно раскрывает инструкции по мере необходимости (ого, неужто workflow 😃). Это снижает шум в контексте и уменьшает вероятность ошибок (якобы 👍)

Meta также использовала AI для ревью самих AI-рецептов (ну а фигли, бесплатные токены же 🔼). По мере роста DEmate разные команды начали добавлять собственные рецепты, и ручная проверка стала узким местом. Для этого ввели автоматизированные проверки: инструкции должны быть не размытыми, без лишнего текста, содержать явные шаги валидации, не конфликтовать друг с другом, не дублировать существующие рецепты и иметь тестовые positive/negative prompts для правильного анализа (😑это ж сколько слопа можно нагенерить).

Еще одна из фич асинхронная валидация. В data engineering тесты выполняются долго, а инженерам приходится возвращаться к задаче через часы, проверять результаты, читать CI-ошибки и вручную исправлять код (👨‍⚕️ у кого-то еще 2024 видимо на дворе). DEmate интегрировали с Analytics Agent (вообще топовая вещь на самом деле 🍷): агент мониторит долгие тестовые job’ы, проверяет гипотезы на тестовых таблицах, обновляет diff (aka pull request) результатами и при необходимости запускает цикл исправления заново. Это превращает тестирование из ручного процесса в почти полностью автоматический loop.

Также многие фичи demate работают как cli, то есть можно встраивать в ваш собственный harnessing 🤨 (это в основном, как я использую)

P.S. В общем переходим на новый стиль дата инженерных задача - наговариваем в микрофон "сделай пайплайн красиво" и ждем пару часов ☕️
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3😱2
Так вот, какова она, цена «сделай пайплайн красиво».

https://habr.com/ru/news/1050202/
Если уж решил заняться вайбкодингом, то нужно идти в своем увлечении до конца…

https://t.me/vibecoding_tg/3420
Forwarded from tl;dr data
Prefect приобретает Dagster Labs

Очень неожиданная новость. Если бы еще вчера меня спросили, кто кого купит — Prefect или Dagster, я бы точно не поставил на такой исход.

Prefect объявил о приобретении Dagster Labs.

За последние восемь лет Prefect и Dagster подталкивали друг друга к развитию, двигая вперед всю категорию инструментов оркестрации. То, что начиналось как два разных подхода, со временем стало всё более взаимодополняющим, особенно сейчас, когда ИИ меняет подход к выполнению задач и управлению рабочими процессами.

Для пользователей ничего не меняется: Dagster и Dagster+ продолжат развиваться, а команда обещает сохранить долгосрочные инвестиции в продукт и сообщество.

Интересно будет посмотреть, как объединение двух главных игроков на рынке оркестрации повлияет на развитие экосистемы. Особенно сейчас, когда границы между data orchestration, workflow orchestration и AI-агентами становятся всё менее заметными.

@tldr_data
Дочитал «Архитектуры данных» Джеймса Серры.

Товарищ сей мне весьма симпатичен, было время, когда я наблюдал за его каналом на YouTube. Мне импонировало то, что, рассказывая про Data Mesh, он не пытался эксплуатировать тему «самого лучшего кунг-фу», а просто рассказывал свое видение ситуации и предлагал свой критерий соответствия функции данных в компании методологии имени Жамак Дегани.

Серра почти 40 лет в IT, 15 из них в хранилищах, «я здесь давно, мне можно верить», короче. Книгу он решил написать, поскольку обратил внимание, что архитектуры данных сложны и «большинство людей не понимают их концепций, если вообще что-то знают о них». Он попытался объективно рассказать о достоинствах и недостатках каждой из представленных архитектур. На мой взгляд, у него получилось. Особенно порадовала глава о проведении дизайн-сессий по разработке архитектуры - хорошее практическое пособие для начинающих архитекторов. Ну, или чек-лист вопросов, которые имеет смысл задать на собеседовании по System Design.

По части Data Mesh Серра не стал отделываться общими словами, а прикинул, как оно будет выглядеть на практике. Его вердикт сродни: «Чистого спирта не бывает. Максимум - 96 градусов!». По его мнению, из тех, кто назовет свое решение Data Mesh:

▪️ ~90% внедрят доменное владение
▪️ ~70% данные как продукт
▪️ ~треть осилит самообслуживаемую инфраструктуру
▪️ ~половина федеративное управление

В суть Data Mesh вообще мало проник, кроме Трента Кримма, разве что. Сам Серра, по собственному признанию, десятки раз перечитывал блоги Дегани и до сих пор иногда обнаруживает, что понял что-то неправильно.

В завершение, как обычно, парочка любимых цитат:

«Слухи о смерти реляционных хранилищ данных сильно преувеличены»


«Стандартных определений концепций и архитектур данных не существует. Иначе эта книга была бы не нужна.»


«Хотя технологии и шагнули далеко вперед, дело не в них - а в людях и процессах, и мы не так хорошо продвинулись в работе с ними. Вы можете придумывать новые крутые словечки и методы, которые вам нравятся, но очень трудно заставить людей измениться.»


Поскольку я не являюсь любителем модных словечек и хайпа вокруг них, то книга Джеймса Серры мне понравилась, рекомендуется всем, кто хочет понять суть, а не заниматься жонглированием малопонятными терминами.
👍8🔥2
Человек, который в конце прошлого года клялся и божился, что станет меньше читать, уже к началу июля залил в «болото данных» своего головного мозга еще 60 книг. И ни конца ни края сему беспределу не видно.

Основными катализаторами стали:

1️⃣ Выход в офис - 2 часа в дороге.

2️⃣ Аудиокниги - еще час во время тренировок. Итого с обеденным перерывом около 4 часов в день выходит, все книги мира прочитать можно.

3️⃣ Учеба в Стратоплане серьезно так пополнила буклог, все такое интересное и само на экран просится.

4️⃣ Смена деятельности - раз уж взялся ИИ-трансформацию внедрять, то надо хотя бы понять, что это такое. Не удивлюсь, если к концу года я еще и геологию активно изучать начну.

5️⃣ В угоду скорости почти перестал читать на английском. Тот же Серра, например, читался в переводе, слезы кровавые ручьем лились, но так все равно быстрее. Мир опять ускорился, пришлось в этот раз под него прогнуться.

Лучшее из прочитанного:

📖 Карл Саган - «Наука в поисках Бога». Саган однозначно попадает в мой личный топ в компанию к Дэвиду Греберу, Ричарду Фейнману и Стивену Хокингу. Даже странно, что я до этого не обращал на него внимания. Прочитаю всё, что смогу, что-то обязательно будет добавлено в бумажную коллекцию.

📖 Элияху Голдрат - «Цель» и «Цель-2». Формат бизнес-романа - новый для меня - читается легко и хорошо запоминается. Не скажу, что стал знатоком теории ограничений, но при решении кейсов на групповых занятиях в Стратоплане регулярно с умным видом врываюсь в дискуссию со словами: «Коллеги, посмотрите, ну, это же чистый Голдрат».

📖 Антон Савочка - «Путь тимлида». Еще один бизнес-роман, вместе с тем представляющий собой набор рецептов по обнаружению и обходу разного рода грабель, хаотично расставленных на пути начинающего тимлида. Пять лет назад эта книга стала бы для меня настоящим спасением, да и сейчас, в общем-то, актуальности не утратила.

📖 Должно же быть в этом списке что-то про данные. Пусть будет Серра из поста выше - проглочен влет, невзирая на кровавые слезы от перевода.

А зарок читать поменьше переносится на следующий год, видимо.
👍4🔥1
https://github.com/AlexGladkov/quickai

Напоминаю, что если вы хотите замерять эффективность своей работы с агентами и Клодом (а сейчас уже и не только), то можете воспользоваться тулзой выше
🔥1
#напочитать

Даниэль Пинк - «Драйв»

Типичная книга из серии «Литература для бизнеса», построенная по формуле «Проблема-Следствие-Аргументы-Выгода». Много воды, различного рода кейсов из жизни деревень Вилларибо и Виллабаджо. В Вилларибо все еще используют обычное моющее средство и вследствие этого кипятятся, а в Виллабаджо уже рубят. И да, мы идем к вам.

Суть первых двух частей можно свести к простой мысли: для творческих задач внутренняя мотивация важнее внешней. Для рутинных задач внешний стимул в короткой перспективе может стать отличным импульсом.

Мотивируют людей, согласно Пинку, всего три вещи:

🔹 Автономность - наше стремление к самоуправлению

🔹 Мастерство - побуждение становиться все лучше и лучше в своем деле

🔹 Целеустремленность - явная отсылка к Фейербаху - желание быть частью чего-то большего, чем мы сами

Самая полезная - третья часть - полный комплект подсказок, упражнений и ресурсов, призванных помочь создавать условия для поведения, определяемого внутренними желаниями. Ради нее и стоит читать книгу.

Цитаты:

«Одна из главных причин фрустрации на рабочем месте - несоответствие между тем, что люди должны делать, и тем, что они могут. Слишком простые задачи заставляют их скучать, слишком сложные - тревожиться»


«Когда вы будете размышлять о своей цели в жизни, начните с важного вопроса: как звучит ваша главная фраза?»



Когда я заступал на пост Head of DE в зеленом (тогда) DIY-ритейлере, у меня была похожая идея с отсылкой на японских императоров, которые в начале своего правления тоже должны были представить некий девиз. Я тогда что-то придумал, следовал выбранному курсу, но нигде это не афишировал, а коль скоро так, то и у меня из головы это вылетело. Но наверняка там что-то было про непрерывное развитие…
👍6
Раз уж вписался в ИИ-трансформацию, надо хотя бы делать вид, что понимаешь, что происходит. Обложился, в общем, специальной литературой, благо ее сейчас предостаточно, да и на русском выходит со скоростью Себастьяна Саве, устаревая примерно так же. Так что «не хайпа ради, а служебной пользы для». Да и стратегию защищать нужно...

Чип Хьюен - персонаж в сфере сей довольно авторитетный: работала в NVIDIA, преподавала в Стэнфорде и даже написала книгу о машинном обучении. Которую я, конечно же, «ни при какой погоде не читал». Ну, не интересовала меня эта тема...

Люблю, когда автор начинает с определения:

«ИИ-инженерия - процесс создания приложений на основе доступных моделей»

Сразу настраивает на рабочий лад.

Далее Хьюен по шагам проводит читателя от знакомства с базовыми моделями до архитектуры ИИ-инженерии. Ровно посередине находится глава, посвященная промт-инжинирингу, который автор определяет как «процесс разработки инструкции, которая позволяет добиться от модели желаемого результата». Отмечая, что:

«Проблема не в промт-инжиниринге. Это реальный и полезный навык. Проблема возникает, когда люди не знают ничего, кроме промт-инжиниринга. Вам будут нужны знания из области статистики, инженерии и классического ML для отслеживания экспериментов, оценки и редактирования наборов данных»

Такой вот нас ждет «новый дивный мир»...

Книга мне понравилась, подойдет тем, кто уже имеет некий инженерный опыт, но в ИИ еще не вляпался.
👍4