Инжиниринг Данных
23.8K subscribers
2.27K photos
63 videos
194 files
3.34K links
Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Download Telegram
Цены на составляющие улетели в космос. Заказал NX Jetson, за 2600, хотя думал он будет стоить долларов 500.


Так же смотрим AI сервер для обучения алгоритмов компьютерного зрения, в планах было взять:
Threadripper 7960X (24 ядра), 256 GB DDR5 ECC, 2× RTX 5090 32 GB, 10 TB NVMe, 1600 W


Задача:

Обучение с учителем на синтетике: дистилляция учитель–ученик для детекции, transfer learning от предобученного ViT для позы, доменная адаптация против sim-to-real разрыва. RL не в критическом пути.


Цена за сервер получается тысяч 30-40, да еще нужна промышленная розетка и охлаждение.

Кто-нибудь, что нибудь собирал в последнее время?
😭273🫡3
В посте From Data Engineer To ?? Engineer автор затронул тему изменений в дата инжиниринге, связанных с развитием AI.

Автор является практикующим инженером, поэтому ему есть, что рассказать.

1. От Data Engineer → Landing Engineer

Что изменилось:
• Раньше пользователи хотели готовые дашборды, витрины данных (data marts) и полностью смоделированный BI-слой
• Теперь запрос стал проще: «просто дай мне сырые данные»

Почему: Пользователи сами «вайб-кодят» последнюю милю с помощью Claude, Codex и подобных инструментов

Следствие для стека:
• Дорогие Snowflake/Databricks нужны лишь для хранения и контроля доступа
• Альтернатива: партиционированные Parquet/Iceberg/DuckLake + несколько DuckDB-трансформаций
• Документация схемы в Markdown — и пользователи готовы к работе

Тут я бы добавил, что просто так вряд ли всё заработает без хорошего семантического слоя. Хороший семантический слой — это модель данных (например, по Кимбалу) и описание каждой таблицы, каждого поля, каждого соединения между таблицами. По моему опыту, это самое сложное. Возможно, когда у вас 1–2 датасета, ИИ сможет понять, что и как, но такой подход не масштабируется. А главное — ИИ может легко накосячить.

Важно понимать, что желание использовать ИИ в аналитике для поиска инсайтов и реальные возможности компании не совпадают. Купить подписку на Claude или Codex не решит накопившиеся проблемы, а только усугубит их. Чем больше legacy и tech debt, тем сложнее проверить такой «фокус».

Но если у вас заведётся, то, как я писал раньше, С-уровень будет в восторге, и у вас появятся бюджеты на новые инструменты, а вас будут ценить как никогда. Можно смело сказать, что ИИ-аналитика сейчас является одним из самых впечатляющих достижений, поэтому я всех прошу добавлять такой кейс в резюме и делать подобные пет-проекты — hiring manager оценит такой бонус.

2. От Data Engineer → DevOps Engineer

Что изменилось:
• Data engineering децентрализуется: инженер создаёт центральные артефакты, а команды сами строят свои пайплайны
• Пользователи хотят запускать агентов для построения дашбордов

Новая инфраструктура, которую нужно поднимать:
• Cloud sandboxes — среда для агентов
• Data storage (bucket) — хранение данных
• LLM governance — контроль затрат и безопасности
• Best practices — стандарты для агентного кода

Вывод: ~90% этой работы — чистый DevOps


Всё, что касается инфраструктуры, для меня всегда было приоритетом, поэтому тут ничего нового — просто стало проще и удобнее. ИИ может писать скрипты для Terraform, и они достаточно простые и надёжные. А вот про LLM governance и sandboxes для агентов я не подскажу — как-то не доводилось.

Обычно в дата-инжиниринге инфраструктура и среды (dev/test/prod) — не проблема. Проблема — иметь свежие данные в среде разработки. Ведь не хочется дублировать все data pipelines на все среды.

Главный бонус DevOps — менеджеры с Claude туда не полезут. Поэтому у вас остаётся хоть немного задач, где вы сами себе хозяин: сами придумываете сроки и сами решаете, как лучше сделать.

3. От Data Engineer → Software Engineer

Что изменилось:
Пользователи с доступом к данным, агенту и sandbox-у неизбежно строят прототипы приложений
И затем просят «просто поднять это в прод» — что, конечно, совсем не просто

Два пути для инженера:
Go Deep — стать специалистом (Streaming, Iceberg и т.д.), скорее всего в software vendor
Go Wide — стать DevOps-data-software инженером, владеющим всем циклом внутри компании


Безусловно, для пет-проектов я теперь Software Engineer. Для компании — я не хочу быть SDE, но с помощью агентов я могу найти исходный код и использовать его в решениях дата-инжиниринга. Или попробовать докопаться до бага в данных.

Есть и примеры, когда продуктовые менеджеры не хотят ждать дата-команду и сами создают аналитические решения. Они решают задачи, но не в долгосрочной перспективе — скорее как поделка. Зато возможности у всех стали безграничными.
36💯15🌚1
Будет все больше и больше AI Data Engineers вакансий.

А ваше резюме готово?
Pet проекты уже лежат в GitHub?
Книжки по основам AI engineering прочитаны?
🙈34💯10😭6
Отличная идея.

Буквально на прошлой неделе я спросил, какие акции мне купить.

Критерий был, чтобы стабильный сток продавался с дисконтом.

AI мне сказал про акции макдональдс, ну я их и купил, с iPhonа.

Мне кажется это спланированная акция от ИИ.
13🙈12🙊4
КосмоХакатоны задачи на реальных спутниковых данных 🚀

Участвовать можно очно на площадке или онлайн из любой точки России — задачи, критерии и рейтинг общие.

Ближайшие два этапа идут одновременно 11–13 сентября, очные площадки в Нижнем Новгороде и Благовещенске.

Всего 12+ задач: технологические, управленческие и на ИИ, на каждом этапе свой набор.

В Нижнем Новгороде - проектирование устойчивой спутниковой группировки: как удержать связь и работоспособность системы, когда часть аппаратов выходит из строя. Плюс управленческий кейс про сервисную модель космических услуг: что сделать общественным сервисом, что отдать рынку и как всё это финансировать при жёстких бюджетах.

В Благовещенске - автономное управление группировкой, где спутники сами распределяют ресурсы по приоритетам задач. И мониторинг гидрологической обстановки по спутниковым снимкам: паводки, обмеление, разливы.

Дальше Санкт-Петербург и Красноярск 18–20 сентября.

🏆 Общий призовой фонд - 7,2 млн ₽, денежные призы на каждом этапе
💻 Очный и онлайн-форматы на всех этапах
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября

Все города, задачи и регистрация: космохакатон.рф
🦄7🌚3🙈1
Воскресная мотивация от Бритни Спирс

Хочешь жить на широкую ногу? Жить в огромном особняке?
Тусоваться во Франции?
Тогда работай, детка, работай, детка,
Работай, детка, работай, детка.
А ну, за работу, детка! (а-а)
А ну, за работу, детка! (а-а)
Давай, бей в набат,
Не останавливайся — будь чемпионом.
Вкалывай так, будто это твоя профессия,
Берегись — вот оно идёт.
12❤‍🔥17💯9🤷‍♀3🐳2👨‍💻1
Привет! Я хотел бы в Surfalytics добавить информация про возможность фриланса и открытия счетов а банках и ИП в странах СНГ. У вас есть информация или примеры? Может быть есть ТГ каналы такие. Если хотите ссылкой поделиться добавляете ссылку как код или цитату.
1❤‍🔥14🐳2
Мощнее — не значит дороже

Главные расходы при расширении 1С и баз данных — это не само железо, а лицензии ПО за каждое ядро.

Оптимизировать затраты можно с помощью высокочастотных процессоров. Selectel запустил кластер AMD HiFreq в публичном облаке на базе VMware. Частота процессоров до 4.8 ГГц позволяет получить нужную производительность на меньшем количестве ядер.

Высокая частота процессоров сглаживает разницу в производительности при переходе с Oracle и MS SQL на российские СУБД: Postgres Pro, Tantor и другие. Быстрые диски снимают ограничения при обработке тяжелых нагрузок в 1С и аналитике.

Рассчитайте стоимость в удобном калькуляторе и разверните кластер для ваших задач: https://slc.tl/zegs8

Реклама. АО "Селектел". erid:2W5zFHGtVhT
🤷5🌚4🫡2💯1
Хакатон на космических данных. Санкт-Петербург, Красноярск или онлайн из любой точки страны.

Стартуем 18 сентября.

За выходные участники доводят одну из задач до рабочего решения.

Санкт-Петербург. К 2035 году над Землёй должен работать топливный узел, у которого заправляются корабли, и откуда он будет получать топливо - с Земли, с Луны или из резерва - пока не решил никто. Команде предстоит собрать схему поставок, посчитать резервы и решить, во что вкладываться сразу. Призовой фонд 1,2 млн ₽.

Красноярск. Спутник видит горящий лес раньше любого наземного поста, но вместе с пожаром ловит нагретые крыши, факелы на месторождениях и блики на воде. Команде предстоит научить сервис отличать настоящий очаг от шума, обвести гарь и выдать площадь в гектарах. Призовой фонд 600 тыс. ₽.

Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.

Команда 3–5 человек, недостающих можно найти на платформе.

Регистрация по ссылке космохакатон.рф
🙈72
Главная ошибка в разговоре об ИИ-агентах — оценивать их по демо. Демо почти всегда выглядит круто, но в проде все упирается в границы ответственности, данных и безопасности.


Коллеги из Cloud․ru поделились популярными мифами об ИИ-агентах и обозначили реальные границы их возможностей — читайте в карточках.

📌 Еще больше интересного контента про ИИ и технологии ребята из Cloud․ru публикуют в своем канале — подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😭6👨‍💻5
Как знакомо, когда организации хотят заставить всех vibe кодить свои приложения, чтобы выпилить вендора, и рассказать как они урезают косты.

Получается такая гремучая смесь tech debt и черной дыры для сжигания токенов.

Особенно, когда финансы, продажи, маркетинг сами себе создают приложения.

Я уже испытал такой подход в одной большой компании. Не проникся.

А как у вас?
❤‍🔥12🙊10
19 сентября в 2:30 pm в Ванкувере решили собраться на Jericho beach, приходите кто хочет. С меня самовар:)
🤷3