Инжиниринг Данных
23.8K subscribers
2.28K photos
64 videos
194 files
3.35K links
Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Download Telegram
Главная ошибка в разговоре об ИИ-агентах — оценивать их по демо. Демо почти всегда выглядит круто, но в проде все упирается в границы ответственности, данных и безопасности.


Коллеги из Cloud․ru поделились популярными мифами об ИИ-агентах и обозначили реальные границы их возможностей — читайте в карточках.

📌 Еще больше интересного контента про ИИ и технологии ребята из Cloud․ru публикуют в своем канале — подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😭8👨‍💻6
Как знакомо, когда организации хотят заставить всех vibe кодить свои приложения, чтобы выпилить вендора, и рассказать как они урезают косты.

Получается такая гремучая смесь tech debt и черной дыры для сжигания токенов.

Особенно, когда финансы, продажи, маркетинг сами себе создают приложения.

Я уже испытал такой подход в одной большой компании. Не проникся.

А как у вас?
❤‍🔥16🙊12
19 сентября в 2:30 pm в Ванкувере решили собраться на Jericho beach, приходите кто хочет. С меня самовар:)
🤷4❤‍🔥3😭21💯1
Как-то незаметно прошла новость, что SAP купил Dremio.


Зачем купили: SAP строит платформу AI-агентов, которым нужен доступ к данным из любых источников — как SAP, так и сторонних систем. Dremio решает именно это: позволяет запрашивать данные где угодно без ETL и копирования. Плюс

Dremio вписывается в более широкую стратегию — вместе с Reltio (очистка данных) и Prior Labs (AI-модели) SAP собирает полный data+AI стек.
Что такое Dremio: Высокопроизводительная lakehouse-платформа. Главные фишки — федеративные запросы к любым источникам без перемещения данных, нативная поддержка Apache Iceberg и автоматическое ускорение запросов (Reflections). Известна ещё тем, что co-создала Apache Arrow и Apache Polaris — оба стали индустриальными стандартами.


Не уверен, что Dremio ждет хорошее будущее. Когда-то BusinessObjects был лучшим BI инструментом, пока в 2007 году его не купил SAP.

Из других покупок:
• Sybase в 2010 году - одно из первых поколоночных хранилищ
• Altiscale в 2016 году - решения для Hadoop/BigData


В Ванкувере есть офис SAP, я даже видел вакансии раньше по data к ним.

Вообще к SAP у меня теплые воспоминания:

1. Я учил английский и SQL используя SAP BO и тренинги
2. В 2011 году я почти получил офер в Ирландию, но в целом понял, что западные технологии дают возможность работать по всему миру
3. Еще работая на первой работе в банке я провернул концепт fake it till you make it и несколько человек зашли в ИТ на позицию BI разработчик по SAP BO без ИТ опыта.
4. В ламоде наверно до сих пор есть видео про SAP BO, первая BI академия. Даже есть на YouTube - Lesson 1 Introduction into SAP BO Web Intelligence
5. Я почти перешел в офис SAP в Москве на позицию pre-sale/sale engineer. Главный мотиватор был, что они давали Audi A4 своим консультантам + поездки в Европу на тренинги.
6. Мне казалось, что SAP BW консультанты получали какие космические деньги на проектах - от 25т рублей в день через ИП, и это было в 2012 году!

У вас есть теплые воспоминания?
🐳1
Please open Telegram to view this post
VIEW IN TELEGRAM
👨‍💻28🐳107🌚7❤‍🔥3
Пока мы тут про AI пишем, в большинстве традиционных бизнесов ничего не поменялось.

Классическая рубрика про ошибку в Excel. У нас в провинции Британской Колумбии отчитались об ошибке на 1,5 ярда $ из-за ошибки в Excel.


Ключевые детали происшествия:

Причины (4 ошибки в расчетах):

• Основная ошибка: Формулу конвертации валют из долларов США в канадские доллары случайно применили к ячейкам таблицы, которые уже содержали суммы в канадских долларах (ошибка при перетягивании формулы в Excel).

• Некорректный пересчет объемов природного газа.

• Использование расходных данных за 2025 год вместо 2026 года в одном из блоков.

• Аналогичное использование устаревших данных за 2025 год в другом блоке.


Последствия: Прогнозируемый дефицит провинции (13,3 млрд долларов) вырастет после корректировки. В министерстве заявили о внедрении новых мер контроля качества расчетов, чтобы избежать подобных ошибок в будущем.


Я бы им Shift Left порекомендовал бы
🔫😊🔫
Please open Telegram to view this post
VIEW IN TELEGRAM
🙉27🙈19😭5🫡4❤‍🔥1🐳1🤷1
Свежий документ для подготовки к собеседования на позицию Sr Data Engineer из одной большой американской компании

Этап 1 — Скрининг с нанимающим менеджером

Продолжительность: 45 минут
Разговорное интервью с нанимающим менеджером.
Что оценивается:
• Общее понимание роли и команды
• Соответствие навыков требованиям позиции
• Понимание стратегических целей должности
• Уровень экспертизы относительно ожиданий по грейду
• Знакомство с технологическим стеком из описания вакансии

Этап 2 — Техническое интервью (Python / SQL)

Продолжительность: 60 минут (30 мин Python + 30 мин SQL)
Живое практическое кодирование в CoderPad, чистый Python без библиотек и фреймворков.
Что оценивается:
• Знание базовых структур данных — list, dict, set
• Умение программно парсить данные
• Умение писать алгоритмы с использованием базовых конструкций — циклы for/while
• Решение задач умеренного уровня сложности
• Владение SQL (вторая половина сессии)
Важные замечания:
• Можно задавать уточняющие вопросы по задаче — только по Python
• Нельзя копировать условие задачи в AI
• Любое использование AI-инструментов в процессе должно быть раскрыто

Этап 3 — Панельные интервью

Четыре части с разными командами.
Этап 3а — Панель: Взаимодействие с командой Data Science
Продолжительность: 30 минут
Обсуждение проектов с командой Data Science.
Что оценивается:
• Опыт в экспериментировании и моделировании
• Умение совместно с DS-командой решать бизнес-задачи
• Глубина обоснования выбора подходов к моделированию и экспериментам

Этап 3б — Панель: Взаимодействие с DE / ML Platform
Продолжительность: 30 минут
Совместное упражнение с командой Data Engineering, которая управляет репозиторием ML-фичей.
Что оценивается:
• Умение глубоко погружаться в техническую задачу
• Перевод требований продукта и DS в проектирование масштабируемого ML-пайплайна
• Кросс-функциональное взаимодействие со стейкхолдерами DE/ML Platform

Этап 3в — Панель: Компетенции в Data Engineering
Продолжительность: 45 минут
Глубокое техническое погружение в экспертизу, доставку и исполнение — от требований до результата.
Что оценивается:
• Экспертный уровень SQL и dbt
• Опыт с современными технологиями пайплайнов — открытые табличные форматы (Iceberg, Delta, Hudi) и распределённые SQL-хранилища (Databricks SQL Warehouse, Snowflake, BigQuery, Redshift)
• Проектирование пайплайнов по схеме Bronze → Silver → Gold
• Опыт в моделировании данных
• Практики обеспечения качества данных
• Тестирование
• Управление данными (Data Governance)
• Оркестрация
• Опыт с AI / LLM для ускорения рабочих процессов разработки
• Умение выбирать правильный инструмент под задачу
• Работа с большими объёмами данных (например, Kafka → DynamoDB)
• Сквозное владение процессом — от требований до поставки

Этап 3г — Панель: Взаимодействие с командой ACE
Продолжительность: 30 минут
Совместное упражнение с командой ACE.
Что оценивается:
• Сбор требований и понимание доменных потребностей
• Управление и поддержка кода
• Обеспечение поддерживаемости и удобства использования
• Ответственность и решение проблем
• Работа с AI / LLM
🐳21❤‍🔥7
Сегодня последний день регистрации на КосмоХакатон

18–20 сентября, Петербург, Красноярск или онлайн из любой точки страны. Четыре задачи на выбор: снабжение орбитального топливного узла и безопасность космонавта в открытом космосе в Петербурге (фонд 1,2 млн ₽), мониторинг лесных пожаров и верификация углеродных кредитов по спутниковым снимкам в Красноярске (600 тыс. ₽). Есть и для тех, кто про данные и ML, и для тех, кто про стратегию и экономику.

Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.

Команду можно собрать на платформе.

Подробности и регистрация
1
Data Driven 2026: аналитика встречается с AI-инфраструктурой

26 сентября Яндекс отмечает десятую, юбилейную Data Driven — и в этот раз конференция заходит на нашу территорию: AI-ready-данные, инфраструктура под агентов и главный вопрос сезона — а можно ли вообще доверять тому, что насчитал AI-агент?

Кого слушать:
Роман Халкечев (CDO Поисковых сервисов и ИИ Яндекса) — расскажет о том, как AI переписывает правила игры при работе с данными, меняет способ принятия решений в компании и трансформирует профессии аналитика и дата инженера;

Олег Хомюк (CDO Яндекс Поиска) — как объективно измерить качество AI-агентов и инфраструктуры AI-ready-данных;

Артём Солоухин (зам. руководителя ML и инновационных инструментов Центральной аналитики) — покажет MARS, первую мультиагентную рабочую среду в Яндексе;

Максим Стаценко (руководитель BigData Tech & Research Центральной аналитики) — расскажет, как собрать агента-аналитика, которому реально можно доверять.

Плюс дискуссии, стенды с экспертами, нетворкинг и афтерпати в честь 10-летия — будет шумно.

📍Москва + онлайн, 26 сентября. Мест офлайн ограниченное количество

Регистрируйтесь по ссылке: https://events.yandex.ru/events/data-driven-2026

Новости конференции: t.me/Data_Driven_Yandex
1❤‍🔥11
Я всегда рад, когда люди находят работы и прокачиваются. Но рад в тройне, когда попадают в Клуб 500 🤑
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤‍🔥27🫡6🌚1