дата инженеретта
3.41K subscribers
294 photos
28 videos
4 files
124 links
мелкое — крупно,
в глубоком разговоре
мудрость приходит

по вопросам сюда: @aigul_sea
Download Telegram
Data + AI

🍿 Вчера-сегодня проходит Data + AI Summit от Databricks. Основная суть — как работать с данными в эру AI, реклама собственных разработок, интервью с партнерами и крупными пользователями, кейсы применения сервисов

Меня больше всего поразило — как они красиво говорят, у них такая чистая четкая речь и акцент, как на аудировании😍 И больше 30к людей в офлайне!!

Есть очень много интересных моментов, которые я пометила себе:

🤩Аннонсировали Lakehouse//RT на собственном движке Reyden, который возвращает результат на огромном объеме данных за мс и не требует перекладки данных в отдельную бд под дэши (красивые графички тут)

🤩Обсуждали Lakebase — это постгря как движок над s3. Чтобы опять-таки хранить данные в одном месте, а не перекладывать из OLTP в OLAP-системы🤪

🤩LTAP (Lake Transactional/Analytical Processing) = Lakebase + Lakehouse. Данные пишутся строками => строки конвертятся в столбцы => чтение по столбцам. Правда, нам не сказали, насколько эта конвертация затратна

🤩На сцене побывал Ryan Blue, один из главных создателей Iceberg. Он сказал, что в Databricks уже поддерживается iceberg v3, где одна из фич — это кросс-поддержка iceberg+delta lake, которые на диске лежат одинаково, и не надо ничего переписывать при смене формата. А к концу q4 или чуть позже уже выйдет iceberg v4

🤩Genie One + Genie Ontology — чат-бот, дополненный глоссарием/знаниями предметной области компании на основе графов + коннектов к гугл драйв/почте/и т.д. А еще он умеет чекать пермишены к данным перед тем, как вернуть ответ. А агентов можно шерить с коллегами

🤩Добавляется отдельный агент Genie ZeroOps, который постоянно следит за кластером. Если в 2 часа ночи упал пайплайн, он пойдет искать причины по линейджу всех зависимостей, внесет изменения в код, потестит в песочнице, подготовит фикс и отправит алерт о готовности. Вам остается только аппрувнуть

🤩Omnigent — платформа, где можно миксовать несколько моделек, чтобы они делали разные операции. Это называется "meta-harness"

🤩В Uber за 1 квартал потратили годовой бюджет на AI

🤩Pepsico — один из пользаков, у которых раньше было 600 дата лейков😳

🤩Databricks заколлабились с OpenAI (приходил кофаундер Greg Brockman), чтобы их модельки забустили дата-сервисы

@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥95💅43
Раскрываю тайну

Наверняка у многих был такой момент, что вы заходите в YARN, находите Hive-запрос, хотите в него провалиться, но Tez UI недоступен?

Теперь вы знаете, как он выглядит

@data_engineerette
🤔2
Кажется, я уработалась😕

Это моя первая мысль, как только я села в такси
Please open Telegram to view this post
VIEW IN TELEGRAM
😁52😭86
Всем привет! Возвращаюсь на связь, на прошлой неделе была в отпуске😌

А пока на нашем рынке я такого не видела, но на зарубежном после HR-интервью присылается очень подробное и информативное саммари: о чем говорили, что нужно спросить в следующий раз, ваши плюсы/минусы, соответствие вакансии

@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
👍205💅2🌚1
Сеньорские вопросы

🤵 Чем круче вы становитесь, чем в более highload сторону вы идете, чем быстрее развиваются ллмки, тем вопросики к вам становятся все серьезнее

Собрала для вас подборку таких вопросов по технологиям:

Spark

Из чего состоит executor memory?
Что такое spark.memory.storageFraction?
В чем разница между Sort-Merge Join и Broadcast на маленькой таблице?
Каким образом уменьшить количество шафла?
Зачем нужен data spill?
Как работает AQE?
Какие проблемы спарка в кубере?

🧊Iceberg

Как айсберг работает с параллельным изменением одного файла и нескольких?
Почему при записи из старой таблицы в новую в айсберге джоба бежит очень долго? 
Почему при перекладке в айсберг забивается кэш?
Какие проблемы с айсбергом, кроме maintenance?

🌺 Airflow, Python

Что такое TYPE_CHECKING?
Как добавить шаблонизированное поле, если оператор не поддерживает jinja?
Что такое dynamic task mapping?

🖥 ClickHouse

Если данные писались в одну ноду клика, то при ее падении какие данные будут лежать на остальных?
Какие проблемы с Replacing Merge Tree при вставке 5тб данных?
300 колонок, 8 ключей - в чем проблема такого подхода и как лучше поменять?

🧘Kafka

Как интеграция Spark-Kafka умеет обеспечивать exactly once?
Как будет читать спарк из кафки, если 10 коров, 5 партиций? Сколько будет простаивать экзекьюторов?
Как будет читаться таблица в спарке, если 1ТБ один файл, 20 коров? Сколько будет простаивать экзекьюторов?
Как будут читать 10 инстансов приложения из 5 партиций?

@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍248🤔4🌚3😁11
Отгадайте с первой попытки, за какой это было период и что случилось😁😁

@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🌚12😁5💅22
пупупу
у меня всего 9 с половиной😚
Please open Telegram to view this post
VIEW IN TELEGRAM
😁487
Ребят, а тут есть такие, кто идет на дата конфу в Лондоне?

https://www.bigdataldn.com

Она бесплатная, нужно просто прилететь🙂 По темам очень похоже: лейкхаус, AI агенты, data fabric, data governance. И сессии от топовых компаний: Databricks, Microsoft, Google, JetBrains, dbt Labs, Snowflake…

Я вот зарегалась и даже на некоторое время задумалась над подачей визы🤭 Но потом как вспомнила, что ИМЕННО В ЭТИ ДАТЫ у меня конфа в Москве

Так что ищу шпиониро😎

Полную программу конференции можно хотя бы полистать тут

@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
😁13💅31
Lakehouse для аналитиков и инженеров данных

Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. 

В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. 
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. 
• Построение пайплайнов, инструменты  для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. 

Кто мы: R&D-центр Devhands, наш канал.

Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B),
ex: VK Tech, М.Видео, Эльдорадо

🗓 Старт курса: 27 августа

Изучить программу и записаться можно здесь.

Ждём вас!

Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
👍4🔥2🤷1