Как прошла SmartData 2026?
Я вот перечитываю свои впечатления от прошлого года и понимаю, что в этом году было совсем не так🥲 Вижу, что писала про
А в этом году не было ни одного доклада про StarRocks или Polars
📚 Доклады
Конфу объединили с DS/ML, поэтому значительная часть докладов сразу отсеклась. Часть была супер нишевой: про китайский CubeFS, внутрянку pgvector, утечки памяти на контроллерах😫
Поэтому лично мне понравились всего 2 доклада:
1️⃣ "Витрины данных на Data Lakehouse: маленькая история про большой переезд с Greenplum", Лемана Тех
Очень крутой чел рассказал про миграцию с Greenplum на dbt с yaml дагогенерацией, сэндбоксы, настройку ролевки, мониторинга, обслуживания. Пока они перенесли совсем немного и такое ощущение, что с многими проблемами просто не столкнулись
Вывод такой: витрины собираются дольше, функционала компонентов DLH не хватает, проблем и вопросов больше, чем решений и ответов
2️⃣ "Контракты данных: когда схема становится договором", Uzum Market
Практически весь доклад мне казалось, что они живут в сказочном мире с единорогами и розовыми пони, настолько так все классно работает. На самом деле очень прикольно: сначала заводятся контракты данных, потом генерятся DDL, конфиги развертывания, автоматически разворачиваются кафка-топики, выставляются MR. DQ, Lineage - тоже все есть
На дискуссия была жесткая заруба по поводу ломающих изменений в контракте
Мне от спикера так понравились две фразы, пусть они тут останутся:
❓ Что по AI?
Опишите красиво ваши метрики и данные, сделайте семантический слой - и будет классный контекст для ваших агентов (база)
📍 Новости и ссылочки
Статья: How Anthropic enables self-service data analytics with Claude
Дэш из доклада про ADBC (Arrow Database Connectivity)
Яндекс вписался в разработку китайского Greenplum - Cloudberry, в который они добавили поддержку Iceberg
Одни ребята переехали на StarRocks уже в 2023 году
В Магните в июне были сокращения
Мысль - сейчас многие делают статичные AI-дэши, а что если навайбкодить BI, который реальными запросами ходит в данные?
21.10.2026 выходит DuckDB 2.0
AWS купили DuckLabs
@data_engineerette
Я вот перечитываю свои впечатления от прошлого года и понимаю, что в этом году было совсем не так
Текущее состояние рынка даты
Presto/Trino + K8s + S3, Iceberg, StarRocks, Polars - движется сюда
А в этом году не было ни одного доклада про StarRocks или Polars
Конфу объединили с DS/ML, поэтому значительная часть докладов сразу отсеклась. Часть была супер нишевой: про китайский CubeFS, внутрянку pgvector, утечки памяти на контроллерах
Поэтому лично мне понравились всего 2 доклада:
Очень крутой чел рассказал про миграцию с Greenplum на dbt с yaml дагогенерацией, сэндбоксы, настройку ролевки, мониторинга, обслуживания. Пока они перенесли совсем немного и такое ощущение, что с многими проблемами просто не столкнулись
Вывод такой: витрины собираются дольше, функционала компонентов DLH не хватает, проблем и вопросов больше, чем решений и ответов
Практически весь доклад мне казалось, что они живут в сказочном мире с единорогами и розовыми пони, настолько так все классно работает. На самом деле очень прикольно: сначала заводятся контракты данных, потом генерятся DDL, конфиги развертывания, автоматически разворачиваются кафка-топики, выставляются MR. DQ, Lineage - тоже все есть
На дискуссия была жесткая заруба по поводу ломающих изменений в контракте
Мне от спикера так понравились две фразы, пусть они тут останутся:
россыпь SDK
data quality ассорти
Опишите красиво ваши метрики и данные, сделайте семантический слой - и будет классный контекст для ваших агентов (база)
Статья: How Anthropic enables self-service data analytics with Claude
Дэш из доклада про ADBC (Arrow Database Connectivity)
Яндекс вписался в разработку китайского Greenplum - Cloudberry, в который они добавили поддержку Iceberg
Одни ребята переехали на StarRocks уже в 2023 году
В Магните в июне были сокращения
Мысль - сейчас многие делают статичные AI-дэши, а что если навайбкодить BI, который реальными запросами ходит в данные?
21.10.2026 выходит DuckDB 2.0
AWS купили DuckLabs
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8❤7 3
5 октября начнется 19-й поток программы Data Engineer от Newprolab
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Реклама. НОЧУ ДПО «НЬЮПРОЛАБ», ИНН 7729461098, erid: CQH36pWzJqVKq9rQaHuCzeGVyN7t33BtnXkZHE54vj73iv
Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE
📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы
📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы
Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь
👉 Подробности и квиз – на сайте
Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
Реклама. НОЧУ ДПО «НЬЮПРОЛАБ», ИНН 7729461098, erid: CQH36pWzJqVKq9rQaHuCzeGVyN7t33BtnXkZHE54vj73iv
👍4🔥4😁2
Lance
Недавно ковырялась в инструменте для обслуживания таблиц Apache Amoro и наткнулась на новый для меня термин - формат данных Lance
Lance - это колоночный формат хранения данных, созданный для AI/ML задач в лейкхаусе
⏰ Он появился еще в 2022 году, а первая стабильная версия вышла в декабре 2025. Примерно с того же времени нашла дискуссии в де сообществе. Разрабатывают ребята, которые создали LanceDB
Главные особенности:
🤩 оптимизация под AI и векторный поиск
🤩 доступ к данным за О(1)
🤩 в одной таблице можно хранить обычные данные + медиа + векторы
🤩 ядро написано на Rust
🤩 построен поверх Apache Arrow
🤩 time travel
🤩 acid
🤩 update/delete так же поддерживается
Lance позиционирует себя как замена Parquet, но к данным можно достучаться в 100 раз быстрее
Поддерживается много интеграций: DuckDB, Polars, Data Fusion, Spark, Doris, Trino, PyTorch, Flink. Но, например, Lance-Trino интеграция вышла из беты только 31 марта этого года, а Spark появился еще позднее, поэтому многие компоненты еще достаточно свежие
А помимо Lance, еще есть Nimble, Vortex, BtrBlocks, FastLanes😯
@data_engineerette
Недавно ковырялась в инструменте для обслуживания таблиц Apache Amoro и наткнулась на новый для меня термин - формат данных Lance
Lance - это колоночный формат хранения данных, созданный для AI/ML задач в лейкхаусе
Главные особенности:
Lance позиционирует себя как замена Parquet, но к данным можно достучаться в 100 раз быстрее
Поддерживается много интеграций: DuckDB, Polars, Data Fusion, Spark, Doris, Trino, PyTorch, Flink. Но, например, Lance-Trino интеграция вышла из беты только 31 марта этого года, а Spark появился еще позднее, поэтому многие компоненты еще достаточно свежие
А помимо Lance, еще есть Nimble, Vortex, BtrBlocks, FastLanes
@data_engineerette
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍1 1