Trino и CedrusData
455 subscribers
6 photos
2 files
58 links
Канал о российской lakehouse-платформе CedrusData и сверхбыстром SQL-движке Trino. Здесь команда разработчиков CedrusData делится опытом и новостями из мира современных data lakehouse-решений и распределённых вычислений.

Чат: @cedrusdatachat
Download Telegram
Всем привет. Мы рады представить релиз CedrusData 458-12. Последние два месяца мы были сосредотоены на новом функционале каталога: ролевая модель доступа к объектам Iceberg, запуск maintenance операций Iceberg по расписанию, web-интерфейс CedrusData Catalog

Iceberg:
- ❗️Добавлена ролевая модель доступа к объектам Iceberg. Пользователи CedrusData Catalog теперь могут задавать права доступа, которые будут универсально применены ко всем движкам, работающим с данными Iceberg. Решение позволяет избавиться от необходимости использования сторонних решений для управления доступом
- ❗️Добавлена поддержка запуска maintenance операций по расписанию. Теперь вы можете задать cron выражение, после чего CedrusData Catalog начнет периодически обслуживать объекты Iceberg без необходимости использования внешних оркестраторов
- ❗️CedrusData Catalog получил новый современный web-интерфейс

SQL Server:
- Добавлена поддержка pushdown типа данных UNIQUEIDENTIFIER

Release notes:
- CedrusData: https://docs.cedrusdata.ru/458-12/release/release-458-12.html
- CedrusData Catalog: https://docs.cedrusdata.ru/catalog/458-12/release/release-458-12.html
👍13👌1
Всем привет!👋

Делимся записью прошедшего Lakehouse Meetup, где эксперты из Авито и CedrusData обсудили, как Trino и Apache Iceberg масштабируются в российских компаниях.

🔹Рассказываем, как в Авито построили экосистему вокруг Trino, которая обрабатывает до 1 ПБ данных в день и обслуживает 300 пользователей.

🔹Представляем CedrusData Catalog — бесплатное решение для управления метаданными в Apache Iceberg, которое уже сейчас решает ключевые задачи и имеет грандиозные планы на развитие.

📣 Хотите поделиться своим опытом или кейсом? Расскажите о нем, заполнив форму докладчика. Давайте создавать крутые митапы вместе!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1
Новый митап по Lakehouse уже в работе!

Ищем тех, кто готов рассказать про свой опыт использования Trino и Iceberg. Напишите о своем кейсе здесь.

Кстати, поддержать развитие канала и чата могут подписчики с Telegram Premium, отдав свой голос за нас.
Ждем вашей поддержки 🙏
🥰2
23 сентября в Москве пройдет Data Internals X 2025 — конференция, где создатели СУБД и движков обработки данных делятся опытом работы с реальными production-системами экстремального масштаба.

🤩Приглашаем всех участников к нам на стенд!

✅Обсудим архитектурные решения и поделиться опытом.
✅Ответим на вопросы, которые не гуглятся.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤1🔥1
Будем рады встретиться на конференции Smart Data уже в это воскресенье!

Владимир Озеров расскажет о перспективах развития Apache Iceberg:

🔹Планы развития (v3, безопасность, материализованные представления, scan planning, статистики и т. п.).
🔹Изменение роли REST-каталогов в экосистеме Iceberg.
🔹Вызовы и конкурентный ландшафт (near-real time сценарии, конкуренция с Paimon/Delta/DuckLake и т. п.).
🔹Состояние сообщества и его влияние на скорость развития и долгосрочные перспективы Apache Iceberg.

А пока делимся записью его прошлого выступления
🔥19
Октябрь встречаем на конференции по инженерии данных Smart Data!
Приходите к нам на стенд! Расскажем всё самое интересное о Trino и CedrusData, ответим на любые вопросы.

А еще 5 октября Владимир Озеров, генеральный директор CedrusData, расскажет о перспективах развития Apache Iceberg.

✅Где? СПб
✅Когда? 5-6 октября
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5🐳2👾1
Вы нас просили — мы сделали: настоящий бенчмарк lakehouse-движков!

Шесть конкурсантов:
клан Presto (CedrusData, Presto, Trino) против клана Impala (Doris, Impala, StarRocks).
DuckDB в качестве арбитра.

🏆Победит сильнейший, остальные отправятся на свалку истории! Правда, будет только один SQL-запрос, один узел и много database internals.
🔥31🤡19🤯7❤4⚡1
Обсудили тренд на Native Execution в Data Engineering инструментах и, в частности, потенциал C++ библиотеки Velox для ускорения Presto, Spark и других аналитических систем. Рассмотрели основные и наиболее зрелые на текущий момент интеграции этой библиотеки с существующими популярными OLAP-/ ML-системами.
🔥7❤3👏2
Каждая компания сегодня живёт в зоопарке технологий: данные хранятся в десятках источников (от PostgreSQL до S3), а запросы приходится собирать из кусочков SQL, Python и R. Между ними — стена несовместимых диалектов, потерянных оптимизаций и бесконечных конекторов. Substrait предлагает элегантное решение — единый универсальный язык описания запросов, понятный и аналитическим DSL, и движкам исполнения.
Substrait превращает SQL-строки в переносимые планы, избавляя от боли диалектов и давая возможность свободно комбинировать системы — от DuckDB и Velox до Spark и DataFusion. Это шаг к экосистеме, где любой frontend может говорить с любым backend без потери смысла и производительности.
👍3🔥3😁3💩3💯2
Всем привет
9 декабря состоится десятый митап сообщества разработчиков СУБД Database Internals

В рамках мероприятия мы представим доклад, посвященный разработке акселератора запросов Trino на основе Rust, Apache Arrow и DataFusion.

Митап пройдет в рамках ежегодной конференции ИСП РАН на площадке кластера «Ломоносов». Также доступен онлайн формат.

Для участия необходимо зарегистрироваться на официальном сайте ИСП РАН до 6 декабря.
🔥9👍3🥰2
Мы переписали ядро Trino с Java на Rust!

В новой статье рассказываем, почему выбрали Rust и DataFusion в качестве основы решения, с какими сложностями столкнулись и какие очевидные (и неочевидные) преимущества получили в результате.
🔥25❤4👍4😁2
CedrusData 458-22

Ядро
— Доработан алгоритм планирования JOIN DPHyp — сложные запросы выполняются быстрее
— Экспорт метрик JVM — для мониторинга и точной диагностики

SQL Web UI
— Добавлена возможность параллельного выполнения нескольких запросов в разных вкладках
— Добавлен Zen-режим
— Добавлен таймаут неактивной сессий
— Увеличена отзывчивость редактора при работе с большим количество объектов

Коннекторы
— Добавлен новый File Connector для работы с файлами напрямую без необходимости использования metastore
— Iceberg: добавлена поддержка Hive-синтаксиса для виртуальных view
— Greenplum: улучшен pushdown для JOIN, добавлена возможность скрывать физические партиции из результата листинга
— SQL Server: улучшен pushdown для COUNT(DISTINCT)
— Oracle: улучшена работа имперсонации
🔥8👍5❤1
CedrusData присоединяется к направлению дата-сервисов VK Tech

Теперь в едином решении:
*️⃣VK Data Platform — lakehouse-платформа
*️⃣S3-совместимое хранилище VK Object Storage
*️⃣Экосистема Tarantool, включая колоночную базу Tarantool Column Store
*️⃣Высокопроизводительный массивно-параллельный SQL-движок CedrusData Engine
*️⃣Каталог метаданных CedrusData Catalog с поддержкой Iceberg

Зачем?
Мы интегрируем наши технологии для создания единой точки доступа ко всем данным без дублирования, снижения затрат на инфраструктуру и ускорения аналитики.
Please open Telegram to view this post
VIEW IN TELEGRAM
😢17🔥14❤3👏3👻1
Рады встрече на Saint Highload++

22–23 июня приходите обсудить Trino и Iceberg: поделимся опытом, разберем ваши задачи и ответим на вопросы. Наши специалисты будут ждать на стенде VK Tech
🔥10👍3🥰2❤1
18 августа проводим технический митап по архитектуре и развитию платформ данных

В программе:

— архитектура дата-платформы VK Tech: как на Kubernetes реализовали оркестрацию сервисов данных, включая СУБД, и унифицировали их развёртывание, масштабирование и эксплуатацию;
— кейс Авито: как сняли ограничение S3 на производительность аналитической платформы — сделали шардирование таблиц между тремя S3 кластерами и увеличили пиковую скорость чтения с 20 до 60 ГБайт/с;
— круглый стол инженеров RWB и VK Tech: кейс подготовки сегментов для таргетинга на Trino и DataFusion и дискуссия об архитектуре платформ данных — Kubernetes, реальном self-service, контроле безопасности, работе платформы как дата-бэкенда для сервисов и подготовке к агентам и AI-нагрузкам.

🗓 18 августа, сбор гостей в 17:30
📍 Москва, БЦ «Скайлайт», Ленинградский проспект, 39
💻 Можно подключиться онлайн
✍️Необходима регистрация

После программы будет время обсудить доклады и пообщаться с коллегами
✍7❤5🔥3🤮1
23–24 сентября выступаем на SmartData с докладом про S3

Также ждем на стенде VK Tech, чтобы обсудить Cedrus и Trino
Будем рады встрече!
👍5❤2🔥2
Когда S3-хранилище растет, метаслой приходится развивать вместе с ним.

Чем больше данных, нагрузки и функциональности, тем сложнее масштабировать систему, если хранение метаданных тесно связано с бизнес-логикой.

На SmartData 2026 эксперт VK Tech Иван Найденов расскажет, как команда пересматривала архитектуру собственного S3-совместимого хранилища и почему решила разделить метаслой и прикладную часть системы.

В докладе Иван разберет:

🔵почему для взаимодействия выбрали асинхронный подход
🔵 как при такой архитектуре работать с согласованностью данных, идемпотентностью и порядком операций
🔵 что происходит при частичных отказах и как система после них восстанавливается
🔵 по каким требованиям выбирали новое хранилище метаданных и на какие компромиссы пришлось пойти.

🗓 23 сентября
📍 SmartData 2026, зал 3

Подробнее о выступлении и участии в конференции по ссылке.

📬 Мы в МАХ
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2