Trino и CedrusData
455 subscribers
6 photos
2 files
58 links
Канал о российской lakehouse-платформе CedrusData и сверхбыстром SQL-движке Trino. Здесь команда разработчиков CedrusData делится опытом и новостями из мира современных data lakehouse-решений и распределённых вычислений.

Чат: @cedrusdatachat
Download Telegram
Обсудили тренд на Native Execution в Data Engineering инструментах и, в частности, потенциал C++ библиотеки Velox для ускорения Presto, Spark и других аналитических систем. Рассмотрели основные и наиболее зрелые на текущий момент интеграции этой библиотеки с существующими популярными OLAP-/ ML-системами.
🔥7❤3👏2
Каждая компания сегодня живёт в зоопарке технологий: данные хранятся в десятках источников (от PostgreSQL до S3), а запросы приходится собирать из кусочков SQL, Python и R. Между ними — стена несовместимых диалектов, потерянных оптимизаций и бесконечных конекторов. Substrait предлагает элегантное решение — единый универсальный язык описания запросов, понятный и аналитическим DSL, и движкам исполнения.
Substrait превращает SQL-строки в переносимые планы, избавляя от боли диалектов и давая возможность свободно комбинировать системы — от DuckDB и Velox до Spark и DataFusion. Это шаг к экосистеме, где любой frontend может говорить с любым backend без потери смысла и производительности.
👍3🔥3😁3💩3💯2
Всем привет
9 декабря состоится десятый митап сообщества разработчиков СУБД Database Internals

В рамках мероприятия мы представим доклад, посвященный разработке акселератора запросов Trino на основе Rust, Apache Arrow и DataFusion.

Митап пройдет в рамках ежегодной конференции ИСП РАН на площадке кластера «Ломоносов». Также доступен онлайн формат.

Для участия необходимо зарегистрироваться на официальном сайте ИСП РАН до 6 декабря.
🔥9👍3🥰2
Мы переписали ядро Trino с Java на Rust!

В новой статье рассказываем, почему выбрали Rust и DataFusion в качестве основы решения, с какими сложностями столкнулись и какие очевидные (и неочевидные) преимущества получили в результате.
🔥25❤4👍4😁2
CedrusData 458-22

Ядро
— Доработан алгоритм планирования JOIN DPHyp — сложные запросы выполняются быстрее
— Экспорт метрик JVM — для мониторинга и точной диагностики

SQL Web UI
— Добавлена возможность параллельного выполнения нескольких запросов в разных вкладках
— Добавлен Zen-режим
— Добавлен таймаут неактивной сессий
— Увеличена отзывчивость редактора при работе с большим количество объектов

Коннекторы
— Добавлен новый File Connector для работы с файлами напрямую без необходимости использования metastore
— Iceberg: добавлена поддержка Hive-синтаксиса для виртуальных view
— Greenplum: улучшен pushdown для JOIN, добавлена возможность скрывать физические партиции из результата листинга
— SQL Server: улучшен pushdown для COUNT(DISTINCT)
— Oracle: улучшена работа имперсонации
🔥8👍5❤1
CedrusData присоединяется к направлению дата-сервисов VK Tech

Теперь в едином решении:
*️⃣VK Data Platform — lakehouse-платформа
*️⃣S3-совместимое хранилище VK Object Storage
*️⃣Экосистема Tarantool, включая колоночную базу Tarantool Column Store
*️⃣Высокопроизводительный массивно-параллельный SQL-движок CedrusData Engine
*️⃣Каталог метаданных CedrusData Catalog с поддержкой Iceberg

Зачем?
Мы интегрируем наши технологии для создания единой точки доступа ко всем данным без дублирования, снижения затрат на инфраструктуру и ускорения аналитики.
Please open Telegram to view this post
VIEW IN TELEGRAM
😢17🔥14❤3👏3👻1
Рады встрече на Saint Highload++

22–23 июня приходите обсудить Trino и Iceberg: поделимся опытом, разберем ваши задачи и ответим на вопросы. Наши специалисты будут ждать на стенде VK Tech
🔥10👍3🥰2❤1
18 августа проводим технический митап по архитектуре и развитию платформ данных

В программе:

— архитектура дата-платформы VK Tech: как на Kubernetes реализовали оркестрацию сервисов данных, включая СУБД, и унифицировали их развёртывание, масштабирование и эксплуатацию;
— кейс Авито: как сняли ограничение S3 на производительность аналитической платформы — сделали шардирование таблиц между тремя S3 кластерами и увеличили пиковую скорость чтения с 20 до 60 ГБайт/с;
— круглый стол инженеров RWB и VK Tech: кейс подготовки сегментов для таргетинга на Trino и DataFusion и дискуссия об архитектуре платформ данных — Kubernetes, реальном self-service, контроле безопасности, работе платформы как дата-бэкенда для сервисов и подготовке к агентам и AI-нагрузкам.

🗓 18 августа, сбор гостей в 17:30
📍 Москва, БЦ «Скайлайт», Ленинградский проспект, 39
💻 Можно подключиться онлайн
✍️Необходима регистрация

После программы будет время обсудить доклады и пообщаться с коллегами
✍7❤5🔥3🤮1
23–24 сентября выступаем на SmartData с докладом про S3

Также ждем на стенде VK Tech, чтобы обсудить Cedrus и Trino
Будем рады встрече!
👍5❤2🔥2
Когда S3-хранилище растет, метаслой приходится развивать вместе с ним.

Чем больше данных, нагрузки и функциональности, тем сложнее масштабировать систему, если хранение метаданных тесно связано с бизнес-логикой.

На SmartData 2026 эксперт VK Tech Иван Найденов расскажет, как команда пересматривала архитектуру собственного S3-совместимого хранилища и почему решила разделить метаслой и прикладную часть системы.

В докладе Иван разберет:

🔵почему для взаимодействия выбрали асинхронный подход
🔵 как при такой архитектуре работать с согласованностью данных, идемпотентностью и порядком операций
🔵 что происходит при частичных отказах и как система после них восстанавливается
🔵 по каким требованиям выбирали новое хранилище метаданных и на какие компромиссы пришлось пойти.

🗓 23 сентября
📍 SmartData 2026, зал 3

Подробнее о выступлении и участии в конференции по ссылке.

📬 Мы в МАХ
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2