Всем привет. Мы рады представить релиз CedrusData 458-12. Последние два месяца мы были сосредотоены на новом функционале каталога: ролевая модель доступа к объектам Iceberg, запуск maintenance операций Iceberg по расписанию, web-интерфейс CedrusData Catalog
Iceberg:
- ❗️Добавлена ролевая модель доступа к объектам Iceberg. Пользователи CedrusData Catalog теперь могут задавать права доступа, которые будут универсально применены ко всем движкам, работающим с данными Iceberg. Решение позволяет избавиться от необходимости использования сторонних решений для управления доступом
- ❗️Добавлена поддержка запуска maintenance операций по расписанию. Теперь вы можете задать cron выражение, после чего CedrusData Catalog начнет периодически обслуживать объекты Iceberg без необходимости использования внешних оркестраторов
- ❗️CedrusData Catalog получил новый современный web-интерфейс
SQL Server:
- Добавлена поддержка pushdown типа данных UNIQUEIDENTIFIER
Release notes:
- CedrusData: https://docs.cedrusdata.ru/458-12/release/release-458-12.html
- CedrusData Catalog: https://docs.cedrusdata.ru/catalog/458-12/release/release-458-12.html
Iceberg:
- ❗️Добавлена ролевая модель доступа к объектам Iceberg. Пользователи CedrusData Catalog теперь могут задавать права доступа, которые будут универсально применены ко всем движкам, работающим с данными Iceberg. Решение позволяет избавиться от необходимости использования сторонних решений для управления доступом
- ❗️Добавлена поддержка запуска maintenance операций по расписанию. Теперь вы можете задать cron выражение, после чего CedrusData Catalog начнет периодически обслуживать объекты Iceberg без необходимости использования внешних оркестраторов
- ❗️CedrusData Catalog получил новый современный web-интерфейс
SQL Server:
- Добавлена поддержка pushdown типа данных UNIQUEIDENTIFIER
Release notes:
- CedrusData: https://docs.cedrusdata.ru/458-12/release/release-458-12.html
- CedrusData Catalog: https://docs.cedrusdata.ru/catalog/458-12/release/release-458-12.html
👍13👌1
Всем привет!👋
Делимся записью прошедшего Lakehouse Meetup, где эксперты из Авито и CedrusData обсудили, как Trino и Apache Iceberg масштабируются в российских компаниях.
🔹Рассказываем, как в Авито построили экосистему вокруг Trino, которая обрабатывает до 1 ПБ данных в день и обслуживает 300 пользователей.
🔹Представляем CedrusData Catalog — бесплатное решение для управления метаданными в Apache Iceberg, которое уже сейчас решает ключевые задачи и имеет грандиозные планы на развитие.
📣 Хотите поделиться своим опытом или кейсом? Расскажите о нем, заполнив форму докладчика. Давайте создавать крутые митапы вместе!
Делимся записью прошедшего Lakehouse Meetup, где эксперты из Авито и CedrusData обсудили, как Trino и Apache Iceberg масштабируются в российских компаниях.
🔹Рассказываем, как в Авито построили экосистему вокруг Trino, которая обрабатывает до 1 ПБ данных в день и обслуживает 300 пользователей.
🔹Представляем CedrusData Catalog — бесплатное решение для управления метаданными в Apache Iceberg, которое уже сейчас решает ключевые задачи и имеет грандиозные планы на развитие.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1
Новый митап по Lakehouse уже в работе!
Ищем тех, кто готов рассказать про свой опыт использования Trino и Iceberg. Напишите о своем кейсе здесь.
Кстати, поддержать развитие канала и чата могут подписчики с Telegram Premium, отдав свой голос за нас.
Ждем вашей поддержки 🙏
Ищем тех, кто готов рассказать про свой опыт использования Trino и Iceberg. Напишите о своем кейсе здесь.
Кстати, поддержать развитие канала и чата могут подписчики с Telegram Premium, отдав свой голос за нас.
Ждем вашей поддержки 🙏
Google Docs
Lakehouse Meetup: заявка на доклад
Рассматриваемые темы докладов:
Опыт использования и внедрения Apache Iceberg и его каталогов
Опыт использования и внедрения Trino и связанных технологий
Опыт использования и внедрения Apache Iceberg и его каталогов
Опыт использования и внедрения Trino и связанных технологий
🥰2
23 сентября в Москве пройдет Data Internals X 2025 — конференция, где создатели СУБД и движков обработки данных делятся опытом работы с реальными production-системами экстремального масштаба.
🤩 Приглашаем всех участников к нам на стенд!
✅ Обсудим архитектурные решения и поделиться опытом.
✅ Ответим на вопросы, которые не гуглятся.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤1🔥1
Будем рады встретиться на конференции Smart Data уже в это воскресенье!
Владимир Озеров расскажет о перспективах развития Apache Iceberg:
🔹Планы развития (v3, безопасность, материализованные представления, scan planning, статистики и т. п.).
🔹Изменение роли REST-каталогов в экосистеме Iceberg.
🔹Вызовы и конкурентный ландшафт (near-real time сценарии, конкуренция с Paimon/Delta/DuckLake и т. п.).
🔹Состояние сообщества и его влияние на скорость развития и долгосрочные перспективы Apache Iceberg.
А пока делимся записью его прошлого выступления
Владимир Озеров расскажет о перспективах развития Apache Iceberg:
🔹Планы развития (v3, безопасность, материализованные представления, scan planning, статистики и т. п.).
🔹Изменение роли REST-каталогов в экосистеме Iceberg.
🔹Вызовы и конкурентный ландшафт (near-real time сценарии, конкуренция с Paimon/Delta/DuckLake и т. п.).
🔹Состояние сообщества и его влияние на скорость развития и долгосрочные перспективы Apache Iceberg.
А пока делимся записью его прошлого выступления
🔥19
Октябрь встречаем на конференции по инженерии данных Smart Data!
Приходите к нам на стенд! Расскажем всё самое интересное о Trino и CedrusData, ответим на любые вопросы.
А еще 5 октября Владимир Озеров, генеральный директор CedrusData, расскажет о перспективах развития Apache Iceberg.
✅ Где? СПб
✅ Когда? 5-6 октября
Приходите к нам на стенд! Расскажем всё самое интересное о Trino и CedrusData, ответим на любые вопросы.
А еще 5 октября Владимир Озеров, генеральный директор CedrusData, расскажет о перспективах развития Apache Iceberg.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5🐳2👾1
Вы нас просили — мы сделали: настоящий бенчмарк lakehouse-движков!
Шесть конкурсантов:
клан Presto (CedrusData, Presto, Trino) против клана Impala (Doris, Impala, StarRocks).
DuckDB в качестве арбитра.
🏆Победит сильнейший, остальные отправятся на свалку истории! Правда, будет только один SQL-запрос, один узел и много database internals.
Шесть конкурсантов:
клан Presto (CedrusData, Presto, Trino) против клана Impala (Doris, Impala, StarRocks).
DuckDB в качестве арбитра.
🏆Победит сильнейший, остальные отправятся на свалку истории! Правда, будет только один SQL-запрос, один узел и много database internals.
🔥31🤡19🤯7❤4⚡1
Обсудили тренд на Native Execution в Data Engineering инструментах и, в частности, потенциал C++ библиотеки Velox для ускорения Presto, Spark и других аналитических систем. Рассмотрели основные и наиболее зрелые на текущий момент интеграции этой библиотеки с существующими популярными OLAP-/ ML-системами.
🔥7❤3👏2
Каждая компания сегодня живёт в зоопарке технологий: данные хранятся в десятках источников (от PostgreSQL до S3), а запросы приходится собирать из кусочков SQL, Python и R. Между ними — стена несовместимых диалектов, потерянных оптимизаций и бесконечных конекторов. Substrait предлагает элегантное решение — единый универсальный язык описания запросов, понятный и аналитическим DSL, и движкам исполнения.
Substrait превращает SQL-строки в переносимые планы, избавляя от боли диалектов и давая возможность свободно комбинировать системы — от DuckDB и Velox до Spark и DataFusion. Это шаг к экосистеме, где любой frontend может говорить с любым backend без потери смысла и производительности.
Substrait превращает SQL-строки в переносимые планы, избавляя от боли диалектов и давая возможность свободно комбинировать системы — от DuckDB и Velox до Spark и DataFusion. Это шаг к экосистеме, где любой frontend может говорить с любым backend без потери смысла и производительности.
👍3🔥3😁3💩3💯2
Всем привет
9 декабря состоится десятый митап сообщества разработчиков СУБД Database Internals
В рамках мероприятия мы представим доклад, посвященный разработке акселератора запросов Trino на основе Rust, Apache Arrow и DataFusion.
Митап пройдет в рамках ежегодной конференции ИСП РАН на площадке кластера «Ломоносов». Также доступен онлайн формат.
Для участия необходимо зарегистрироваться на официальном сайте ИСП РАН до 6 декабря.
9 декабря состоится десятый митап сообщества разработчиков СУБД Database Internals
В рамках мероприятия мы представим доклад, посвященный разработке акселератора запросов Trino на основе Rust, Apache Arrow и DataFusion.
Митап пройдет в рамках ежегодной конференции ИСП РАН на площадке кластера «Ломоносов». Также доступен онлайн формат.
Для участия необходимо зарегистрироваться на официальном сайте ИСП РАН до 6 декабря.
🔥9👍3🥰2
В 16:00 начинаем доклад про переписывание ядра Trino на Rust.
Ссылки на трансляции доступны на странице Database Internals Meetup #10: https://databaseinternals.timepad.ru/event/3698395/
Ссылки на трансляции доступны на странице Database Internals Meetup #10: https://databaseinternals.timepad.ru/event/3698395/
databaseinternals.timepad.ru
Database Internals Meetup #10 (офлайн + онлайн): 5 докладов на конференции ISPRAS Open / События на TimePad.ru
Десятый митап российского сообщества разработчиков СУБД и распределенных систем. Программа в пять докладов про PostgreSQL, Data Fusion, графовые СУБД и применение JIT в компиляции запросов.
🔥12👍2
План на сегодня: гирлянды, мандарины и… миграция DWH 🍾
Пока мир делится итогами, мы нашли идеальный материал для последнего рабочего дня этого года. Статья Дмитрия Реймана из Авито «Есть ли жизнь после Vertica или миграция DWH в Lakehouse»
Пока мир делится итогами, мы нашли идеальный материал для последнего рабочего дня этого года. Статья Дмитрия Реймана из Авито «Есть ли жизнь после Vertica или миграция DWH в Lakehouse»
Хабр
Есть ли жизнь после Vertica или миграция DWH в Lakehouse
Всем привет! Меня зовут Дмитрий Рейман, я техлид аналитической платформы Авито. Последний раз мы подробно писали о нашей платформе почти четыре года назад – в статье «Эволюция хранилища данных в...
🔥13❤2
Мы переписали ядро Trino с Java на Rust!
В новой статье рассказываем, почему выбрали Rust и DataFusion в качестве основы решения, с какими сложностями столкнулись и какие очевидные (и неочевидные) преимущества получили в результате.
В новой статье рассказываем, почему выбрали Rust и DataFusion в качестве основы решения, с какими сложностями столкнулись и какие очевидные (и неочевидные) преимущества получили в результате.
🔥25❤4👍4😁2
CedrusData 458-22
Ядро
— Доработан алгоритм планирования JOIN DPHyp — сложные запросы выполняются быстрее
— Экспорт метрик JVM — для мониторинга и точной диагностики
SQL Web UI
— Добавлена возможность параллельного выполнения нескольких запросов в разных вкладках
— Добавлен Zen-режим
— Добавлен таймаут неактивной сессий
— Увеличена отзывчивость редактора при работе с большим количество объектов
Коннекторы
— Добавлен новый File Connector для работы с файлами напрямую без необходимости использования metastore
— Iceberg: добавлена поддержка Hive-синтаксиса для виртуальных view
— Greenplum: улучшен pushdown для JOIN, добавлена возможность скрывать физические партиции из результата листинга
— SQL Server: улучшен pushdown для COUNT(DISTINCT)
— Oracle: улучшена работа имперсонации
Ядро
— Доработан алгоритм планирования JOIN DPHyp — сложные запросы выполняются быстрее
— Экспорт метрик JVM — для мониторинга и точной диагностики
SQL Web UI
— Добавлена возможность параллельного выполнения нескольких запросов в разных вкладках
— Добавлен Zen-режим
— Добавлен таймаут неактивной сессий
— Увеличена отзывчивость редактора при работе с большим количество объектов
Коннекторы
— Добавлен новый File Connector для работы с файлами напрямую без необходимости использования metastore
— Iceberg: добавлена поддержка Hive-синтаксиса для виртуальных view
— Greenplum: улучшен pushdown для JOIN, добавлена возможность скрывать физические партиции из результата листинга
— SQL Server: улучшен pushdown для COUNT(DISTINCT)
— Oracle: улучшена работа имперсонации
🔥8👍5❤1
CedrusData присоединяется к направлению дата-сервисов VK Tech
Теперь в едином решении:
*️⃣ VK Data Platform — lakehouse-платформа
*️⃣ S3-совместимое хранилище VK Object Storage
*️⃣ Экосистема Tarantool, включая колоночную базу Tarantool Column Store
*️⃣ Высокопроизводительный массивно-параллельный SQL-движок CedrusData Engine
*️⃣ Каталог метаданных CedrusData Catalog с поддержкой Iceberg
Зачем?
Мы интегрируем наши технологии для создания единой точки доступа ко всем данным без дублирования, снижения затрат на инфраструктуру и ускорения аналитики.
Теперь в едином решении:
Зачем?
Мы интегрируем наши технологии для создания единой точки доступа ко всем данным без дублирования, снижения затрат на инфраструктуру и ускорения аналитики.
Please open Telegram to view this post
VIEW IN TELEGRAM
😢17🔥14❤3👏3👻1
18 августа проводим технический митап по архитектуре и развитию платформ данных
В программе:
— архитектура дата-платформы VK Tech: как на Kubernetes реализовали оркестрацию сервисов данных, включая СУБД, и унифицировали их развёртывание, масштабирование и эксплуатацию;
— кейс Авито: как сняли ограничение S3 на производительность аналитической платформы — сделали шардирование таблиц между тремя S3 кластерами и увеличили пиковую скорость чтения с 20 до 60 ГБайт/с;
— круглый стол инженеров RWB и VK Tech: кейс подготовки сегментов для таргетинга на Trino и DataFusion и дискуссия об архитектуре платформ данных — Kubernetes, реальном self-service, контроле безопасности, работе платформы как дата-бэкенда для сервисов и подготовке к агентам и AI-нагрузкам.
🗓 18 августа, сбор гостей в 17:30
📍 Москва, БЦ «Скайлайт», Ленинградский проспект, 39
💻 Можно подключиться онлайн
✍️Необходима регистрация
После программы будет время обсудить доклады и пообщаться с коллегами
В программе:
— архитектура дата-платформы VK Tech: как на Kubernetes реализовали оркестрацию сервисов данных, включая СУБД, и унифицировали их развёртывание, масштабирование и эксплуатацию;
— кейс Авито: как сняли ограничение S3 на производительность аналитической платформы — сделали шардирование таблиц между тремя S3 кластерами и увеличили пиковую скорость чтения с 20 до 60 ГБайт/с;
— круглый стол инженеров RWB и VK Tech: кейс подготовки сегментов для таргетинга на Trino и DataFusion и дискуссия об архитектуре платформ данных — Kubernetes, реальном self-service, контроле безопасности, работе платформы как дата-бэкенда для сервисов и подготовке к агентам и AI-нагрузкам.
🗓 18 августа, сбор гостей в 17:30
📍 Москва, БЦ «Скайлайт», Ленинградский проспект, 39
💻 Можно подключиться онлайн
✍️Необходима регистрация
После программы будет время обсудить доклады и пообщаться с коллегами
tech.vk.ru
Data Meetup VK Tech #1: платформы данных
Технический митап для инженеров, архитекторов и руководителей, которые проектируют, развивают и эксплуатируют платформы данных.
✍7❤5🔥3🤮1
23–24 сентября выступаем на SmartData с докладом про S3
Также ждем на стенде VK Tech, чтобы обсудить Cedrus и Trino
Будем рады встрече!
Также ждем на стенде VK Tech, чтобы обсудить Cedrus и Trino
Будем рады встрече!
👍5❤2🔥2
Forwarded from Данные на стероидах
Когда S3-хранилище растет, метаслой приходится развивать вместе с ним.
Чем больше данных, нагрузки и функциональности, тем сложнее масштабировать систему, если хранение метаданных тесно связано с бизнес-логикой.
На SmartData 2026 эксперт VK Tech Иван Найденов расскажет, как команда пересматривала архитектуру собственного S3-совместимого хранилища и почему решила разделить метаслой и прикладную часть системы.
В докладе Иван разберет:
🔵 почему для взаимодействия выбрали асинхронный подход
🔵 как при такой архитектуре работать с согласованностью данных, идемпотентностью и порядком операций
🔵 что происходит при частичных отказах и как система после них восстанавливается
🔵 по каким требованиям выбирали новое хранилище метаданных и на какие компромиссы пришлось пойти.
🗓 23 сентября
📍 SmartData 2026, зал 3
Подробнее о выступлении и участии в конференции по ссылке.
📬 Мы в МАХ
Чем больше данных, нагрузки и функциональности, тем сложнее масштабировать систему, если хранение метаданных тесно связано с бизнес-логикой.
На SmartData 2026 эксперт VK Tech Иван Найденов расскажет, как команда пересматривала архитектуру собственного S3-совместимого хранилища и почему решила разделить метаслой и прикладную часть системы.
В докладе Иван разберет:
🗓 23 сентября
📍 SmartData 2026, зал 3
Подробнее о выступлении и участии в конференции по ссылке.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2