Почему DuckDB нередко быстрее Spark на одной машине
Секрет не в «магии», а в том, как DuckDB работает с железом. Колоночный формат читает только нужные поля, векторизованное выполнение гоняет данные батчами по 1024–2048 значений и лучше попадает в кэш CPU, а
На TPC-H разница показательная: DuckDB уложилась в 1:16 на одной машине, а Spark на 32 узлах — примерно в 8 минут. Причина простая: у распределённой системы есть заметные накладные расходы.
Но это не универсальная замена PostgreSQL, Kafka или кластерным решениям. Для локальной аналитики и ETL — очень сильный вариант.
Любишь не только технологии, но и культуру? Загляни в канал про искусство, эпохи и визуальные шедевры — там интересно и без занудства.
#DuckDB #Spark #ETL
Секрет не в «магии», а в том, как DuckDB работает с железом. Колоночный формат читает только нужные поля, векторизованное выполнение гоняет данные батчами по 1024–2048 значений и лучше попадает в кэш CPU, а
min-max-индексы помогают сразу отсеивать лишние блоки строк. Плюс всё это хорошо распараллеливается по ядрам.На TPC-H разница показательная: DuckDB уложилась в 1:16 на одной машине, а Spark на 32 узлах — примерно в 8 минут. Причина простая: у распределённой системы есть заметные накладные расходы.
Но это не универсальная замена PostgreSQL, Kafka или кластерным решениям. Для локальной аналитики и ETL — очень сильный вариант.
Любишь не только технологии, но и культуру? Загляни в канал про искусство, эпохи и визуальные шедевры — там интересно и без занудства.
#DuckDB #Spark #ETL
❤3🔥2🥰1👏1