💻 PYTHON Backend Frontend
54.2K subscribers
345 photos
55 videos
79 links
🔥 ЕЩЁ БОЛЬШЕ КОНТЕНТА:
t.me/addlist/2EjwwexCDeRlNWNh

💬 ЧАТЫ ДЛЯ ОБЩЕНИЯ:
t.me/addlist/1ZoIIyAsAgkzYjEx

🌐 Реклама / Сотрудничество: @DealAds
Download Telegram
Почему DuckDB нередко быстрее Spark на одной машине

Секрет не в «магии», а в том, как DuckDB работает с железом. Колоночный формат читает только нужные поля, векторизованное выполнение гоняет данные батчами по 1024–2048 значений и лучше попадает в кэш CPU, а min-max-индексы помогают сразу отсеивать лишние блоки строк. Плюс всё это хорошо распараллеливается по ядрам.

На TPC-H разница показательная: DuckDB уложилась в 1:16 на одной машине, а Spark на 32 узлах — примерно в 8 минут. Причина простая: у распределённой системы есть заметные накладные расходы.

Но это не универсальная замена PostgreSQL, Kafka или кластерным решениям. Для локальной аналитики и ETL — очень сильный вариант.

Любишь не только технологии, но и культуру? Загляни в канал про искусство, эпохи и визуальные шедевры — там интересно и без занудства.

#DuckDB #Spark #ETL
3🔥2🥰1👏1