HeadlinesBriefing favicon HeadlinesBriefing.com

Membangun Data Lakehouse dengan DuckDB dan DuckLake

Towards Data Science •
×

Bertahun-tahun yang lalu, jika Anda ingin menyimpan sejumlah besar data yang dapat dikueri dengan masuk akal, database seperti Oracle atau Postgres adalah pilihan utama Anda. Kemajuan besar berikutnya adalah gudang data, diikuti oleh danau data. Danau data memungkinkan organisasi untuk menyimpan volume data mentah terstruktur, semi-terstruktur, dan tidak terstruktur yang jauh lebih besar dengan biaya murah. Perusahaan seperti Databricks, Snowflake, dan AWS mengenakan biaya tinggi, tetapi Anda dapat mengembangkan danau data yang efektif dengan biaya hampir nol menggunakan DuckDB dan ekstensi DuckLake.

Baik DuckDB maupun DuckLake dilisensikan MIT, open source, dan gratis digunakan. DuckLake, yang dikembangkan oleh tim DuckDB, mengelola metadata di database relasional, bukan di file yang ditempatkan bersama data Parquet.

Artikel ini memandu pembuatan DuckLake lokal, pemeriksaan metadata, kueri time-travel, mengembangkan skema tabel, dan menggunakan data S3 berbasis cloud dengan DuckLake.

Entitas Kunci: Perusahaan: Oracle, Databricks, Snowflake, AWS