HeadlinesBriefing favicon HeadlinesBriefing.com

بناء بحيرة بيانات باستخدام DuckDB و DuckLake

Towards Data Science •
×

منذ سنوات عديدة، إذا كنت تريد تخزين كميات كبيرة من البيانات يمكن الاستعلام عنها بشكل معقول، كان قاعدة بيانات مثل Oracle أو Postgres هي خيارك الرئيسي. كان التطور الكبير التالي هو مستودع البيانات، تلاها بحيرة البيانات. سمحت بحيرات البيانات للمؤسسات بتخزين أحجام أكبر بكثير من البيانات الخام المهيكلة وشبه المهيكلة وغير المهيكلة بتكلفة رخيصة. تفرض شركات مثل Databricks و Snowflake و AWS رسومًا باهظة، لكن يمكنك تطوير بحيرة بيانات فعالة بتكلفة قريبة من الصفر باستخدام DuckDB وإضافة DuckLake.

كلا من DuckDB و DuckLake مرخصان بموجب رخصة MIT، ومفتوحا المصدر، ومجانيان للاستخدام. تم تطوير DuckLake من قبل فريق DuckDB، ويدير البيانات الوصفية في قاعدة بيانات علائقية بدلاً من الملفات الموجودة بجانب بيانات Parquet.

توضح المقالة إنشاء بحيرة DuckLake محلية، وفحص البيانات الوصفية، واستعلامات السفر عبر الزمن، وتطوير مخطط الجدول، واستخدام بيانات S3 المستندة إلى السحابة مع DuckLake.

الكيانات الرئيسية: الشركات: Oracle، Databricks، Snowflake، AWS