HeadlinesBriefing favicon HeadlinesBriefing.com

DuckDB और DuckLake के साथ डेटा लेकहाउस बनाएं

Towards Data Science •
×

कई साल पहले, यदि आप बड़ी मात्रा में डेटा संग्रहीत करना चाहते थे जिसे समझदारी से क्वेरी किया जा सके, तो Oracle या Postgres जैसा डेटाबेस आपका मुख्य विकल्प था। अगली बड़ी प्रगति डेटा वेयरहाउस थी, जिसके बाद डेटा लेक आया। डेटा लेक ने संगठनों को कच्चे संरचित, अर्ध-संरचित और असंरचित डेटा के बहुत बड़े संस्करणों को सस्ते में संग्रहीत करने की अनुमति दी। Databricks, Snowflake, और AWS जैसी कंपनियां भारी शुल्क लेती हैं, लेकिन आप DuckDB और DuckLake एक्सटेंशन के साथ लगभग शून्य लागत पर एक प्रभावी डेटा लेक विकसित कर सकते हैं।

DuckDB और DuckLake दोनों MIT-लाइसेंस प्राप्त, ओपन-सोर्स और उपयोग करने के लिए मुफ़्त हैं। DuckLake, DuckDB टीम द्वारा विकसित, मेटाडेटा को Parquet डेटा के साथ सह-स्थित फ़ाइलों के बजाय एक रिलेशनल डेटाबेस में प्रबंधित करता है।

लेख एक स्थानीय DuckLake बनाने, मेटाडेटा की जांच करने, टाइम-ट्रैवल क्वेरी, एक टेबल स्कीमा को विकसित करने, और DuckLake के साथ क्लाउड-आधारित S3 डेटा का उपयोग करने के माध्यम से चलता है।

मुख्य संस्थाएं: कंपनियां: Oracle, Databricks, Snowflake, AWS