HeadlinesBriefing favicon HeadlinesBriefing.com

DuckDB এবং DuckLake দিয়ে ডেটা লেকহাউস তৈরি

Towards Data Science •
×

অনেক বছর আগে, যদি আপনি বড় পরিমাণে ডেটা সংরক্ষণ করতে চান যেগুলো যুক্তিসঙ্গতভাবে কোয়েরি করা যায়, তবে Oracle বা Postgres-এর মতো ডেটাবেস আপনার প্রধান পছন্দ ছিল। পরবর্তী বড় অগ্রগতি ছিল ডেটা ওয়ারহাউস, তারপর ডেটা লেক। ডেটা লেক সংস্থাগুলোকে কাঁচা স্ট্রাকচার্ড, সেমি-স্ট্রাকচার্ড এবং আনস্ট্রাকচার্ড ডেটার অনেক বড় আকার সংরক্ষণ করার অনুমতি দেয় সস্তে। Databricks, Snowflake, এবং AWS-এর মতো কোম্পানিগুলো ভारी ফি চার্জ করে, কিন্তু আপনি DuckDB এবং DuckLake এক্সটেনশনের সাথে প্রায় শূন্য খরচে একটি কার্যকর ডেটা লেক विकশিত করতে পারেন।

DuckDB এবং DuckLake উভয়ই MIT-লাইসেন্সড, ওপেন-সোর্স, এবং ব্যবহার করার জন্য নিখরচে। DuckLake, DuckDB টিম দ্বারা বিকশিত, Parquet ডেটার সাথে সহ-অবস্থিত ফাইলগুলির পরিবর্তে একটি রিলেশনাল ডেটাবেসে মেটাডেটা পরিচালনা করে।

লেখাটি একটি লোকাল DuckLake তৈরি করার মাধ্যমে, মেটাডেটা পরীক্ষা করার মাধ্যমে, টাইম-ট্রাভেল কোয়েরি, একটি টেবিল স্কিমা বিকাশ করার মাধ্যমে, এবং DuckLake-এর সাথে ক্লাউড-ভিত্তিক S3 ডেটা ব্যবহার করার মাধ্যমে চলে।

মূল エンティটি: কোম্পানিগুলো: Oracle, Databricks, Snowflake, AWS