HeadlinesBriefing favicon HeadlinesBriefing.com

Iceberg कॉम्पैक्शन: 1000 से 6, प्रभाव

Towards Data Science •
×

जब आप Apache Iceberg जैसे टेबल प्रारूपों में संग्रहीत बड़े विश्लेषणात्मक डेटासेट से निपटते हैं, तो एक ज्ञात समस्या होती है जिसे छोटी फ़ाइलों की समस्या कहा जाता है। यह तब होता है जब डेटा उचित आकार की कम संख्या के बजाय कई छोटी फ़ाइलों में लिखा जाता है। इससे मेटाडेटा ओवरहेड बढ़ता है और क्वेरी योजना और निष्पादन धीमा हो सकता है। इससे निपटने के लिए, कॉम्पैक्शन नामक प्रक्रिया का उपयोग किया जाता है जो सभी छोटी फ़ाइलों को कुछ बड़ी फ़ाइलों में जोड़ती है।

मैं Apache Iceberg पर ध्यान केंद्रित कर रहा हूँ क्योंकि यह बड़े पैमाने पर विश्लेषणात्मक डेटा के लिए अग्रणी खुले टेबल प्रारूपों में से एक के रूप में तेजी से बढ़ रहा है। महत्वपूर्ण बात यह है कि हालांकि Iceberg कॉम्पैक्शन का समर्थन करता है, यह हमारे लिए स्वचालित रूप से नहीं करता है। Iceberg rewrite_data_files प्रक्रिया प्रदान करता है, लेकिन हमें सिस्टम व्यवस्थापक के रूप में उस प्रक्रिया को निष्पादित करना होगा।

हम 50 मिलियन पंक्तियों वाली एक Iceberg तालिका बनाएंगे जो 1000 छोटी फ़ाइलों में फैली हुई है। जब तक हम कॉम्पैक्शन कमांड जारी नहीं करते, वे फ़ाइलें अछूती रहेंगी। हम पुनर्लेखन से पहले और बाद में तीन SQL वर्कलोड मापेंगे। सब कुछ स्थानीय रूप से चलता है; आपको क्लाउड खाते, Docker, Hadoop क्लस्टर या भुगतान सेवा की आवश्यकता नहीं होगी।