HeadlinesBriefing favicon HeadlinesBriefing.com

Iceberg কমপ্যাকশন: 1000 থেকে 6, প্রভাব

Towards Data Science •
×

যখন আপনি Apache Iceberg-এর মতো টেবিল ফরম্যাটে সংরক্ষিত বড় বিশ্লেষণাত্মক ডেটাসেট নিয়ে কাজ করেন, তখন একটি পরিচিত সমস্যা রয়েছে যাকে ছোট ফাইল সমস্যা বলা হয়। এটি ঘটে যখন ডেটা যুক্তিসঙ্গত আকারের কম সংখ্যক ফাইলের পরিবর্তে অনেক ছোট ফাইলে লেখা হয়। এটি মেটাডেটা ওভারহেড বাড়ায় এবং কোয়েরি পরিকল্পনা ও কার্যকরীকরণ ধীর করতে পারে। এটি মোকাবেলার জন্য, কমপ্যাকশন নামক একটি প্রক্রিয়া ব্যবহার করা হয় যা সমস্ত ছোট ফাইলকে অল্প সংখ্যক বড় ফাইলে একত্রিত করে।

আমি Apache Iceberg-এর উপর মনোযোগ দিচ্ছি কারণ এটি বড় আকারের বিশ্লেষণাত্মক ডেটার জন্য শীর্ষস্থানীয় ওপেন টেবিল ফরম্যাটগুলির মধ্যে একটি হিসাবে দ্রুত বৃদ্ধি পাচ্ছে। গুরুত্বপূর্ণভাবে, যদিও Iceberg কমপ্যাকশন সমর্থন করে, এটি আমাদের জন্য স্বয়ংক্রিয়ভাবে করে না। Iceberg rewrite_data_files প্রক্রিয়া সরবরাহ করে তবে আমাদের সিস্টেম অ্যাডমিনিস্ট্রেটর হিসাবে সেই প্রক্রিয়াটি কার্যকর করতে হবে।

আমরা একটি Iceberg টেবিল তৈরি করব যাতে 50 মিলিয়ন সারি 1000 ছোট ফাইলে ছড়িয়ে থাকে। আমরা কমপ্যাকশন কমান্ড না দেওয়া পর্যন্ত সেই ফাইলগুলি অপরিবর্তিত থাকবে। আমরা পুনর্লিখনের আগে এবং পরে তিনটি SQL ওয়ার্কলোড পরিমাপ করব। সবকিছু স্থানীয়ভাবে চলে; আপনার ক্লাউড অ্যাকাউন্ট, Docker, Hadoop ক্লাস্টার বা অর্থপ্রদানকারী পরিষেবার প্রয়োজন হবে না।