HeadlinesBriefing favicon HeadlinesBriefing.com

Kompresi Iceberg: 1000 ke 6, Dampak

Towards Data Science •
×

Saat menangani kumpulan data analitik besar yang disimpan dalam format tabel seperti Apache Iceberg, ada masalah yang dikenal sebagai masalah file kecil. Ini terjadi ketika data ditulis dalam banyak file kecil daripada jumlah file yang lebih sedikit dengan ukuran yang wajar. Ini meningkatkan overhead metadata dan dapat memperlambat perencanaan dan eksekusi kueri. Untuk mengatasinya, digunakan proses yang disebut kompresi yang menggabungkan semua file yang lebih kecil menjadi sejumlah kecil file yang lebih besar.

Saya fokus pada Apache Iceberg karena dengan cepat menjadi salah satu format tabel terbuka terkemuka untuk data analitik skala besar. Yang penting, meskipun Iceberg mendukung kompresi, ia tidak melakukannya secara otomatis untuk kita. Iceberg menyediakan prosedur rewrite_data_files tetapi kita sebagai administrator sistem masih harus menjalankan prosedur tersebut.

Kita akan membuat tabel Iceberg yang berisi 50 juta baris yang tersebar di 1000 file kecil. File-file tersebut akan tetap tidak tersentuh sampai kita mengeluarkan perintah kompresi. Kita akan mengukur tiga beban kerja SQL sebelum dan sesudah penulisan ulang. Semuanya berjalan secara lokal; Anda tidak memerlukan akun cloud, Docker, cluster Hadoop, atau layanan berbayar.