HeadlinesBriefing favicon HeadlinesBriefing.com

Random Forest: Keacakan Memecahkan Bagging

Towards Data Science •
×

Nama Random Forest mengisyaratkan lapisan kedua keacakan di luar bagging sederhana. Sementara bagging merata-ratakan banyak pohon untuk mengurangi varians, desain Breiman tahun 2001 menambahkan sub-sampling fitur pada setiap split, membatasi setiap pohon ke subset fitur acak. Keacakan tambahan ini menargetkan error terkorelasi antar pohon, yang rata-rata saja tidak dapat sepenuhnya hilangkan. Artikel menjelaskan bahwa korelasi antar prediksi pohon menciptakan batas atas performa bagging, dan sub-sampling fitur secara matematis menerobos batas ini. Dengan mengurangi korelasi pohon-ke-pohon, Random Forest mencapai varians keseluruhan lebih rendah dan daya prediksi lebih baik. Artikel meninjau kembali dekomposisi bias-varians, menekankan bahwa bagging mengurangi varians tetapi tidak bias, dan menekankan mengapa pemilihan fitur acak Random Forest esensial untuk performa ensemble optimal.

Inti matematis menunjukkan bagaimana error terkorelasi membatasi pengurangan varians bagging, dan eksperimen memvalidasi bahwa sub-sampling fitur benar-benar menurunkan korelasi, mengarah pada peningkatan akurasi model. Wawasan ini mengungkap Random Forest sebagai solusi elegan untuk masalah spesifik: error terkorelasi yang rata-rata tidak sepenuhnya dapat atasi.