HeadlinesBriefing favicon HeadlinesBriefing.com

Random Forest: Aleatoriedade Quebra o Bagging

Towards Data Science •
×

O nome Random Forest sugere uma segunda camada de aleatoriedade além do simples bagging. Enquanto o bagging faz a média de muitas árvores para reduzir a variância, o design de Breiman de 2001 adiciona subamostragem de features em cada divisão, limitando cada árvore a um subconjunto aleatório de features. Essa aleatoriedade extra visa erros correlacionados entre as árvores, que a média sozinha não pode eliminar completamente. O artigo explica que a correlação entre as previsões das árvores cria um teto para o desempenho do bagging, e a subamostragem de features quebra matematicamente essa barreira. Ao reduzir a correlação árvore a árvore, o Random Forest alcança uma variância geral menor e melhor poder preditivo. O artigo revisita a decomposição viés-variância, enfatizando que o bagging reduz a variância mas não o viés, e destaca por que a seleção aleatória de features do Random Forest é essencial para o desempenho ideal do ensemble.

O núcleo matemático mostra como erros correlacionados limitam a redução de variância do bagging, e o experimento valida que a subamostragem de features de fato reduz a correlação, levando a uma melhor precisão do modelo. Essa percepção revela o Random Forest como uma solução elegante para um problema específico: erros correlacionados que a média não pode abordar completamente.