HeadlinesBriefing favicon HeadlinesBriefing.com

Random Forest: La aleatoriedad rompe el Bagging

Towards Data Science •
×

El nombre de Random Forest sugiere una segunda capa de aleatoriedad más allá del simple bagging. Mientras que el bagging promedia muchos árboles para reducir la varianza, el diseño de Breiman de 2001 añade submuestreo de características en cada división, limitando cada árbol a un subconjunto aleatorio de características. Esta aleatoriedad adicional se dirige a los errores correlacionados entre árboles, que el promedio por sí solo no puede eliminar completamente. El artículo explica que la correlación entre las predicciones de los árboles crea un techo para el rendimiento del bagging, y el submuestreo de características rompe matemáticamente esta barrera. Al reducir la correlación árbol a árbol, Random Forest logra una varianza general menor y un mejor poder predictivo. El artículo revisa la descomposición sesgo-varianza, enfatizando que el bagging reduce la varianza pero no el sesgo, y subraya por qué la selección aleatoria de características de Random Forest es esencial para un rendimiento óptimo del ensamble.

El núcleo matemático muestra cómo los errores correlacionados limitan la reducción de varianza del bagging, y el experimento valida que el submuestreo de características efectivamente reduce la correlación, conduciendo a una mayor precisión del modelo. Esta revelación muestra a Random Forest como una solución elegante a un problema específico: errores correlacionados que el promedio no puede abordar completamente.