HeadlinesBriefing favicon HeadlinesBriefing.com

Random Forest: случайность ломает бэггинг

Towards Data Science •
×

Название Random Forest намекает на второй слой случайности, выходящий за рамки простого бэггинга. В то время как бэггинг усредняет множество деревьев для снижения дисперсии, дизайн Бреймана 2001 года добавляет подвыборку признаков при каждом разделении, ограничивая каждое дерево случайным подмножеством признаков. Эта дополнительная случайность нацелена на коррелированные ошибки между деревьями, которые простое усреднение не может полностью устранить. Статья объясняет, что корреляция между предсказаниями деревьев создает потолок для производительности бэггинга, а подвыборка признаков математически пробивает этот барьер. За счет снижения корреляции дерево-к-дереву Random Forest достигает более низкой общей дисперсии и лучшей предсказательной способности. Статья пересматривает разложение смещение-дисперсия, подчеркивая, что бэггинг снижает дисперсию, но не смещение, и подчеркивает, почему случайный выбор признаков в Random Forest необходим для оптимальной производительности ансамбля.

Математическое ядро показывает, как коррелированные ошибки ограничивают снижение дисперсии бэггингом, а эксперимент подтверждает, что подвыборка признаков действительно снижает корреляцию, что ведет к улучшению точности модели. Это понимание раскрывает Random Forest как элегантное решение конкретной проблемы: коррелированных ошибок, которые усреднение не может полностью решить.