随机森林(Random Forest)方法是Leo Breiman于2001年提出的一种集成学习(Ensemble Learning)方法,它是传统决策树方法的扩展,将多个决策树进行组合,来提高预测精度。随机森林利用分类回归树(CART)作为其基本组成单元,也可称之为基学习器或是子模型。CART在之前的文章中我们已经介绍过,就不再详细说明了。而集成学习的思路是试图通过连续调用单个学习算法,获得不同的学习器,然后根据规则组合这些学习器来解决同一个问题,可以显著的提高学习系统的泛化能力。组合多个学习器主要采用加权平均或投票的方法。常见的集成学习算法还包括了装袋算法(Bagging)和提升算法(Boosting)。
1. 随机森林计算步骤
- 从原始训练样本中随机有放回抽出N个样本;
- 从解释变量中随机抽出M个变量;
- 依据上述得到的子集实施CART方法(无需剪枝),从而形成一个单独的决策树;
- 重复上面步骤X次,就构建了有X棵树的随机森林模型。
- 在对新数据进行预测分类时,由X棵树分别预测,以投票方式综合最终结果。

