知识卡片

随机森林、集成学习与提升方法

专业/工作 · 915.m

内容

单棵[[决策树不纯度与信息增益|决策树]]准确率不高时,一个反直觉但有效的思路是:训练一大堆决策树,靠多数表决(分类)或求平均(预测)来得出最终结果,即随机森林——即使每棵树本身都不算精准,只要它们的错误方向足够分散,投票结果整体上反而能变得均衡准确,这是”集成学习”(组合多个模型来获得比单个模型更好的效果)的一种。集成的具体做法有两条路线:引导聚集算法(bagging)从原始数据里随机抽取多份子样本,各自独立训练出并列的多棵树,因为彼此独立所以能并行计算,随机森林正是引导聚集算法与决策树的结合;提升方法(boosting)则反过来,让每一棵新树专门针对前面树的预测误差进行修正,一棵接一棵串行改进,虽然不能并行、更耗时,但往往能拿到更高的精度。选哪条路线本质是在”训练速度”和”精度上限”之间做取舍。

参考来源

《图解数据科学》第5章《需要了解的有关人工智能的知识》