知识卡片
列采样比行采样更防过拟合
内容
XGBoost同时支持行采样(有放回地抽样本子集训练每棵树)和列采样(借鉴随机森林,只用部分特征子集训练),实践经验显示列采样在防止过拟合上比行采样更有效。直觉上的原因是:行采样只是改变了每棵树看到的样本组合,但如果某个特征本身信息量极强,几乎每次采样出的子集都会优先选它作为分裂特征,各棵树之间的相关性依然很高;而列采样直接切断了某些树接触强特征的机会,强迫模型在缺少”最优解”的情况下寻找次优但仍然有效的特征组合,从根本上降低了树与树之间的相关性,使集成的方差降低效果更明显。这提示:想通过”随机扰动”降低集成模型的方差时,扰动”能看到什么”(特征空间)通常比扰动”看多少样本”更有效。
参考来源
《深入理解XGBoost:高效机器学习算法与进阶》第5章《XGBoost原理与理论证明》