知识卡片
DART是MART与随机森林间的过渡
内容
Boosting模型有个结构性缺陷:越早加入的树对最终预测的影响越大,越靠后的树只能修正很小一部分残差,导致模型对最初几棵树过度敏感,容易过拟合。DART借用深度学习dropout的思路,在训练每一轮新树之前,先随机丢弃已有模型中的一部分树,让新树去拟合”丢弃后模型”的负梯度,再对新树和被丢弃的树按比例重新标准化避免整体超调。丢弃概率为0时DART等价于普通MART,丢弃概率拉满(每次都丢光已有的树)时则等价于随机森林——同一个超参数,两端分别对应”完全累积依赖”和”完全独立重训”两种极端,DART本身是这两种范式之间连续可调的中间地带,这种”用一个概率参数连接两种经典范式”的设计手法本身值得记住。
参考来源
《深入理解XGBoost:高效机器学习算法与进阶》第5章《XGBoost原理与理论证明》