知识卡片

缩减机制与训练轮数的权衡

专业/工作 · 279

内容

缩减(shrinkage)给每轮新加入的子模型乘一个小于1的系数(类似学习率),让模型每次只沿梯度方向走一小步而非一步到位。这个设计背后的权衡是:步长越小,模型越不容易被某一轮的噪声带偏(泛化能力更好),但需要更多轮数才能收敛,训练时间随之上升。实践中较优策略不是直接调大学习率省时间,而是选一个较小的学习率,再靠早停(根据验证集表现提前结束训练)去控制实际轮数——用”训练时间预算”换”泛化能力”,而不是反过来。这个思路后来也是DART、集成学习里”降低单个组件影响力”的通用套路。

参考来源

《深入理解XGBoost:高效机器学习算法与进阶》第5章《XGBoost原理与理论证明》