知识卡片
缩减机制与训练轮数的权衡
内容
缩减(shrinkage)给每轮新加入的子模型乘一个小于1的系数(类似学习率),让模型每次只沿梯度方向走一小步而非一步到位。这个设计背后的权衡是:步长越小,模型越不容易被某一轮的噪声带偏(泛化能力更好),但需要更多轮数才能收敛,训练时间随之上升。实践中较优策略不是直接调大学习率省时间,而是选一个较小的学习率,再靠早停(根据验证集表现提前结束训练)去控制实际轮数——用”训练时间预算”换”泛化能力”,而不是反过来。这个思路后来也是DART、集成学习里”降低单个组件影响力”的通用套路。
参考来源
《深入理解XGBoost:高效机器学习算法与进阶》第5章《XGBoost原理与理论证明》