知识卡片

K折交叉验证的K值权衡

专业/工作 · 289.a

内容

K折交叉验证里K的取值不是越大越好:K取到样本总数(留一法)时,每次几乎用了全部数据训练,对平均预测误差的估计偏差最小,但K个训练集彼此高度相似导致估计方差大,且要训练和样本数一样多的模型,计算成本极高;K取小(如2)时估计方差小、计算量小,但训练集只有一半数据,与真实情况差异较大,导致偏差变高。这三者(偏差、方差、计算成本)不可能同时最优,工程上常取K=5作为一个经验上兼顾三者的折中点。这提示一个更通用的判断框架:任何”重复采样估计误差”的方法背后都有偏差/方差/成本三角,调整采样规模前先想清楚自己愿意牺牲哪一个。

参考来源

《深入理解XGBoost:高效机器学习算法与进阶》第8章《模型选择与优化》