知识卡片
伪反向映射让不可微模型也能叠层
内容
深度神经网络能叠很多层,核心依赖反向传播——用链式法则把最终误差逐层往回传,前提是每一层都可微。GBDT这类树模型天然不可微,无法直接用同样方法搭出多层结构。mGBDT的解法很巧妙:不去为每一层求梯度,而是额外训练一个”伪反向”模型,去近似”如果输出已知,输入大概是什么样”这个反函数;有了这个反函数,就能把最终的真实标签一层层反推出每一中间层”应该长成什么样子”的伪标签,再让每一层各自用普通GBDT去拟合这个伪标签。这个思路把”端到端联合优化”这个难题,替换成了”每层独立监督学习”的一串子问题,对于任何不满足可微条件、但仍想叠加多层结构的模型,都是一个可以借鉴的绕行路线。
参考来源
《深入理解XGBoost:高效机器学习算法与进阶》第10章《基于树模型的其他研究与应用》