知识卡片

决策树模糊化换取端到端可微

专业/工作 · 292.a

内容

DEF想把树模型嵌进一个可以端到端反向传播优化的深度学习管道里,但树的分裂规则是硬性的”非左即右”,不可微,梯度传不过去。它的解法是把每个内部节点的判断从确定性开关换成一个用sigmoid表达的概率——样本以一定概率走左子节点、以一定概率走右子节点,只有落在切分阈值附近”模糊带”里的样本才会被明显地分给两边,绝大多数样本仍接近于原来的确定性路由。这样一来,最终预测值就变成了各叶子节点预测值按”落入概率”加权求和的连续函数,整个树重新变得可微,可以和外层的Embedding、神经网络层一起用梯度下降联合训练。这体现一个通用技巧:把一个离散、不可微的决策规则,替换成带有平滑参数的概率化版本,往往是把它接入梯度优化框架最直接的办法。

参考来源

《深入理解XGBoost:高效机器学习算法与进阶》第10章《基于树模型的其他研究与应用》