知识卡片

SHAP把Shapley值转化为线性可加分解

普通读书笔记卡 · 1070.k

内容

SHAP把每个样本预测值分解成”基线值(所有样本预测均值)+ 各特征SHAP值之和”的线性可加公式,某特征SHAP值为正说明把预测值往上推,为负则往下拉。这解决了[[Shapley值合作博弈里的公平贡献分配]]原本计算量随特征数指数增长、难落地的问题(树模型有高效算法TreeExplainer),让黑盒模型的单次预测能拆解成每个特征清晰可读的贡献量。

参考来源

- 位置:《数据科学工程实践》第11章《机器学习模型可解释性》"11.3.1 黑盒模型解释方法·Shapley"一节(源文件:_epub-src/OEBPS/Text/part0063.xhtml) - 结论依据:原文给出SHAP公式"yi = ybase + f(xi1) + f(xi2) + … + f(xij)",明确"该方法有效解决了Shapley值计算效率低的问题,提出了基于核及基于树模型的替代方法……创新之处在于将Shapley值表示为一种附加特征归因方法,即线性模型",并说明"当f(xij)>0时……起到正向作用;当f(xij)<0时……起到反向作用"。 - 原始内容:伦德伯格于2016年基于Shapley值提出了可用于解释个体预测的SHAP方法。该方法有效解决了Shapley值计算效率低的问题……SHAP的目标是通过计算每个特征在预测过程中的贡献量……它的创新之处在于将Shapley值表示为一种附加特征归因方法,即线性模型……yi = ybase + f(xi1) + f(xi2) + … + f(xij)……当f(xij)>0时,说明该特征提升了预测值,起到正向作用;当f(xij)<0时,说明该特征降低了预测值,起到反向作用。