知识卡片

决策树不纯度指标的选择逻辑

普通读书笔记卡 · 1063.c

内容

决策树通过不断寻找能让子结点”更纯”(同一类别样本占比更高)的特征来分裂数据,不纯度的度量方式决定了具体算法:ID3用信息增益,但天然偏向取值较多的特征;C4.5用信息增益比修正这个偏差;CART用基尼指数并只生成二叉树。三种指标本质上都在衡量同一件事——分裂前后类别分布的混乱程度下降了多少,区别只在数学形式和对特征取值个数的敏感度。

参考来源

- 位置:《数据科学工程实践》第4章《使用体系化分析方法进行场景挖掘》"4.2.2 可解释模型——决策树"一节(源文件:_epub-src/OEBPS/Text/part0023.xhtml) - 结论依据:原文明确"ID3采用信息增益作为选择最优属性的分裂方法……使用信息增益选择特征进行数据分割时容易偏向水平较多的特征,为了解决这个问题,我们引入了信息增益比与C4.5算法",以及"CART树是一个二叉树,采用基尼系数作为最优的属性分裂方法"。 - 原始内容:ID3采用信息增益作为选择最优属性的分裂方法……从ID3的使用信息增益指标可以发现,这里有一个比较棘手的问题,就是使用信息增益选择特征进行数据分割时容易偏向水平较多的特征,为了解决这个问题,我们引入了信息增益比与C4.5算法。C4.5算法采用信息增益比作为选择最优的属性分裂方法……CART树是一个二叉树,采用基尼系数作为最优的属性分裂方法。