知识卡片
决策树、不纯度与信息增益
内容
决策树用一连串”是否满足某条件”的分支来解决分类(分类树)或数值预测(回归树)问题,好处是即使数据有缺失也能处理、数值型和分类型数据都能兼容,而且判断依据能被可视化,不像神经网络那样是个黑箱。构建决策树的核心追求是”用尽量少、尽量浅的分支达到整齐的分类效果”,用来衡量分支好坏的指标是不纯度(衡量一个节点里混杂了多少种不同类别,全是同一类则不纯度为0,掺杂越多不纯度越高,常用熵或基尼不纯度计算)和信息增益(分支前后不纯度下降了多少,下降越多说明这次分支划分得越”干净”)。构建过程本质是贪心地不断寻找信息增益最大的分支条件,逐层让每个节点内部的数据变得更纯,这也是它容易被理解和解释的原因——每一步分支的选择标准都是明确、可回溯的。
参考来源
《图解数据科学》第5章《需要了解的有关人工智能的知识》