知识卡片

数据挖掘算法按任务类型的分类谱系

普通读书笔记卡

内容

数据挖掘不是一种算法,而是解决不同问题的多类算法的统称,按要回答 的问题类型可以分成几个大类,每类内部又有多种具体实现可选。分类 算法回答”这个对象属于哪一类”(如k近邻算法:看一个样本在特征空间 里最相邻的k个样本大多属于哪一类,就判定它属于那一类;支持向量机: 在高维空间里找一个能把两类样本尽量分开、且间隔最大的分界面)。 聚类算法回答”这些对象能自然分成几群”,不需要预先知道类别标签(如 k-Means:把n个对象按属性分成k个组,让每组内部的误差平方和最小)。 关联性挖掘算法回答”哪些事物经常一起出现”(如Apriori算法:找出出现 频率超过阈值的项目组合,即”频繁项集”,是购物篮分析等场景的基础)。 预测算法回答”接下来会发生什么”,往往建立在分类/回归模型基础上对 未来做外推。降维算法和异常检测算法则分别解决”数据维度太高怎么 压缩”和”哪些数据点明显不正常”这两类支撑性问题。这套按任务类型 划分的谱系说明:面对一个具体的数据挖掘需求,第一步不是纠结该用 哪个具体算法,而是先想清楚这个需求本质上属于分类、聚类、关联、 预测里的哪一类问题,问题类型定了,可选算法的范围自然就收窄了。

参考来源

- 位置:《数据库原理(微课版)》第12章《大数据管理技术》12.2.2节"大 数据知识获取技术"(源文件:_epub-src/index_split_008.html) - 结论依据:原文明确"经典的数据挖掘算法包括以下几种:分类算法、 聚类算法、关联性挖掘算法、预测算法、降维算法和异常检测算法等 ……k-Means算法是一个聚类算法,把n个对象根据它们的属性分为k个 分割……目标是使各个群组内部的均方误差总和最小……Apriori算法是 一种较有影响力的挖掘布尔关联规则频繁项集的算法……所有支持度 大于最小支持度的项集称为频繁项集",因此可以推出数据挖掘算法按 任务类型分类的谱系结构。 - 原始内容:经典的数据挖掘算法包括以下几种:分类算法、聚类算法、 关联性挖掘算法、预测算法、降维算法和异常检测算法等。其中每类 算法又包括多种算法,例如分类算法包括贝叶斯分类算法、支持向量机、 BP神经网络、决策树和k近邻分类算法等。