知识卡片
数据预处理四步流程解决"脏数据无法直接挖掘"的问题
内容
现实中采集到的数据大多是”脏”的——不完整(有缺失值)、不一致(多 来源数据存在矛盾)——直接拿去做数据挖掘要么根本跑不动,要么挖出 的结果质量很差,因此数据挖掘之前必须先经过一套标准化的预处理流程, 这个流程本身按处理目标不同拆成四个环节。数据清洗解决数据本身的 质量问题:填补缺失值(可以删除有缺失的样本、人工填、用均值填等 多种策略)、识别并处理离群点(数据集中明显偏离整体模式的对象, 不同于”噪声数据”——后者是测量误差导致的错误值,两者需要用不同 方法分别处理)。数据集成解决多来源数据合并的问题:把多个数据源 的数据拼到一起后,往往会产生新的冗余,因此集成之后通常还要再做 一轮清理去除这层冗余。数据规约解决数据规模的问题:在尽量保持数据 完整性的前提下压缩数据集规模(如降维、数值规约、压缩),让后续 分析在更小的数据集上进行、效率更高。数据转换解决数据形式的问题: 把数据转换成更适合挖掘算法处理的形式(如规范化数值范围、把连续 值离散化)。这四个环节有明确的先后依赖关系(先清洗保证质量,再 集成合并来源,再规约压缩规模,最后转换适配算法),而不是可以任意 顺序执行的并列步骤。
结构图:
flowchart LR
A[原始脏数据<br/>不完整/不一致] --> B[数据清洗<br/>填缺失值/去离群点噪声]
B --> C[数据集成<br/>合并多来源, 消除新增冗余]
C --> D[数据规约<br/>压缩规模保持完整性]
D --> E[数据转换<br/>规范化/离散化适配挖掘算法]
E --> F[可用于数据挖掘的干净数据]
参考来源
- 位置:《数据库原理(微课版)》第12章《大数据管理技术》12.2.2节"大
数据的关键技术"数据预处理技术部分(源文件:_epub-src/index_split_008.html)
- 结论依据:原文明确"由于现实世界中数据大体上是不完整、不一致的
'脏'数据,无法直接进行数据挖掘,或挖掘结果差……目前存在4种主流
的数据预处理技术,分别为数据清洗、数据集成、数据规约和数据转换,
这也是数据预处理的大致流程",因此可以推出四步流程各自解决的问题
及其先后依赖关系。
- 原始内容:由于现实世界中数据大体上是不完整、不一致的"脏"数据,
无法直接进行数据挖掘,或挖掘结果差……目前存在4种主流的数据预
处理技术,分别为数据清洗、数据集成、数据规约和数据转换,这也是
数据预处理的大致流程。