知识卡片

聚类分析的本质是相似度定义的选择

普通读书笔记卡 · 1071

内容

聚类分析把一组对象按”相似性”分组,但”相似”本身没有唯一定义——闵可夫斯基距离(连续变量,p=2时即欧氏距离)、杰卡德系数(分类变量,衡量集合交并比)、余弦相似度(衡量向量夹角,常用于文本/高维稀疏数据)适用于不同的数据类型和场景。选错距离度量,聚类算法即使跑得再对也会得到没有业务意义的分组,所以聚类本质上不是一个自动化任务,而是需要结合数据特点反复尝试的迭代过程。

参考来源

- 位置:《数据科学工程实践》第12章《基于LSTM-Autoencoder的无监督聚类模型》"12.1 聚类分析的广泛应用"一节(源文件:_epub-src/OEBPS/Text/part0066.xhtml) - 结论依据:原文列出三种距离测量公式:"闵可夫斯基距离,用于连续型数据……当p=2时,为欧氏距离"、"杰卡德系数,用于分类数据"、"余弦相似度,一般用于测量两个向量夹脚的余弦值",并明确"聚类分析不是一个自动化的任务,而是知识的发现、尝试和交互的过程,是多目标优化的迭代过程"。 - 原始内容:常见的距离测量公式有以下3种。1)闵可夫斯基距离,用于连续型数据……当p=2时,为欧氏距离……2)杰卡德系数,用于分类数据……3)余弦相似度,一般用于测量两个向量夹脚的余弦值,以此度量向量之间的相似性……数据集和聚类的目的决定了我们对于距离函数、预期簇类个数以及聚类算法的选择,因此聚类分析不是一个自动化的任务,而是知识的发现、尝试和交互的过程,是多目标优化的迭代过程。