知识卡片
K均值聚类需要预先指定K值
内容
K均值聚类通过反复”分配最近质心→重算质心”迭代,让每个点到所属簇质心的距离平方和最小,运算高效、结果易理解。但它有两个明显短板:一是必须提前指定簇数K,K选不好聚类质量就差,通常靠手肘法或轮廓图来辅助挑选;二是对异常点比较敏感,实践中往往需要先做标准化和去除离群值再聚类。
参考来源
- 位置:《数据科学工程实践》第12章《基于LSTM-Autoencoder的无监督聚类模型》"12.2.1 K均值聚类"一节(源文件:_epub-src/OEBPS/Text/part0067.xhtml)
- 结论依据:原文明确K均值"运算效率很高,适用于各种问题,运算结果也便于理解。但是K均值聚类也有明显的缺点,它需要提前指定K值作为群集个数,如果K值选得不好,会导致聚类效果不佳。通常我们可以通过手肘法和轮廓图选出最优K值……此外,K均值对于数据异常点比较敏感,因此往往需要通过对数据进行标准化和去除异常点进行降噪"。
- 原始内容:K均值聚类的运算效率很高,适用于各种问题,运算结果也便于理解。但是K均值聚类也有明显的缺点,它需要提前指定K值作为群集个数,如果K值选得不好,会导致聚类效果不佳。通常我们可以通过手肘法和轮廓图选出最优K值并评估聚类效果……此外,K均值对于数据异常点比较敏感,因此往往需要通过对数据进行标准化和去除异常点进行降噪。