知识卡片

SVD降维+K均值聚类的组合套路

普通读书笔记卡 · 1064.d

内容

直接对高维原始时间序列(如51周的商品销量)做聚类容易被噪声和维度灾难干扰。常见做法是先用SVD把数据压缩到k个主方向,再计算每个样本和每个主方向的相关系数,把这组相关系数当作新的低维特征交给K均值聚类,最后还原到原始时间轴上观察每一类的平均曲线。这套”先分解降维、再对分解出的系数聚类”的组合,是矩阵分解类方法做行为规律挖掘的典型套路。

参考来源

- 位置:《数据科学工程实践》第5章《行为规律的发现与挖掘》"5.2 SVD聚类建模Python实战"一节(源文件:_epub-src/OEBPS/Text/part0028.xhtml) - 结论依据:原文明确实战流程包括"SVD分解、选取合适的特征数量、计算矩阵与原始数据的相关性、对求得的相关系数矩阵进行k均值聚类并对聚类结果进行解读",用信息比90%确定k值("设定信息比为90%,则k=5"),再对V矩阵与原始数据的相关系数做K均值聚类。 - 原始内容:本节将介绍基于SVD方法聚类建模的Python实战,包括以下几个部分:软件包安装、数据读取、数据清洗、SVD分解、选取合适的特征数量、计算矩阵与原始数据的相关性、对求得的相关系数矩阵进行k均值聚类并对聚类结果进行解读……SVD分解选取特征数量结果如图5-5所示,根据信息比选择合适的特征数量……设定信息比为90%,则k=5……根据原始数据与V向量的相关系数来做k均值聚类。