知识卡片
深度聚类同步优化特征表示和聚类分配
内容
传统做法是先做特征提取/降维,再对提取出的特征跑一次K均值聚类,两步互不影响。基于[[自编码器把无监督表征学习拆成压缩与重建]]的深度嵌入聚类模型则先用自编码器预训练出初始特征、再用K均值给出初始聚类中心,之后把聚类质心也变成可训练的参数,和特征表示一起用反向传播同步优化——特征表示的调整会让聚类更容易分开,聚类信号反过来又引导特征往更利于分类的方向收敛,两者互相促进而不是割裂的两个阶段。
参考来源
- 位置:《数据科学工程实践》第12章《基于LSTM-Autoencoder的无监督聚类模型》"12.3.1 基于深度学习的聚类算法原理"一节(源文件:_epub-src/OEBPS/Text/part0068.xhtml)
- 结论依据:原文明确"SQLFlow不使用标记数据训练深度网络,而是从当前聚类划分中提取辅助目标分布,然后同步优化聚类和特征表示,因此这种基于深度神经网络的聚类在完成聚类分配的同时能够很好地完成特征表示",并说明模型先用K均值"初始化群集中心"再用聚类层"改善聚类分配和特征表示"。
- 原始内容:不同于有监督学习模型,SQLFlow不使用标记数据训练深度网络,而是从当前聚类划分中提取辅助目标分布,然后同步优化聚类和特征表示,因此这种基于深度神经网络的聚类在完成聚类分配的同时能够很好地完成特征表示……使用K均值聚类初始化群集中心……下一步是同时改善聚类分配和特征表示。