知识卡片

辅助目标分布强化聚类置信度

普通读书笔记卡 · 1071.f

内容

[[深度聚类同步优化特征表示和聚类分配]]不会直接用聚类概率q去训练自己,而是构造一个基于q计算出的辅助目标分布p(对每个样本的相似度做平方再归一化),让模型去拟合p和q之间的KL散度。这个平方操作会放大那些”已经比较自信”的分配、抑制模糊不清的分配,效果是聚类结果逐渐变得更纯,防止某个大簇因为占比高就吸走所有摇摆样本、扭曲整体的特征空间。

参考来源

- 位置:《数据科学工程实践》第12章《基于LSTM-Autoencoder的无监督聚类模型》"12.3.1 基于深度学习的聚类算法原理·训练神经网络聚类模型"一节(源文件:_epub-src/OEBPS/Text/part0068.xhtml) - 结论依据:原文给出辅助目标分布计算公式"weight = q ** 2 / q.sum(0)",并明确"我们希望目标分布能够加强预测性能,即提高簇纯度,更加注重以高可信度分配的数据点,防止大型群集扭曲隐藏的特征空间。……模型可以从高可信度分配中学习迭代优化聚类",训练目标是"针对模型聚类的结果最小化KL离散度"。 - 原始内容:为此,我们定义基于质心的目标概率分布,并针对模型聚类的结果最小化KL离散度。我们希望目标分布能够加强预测性能,即提高簇纯度,更加注重以高可信度分配的数据点,防止大型群集扭曲隐藏的特征空间。……def target_distribution(q): weight = q ** 2 / q.sum(0); return (weight.T / weight.sum(1)).T……在辅助目标分布的帮助下,模型可以从高可信度分配中学习迭代优化聚类。