知识卡片
聚类与k均值算法
内容
聚类是把相似的数据自动归入同一组(簇)的[[机器学习的三种范式|无监督学习]]方法,分两大类:非层次聚类直接把数据划成固定数量的组,层次聚类则不预设组数、逐步合并出一个层级结构。k均值算法是最常用的非层次聚类方法,运作方式很直白:先随机给每个数据点分配一个初始簇编号,算出各簇的重心(平均值);然后让每个点重新选择离自己最近的重心所属的簇;用新的分组再算一次重心;如此反复,直到所有点的簇归属不再变化为止。这个方法的前提是必须先知道要分成几个簇(k值),而且如果原始数据分布本身就不均衡,效果可能不理想(改进版是k-means++法)。它的核心机制其实很简单——不断在”按当前重心重新分组”和”按当前分组重新算重心”之间来回迭代,直到收敛,本质是一种反复逼近的自组织过程。
参考来源
《图解数据科学》第5章《需要了解的有关人工智能的知识》