知识卡片
LDA主题数的选择依据困惑度而非拍脑袋
内容
LDA主题模型把每篇文档看作若干潜在主题的混合、每个主题又是若干词的概率分布,通过贝叶斯生成过程反推出隐藏的主题结构。这个模型最容易被误用的地方是主题数K的设定——K太小则主题粗糙笼统,太大则支离破碎。作者布莱给出的客观办法是用困惑度(perplexity)评估:困惑度越低说明模型对新数据的泛化能力越强,据此在多个候选K之间做横向比较来定夺,而不是凭经验或美观程度决定K的取值。
参考来源
《科学知识图谱:工具、方法与应用》第6章《6.1 NLP理论方法》