知识卡片

词的出现是成簇的,不是均匀撒在文档集里的

普通读书笔记卡 · 1225.f

内容

贝努里模型假设一个词在每篇文档中出现的概率独立且均匀,但真实语料并非如此——像”切尔诺贝利”这类专有名词常因讨论同一事件的文档挨在一起存放,在倒排列表里表现为一连串很小的文档间隔紧密聚集,而非均匀撒开。有偏贝努里模型和局部双曲模型正是为了捕捉这种偏斜而设计的:把编码的第一个”桶”设得更小(用间隔中位数而非平均数作参数),让聚集出现的小间隔被更经济编码。

参考来源

- 位置:第3章《索引》「有偏贝努里模型」小节(源文件:_chapter-text/ch03.txt) - 结论依据:原文用切尔诺贝利这一具体术语说明词汇会因主题或时间顺序成簇分布,并说明有偏贝努里模型用间隔中位数而非平均数作参数来捕捉这种偏斜,直接支持卡片论点。 - 原始内容:"实际的情况是,每个术语随机分布在文档集合的文档中,这一假设是不合理的。而且有些文档包含了一些特定单词,或者说单词成块或成簇(cluster)地分布在这些文档中……这些单词,例如,切尔诺贝利(Chernobyl)……值可以是每个倒排列表中的文档间隔大小的中位数(median)。"