知识卡片
向量空间模型:比的是方向,不是距离
内容
把文档和查询表示成n维向量,最直接的相似度算法是算内积,但长文档天然占便宜——包含的词越多各维越可能非零,内积自然更大;改用欧氏距离又会反过来惩罚长文档。向量空间模型换一个度量对象:不比向量长度,只比方向——用夹角余弦衡量相似度,方向一致余弦值为1,正交为0。这数学上等价于先归一化再求内积,但概念上把”讨论了多少查询词”重新定义成”讨论查询词的比重”,天然消除文档长度这个混杂因素。
参考来源
- 位置:第4章《查询》「向量空间模型」小节(源文件:_chapter-text/ch04.txt)
- 结论依据:原文明确说明向量空间模型关心的是两向量方向上的差异(夹角)而非向量长度,并给出余弦相似度公式,直接支持卡片论点。
- 原始内容:"我们正在感兴趣的是二向量的方向,或者更精确地说,是二向量的在方向上的差异,而不考虑向量的长度……这就是向量间夹角……相似度度量转换为文档向量和查询向量的夹角余弦后,余弦值越大,相似度越高。"