知识卡片
相关性反馈:把用户的取舍读回查询向量本身
内容
相关性反馈把用户标记”这些是我要的”“这些不是”的动作,直接转化成对查询向量的数值调整:新查询向量=旧查询向量+被标记相关文档向量-被标记无关文档向量,让查询向量向”相关文档聚集的方向”挪动一步,而非要求用户重新想出更精确的关键词。评价陷阱是直接在同批文档重新计算精确率必然虚高,公平评价需剔除用户已判断过的文档再评分。经验规律是第一轮反馈带来显著提升,此后每多一轮边际收益迅速衰减。
参考来源
- 位置:第4章《查询》「相关性反馈」小节(源文件:_chapter-text/ch04.txt)
- 结论依据:原文明确说明相关反馈根据用户选中/未选文档调整rank,且指出直接在同批文档重新评价会导致精确率虚高,需要排除已判断文档,直接支持卡片论点。
- 原始内容:"检索引擎周期性,或者甚至在用户操作之后就将重新评价rank,将那些和用户选中文档相似的文档提高rank;而和用户未选文档相似的文档则降低rank……相关性反馈技术的评价是很复杂的,这是因为在修订的rank中,精确率必将会变高……一般假定那些已经被用户判定过的文档不应该在第2次评价中出现。"