知识卡片
训练集特征空间必须复用到测试集
内容
用TF-IDF这类方法把文本转成向量时,词表必须只从训练集构建一次,然后原封不动地套用到测试集上——不能让测试集重新统计自己的词表。原因是分类器学到的规律是基于训练集那一套坐标系的权重关系,如果测试集用了另一套坐标系,同一个位置的数字就不再代表同一个词,模型的判断直接失效。
参考来源
- 位置:《用户画像:方法论与工程化解决方案》第4章《标签数据开发》(源文件:_epub-src/OEBPS/text00057.html)
- 结论依据:原文围绕“该步骤中将上一步存储的结构化数据构建成一个TF-IDF词向量空间,空间中的词均来自该”给出定义、场景或处理方式,支撑卡片对“训练集特征空间必须复用到测试集”的概括。
- 原始内容:该步骤中将上一步存储的结构化数据构建成一个TF-IDF词向量空间,空间中的词均来自该训练集,各个词的权重矩阵也都一并保存下来。在建模的过程中需要注意将训练集的词向量空间坐标赋值给测试集,代码执行如下(文件tfidf_space.py):