知识卡片

机器学习标签开发的标注-训练-预测流程

专业/工作 · 1207.b

内容

属于[[三类用户标签及工程占比]]中机器学习挖掘类的标签本质上都遵循同一套流程:先人工标注一批数据作为训练集,再让算法从标注好的数据中学习出能区分类别的规律生成分类器,最后把分类器应用到未标注的数据上产出预测结果。这个三段式框架比具体用什么算法更值得记住——遇到任何”给用户/内容打预测性标签”的需求,第一步永远是先想清楚训练集从哪来、标注质量如何保证,算法选型反而是相对次要的决策。

参考来源

- 位置:《用户画像:方法论与工程化解决方案》第4章《标签数据开发》(源文件:_epub-src/OEBPS/text00054.html) - 结论依据:原文围绕“机器学习以统计理论为基础,通过算法对已知的训练数据做统计分析从而获得规律,再运用规律”给出定义、场景或处理方式,支撑卡片对“机器学习标签开发的标注-训练-预测流程”的概括。 - 原始内容:机器学习以统计理论为基础,通过算法对已知的训练数据做统计分析从而获得规律,再运用规律对未知数据做预测。在文本分类问题上的基本思路是:标注——人工对一批文档进行准确分类,作为训练集样本;训练——计算机从标注好的文档集中挖掘出能够有效分类的规则,生成分类器;分类——将生成的分类器应用在待分类的文档集中...