知识卡片
数据偏差与算法偏差
内容
不是所有”用小样本推断大总体”的做法都同样可靠——关键要看这个变量本身在总体内部是否均质。测某所中学学生的身高来推算全国中学生平均身高相对靠谱,因为身高的地域、学校差异不大;但用同一所学校学生的交通费来推算全国平均交通费就会严重失真,因为不同地区、公立私立学校之间的通勤成本天差地别。这种因为数据收集者的偏见、想当然或抽样场景局限而系统性混入的误差叫数据偏差;当机器学习模型用带有这种偏差的数据训练出来,把结论用到与训练场景不同的人群或场景上(只学过男性数据的模型用来预测女性、只在实验室干净数据里学习过的模型被直接扔到嘈杂的商业一线),得到失真甚至荒谬的结果,这就是算法偏差。发散:这提示评估一份训练数据”够不够”的第一个问题不该是”数据量大不大”,而应该是”这批数据覆盖的场景,和模型将来要用在的场景是不是同一回事”。
参考来源
《图解数据科学》第6章《有关安全与隐私的问题》