知识卡片

预测性分析的算法监狱风险与偏见反馈循环

普通读书笔记卡

内容

用数据分析预测天气或疾病传播是一回事,用来预测一个罪犯是否会再犯、一个贷款申请人是否会违约,是另一回事——后者直接影响个人生活。支付网络防欺诈、银行避免不良贷款、公司避免雇佣不可信员工,各自的诉求都是”失去商机的成本低、犯错的成本高”,所以自然倾向于”存疑就拒绝”;但随着算法决策越来越普遍,被算法(无论对错)标记为有风险的人,可能系统性地被排除在工作、航旅、保险、租房、金融服务这些社会关键领域之外,且几乎没有申诉机会——这种对个体自由的严重约束被称为”算法监狱”,与刑事司法系统惯常的无罪推定原则形成鲜明对比。算法本身不必然比人类更好或更差——人有偏见、歧视性做法也可能已被文化制度化——但预测性分析系统学到的模式是黑盒,如果算法输入本身存在系统性偏见,输出很可能会学习并放大这种偏见:反歧视法禁止按种族性别等受保护特征区分对待,但邮政编码、IP地址这类”允许使用”的特征本身可能与种族高度相关(”机器学习处理偏差的方式就像洗钱处理黑钱”这句讽刺正指向这一点)。更危险的是自我强化的反馈循环:信用分不错的员工因意外陷入财务困境、账单逾期拖累信用分、找工作更难、更加贫困、信用分进一步恶化——这种”数据与数学严谨性伪装下的恶性循环”很难被预先预测,只有通过系统思维(把计算机化部分和与之互动的人当作一个整体来理解)才能识别系统是在放大差距还是在对抗不公。

参考来源

- 位置:《数据密集型应用系统设计》第十二章《数据系统的未来》"预测性分析""偏见与歧视""反馈循环"(源文件:_epub-src/ch12_split_003.html) - 结论依据:原文说明算法决策的"存疑说不"倾向导致算法监狱式的社会排斥,指出算法可能学习并放大数据中的系统性偏见(如邮政编码与种族关联),并用信用分-失业-更差信用分的例子说明自我强化的反馈循环,直接支撑本卡片结论。 - 原始内容:被某种算法标记为有风险的某人可能会遭受大量这种"No"的决定……如果算法的输入中存在系统性的偏见,则系统很有可能会在输出中学习并放大这种偏见……由于不能按期付账单,你的信用分会受到影响,进而导致找到工作更为困难。