知识卡片
机器学习三层级:按人为干预程度区分
内容
机器学习方法可以按需要多少人为干预来分层:模仿学习里人类直接演示任务步骤,机器只是原样记录并重放,几乎不承担独立判断的责任(如电子表格的宏录制);监督训练里人类给出一批”输入-正确答案”的示例(训练集),机器要自己从这些示例里归纳出一条能推广到新案例的规律(学习识别笔迹、区分垃圾邮件);强化学习里人类连正确答案都不直接给出,机器只能通过反复试验、依据成功或失败的结果自己摸索出规律(下棋、玩游戏这类胜负容易判定的场景最适合)。三者对人为干预的依赖依次递减,机器需要自主承担的判断责任依次递增。发散:这三层的核心区别在于”谁来提供反馈信号,以及反馈的粒度有多细”——模仿学习的反馈是逐步骤的完整示范,监督训练的反馈是逐案例的对错标注,强化学习的反馈往往只有一个滞后的、笼统的成败信号(赢了还是输了整盘棋),反馈信号越稀疏、越滞后,机器自己需要完成的归纳和试探工作量就越大,这也是强化学习通常比监督学习更难训练、需要更多样本的根本原因。
参考来源
《计算机科学概论》第11章《人工智能》