知识卡片

强化学习价值函数转化为监督学习

专业/工作 · 293

内容

最基础的Q-learning把每个”状态-动作”对的价值存成一张表格,逐格更新——这要求状态和动作空间足够小、能穷举,而且必须能实时和环境交互获得反馈。但很多实际业务场景(比如基于历史交易数据做营销决策)既没有小到能枚举的状态空间,也没法在线试错。解法是把这张表格换成一个函数:让价值Q变成”状态、动作 → 价值”的一个映射函数,这样问题就从”填表格”转化成了一个标准的监督学习回归问题——用历史积累的(状态、动作、奖励)序列做训练数据,用任意成熟的回归模型(树模型、SVM、神经网络)去拟合这个价值函数。这个转化的意义在于:强化学习中很多”在线试错学表格”的限制,一旦把问题重新表述成监督学习,就能直接复用整套成熟的批量训练基础设施和模型选择方法。

参考来源

《深入理解XGBoost:高效机器学习算法与进阶》第10章《基于树模型的其他研究与应用》