本文研究部分可观测马尔可夫决策过程下的非对称演员-评论家方法,即训练阶段可利用环境真实状态等额外信息、执行阶段仅依赖观测历史的学习框架。作者指出,仅以状态为条件的评论家定义不完整,会导致策略梯度有偏;而同时以状态和历史为条件的历史-状态评论家虽能恢复无偏性,却需额外引入一个循环网络来近似历史。论文提出“记忆-状态评论家”:直接以策略自身的内部记忆(即策略据以选动作的历史表示)与状态共同作为评论家输入,证明其定义完备且策略梯度无偏,从而省去第二个循环近似器,并且无需将评论家损失反传进该记忆,即便记忆是历史的有损编码。作者在双四旋翼视觉追逃环境中验证,追捕者为学习智能体,逃逸者每回合从固定启发式行为池中采样。结果显示,记忆-状态评论家优于历史-状态评论家且收敛更快;相比仅用状态的评论家,它保持无偏并略占优势,在演员历史含有特权状态所不具备信息的墙壁场景中尤为明显。
| 部分可观测马尔可夫决策过程 | 一种决策过程,其中智能体无法完全观测到环境状态,只能获得部分观测信息。 |
| 非对称演员-评论家 | 一种强化学习框架,其中演员和评论家使用不同的信息,评论家在训练时可以利用额外的状态信息。 |
| 记忆状态评论家 | 本文提出的方法,评论家以环境状态和策略的内部记忆为条件,提供无偏的策略梯度。 |
| 策略梯度 | 一种强化学习方法,通过计算策略参数的梯度来直接优化策略,以最大化期望回报。 |
| 基于视觉的追逃 | 一种多智能体任务,其中追捕者使用视觉观测来追捕逃避者,通常用于测试强化学习算法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅