🔥 今日值得一读 评论家只看策略记忆就够了!无需历史模型,追逃任务收敛更快、性能反超
Memory-State Critic for Asymmetric Actor-Critic with Application to Vision-Based Pursuit-Evasion
arXiv LG (cs.LG) 🔥 重点 #强化学习#Actor-Critic#部分可观测 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
训练时可用真实状态辅助评论家,执行时仅需观测历史,适合机器人视觉追逃等POMDP任务。

📖 AI 总结

本文研究部分可观测马尔可夫决策过程下的非对称演员-评论家方法,即训练阶段可利用环境真实状态等额外信息、执行阶段仅依赖观测历史的学习框架。作者指出,仅以状态为条件的评论家定义不完整,会导致策略梯度有偏;而同时以状态和历史为条件的历史-状态评论家虽能恢复无偏性,却需额外引入一个循环网络来近似历史。论文提出“记忆-状态评论家”:直接以策略自身的内部记忆(即策略据以选动作的历史表示)与状态共同作为评论家输入,证明其定义完备且策略梯度无偏,从而省去第二个循环近似器,并且无需将评论家损失反传进该记忆,即便记忆是历史的有损编码。作者在双四旋翼视觉追逃环境中验证,追捕者为学习智能体,逃逸者每回合从固定启发式行为池中采样。结果显示,记忆-状态评论家优于历史-状态评论家且收敛更快;相比仅用状态的评论家,它保持无偏并略占优势,在演员历史含有特权状态所不具备信息的墙壁场景中尤为明显。

🔑 关键词速览

部分可观测马尔可夫决策过程一种决策过程,其中智能体无法完全观测到环境状态,只能获得部分观测信息。
非对称演员-评论家一种强化学习框架,其中演员和评论家使用不同的信息,评论家在训练时可以利用额外的状态信息。
记忆状态评论家本文提出的方法,评论家以环境状态和策略的内部记忆为条件,提供无偏的策略梯度。
策略梯度一种强化学习方法,通过计算策略参数的梯度来直接优化策略,以最大化期望回报。
基于视觉的追逃一种多智能体任务,其中追捕者使用视觉观测来追捕逃避者,通常用于测试强化学习算法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅