本文研究网络化马尔可夫决策过程(MDP)中的无模型强化学习问题。在这类场景下,状态-动作空间随智能体数量急剧增长,且转移动态通常未知,传统方法难以扩展。作者提出基于泰勒表示的Q函数近似方法,并给出理论依据:在期望未来局部奖励光滑且导数受控的条件下,有限速度的信息传播与折扣机制使得局部评论家泰勒系数随图距离呈指数衰减。据此,通过舍弃远距离智能体系数并进行边缘化,可得到可扩展的局部泰勒表示,其误差由图的局部性控制。基于该表示,作者提出一种可扩展的无模型演员-评论家算法,为线性LSTD评论家建立了有限样本与近平稳性保证,并进一步引入表达能力更强的神经TD参数化。与既有谱方法不同,该方法适用于局部动态映射未知的情形,如隐藏切换线性二次调节。在三个控制基准上,该方法性能匹配或优于谱基线,并能高效扩展至大规模图。
| 网络化马尔可夫决策过程 | 一种多智能体决策框架,其中智能体通过图结构相互连接,状态转移和奖励依赖于局部交互。 |
| 泰勒表示 | 利用泰勒展开对Q函数进行近似的方法,通过局部信息捕捉全局价值函数。 |
| 演员-评论家算法 | 一种强化学习框架,演员负责策略改进,评论家负责策略评估,两者交替优化。 |
| LSTD | 最小二乘时序差分,一种用于策略评估的线性函数逼近方法,通过最小二乘求解TD固定点。 |
| 隐藏切换线性二次调节 | 一种控制问题,系统动态在多个线性二次调节模式间切换,但切换模式不可直接观测。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅