本文提出一种名为G2QDR的框架,旨在解决目标条件分层强化学习(GCHRL)中图结构利用不足的问题。现有基于图的方法多将图视为随机采样工具,而忽略了其蕴含的状态连通性信息,在状态转移不对称的拟度量环境中尤为受限。作者引入状态连通性模型,通过在有向状态图上训练的神经网络预测状态对之间的连通强度,并将其转化为标量辅助稠密奖励,为多个层级提供连续引导。理论分析表明,该框架可集成到任意现有GCHRL架构中。在多种稀疏奖励环境下的实验显示,G2QDR通常能以可接受的计算开销提升基线方法的性能,为利用环境拓扑结构改进分层强化学习提供了新思路。
| Goal-Conditioned Hierarchical Reinforcement Learning (GCHRL) | 目标条件分层强化学习,一种将复杂任务分解为多个层次子目标来学习的强化学习范式。 |
| Quasimetric Environment | 准度量环境,指状态转移距离不满足对称性的环境,即从A到B的距离不等于从B到A的距离。 |
| Dense Reward | 密集奖励,在每个时间步都提供反馈的奖励信号,与仅在目标达成时给予的稀疏奖励相对。 |
| Directed State Graph | 有向状态图,用有向边表示状态之间可达关系的图结构,能够编码非对称的转移信息。 |
| State Connectivity Model | 状态连通性模型,用于预测状态对之间连通强度的模型,为分层学习提供辅助奖励信号。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅