🔥 今日值得一读 图强化学习新突破:G2QDR让稀疏奖励任务性能飙升!
From Connectivity to Rewards: Dense Reward Learning with Directed State Graphs
arXiv LG (cs.LG) 🔥 重点 #强化学习#分层RL#稠密奖励#图神经网络 🕐 09-11 12:00
👨‍💼 主理人解读 · 为什么值得关注
把状态图当作环境模型来生成稠密奖励信号,可用于稀疏奖励下的机器人导航与长程任务训练。

📖 AI 总结

本文提出一种名为G2QDR的框架,旨在解决目标条件分层强化学习(GCHRL)中图结构利用不足的问题。现有基于图的方法多将图视为随机采样工具,而忽略了其蕴含的状态连通性信息,在状态转移不对称的拟度量环境中尤为受限。作者引入状态连通性模型,通过在有向状态图上训练的神经网络预测状态对之间的连通强度,并将其转化为标量辅助稠密奖励,为多个层级提供连续引导。理论分析表明,该框架可集成到任意现有GCHRL架构中。在多种稀疏奖励环境下的实验显示,G2QDR通常能以可接受的计算开销提升基线方法的性能,为利用环境拓扑结构改进分层强化学习提供了新思路。

🔑 关键词速览

Goal-Conditioned Hierarchical Reinforcement Learning (GCHRL)目标条件分层强化学习,一种将复杂任务分解为多个层次子目标来学习的强化学习范式。
Quasimetric Environment准度量环境,指状态转移距离不满足对称性的环境,即从A到B的距离不等于从B到A的距离。
Dense Reward密集奖励,在每个时间步都提供反馈的奖励信号,与仅在目标达成时给予的稀疏奖励相对。
Directed State Graph有向状态图,用有向边表示状态之间可达关系的图结构,能够编码非对称的转移信息。
State Connectivity Model状态连通性模型,用于预测状态对之间连通强度的模型,为分层学习提供辅助奖励信号。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅