本文针对离线目标条件强化学习中稀疏奖励与长时程依赖带来的挑战展开研究。作者从奖励传播的视角分析指出,在延迟目标场景下,目标导向的价值区分度可能小于局部估计误差,从而导致学习困难。为此,论文提出奖励刺激隐式Q学习(RSIQL)方法,通过在离线轨迹中被判定为取得进展的中间状态引入额外奖励信号,利用辅助目标条件价值函数识别这些状态,从而提供延迟更小的训练监督。与分层方法不同,RSIQL无需学习独立的高层子目标策略,保持了简单的扁平策略结构。在D4RL目标达成基准和OGBench上的实验表明,RSIQL平均优于目标条件IQL,并与分层离线目标条件方法性能相当。
| Goal-Conditioned Reinforcement Learning | 目标条件强化学习,一种强化学习设定,策略以指定目标为条件,学习到达该目标的动作。 |
| Offline Reinforcement Learning | 离线强化学习,仅从预先收集的静态数据集中学习策略,无需与环境在线交互。 |
| Reward Stimulation | 奖励刺激,在中间状态人为添加额外奖励信号,以缓解稀疏奖励下的信用分配问题。 |
| Implicit Q-Learning (IQL) | 隐式Q学习,一种离线强化学习算法,通过期望回归避免查询分布外动作,实现稳定的价值估计。 |
| Hierarchical Reinforcement Learning | 分层强化学习,将任务分解为高层子目标策略和低层动作策略,以处理长时程问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅