本文针对非马尔可夫环境下的行为克隆难题,提出了一种名为“关键帧记忆法”的自监督方法。现有策略架构依赖循环或注意力机制捕捉长程依赖,但前者面临隐藏状态崩溃与梯度不稳定问题,后者受限于上下文长度。该方法通过从随机采样的历史观测中学习目标函数,将其作为关键帧选择的奖励信号,自动发现信息关键观测(即“记忆点”),并训练以这些关键帧为条件的克隆策略来建模动作分布。在特定任务结构假设下,该形式化方法能在无限时间跨度上提供上下文保持保证,同时将决策相关关键帧维持在较小规模。实验表明,在合成记忆任务中策略成功率达100%,且能泛化至远超训练时域的数量级而不出现性能退化;在记忆密集型机器人操作基准的23项任务中,平均绝对成功率较最强基线提升13.9%,并在真实机器人上于20倍更长时域下仍保持80%的成功率。
| Behavior Cloning (BC) | 行为克隆,一种通过模仿专家演示来学习策略的监督学习方法。 |
| Non-Markovian Environments | 非马尔可夫环境,指当前状态不足以决定最优动作,需要历史上下文信息的环境。 |
| Keyframe Mnemonics | 关键帧助记,本文提出的自监督方法,用于发现信息关键帧作为记忆辅助。 |
| Self-Supervised Learning | 自监督学习,一种无需人工标注标签,从数据本身生成监督信号的学习范式。 |
| Horizon-Invariant | 时域不变的,指策略性能不随时域长度增加而下降的特性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅