自监督关键帧助记让机器人行为克隆成功率100%,真实场景长时域20倍仍保持80%!
Self-Supervised Keyframe Discovery for Horizon-Invariant Behavior Cloning
arXiv AI (cs.AI) 论文方法 🕐 今天 12:00

📖 AI 总结

本文针对非马尔可夫环境下的行为克隆难题,提出了一种名为“关键帧记忆法”的自监督方法。现有策略架构依赖循环或注意力机制捕捉长程依赖,但前者面临隐藏状态崩溃与梯度不稳定问题,后者受限于上下文长度。该方法通过从随机采样的历史观测中学习目标函数,将其作为关键帧选择的奖励信号,自动发现信息关键观测(即“记忆点”),并训练以这些关键帧为条件的克隆策略来建模动作分布。在特定任务结构假设下,该形式化方法能在无限时间跨度上提供上下文保持保证,同时将决策相关关键帧维持在较小规模。实验表明,在合成记忆任务中策略成功率达100%,且能泛化至远超训练时域的数量级而不出现性能退化;在记忆密集型机器人操作基准的23项任务中,平均绝对成功率较最强基线提升13.9%,并在真实机器人上于20倍更长时域下仍保持80%的成功率。

🔑 关键词速览

Behavior Cloning (BC)行为克隆,一种通过模仿专家演示来学习策略的监督学习方法。
Non-Markovian Environments非马尔可夫环境,指当前状态不足以决定最优动作,需要历史上下文信息的环境。
Keyframe Mnemonics关键帧助记,本文提出的自监督方法,用于发现信息关键帧作为记忆辅助。
Self-Supervised Learning自监督学习,一种无需人工标注标签,从数据本身生成监督信号的学习范式。
Horizon-Invariant时域不变的,指策略性能不随时域长度增加而下降的特性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅