苹果研究团队提出REVERSAL-BENCH基准,用于衡量自主强化学习在无外部重置条件下的持续训练能力。该基准通过连续参数控制环境的可逆性,并提供重置预言机作为状态可恢复性的真值验证机制,覆盖五种物理引擎下的八种操作场景。研究发现存在明显的“可逆性悬崖”:随着不可逆程度上升,无重置智能体持续陷入不可恢复状态并永久停滞,学习中断;而依赖回合重置的智能体则能保持稳定学习。这一失败模式在标准演员-评论家算法、安全强化学习及专用无重置框架中普遍存在,且在完整物理仿真中同样成立。通过与几何结构相同但可逆的对照环境比较,研究确认该崩溃由不可逆性而非障碍复杂度导致。团队还评估了安全防护机制,发现可恢复性虽可被准确预测,但主动恢复仅在智能体能够物理避开陷阱时才有效。该工作揭示了无重置强化学习在真实不可逆场景中的根本性局限。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅