该研究探讨持续学习型具身智能体在策略更新准入环节面临的验证困境:独立评估虽能拦截有害更新,却也可能扼杀有益的持续学习机会。作者提出应从错误控制与学习机会保留两个维度,在给定交互预算下审计更新准入机制。研究识别出一个具体失效模式——基于范围置信度的门控在充足预算下仍无法证明旧任务行为未变,而标准配对二项式构造在结果分歧稀少时可显著降低该负担。作者进一步提出经认证的历史参考提升机制及轮级错失机会指标。在32个种子的单步推动诊断实验中,新鲜配对检查在每阶段2000回合预算下接纳了常见更新流的31.6%,而范围门控接纳率为零;但闭环运行中无条件回放的学习效果反而更优。另一项学习动力学压力测试区分了模型偏差与反馈选择误差。该工作的贡献在于提出一套准入审计协议及分析与合成证据,物理机器人与VLA验证尚待开展。
| 更新准入 | 决定是否接受策略更新的过程,需平衡错误控制与学习机会。 |
| 持续学习 | 智能体在交互中不断学习新任务而不遗忘旧任务的能力。 |
| 配对二项构造 | 一种统计方法,用于在结果分歧罕见时减少验证负担。 |
| 错失机会度量 | 衡量因拒绝更新而失去的有益学习机会的指标。 |
| VLA | 视觉-语言-动作模型,一种结合视觉、语言和动作的具身智能模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅