该研究探讨了具身智能体在用户纠正可能有误时应如何应对,将"有依据的纠正仲裁"形式化为接受、拒绝、检查世界和询问说话者四种选择。作者提出GAVA方法,结合观察受限证据、合法探针和一步期望损失规则。在纯文本ALFWorld环境中,162个检查点产生972对真假干预样本。完整局部检查使GAVA和"始终验证"策略均达到100%纠正准确率,确立了证据契约而非比较优势。在同回合执行中,GAVA相对"始终验证"降低了交互成本,但在完美说话者下与成本阈值持平。探索性训练先验在340个未见场景中将交互成本和声明联合成本分别降低0.490和0.420。冻结策略后,在77个不重叠检查点、308个场景上复现了增益,分别为0.595和0.517,置信区间均排除零。语义GAVA在两个队列中各出现四次事实错误,准确率分别为98.8%和98.7%。研究支持在声明成本下结合语义先验进行选择性信息收集,但未证明环境信息价值相对澄清具有普遍优势,且未涉及真人参与者、视觉输入或物理机器人。
| GAVA | 一种基于环境的纠正仲裁方法,通过观察受限证据、合法探针和一步期望损失规则来决定接受、拒绝、检查或询问。 |
| ALFWorld | 一个纯文本的具身智能体基准测试环境,用于评估智能体在家庭场景中的任务完成能力。 |
| VOI (Value of Information) | 信息价值,指获取额外信息所能带来的预期收益,用于权衡是否值得进行信息收集。 |
| grounded correction arbitration | 基于环境的纠正仲裁,指智能体根据环境证据决定如何回应用户纠正的决策过程。 |
| expected-loss rule | 期望损失规则,一种决策规则,通过最小化预期损失来选择最优行动。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅