🔥 今日值得一读 具身智能体学会拒绝错误纠正,准确率直冲100%!
Knowing When to Yield: Grounded Arbitration of User Corrections in Text-Based Embodied Agents
arXiv AI (cs.AI) 🔥 重点 #具身智能#Agent#人机交互 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让具身智能体判断何时接受、拒绝或核实用户纠正,避免盲从错误指令。

📖 AI 总结

该研究探讨了具身智能体在用户纠正可能有误时应如何应对,将"有依据的纠正仲裁"形式化为接受、拒绝、检查世界和询问说话者四种选择。作者提出GAVA方法,结合观察受限证据、合法探针和一步期望损失规则。在纯文本ALFWorld环境中,162个检查点产生972对真假干预样本。完整局部检查使GAVA和"始终验证"策略均达到100%纠正准确率,确立了证据契约而非比较优势。在同回合执行中,GAVA相对"始终验证"降低了交互成本,但在完美说话者下与成本阈值持平。探索性训练先验在340个未见场景中将交互成本和声明联合成本分别降低0.490和0.420。冻结策略后,在77个不重叠检查点、308个场景上复现了增益,分别为0.595和0.517,置信区间均排除零。语义GAVA在两个队列中各出现四次事实错误,准确率分别为98.8%和98.7%。研究支持在声明成本下结合语义先验进行选择性信息收集,但未证明环境信息价值相对澄清具有普遍优势,且未涉及真人参与者、视觉输入或物理机器人。

🔑 关键词速览

GAVA一种基于环境的纠正仲裁方法,通过观察受限证据、合法探针和一步期望损失规则来决定接受、拒绝、检查或询问。
ALFWorld一个纯文本的具身智能体基准测试环境,用于评估智能体在家庭场景中的任务完成能力。
VOI (Value of Information)信息价值,指获取额外信息所能带来的预期收益,用于权衡是否值得进行信息收集。
grounded correction arbitration基于环境的纠正仲裁,指智能体根据环境证据决定如何回应用户纠正的决策过程。
expected-loss rule期望损失规则,一种决策规则,通过最小化预期损失来选择最优行动。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅