🔥 今日值得一读 GPT-5.6成功率从45.3%飙至58.5%,零回退!
TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents
arXiv AI (cs.AI) 🔥 重点 Agent论文方法安全对齐 🕐 09-24 12:00

📖 AI 总结

本文提出 TwinCheck,一种面向有状态工具智能体的推理时验证策略,用于解决单个局部看似合理的工具调用可能导致整条智能体轨迹失败的问题。其核心思路是:仅当轨迹满足与局部失败假设相关的证据条件时才考虑替换动作,并据此构造一个基于轨迹的反事实替代方案,即"负孪生";只有当该孪生通过结构检查,且成对验证器在两种候选顺序下均更偏好它时,才替换智能体的原始提议。为分离干预效果与重采样影响,作者采用精确重放方法,在首次接受替换前固定智能体已解析的响应与动作。在 159 个多轮 BFCL V4 任务的主要分析中,该策略将 GPT-5.6 Sol 的任务成功率从 45.3% 提升至 58.5%(95% 任务自助法置信区间 [8.2, 18.8]),且未观察到成功转为失败的回归。该工作将执行边界修复重新表述为一种受约束的比较,使反事实动作本身成为验证对象。

🔑 关键词速览

TwinCheck一种推理时验证策略,仅在轨迹满足证据条件时构建并评估反事实替代动作(负孪生),以决定是否替换智能体的工具调用。
negative twin基于当前轨迹构建的反事实替代动作,作为智能体原始提议的对照候选,需通过结构检查和成对偏好验证。
exact replay一种配对评估方法,固定智能体在首次接受替换之前的解析响应和动作,从而将干预效应与重采样噪声分离。
BFCL V4一个用于评估工具调用智能体的多轮基准测试集,本文使用其中 159 个任务进行主要分析。
pairwise verifier一种成对比较验证器,在两种候选顺序下评估原始提议与负孪生,仅当两种顺序下都偏好负孪生时才接受替换。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅