🔥 今日值得一读 智能体内部表示预测成功率,零开销碾压传统校准基线!
Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations
arXiv AI (cs.AI) 🔥 重点 Agent安全对齐论文方法 🕐 09-10 12:00

📖 AI 总结

该研究探讨了多轮智能体任务中模型能否预判自身成败的问题。作者指出,相比传统机器学习,智能体工作流涉及规划、工具调用与动态环境交互,失败模式更复杂,因此衡量其行动置信度对安全关键场景尤为重要。为此,论文提出两种互补方法:潜在轨迹动态(LTD)通过汇总交互轨迹中残差流表示的变化来刻画过程,动作表示探针(ARP)则从动作决策时刻形成的内部表示预测任务成功。在Bash、SQL、Python三个交互式基准和Qwen14B、Qwen7B、DeepSeek6.7B三个模型族上,两种方法均稳定优于表层生成与序列校准基线,且无需修改提示或多轮采样,提供了一种零开销的可靠性监控手段。其意义在于表明模型内部表示蕴含比输出文本更强的成功信号,为智能体可靠性评估开辟了新路径。

🔑 关键词速览

Latent Trajectory Dynamics (LTD)一种通过总结交互轨迹中残差流表示变化来评估智能体任务成功可能性的方法。
Action Representation Probe (ARP)一种利用动作决策时形成的内部表示来预测任务成功与否的探针方法。
Residual-stream representations指模型内部残差流中的表示,即各层残差连接所携带的隐藏状态信息。
Agentic workflows智能体工作流,指涉及规划、工具调用和环境交互的复杂多步任务执行流程。
Zero-overhead reliability monitor零开销可靠性监控器,指无需修改提示或进行多样本展开即可实时监控智能体可靠性的机制。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅