这篇论文对智能体与工具交互中的“静默失败”现象进行了系统审计。所谓静默失败,是指工具调用表面上成功,但通过API或封装层返回的信息或功能实际不完整或缺失,且系统未向用户或智能体发出任何通知。研究以ToolUniverse为实验环境,考察了15个科学工具及其API与工具文档,围绕7个失败位点构建审计机制,经大模型候选发现、自动化测试与人工验证,共识别出91个失败案例,最常见的是数据或字段缺失以及搜索、过滤、排序标准不一致。这些失败主要发生在API层(51个)和封装层(25个),并可能向下游放大。研究指出,静默失败源于上游并传播至看似有效的科学输出,据此提出“上下文可靠性”概念,并建议在智能体—工具交互全流程中建立测试、披露、监控与度量机制。
| 静默故障 (Silent Failures) | 工具调用看似成功,但实际返回的信息不完整或缺失,且未向用户或智能体发出任何通知的故障类型。 |
| 智能体-工具交互 (Agent-Tool Interaction) | 智能体AI系统调用外部工具(如API或封装器)以完成任务的过程,涉及信息传递和功能执行。 |
| ToolUniverse | 本研究中作为实验环境的工具集成平台,用于审计智能体与工具交互中的静默故障。 |
| 故障位点 (Failure Locus) | 故障在智能体-工具交互链条中发生的具体位置,本研究将其分为7类以定位问题。 |
| 情境可靠性 (Contextual Reliability) | 本研究提出的概念,强调在特定上下文(如工具交互流水线)中评估和确保系统可靠性的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅