本文关注工具增强型大语言模型智能体的一种结构性失效:模型会调用根本不存在的工具,或传入任何模式都未声明的参数。作者指出,现有的工具选择与安全门控方法都预设了调用指向真实工具,因此无法拦截这类幻觉调用,防御必须前置到任何因果门控之前。文章提出工具幻觉的五类分类法(H1–H5),并给出无需训练的封闭世界解析器“Resolution Rung”作为参照。在十款托管模型、两种调用接口下,共测得322次真实幻觉,伪造工具调用集中在无约束的原始JSON接口(34比3),且模型规模无助于缓解,675B模型与7–8B模型表现相当。研究进一步扩展到模型上下文协议,发现多服务器合并命名空间会产生单一注册表无法表达的幻觉面(M1–M5),实测154次幻觉,甚至包括在单注册表场景下表现干净的前沿模型。作者发布了版本化的幻觉工具基准HTB,以便不同解析器可跨提交比较。
| 工具幻觉 | LLM智能体调用不存在的工具或传递未声明参数的现象。 |
| 封闭世界解析器 | 一种免训练方法,通过检查工具是否在注册表中以及参数是否符合签名来拒绝幻觉调用。 |
| 解析层级 | 作为参考点的封闭世界解析器,强调其必须位于因果门控之前的位置。 |
| 模型上下文协议 | 一种协议,允许将多个工具服务器合并到一个命名空间,从而引入新的幻觉表面。 |
| 幻觉工具基准 | 一个版本化的基准数据集,用于在不同提交之间比较解析器的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅