LLM智能体狂调不存在的工具!322次真实幻觉曝光,675B大模型竟和7B一样翻车
Closed-World Resolution Against Tool Hallucination in LLM Agents
arXiv AI (cs.AI) 重要 Agent安全对齐论文方法 🕐 09-18 12:00

📖 AI 总结

本文关注工具增强型大语言模型智能体的一种结构性失效:模型会调用根本不存在的工具,或传入任何模式都未声明的参数。作者指出,现有的工具选择与安全门控方法都预设了调用指向真实工具,因此无法拦截这类幻觉调用,防御必须前置到任何因果门控之前。文章提出工具幻觉的五类分类法(H1–H5),并给出无需训练的封闭世界解析器“Resolution Rung”作为参照。在十款托管模型、两种调用接口下,共测得322次真实幻觉,伪造工具调用集中在无约束的原始JSON接口(34比3),且模型规模无助于缓解,675B模型与7–8B模型表现相当。研究进一步扩展到模型上下文协议,发现多服务器合并命名空间会产生单一注册表无法表达的幻觉面(M1–M5),实测154次幻觉,甚至包括在单注册表场景下表现干净的前沿模型。作者发布了版本化的幻觉工具基准HTB,以便不同解析器可跨提交比较。

🔑 关键词速览

工具幻觉LLM智能体调用不存在的工具或传递未声明参数的现象。
封闭世界解析器一种免训练方法,通过检查工具是否在注册表中以及参数是否符合签名来拒绝幻觉调用。
解析层级作为参考点的封闭世界解析器,强调其必须位于因果门控之前的位置。
模型上下文协议一种协议,允许将多个工具服务器合并到一个命名空间,从而引入新的幻觉表面。
幻觉工具基准一个版本化的基准数据集,用于在不同提交之间比较解析器的性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅