本文提出对LLM智能体实施"行动前验证"的监督机制,即在动作实际执行前进行低成本的确定性检查,以捕捉那些不报错却产生错误效果的"静默失败"。研究在两种动作模态上验证该思路:对shell命令,静态验证器在9930条命令和482个工具上以10.0%的误报率捕获95.8%的无效命令,其中语法与二进制检查达到零误报;对代码编辑,640次编辑的基准测试显示,基于内容锚定的格式(如查找替换、diff)能干净地失败,而基于位置锚定的格式(如行号、函数名)会静默失败,一行偏移即可损坏99.1%的文件。研究表明,采用"不确定即拒绝"策略可将静默失败转化为可恢复失败,选择性接地达到0.958召回率与7.0%误报率,锚定验证应用器在8320次试验中仅出现一次静默误用。作者公开了基准、验证器与防护组件。
| LLM Agent | 基于大语言模型的智能体,能够通过发出动作(如执行命令、编辑代码)与环境交互。 |
| Pre-Action Verification | 在动作执行前进行验证,以确保动作的正确效果,防止静默失败。 |
| Silent Failure | 动作执行后未引发错误,但产生了错误或非预期的效果,难以被察觉。 |
| Static Verifier | 一种在动作执行前对动作进行静态分析的验证器,用于检测潜在错误。 |
| Refuse-When-Unsure | 一种策略,当验证器不确定动作是否正确时,选择拒绝执行,以避免静默失败。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅