本文针对黑盒大语言模型智能体在调用工具、查询和生成代码时可能出现的隐蔽错误,提出了一种基于低成本开放权重代理模型的审计方法。由于前沿模型的接口不暴露词元概率,其自报置信度在关键错误上几乎等同于随机猜测,且因模型高度重复,重采样也无法提供有效信号。作者让代理模型读取与智能体相同的上下文、模式及拟执行动作,通过教师强制、请求PMI、判别式裁决和工具选择竞争等多种互补读出方式,从自身对数概率中恢复缺失的置信信号。该方法无需训练、不访问智能体内部,仅需一次预填充。在困难编程任务上,其AUROC达0.825,而智能体自报置信度仅为0.598;在近确定性智能体上较自一致性方法提升0.14至0.19,成本仅为后者的1/K。该信号支持实时门控与置信反馈两种部署模式,可显著提升任务成功率。
| Proxy Confidence | 代理置信度,指利用低成本代理模型的对数概率来评估黑盒LLM智能体动作可信度的信号。 |
| Surrogate Model | 代理模型,一个低成本的开源权重模型,与目标智能体并行运行,用于读取相同上下文并评分其动作。 |
| Log-Probabilities | 对数概率,模型对每个token或动作赋予的概率的对数值,用于量化置信度。 |
| Teacher Forcing | 教师强制,一种训练/评估技术,在预测每个token时使用真实的前序token作为输入。 |
| AUROC | 接收者操作特征曲线下面积,衡量二分类模型性能的指标,值越高表示区分能力越强。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅