🔥 今日值得一读 黑盒LLM智能体悄悄出错?用开源代理模型对数概率审计,困难编码任务AUROC达0.
Proxy Confidence: Auditing Black-Box LLM Agents with a Surrogate's Log-Probabilities
arXiv AI (cs.AI) 🔥 重点 #Agent#安全对齐#不确定性估计#LLM评测 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用开源小模型并行读取上下文与动作,检测黑盒Agent工具调用是否悄悄出错,提升部署可靠性。

📖 AI 总结

本文针对黑盒大语言模型智能体在调用工具、查询和生成代码时可能出现的隐蔽错误,提出了一种基于低成本开放权重代理模型的审计方法。由于前沿模型的接口不暴露词元概率,其自报置信度在关键错误上几乎等同于随机猜测,且因模型高度重复,重采样也无法提供有效信号。作者让代理模型读取与智能体相同的上下文、模式及拟执行动作,通过教师强制、请求PMI、判别式裁决和工具选择竞争等多种互补读出方式,从自身对数概率中恢复缺失的置信信号。该方法无需训练、不访问智能体内部,仅需一次预填充。在困难编程任务上,其AUROC达0.825,而智能体自报置信度仅为0.598;在近确定性智能体上较自一致性方法提升0.14至0.19,成本仅为后者的1/K。该信号支持实时门控与置信反馈两种部署模式,可显著提升任务成功率。

🔑 关键词速览

Proxy Confidence代理置信度,指利用低成本代理模型的对数概率来评估黑盒LLM智能体动作可信度的信号。
Surrogate Model代理模型,一个低成本的开源权重模型,与目标智能体并行运行,用于读取相同上下文并评分其动作。
Log-Probabilities对数概率,模型对每个token或动作赋予的概率的对数值,用于量化置信度。
Teacher Forcing教师强制,一种训练/评估技术,在预测每个token时使用真实的前序token作为输入。
AUROC接收者操作特征曲线下面积,衡量二分类模型性能的指标,值越高表示区分能力越强。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅