本文提出BLINDSPOT,一个面向长周期工具使用型智能体的轨迹级安全校准基准。随着大模型智能体在涉及工具调用、持久状态、动态授权与环境反馈的多轮交互中持续运行,安全失效往往在若干轮之后才显现,而现有评估多将智能体行为简化为任务或攻击是否成功,无法反映其在交互过程中是行动、拒绝还是保持恰当校准。BLINDSPOT通过自适应对抗交互、有状态工具执行和基于执行结果的判定,评估完整的用户—智能体—环境轨迹,当前包含7个领域的22类攻击、35个场景,生成逾2500条平均14.7轮的长周期轨迹,每条轨迹被归为安全完成、正确拒绝、不安全完成、过度拒绝或不确定五类结果。该基准为可扩展的实时仿真框架,作者用八项指标评估了13个专有与开源模型,初步结果显示各模型在安全与效用校准上差异显著,且失败可能仅在若干初始安全步骤后才出现,表明智能体安全应被视为轨迹级属性而非单轮或二元成功标准。
| 长时程工具使用智能体 | 指在长时间、多轮交互中调用外部工具并维持状态的大型语言模型智能体。 |
| 轨迹级安全校准 | 从完整交互轨迹而非单轮响应来评估智能体安全行为是否恰当。 |
| 自适应对抗交互 | 攻击者根据智能体响应动态调整策略以诱发安全故障的交互方式。 |
| 过度拒绝 | 智能体对良性请求错误地拒绝,导致正常效用受损。 |
| 拒绝后失败 | 智能体在拒绝请求后仍因后续交互而出现不安全行为的情况。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅