🔥 今日值得一读 2500条长时程轨迹揭秘:LLM智能体安全校准盲点,平均14.7轮才暴露!
BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents
arXiv AI (cs.AI) 🔥 重点 安全对齐Agent论文方法 🕐 09-16 12:00

📖 AI 总结

本文提出BLINDSPOT,一个面向长周期工具使用型智能体的轨迹级安全校准基准。随着大模型智能体在涉及工具调用、持久状态、动态授权与环境反馈的多轮交互中持续运行,安全失效往往在若干轮之后才显现,而现有评估多将智能体行为简化为任务或攻击是否成功,无法反映其在交互过程中是行动、拒绝还是保持恰当校准。BLINDSPOT通过自适应对抗交互、有状态工具执行和基于执行结果的判定,评估完整的用户—智能体—环境轨迹,当前包含7个领域的22类攻击、35个场景,生成逾2500条平均14.7轮的长周期轨迹,每条轨迹被归为安全完成、正确拒绝、不安全完成、过度拒绝或不确定五类结果。该基准为可扩展的实时仿真框架,作者用八项指标评估了13个专有与开源模型,初步结果显示各模型在安全与效用校准上差异显著,且失败可能仅在若干初始安全步骤后才出现,表明智能体安全应被视为轨迹级属性而非单轮或二元成功标准。

🔑 关键词速览

长时程工具使用智能体指在长时间、多轮交互中调用外部工具并维持状态的大型语言模型智能体。
轨迹级安全校准从完整交互轨迹而非单轮响应来评估智能体安全行为是否恰当。
自适应对抗交互攻击者根据智能体响应动态调整策略以诱发安全故障的交互方式。
过度拒绝智能体对良性请求错误地拒绝,导致正常效用受损。
拒绝后失败智能体在拒绝请求后仍因后续交互而出现不安全行为的情况。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅