该论文系统化研究了基于大语言模型(LLM)的智能体安全系统,即利用LLM智能体规划、调度和解释安全工具的渗透测试框架。作者通过对十种广泛使用的静态、动态、云、编排及AI红队工具进行实操评估,归纳出常见运维失败模式,并提出四维“集成摩擦指数”以区分一次性工程成本与持续性组织、法律及维护成本。研究揭示了若干定量规律:长期会话会随阶段推进丢失证据,而短期子智能体可依据证据压缩比延长有效工作范围;两级裁决级联虽能倍增评分器似然比,但在评分器误差相关时收益甚微;将不可评估结果视为攻击失败会引入测量偏差。此外,论文将规划者与执行者的模型路由建模为背包问题,推导出重尾工具的执行上限公式,并论证了范围与预算约束无法仅靠系统提示词强制执行。作者实现的Inspectra平台作为实践验证,标注了各机制的落地状态。
| Agentic security | 利用LLM代理自主规划、调度和执行安全测试的范式。 |
| Integration Friction Index | 衡量集成安全工具时一次性工程成本与长期组织、法律和维护成本的综合指标。 |
| LLM policies | 由大型语言模型生成的决策策略,用于指导代理行为。 |
| Verdict cascade | 多阶段裁决流程,通过组合多个评分器结果提高整体判断准确性。 |
| Knapsack problem | 一种优化问题,在资源限制下选择最优组合,此处用于模型路由决策。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅