本文提出了一种名为“环境引导”的新方法,旨在提升大语言模型智能体在工具调用过程中的安全性与实用性。现有防御手段多依赖模型自身行为约束或外部评判,往往只能阻止不安全操作,却无法帮助智能体恢复并继续完成任务。该研究主张由执行环境在智能体运行过程中实时 enforcing 安全策略,通过将智能体与执行环境的状态建模为数据库表,追踪记录级数据流,并在运行时依据声明式策略检测违规行为。一旦发现违规,系统会提供与策略和上下文相关的反馈,引导智能体转向安全轨迹。在 AgentDyn 基准测试中,该方法使智能体在任务成功率上优于无防御基线,同时实现了零攻击成功率,表明环境层面的数据流控制能够在不牺牲任务效用的前提下有效保障智能体安全。
| Environment Steering | 一种在代理运行时通过执行环境强制执行安全并引导代理转向安全替代方案的方法。 |
| LLM agents | 基于大型语言模型的智能代理,能够调用工具执行任务。 |
| Data Flow Control | 通过跟踪记录级数据流并根据策略检查来控制数据流动的技术。 |
| Declarative Policies | 声明式策略,指定应遵循的规则而不指定具体执行步骤。 |
| AgentDyn | 一个用于评估代理安全性和效用的基准测试环境。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅