大型语言模型(LLM)越来越多地被部署为工具增强型智能体,其响应不仅依赖模型参数,还依赖工具调用和外部观察。这给LLM遗忘(unlearning)带来了评估错位:传统遗忘方法可能抑制了参数层面的直接记忆,但智能体仍可通过网络搜索、检索或数据库查询等工具恢复被遗忘的目标信息,作者将此称为“工具介导恢复”。针对这一问题,论文提出智能体工具遗忘(ATU)框架,包含两个阶段:第一阶段应用参数知识遗忘以抑制直接回忆;第二阶段在模拟工具增强环境中进行轨迹级强化学习,惩罚目标导向的工具使用行为和最终答案泄露。在RWKU和MUSE基准上、跨不同LLM架构的实验表明,ATU在目标遗忘与保留正常工具使用能力之间取得了更优平衡,使遗忘机制在工具增强的智能体部署场景下更加稳健。该研究填补了LLM遗忘在智能体场景下的空白,对隐私保护和模型安全具有实际意义。
| Agentic Tool Unlearning (ATU) | 一种两阶段框架,用于减少LLM智能体对遗忘目标的参数性回忆和工具介导恢复。 |
| Tool-mediated recovery | 智能体通过外部工具(如搜索或检索)恢复本应被遗忘的信息的现象。 |
| Parametric knowledge unlearning | 通过调整模型参数来抑制直接回忆特定知识的技术。 |
| Trajectory-level reinforcement learning | 在工具增强环境中,基于完整交互轨迹进行强化学习以优化行为。 |
| Tool-augmented agents | 能够调用外部工具(如搜索引擎或数据库)来辅助回答问题的LLM系统。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅