🔥 今日值得一读 忘记没用!LLM智能体靠工具秒找回,新框架让遗忘真正生效
Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents
arXiv CL (cs.CL) 🔥 重点 #Agent#安全对齐#遗忘学习 🕐 08-25 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法确保LLM代理在工具调用中不泄露已删除数据,增强隐私合规。

📖 AI 总结

大型语言模型(LLM)越来越多地被部署为工具增强型智能体,其响应不仅依赖模型参数,还依赖工具调用和外部观察。这给LLM遗忘(unlearning)带来了评估错位:传统遗忘方法可能抑制了参数层面的直接记忆,但智能体仍可通过网络搜索、检索或数据库查询等工具恢复被遗忘的目标信息,作者将此称为“工具介导恢复”。针对这一问题,论文提出智能体工具遗忘(ATU)框架,包含两个阶段:第一阶段应用参数知识遗忘以抑制直接回忆;第二阶段在模拟工具增强环境中进行轨迹级强化学习,惩罚目标导向的工具使用行为和最终答案泄露。在RWKU和MUSE基准上、跨不同LLM架构的实验表明,ATU在目标遗忘与保留正常工具使用能力之间取得了更优平衡,使遗忘机制在工具增强的智能体部署场景下更加稳健。该研究填补了LLM遗忘在智能体场景下的空白,对隐私保护和模型安全具有实际意义。

🔑 关键词速览

Agentic Tool Unlearning (ATU)一种两阶段框架,用于减少LLM智能体对遗忘目标的参数性回忆和工具介导恢复。
Tool-mediated recovery智能体通过外部工具(如搜索或检索)恢复本应被遗忘的信息的现象。
Parametric knowledge unlearning通过调整模型参数来抑制直接回忆特定知识的技术。
Trajectory-level reinforcement learning在工具增强环境中,基于完整交互轨迹进行强化学习以优化行为。
Tool-augmented agents能够调用外部工具(如搜索引擎或数据库)来辅助回答问题的LLM系统。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅