该研究提出了一种名为KFS-RAG的防御方法,用于缓解检索增强生成(RAG)系统中的数据库泄露风险。RAG系统虽能结合大语言模型与外部知识,但易受提示注入攻击,导致敏感数据被暴露。KFS-RAG通过重构检索到的上下文来应对这一威胁:首先利用注意力展开和因果扰动机制识别检索文本中的关键影响词,再借助辅助语言模型基于这些关键词生成精炼的事实集合,最终用这些经过净化的事实替代原始检索内容,使生成器仅基于安全证据工作。实验结果显示,该方法在注入攻击下显著降低了数据库泄露风险,同时保持了回答的准确性和相关性。这项研究为构建更安全可信的RAG系统提供了可行路径。
| Retrieval-Augmented Generation (RAG) | 检索增强生成,一种结合大型语言模型与外部知识库的范式,通过检索相关信息来增强生成能力。 |
| Prompt Injection Attack | 提示注入攻击,一种通过精心构造的输入提示来操纵模型行为,可能导致敏感信息泄露的攻击方式。 |
| KFS-RAG | 基于关键词事实替换的RAG防御方法,通过用关键词引导生成的事实替换原始上下文来防止信息泄露。 |
| Attention Rollout | 注意力展开,一种通过累积注意力权重来评估输入元素重要性的技术,用于识别关键信息。 |
| Causal Perturbation | 因果扰动,一种通过干扰输入部分来观察输出变化,从而确定因果影响的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅