🔥 今日值得一读 实测打脸!号称“已遗忘”的AI,换个问法就能找回84%隐私数据!
Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation
arXiv CL (cs.CL) 🔥 重点 #遗忘学习#安全对齐#评测基准 🕐 08-25 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此框架测试遗忘方法在对抗提示下的鲁棒性,确保数据真正不可恢复。

📖 AI 总结

该研究针对大语言模型“机器遗忘”评估中的关键盲区展开,指出现有基准多在干净、非对抗性查询下测试,无法反映信息是否可通过策略性提示被重新恢复。作者在TOFU数据集上,以Llama-3.2-3B-Instruct为基底,统一评估了基于提示和微调的遗忘方法,并对标准指标表现优异的模型进行对抗鲁棒性测试。他们提出“攻击成功率”(ASR)作为LLM评判指标,衡量泄漏分数超过0.2的对抗响应比例,并覆盖八类攻击套件。结果显示,干净查询下的遗忘效果与对抗鲁棒性之间存在显著差距:尽管多种微调方法的遗忘质量超过0.91,但目标信息仍可被恢复,ASR介于72.8%至84.3%,接近未受保护基线的87.5%;而干净的多语言改写仅造成2.95%的泄漏。人工审计中,ASR的二元判定与人类事实评估在十例中有七例一致,表明该指标虽不完美,但能有效反映行为层面的可恢复性。研究结论强调,仅凭标准指标优异不足以证明遗忘的稳健性,对抗压力测试应成为遗忘评估的必要补充。

🔑 关键词速览

Machine unlearning机器遗忘,旨在从训练好的模型中移除特定数据的影响,同时保持模型其他能力的技术。
Attack Success Rate (ASR)攻击成功率,衡量对抗性提示下模型泄漏目标信息的比例,用于评估遗忘的鲁棒性。
TOFU一个用于评估机器遗忘方法的基准数据集,包含虚构作者传记等目标数据。
Llama-3.2-3B-InstructMeta发布的一个3B参数量的指令微调语言模型,用于实验中的基础模型。
Forget Quality遗忘质量,衡量模型在标准查询下遗忘目标数据能力的指标,值越高表示遗忘效果越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅