该论文提出了I-CARE方法,旨在系统研究文本到图像生成模型在机器遗忘过程中的干扰现象。机器遗忘旨在移除模型已学习的特定概念,但现有研究对语义相关概念在遗忘过程中的意外退化缺乏统一描述和评估标准。I-CARE不提出新的基准或遗忘算法,而是为任务、指标和结果报告提供正式定义,使干扰研究在不同遗忘设置下可系统复现。该方法设计上独立于具体模型和算法,将长期科学洞见与短期实证结果分离。研究使用现有先进算法和常用数据集进行了可行性验证,结果表明I-CARE能有效分析多种遗忘设置下的干扰模式。该方法的开源软件框架和网页图形界面已发布,便于研究者无需直接操作代码即可探索研究结果。
| Machine unlearning | 机器遗忘,指从已训练模型中移除特定知识或概念的过程。 |
| Interference | 干扰,指在遗忘过程中,本应保留的语义相关概念发生意外退化或性能下降的现象。 |
| Generative unlearning | 生成式遗忘,针对生成模型(如文本到图像模型)的遗忘技术,旨在移除模型生成特定内容的能力。 |
| I-CARE | 本文提出的方法论框架,用于形式化定义和系统研究生成式遗忘中的干扰现象。 |
| Text-to-image models | 文本到图像模型,根据文本描述生成对应图像的AI模型,如Stable Diffusion等。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅