本文研究视觉语言模型中的领域遗忘问题。作者指出,预训练VLM虽具备强大的跨域识别能力,但这种鲁棒性也会保留不希望的领域特定行为,且领域信息与语义信息在表示空间中相互纠缠,使选择性遗忘变得困难。现有方法多通过潜在空间解耦或提示、特征层面的干预来处理,未直接定位并削弱单个图像块令牌的贡献。作者提出,与其均匀压制整个表示,不如利用视觉Transformer的空间结构,定位并抑制对遗忘领域预测贡献过大的图像块区域,因为对遗忘领域预测影响大的图像块未必对语义识别同等重要。为此,他们提出一个两阶段图像块选择框架:先估计图像块级别的领域敏感度,再选择性地削弱那些对遗忘领域预测贡献强于其语义效用的图像块。在Office-Home、Mini DomainNet和DomainNet上的实验表明,该方法在遗忘与保留的权衡上优于已有方法,保留领域识别率最高提升3.8%,并在视觉重叠和未见领域设置下展现出更好的分布偏移鲁棒性。
| 视觉-语言模型 (VLM) | 同时处理视觉和文本信息的多模态预训练模型,如CLIP,能实现跨模态理解和识别。 |
| 领域遗忘 (Domain Unlearning) | 从预训练模型中移除特定领域知识或行为,同时保留其他领域性能的技术。 |
| 图像块令牌 (Patch Token) | 视觉Transformer中将输入图像分割成固定大小的块,每个块线性嵌入后形成的令牌序列。 |
| 遗忘-保留权衡 (Forgetting-Retention Tradeoff) | 在遗忘目标领域知识的同时,尽可能保持模型在其他领域识别性能的平衡关系。 |
| 分布偏移 (Distribution Shift) | 测试数据分布与训练数据分布不一致的情况,模型需要在此条件下保持鲁棒性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅