🔥 今日值得一读 双缓存加持!RADC让视觉语言模型测试时自适应性能刷新SOTA
RADC: Risk-Aware Dual Caching for Vision-Language Test-Time Adaptation
arXiv CV (cs.CV) 🔥 重点 #测试时适应#视觉语言模型#缓存机制 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
在分布变化下提升CLIP类模型适应能力,前景缓存减少背景干扰,适合在线部署。

📖 AI 总结

本文提出RADC方法,用于视觉-语言模型的测试时自适应。针对现有基于缓存的测试时自适应方法存在的两个问题——全局表示中的背景偏差,以及表示变化下基于熵的缓存准入不可靠——RADC通过可靠的双缓存机制增强原型学习。具体而言,该方法引入语义前景缓存,从CLIP表示中聚合类别一致的空间证据,生成前景原型,既补充全局缓存又缓解背景干扰;同时提出高斯风险准入机制,将多视角表示建模为对角高斯分布,综合考量类别分离度与特征不确定性,以优先筛选可靠的缓存候选。推理阶段,RADC将零样本logits与全局缓存、前景缓存的预测结果融合。在跨域和分布外基准上的大量实验表明,该方法持续取得当前最优性能。

🔑 关键词速览

测试时自适应 (TTA)在测试阶段利用无标签数据调整模型,以适应目标域分布变化的技术。
语义前景缓存从CLIP表示中聚合类别一致的空间证据,生成前景原型以补充全局缓存并减轻背景干扰的缓存机制。
高斯风险准入将多视图表示建模为对角高斯分布,联合考虑类别分离和特征不确定性,以优先选择可靠缓存候选的准入策略。
CLIP对比语言-图像预训练模型,通过图像和文本的对比学习实现强大的零样本视觉-语言表示能力。
分布外 (OOD)测试数据分布与训练数据分布不同,模型需要泛化到未见过的分布外样本。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅