本文提出RADC方法,用于视觉-语言模型的测试时自适应。针对现有基于缓存的测试时自适应方法存在的两个问题——全局表示中的背景偏差,以及表示变化下基于熵的缓存准入不可靠——RADC通过可靠的双缓存机制增强原型学习。具体而言,该方法引入语义前景缓存,从CLIP表示中聚合类别一致的空间证据,生成前景原型,既补充全局缓存又缓解背景干扰;同时提出高斯风险准入机制,将多视角表示建模为对角高斯分布,综合考量类别分离度与特征不确定性,以优先筛选可靠的缓存候选。推理阶段,RADC将零样本logits与全局缓存、前景缓存的预测结果融合。在跨域和分布外基准上的大量实验表明,该方法持续取得当前最优性能。
| 测试时自适应 (TTA) | 在测试阶段利用无标签数据调整模型,以适应目标域分布变化的技术。 |
| 语义前景缓存 | 从CLIP表示中聚合类别一致的空间证据,生成前景原型以补充全局缓存并减轻背景干扰的缓存机制。 |
| 高斯风险准入 | 将多视图表示建模为对角高斯分布,联合考虑类别分离和特征不确定性,以优先选择可靠缓存候选的准入策略。 |
| CLIP | 对比语言-图像预训练模型,通过图像和文本的对比学习实现强大的零样本视觉-语言表示能力。 |
| 分布外 (OOD) | 测试数据分布与训练数据分布不同,模型需要泛化到未见过的分布外样本。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅