该论文提出了一种统一的视角,将视觉语言模型(VLM)的推理与测试时适应(TTA)过程通过最优传输(OT)理论进行整合。研究发现,现有TTA方法依赖原始嵌入相似度产生的噪声伪标签,在分布偏移下不可靠,且常采用粗粒度目标导致推理与适应目标不一致。为此,作者提出名为\algname的方法:在推理阶段,将零样本图像分类建模为基于Wasserstein距离的跨模态对齐问题,生成样本级鲁棒伪标签;在适应阶段,采用软标签InfoNCE损失,利用OT诱导的伪标签进行细粒度对比学习,显式建模图像-文本对的样本级关系。理论上,论文证明InfoNCE损失可重构为Wasserstein OT形式,从而统一了推理与适应目标。实验表明,该方法在效率和效果上均优于现有方法,性能最高提升7%。
| Vision-language models (VLMs) | 视觉语言模型,联合处理图像和文本的深度学习模型,如CLIP。 |
| Test-time adaptation (TTA) | 测试时适配,在推理阶段调整模型以适应新数据分布的技术。 |
| Wasserstein optimal transport (OT) | Wasserstein最优传输,一种度量概率分布间距离并寻找最优匹配的数学框架。 |
| InfoNCE loss | 一种对比学习损失函数,通过区分正负样本对来学习表示。 |
| Pseudo-labels | 伪标签,由模型预测生成的标签,用于无监督或半监督学习。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅