CLIP不更新参数也能强?ProCAP用概率交叉注意力提示学习,11个数据集少样本泛化性能飙升!
ProCAP: Probabilistic Cross-Attentive Prompt Learning for Vision-Language Models
arXiv CV (cs.CV) 重要 #提示学习#视觉语言模型#CLIP 🕐 今天 12:00

📖 AI 总结

本文提出ProCAP,一种面向视觉-语言模型的概率化交叉注意力提示学习框架,旨在解决CLIP等预训练模型在标注数据稀缺或测试分布偏移时识别新类别能力不足的问题。现有提示学习方法通常仅微调少量参数并冻结主干,但视觉与文本分支耦合较弱,在低样本场景下表现脆弱。ProCAP在不更新任何CLIP权重的前提下,同时学习视觉与文本提示令牌,并通过堆叠的双向多头交叉注意力在提示深度上让两个分支相互精炼,从而增强跨模态交互与训练稳定性。为缓解有限监督下的过拟合,作者用高斯均值与方差参数化提示令牌,并施加轻量KL与L2正则,同时引入紧凑的对称InfoNCE头,在共享低维空间中对齐交叉注意力图像特征与类别级文本表示。在11个数据集的少样本基类到新类泛化、跨数据集迁移以及ImageNet分布偏移基准的域泛化实验中,ProCAP取得了较强的综合基类到新类性能和有竞争力的迁移表现,且保持CLIP主干不变。

🔑 关键词速览

CLIP一种预训练的视觉语言模型,通过对比学习将图像和文本映射到共享嵌入空间,支持零样本识别。
Prompt Learning提示学习,一种微调范式,仅调整少量提示参数而保持预训练模型主干冻结,以适应下游任务。
Cross-Attention交叉注意力,一种注意力机制,允许两个不同模态或分支的特征相互交互和细化。
InfoNCE一种对比损失函数,通过最大化正样本对之间的相似度并最小化负样本对的相似度来学习表示。
Few-shot Learning少样本学习,指模型在仅有少量标注样本的情况下学习新类别或任务的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅