视觉语言模型模态间隙竟呈秩一结构,94%以上均值分离被单一方向捕获!
One Geometry, Different Outcomes: Readout-Dependent Effects of the Modality Gap in Vision-Language Models
arXiv CV (cs.CV) 重要 多模态论文方法大模型 🕐 今天 12:00

📖 AI 总结

本文针对对比式视觉语言模型(如CLIP和SigLIP)中普遍存在的模态间隙现象,提出统一的几何解释,以调和以往研究中关于修改模态间隙效果相互矛盾的结论。研究发现,图像与文本均值分离的平方范数中有94.4%至99.9%可由单一主导方向捕获,即均值分离分量近似秩一结构。基于相似度分数的分解,作者识别出间隙在不同任务中的三种作用:在零样本分类中,查询侧固定间隙偏移的减除等价于加性类别偏置;在标准跨模态检索中,投影消除间隙方向并重归一化残差会丢弃候选特定的范数信息,造成乘性排序扭曲,而由几何推导的指数与网格搜索最优值高度吻合(Spearman相关系数0.93),可在部分场景恢复性能;在混合模态检索中,间隙方向按模态对候选排序,其移除可改善跨模态排序。该工作阐明了间隙修改在不同下游任务中产生增益、损害或恢复效果的机制,为相似度视觉语言系统中间隙干预策略的选择提供了理论依据。

🔑 关键词速览

模态间隙 (Modality Gap)对比视觉-语言模型中图像和文本嵌入分布之间持续存在的系统性分离现象。
零样本分类 (Zero-shot Classification)模型无需针对特定类别训练即可对图像进行分类的任务,通常利用文本描述作为类别代理。
跨模态检索 (Cross-modal Retrieval)使用一种模态(如文本)查询来检索另一种模态(如图像)相关项的任务。
秩一 (Rank-one)矩阵的秩为1,表示其所有行或列向量共线,即由一个主导方向张成。
CLIP一种经典的对比视觉-语言预训练模型,通过图像-文本对对齐学习共享嵌入空间。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅