本文针对对比式视觉语言模型(如CLIP和SigLIP)中普遍存在的模态间隙现象,提出统一的几何解释,以调和以往研究中关于修改模态间隙效果相互矛盾的结论。研究发现,图像与文本均值分离的平方范数中有94.4%至99.9%可由单一主导方向捕获,即均值分离分量近似秩一结构。基于相似度分数的分解,作者识别出间隙在不同任务中的三种作用:在零样本分类中,查询侧固定间隙偏移的减除等价于加性类别偏置;在标准跨模态检索中,投影消除间隙方向并重归一化残差会丢弃候选特定的范数信息,造成乘性排序扭曲,而由几何推导的指数与网格搜索最优值高度吻合(Spearman相关系数0.93),可在部分场景恢复性能;在混合模态检索中,间隙方向按模态对候选排序,其移除可改善跨模态排序。该工作阐明了间隙修改在不同下游任务中产生增益、损害或恢复效果的机制,为相似度视觉语言系统中间隙干预策略的选择提供了理论依据。
| 模态间隙 (Modality Gap) | 对比视觉-语言模型中图像和文本嵌入分布之间持续存在的系统性分离现象。 |
| 零样本分类 (Zero-shot Classification) | 模型无需针对特定类别训练即可对图像进行分类的任务,通常利用文本描述作为类别代理。 |
| 跨模态检索 (Cross-modal Retrieval) | 使用一种模态(如文本)查询来检索另一种模态(如图像)相关项的任务。 |
| 秩一 (Rank-one) | 矩阵的秩为1,表示其所有行或列向量共线,即由一个主导方向张成。 |
| CLIP | 一种经典的对比视觉-语言预训练模型,通过图像-文本对对齐学习共享嵌入空间。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅