无需重训练,ProtoLIP竟让视觉证据分离效果直接拉满!
ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement
arXiv CV (cs.CV) 重要 #视觉语言模型#可解释性#证据解耦 🕐 09-16 12:00

📖 AI 总结

该研究针对查询条件下的视觉语言模型(VLM)提出一个关键问题:基于完整描述所获得的证据未必能分解为对象特定的证据,且已呈现的证据图也不一定能识别出构成模型预测的实际证据。作者在多种VLM架构和独立基准上发现,对象级查询往往残留共现对象与共享上下文的证据,导致证据定位与分离不准确。为此,论文提出ProtoLIP,一种轻量级的原型中介证据层,将可复用的视觉原型组织为文本衍生的语义族,并通过查询相关的族路由约束可提供证据的原型范围。该方法无需空间标注或骨干网络重训练,即可在多种查询粒度上提升证据定位与分离效果,且定位增益可迁移至独立预训练的VLM。ProtoLIP仅使用文本衍生的弱监督,性能即可与空间监督的定位模型竞争,同时保持较强的匹配与图像文本检索能力。更重要的是,其匹配分数直接由局部化原型证据构建,可精确分解为语义族与原型两部分的贡献。

🔑 关键词速览

ProtoLIP一种轻量级原型介导的证据层,通过文本衍生的语义家族组织视觉原型,实现对象级证据解耦。
视觉-语言模型 (VLM)能够同时处理视觉和文本信息,并实现跨模态理解与生成的深度学习模型。
证据解耦将模型预测所依赖的视觉证据从共现对象和共享上下文中分离出来,以识别对象特定的证据。
原型介导利用可复用的视觉原型作为中间表示,通过查询依赖的路由机制来约束证据来源。
弱监督使用不精确或不完整的监督信号(如仅文本标签)进行训练,而非依赖精细的空间标注。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅