该研究关注视觉语言模型在视觉证据逐步受损时的答案可靠性问题,提出以“证据顺序”为视角考察置信度的一致性。作者基于冻结的Qwen2.5-VL-3B-Instruct模型,通过逐步遮蔽场景图中与问题关键相关的区域,构建了176条五步证据损失轨迹(共880种遮蔽条件)。结果显示,模型原生序列置信度的证据单调性违反率高达0.436,92.0%的轨迹至少存在一次相邻违反;完全遮蔽关键区域使准确率下降28.2个百分点,而同等面积的非关键区域遮蔽仅下降0.6个百分点,配对差异为27.6个百分点。作者进一步训练轻量级事后可靠性头,在二元交叉熵中加入证据顺序监督后,遮蔽场景下的违反率由0.330降至0.303,并在未见过的局部高斯模糊下由0.449降至0.402。不过,AUROC、Brier和AURC等指标上两种学习头的差异不具统计显著性,原生置信度在选择性风险排序上仍更强。研究的意义在于将证据顺序一致性与传统正确性判别区分开来,而非宣称通用的置信度优势。
| 证据单调性违反率 (EMVR) | 衡量模型置信度随证据逐步丢失而本应单调下降却出现反常上升的违反比例。 |
| 问题关键区域 | 场景图中与给定问题直接相关、对正确回答至关重要的视觉区域。 |
| 后验可靠性头 | 在冻结的视觉语言模型之上训练的一个轻量级模块,用于预测答案的可靠性。 |
| 选择性风险排序 | 根据置信度对预测进行排序,以决定在哪些样本上接受或拒绝预测,从而控制风险。 |
| GQA | 一个用于视觉推理的问答数据集,包含基于场景图的复杂问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅