本文提出并形式化了“判决接地分数”(Verdict Grounding Score),用于检验多模态模型评判者是否真正依据图像证据作出判断。该探针通过编辑图像使真实标签翻转、保持推理链不变,观察判决是否随之改变。作者指出,这一分数存在“可感知性混淆”:判决只对能进入评判者决策相关读取的编辑作出反应,因此分数上限受编辑可感知程度制约,且误差是单向的——分数只会让评判者显得比实际更不接地。这意味着审计中可能出现误报,导致可用的监督模型被错误弃用。作者证明,在给定假设下,这一缺失量可由同一审计流程已采集的三个量识别,使误报率可被直接测量。在九个评判者的审计中,预测的排序在主要样本中严格成立,典型评判者仅对约一半其本可分辨属性的编辑作出反应;采用保守拒绝阈值后,若干案例被直接判定为误报,其中最明显的一个评判者几乎每次都能检测到注入错误,却仍被打出仿佛完全未使用图像的分数。由此得出的规则是:图像侧反事实分数不应单独报告,未编辑图像上的检测探针可为其提供上界、确认误报,且不增加额外成本。
| Verdict Grounding Score | 判定基础分数,一种通过编辑图像翻转真实标签并保持推理轨迹不变来评估多模态评判者是否使用视觉证据的指标。 |
| Perceptibility Confound | 可感知性混淆,指图像编辑的可感知程度会限制基础分数,导致分数无法准确反映评判者的真实基础能力。 |
| False Alarm | 虚警,在审计中错误地将一个可用的监督者判定为不基于视觉证据,从而可能丢弃有用的模型。 |
| Counterfactual Probe | 反事实探测,通过改变输入(如图像)并观察输出是否相应变化来测试模型是否依赖该输入的方法。 |
| Detection Probe | 检测探测,在未编辑图像上运行以检测模型是否能识别注入错误的测试,用于为上界基础分数和认证虚警提供依据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅