该研究揭示了医学多模态选择题评估中的一个关键问题:现有基准分数只关注最终答案,却忽略了答题路径,导致模型可能通过非图像捷径获得高分,作者称之为“推理膨胀”。研究对六个医学多模态数据集进行了系统性审计,通过文本侧和图像侧检查、模态消融及匹配修复等方法,分离了候选线索与行为证据。在13种配置的开放模型面板中,完整输入准确率为62.63%,而纯文本和纯选项设置分别达到53.96%和29.71%,表明模型可仅凭文本线索作答。移除长度差异、绝对/显著性和空间/介词线索后,准确率分别下降6.58、3.50和4.77个百分点。研究者构建了包含1000个条目的MedQA-MM子集,在该子集中纯文本和纯选项准确率骤降至5.21%和12.33%。该研究强调,医学图像推理的评估需要路径级证据,而非仅依赖最终得分。
| reasoning inflation | 推理膨胀:指模型因利用基准中的捷径线索而非真正推理而获得虚高的分数表现。 |
| shortcut-mitigated subset | 捷径缓解子集:经过处理以减少或消除捷径线索的数据子集,用于更公平地评估模型能力。 |
| modality ablations | 模态消融:通过移除或隔离输入模态(如文本或图像)来测试模型依赖性的实验方法。 |
| MedQA-MM | 医学多模态问答基准的捷径缓解子集,用于评估医学视觉推理的真实能力。 |
| route-level evidence | 路径级证据:指证明模型确实通过预期输入路径(如影像)而非捷径得出答案的证据。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅