本研究针对多模态大语言模型在图像或语音与文本冲突时的判断行为,提出了一种配对比较方法:固定指令与证据内容不变,仅交换两种来源的呈现位置,以分离模态偏好与证据顺序的影响。结果发现,在视觉与语音模型中,当图像或录音被置于冲突文本之后时,模型的回答会一致性地偏向感知证据的内容。作者还重新审视了以往关于文本偏见的实验,指出其固定证据顺序或随证据移动任务指令的设计可能导致误导性结论。该研究揭示了跨模态证据的非交换性,即同一证据因顺序不同可导致不同判断,且将感知证据后置会提升模型对其内容的依赖程度。这一发现对多模态模型的评估方法与偏见分析具有重要启示。
| 多模态大语言模型 | 能够同时处理文本、图像、语音等多种模态输入的大型语言模型。 |
| 文本依赖度 | 模型在决策时依赖文本证据而非其他模态证据的程度。 |
| 证据非交换性 | 证据的顺序改变会导致模型判断发生变化,即顺序不可交换。 |
| 配对比较 | 一种实验设计,通过交换两个证据的位置并保持其他因素不变来比较影响。 |
| 模态偏好 | 模型在处理冲突信息时倾向于依赖某一特定模态(如文本)的倾向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅