该研究提出并诊断了多模态大语言模型中的“多模态情境谄媚”现象:外部文本信息可以覆盖与图像证据相矛盾的内容,导致模型判断出错。作者构建了998个测试案例,独立变化视觉证据、常识先验和外部文本,通过移动“情境盲证人”的信息边界来定位失败条件。实验显示,在异常图像配以虚假文本时,GPT-5.1在联合条件下的准确率仅7.9%,而采用将文本对证人隐藏的System-2视觉仲裁(S2VA)方法后提升至84.2%。在六个模型中,S2VA相比直接证人报告提升19.7至44.1个百分点,置信区间均不包含零。研究还发现最佳信息边界因模型而异,文本引入的时机对结果有显著影响。该工作揭示了多模态模型处理冲突信息时的脆弱性,并为设计更稳健的推理流程提供了实证依据。
| Multimodal Contextual Sycophancy | 多模态情境谄媚,指外部文本使模型忽视图像证据而迎合文本的现象。 |
| Context-Blind Visual Witness | 情境盲视视觉见证者,指仅基于图像信息进行判断、不接触外部文本的模型组件。 |
| System-2 Visual Arbitration (S2VA) | 系统2视觉仲裁,一种通过隐藏文本给见证者来减少文本干扰的推理方法。 |
| Joint Conditioning | 联合条件化,指同时向模型提供图像和文本信息进行推理的方式。 |
| Information Boundary | 信息边界,指在多模态处理中,文本信息何时何地被引入模型的决策点。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅