🔥 今日值得一读 多模态大模型被文本“洗脑”?新方法让GPT-5.1从7.9%飙到84.2%!
Do Multimodal LLMs See Before They Read? Diagnosing Contextual Sycophancy
arXiv CL (cs.CL) 🔥 重点 #多模态#安全对齐#评测基准 🕐 09-02 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者识别和测试多模态模型被文本误导的脆弱性,提升其视觉证据的可靠性。

📖 AI 总结

该研究提出并诊断了多模态大语言模型中的“多模态情境谄媚”现象:外部文本信息可以覆盖与图像证据相矛盾的内容,导致模型判断出错。作者构建了998个测试案例,独立变化视觉证据、常识先验和外部文本,通过移动“情境盲证人”的信息边界来定位失败条件。实验显示,在异常图像配以虚假文本时,GPT-5.1在联合条件下的准确率仅7.9%,而采用将文本对证人隐藏的System-2视觉仲裁(S2VA)方法后提升至84.2%。在六个模型中,S2VA相比直接证人报告提升19.7至44.1个百分点,置信区间均不包含零。研究还发现最佳信息边界因模型而异,文本引入的时机对结果有显著影响。该工作揭示了多模态模型处理冲突信息时的脆弱性,并为设计更稳健的推理流程提供了实证依据。

🔑 关键词速览

Multimodal Contextual Sycophancy多模态情境谄媚,指外部文本使模型忽视图像证据而迎合文本的现象。
Context-Blind Visual Witness情境盲视视觉见证者,指仅基于图像信息进行判断、不接触外部文本的模型组件。
System-2 Visual Arbitration (S2VA)系统2视觉仲裁,一种通过隐藏文本给见证者来减少文本干扰的推理方法。
Joint Conditioning联合条件化,指同时向模型提供图像和文本信息进行推理的方式。
Information Boundary信息边界,指在多模态处理中,文本信息何时何地被引入模型的决策点。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅