该研究探讨多模态大语言模型(MLLMs)在报告鸭兔图等双稳态图像时是否表现出与人类相似的报告行为,以及支撑这种行为的内部计算机制。作者以LLaVA系列模型为对象,围绕两个可量化维度展开:可调制性,即报告能否被自下而上的视觉线索和自上而下的语言先验所偏置;排他性,即模型是否只给出单一解释。实验在经典鸭兔图和合成的视觉变位图上进行,以排除记忆化干扰。结果显示,视觉与语言操纵均能以与人类一致的方式系统性改变模型报告,且回答仍以排他性为主。机制层面,这些效应源于相互竞争的图像token表征、自下而上与自上而下调制的不同通路,以及排他性报告与物体计数编码之间的关联。该工作为理解MLLMs感知歧义图像的内部机制提供了行为与机制双重证据。
| 双稳态图像 | 一种可被感知为两种不同且互斥解释的图像,如鸭兔图。 |
| 多模态大语言模型 (MLLM) | 能够处理并整合视觉和文本等多种模态信息的大型语言模型。 |
| 可调制性 | 模型报告可被自下而上视觉线索或自上而下语言先验所偏置的程度。 |
| 排他性 | 模型在报告时是否只选择一种解释,而非同时报告多种。 |
| 视觉变体 (Visual Anagrams) | 合成的双稳态图像,通过特定变换产生不同解释,用于减少记忆效应。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅