多模态大模型竟像人类一样看鸭兔图,一次只认一种解释!
(How) Do MLLMs Report Bistable Images Like Humans?
arXiv CV (cs.CV) 重要 #多模态大模型#双稳态图像#可解释性 🕐 09-15 12:00

📖 AI 总结

该研究探讨多模态大语言模型(MLLMs)在报告鸭兔图等双稳态图像时是否表现出与人类相似的报告行为,以及支撑这种行为的内部计算机制。作者以LLaVA系列模型为对象,围绕两个可量化维度展开:可调制性,即报告能否被自下而上的视觉线索和自上而下的语言先验所偏置;排他性,即模型是否只给出单一解释。实验在经典鸭兔图和合成的视觉变位图上进行,以排除记忆化干扰。结果显示,视觉与语言操纵均能以与人类一致的方式系统性改变模型报告,且回答仍以排他性为主。机制层面,这些效应源于相互竞争的图像token表征、自下而上与自上而下调制的不同通路,以及排他性报告与物体计数编码之间的关联。该工作为理解MLLMs感知歧义图像的内部机制提供了行为与机制双重证据。

🔑 关键词速览

双稳态图像一种可被感知为两种不同且互斥解释的图像,如鸭兔图。
多模态大语言模型 (MLLM)能够处理并整合视觉和文本等多种模态信息的大型语言模型。
可调制性模型报告可被自下而上视觉线索或自上而下语言先验所偏置的程度。
排他性模型在报告时是否只选择一种解释,而非同时报告多种。
视觉变体 (Visual Anagrams)合成的双稳态图像,通过特定变换产生不同解释,用于减少记忆效应。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅