没学过看人,大模型竟自己学会了目标导向注意力!测试4887个场景,与人类注视高度一致
Emergent Goal-Directed Attention in Large Vision-Language Models
arXiv CV (cs.CV) 重要 #视觉语言模型#注意力#视觉搜索 🕐 09-09 12:00

📖 AI 总结

该研究探讨了大型视觉语言模型(VLMs)是否能在无注视监督的情况下产生目标导向的注意力。作者测试了Qwen3-VL-32B-Thinking和Gemma-4-26B-A4B-it两个现成模型,在4,887个自然场景中分别执行视觉搜索和自由观看任务,并将模型预测与人类注视数据对比。结果显示,当任务目标匹配时,两种模型的注意力分布与人类注视的吻合度显著高于目标不匹配时。这种交叉效应在目标缺失场景中依然存在,排除了简单视觉锚定的解释,且该效应出现在解码器层读取中。此外,模型思考轨迹在搜索时锚定于目标语义,在自由观看时锚定于视觉显著性。研究表明,通用VLMs无需注视专项训练即可生成与人类一致的目标导向空间注意力,为目标导向注意理论提供了新视角,并为跨任务预测人类注视位置提供了可扩展工具。

🔑 关键词速览

视觉-语言模型 (Vision-Language Models, VLMs)一种结合视觉和语言处理的人工智能模型,能够理解图像和文本信息。
目标导向注意力 (Goal-Directed Attention)根据当前任务目标选择性关注视觉场景中相关信息的认知过程。
注视点 (Fixations)眼睛在视觉场景中短暂停留的位置,反映注意力的焦点。
视觉搜索 (Visual Search)一种任务,要求观察者在场景中寻找特定目标物体。
自由观看 (Free Viewing)一种无特定任务的自然观看模式,观察者自由浏览场景。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅