该研究探讨了大型视觉语言模型(VLMs)是否能在无注视监督的情况下产生目标导向的注意力。作者测试了Qwen3-VL-32B-Thinking和Gemma-4-26B-A4B-it两个现成模型,在4,887个自然场景中分别执行视觉搜索和自由观看任务,并将模型预测与人类注视数据对比。结果显示,当任务目标匹配时,两种模型的注意力分布与人类注视的吻合度显著高于目标不匹配时。这种交叉效应在目标缺失场景中依然存在,排除了简单视觉锚定的解释,且该效应出现在解码器层读取中。此外,模型思考轨迹在搜索时锚定于目标语义,在自由观看时锚定于视觉显著性。研究表明,通用VLMs无需注视专项训练即可生成与人类一致的目标导向空间注意力,为目标导向注意理论提供了新视角,并为跨任务预测人类注视位置提供了可扩展工具。
| 视觉-语言模型 (Vision-Language Models, VLMs) | 一种结合视觉和语言处理的人工智能模型,能够理解图像和文本信息。 |
| 目标导向注意力 (Goal-Directed Attention) | 根据当前任务目标选择性关注视觉场景中相关信息的认知过程。 |
| 注视点 (Fixations) | 眼睛在视觉场景中短暂停留的位置,反映注意力的焦点。 |
| 视觉搜索 (Visual Search) | 一种任务,要求观察者在场景中寻找特定目标物体。 |
| 自由观看 (Free Viewing) | 一种无特定任务的自然观看模式,观察者自由浏览场景。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅