这篇论文提出“人类第六感”(HSS)基准,用于评估多模态大语言模型的直觉视觉推理能力。作者指出,人类只需一瞥便能推断场景中的隐含信息,如事件的因果与走向、空间可行性、社会关系及抽象规则,而现有视觉基准多聚焦专家级分析或低层感知,忽视了这种快速、零样本的直觉能力。HSS涵盖图像与视频输入,按结构化分类组织,并配以人工撰写的提示,考察时间、空间、社会和抽象四个维度的隐含结构。实验显示,人类参与者准确率达93.1%,而最强模型GPT-6-astra即使以最大推理强度运行也仅达53.6%。研究还尝试引入动态视觉操作的智能体设置,虽能缩小差距但未能弥合。该工作将直觉视觉推理确立为可测量的能力维度,揭示当前模型在人类习以为常的视觉任务上仍存在显著短板。
| Multimodal Large Language Models (MLLMs) | 多模态大语言模型,能够处理文本、图像等多种模态信息的大型语言模型。 |
| Intuitive Visual Reasoning | 直觉视觉推理,指人类在无需刻意分析的情况下快速理解视觉场景中隐含信息的能力。 |
| Zero-shot | 零样本,指模型在没有针对特定任务进行训练的情况下直接进行推理或预测。 |
| Benchmark | 基准测试,用于评估和比较模型性能的标准数据集或测试框架。 |
| Agentic Setup | 智能体设置,指模型作为自主智能体与环境交互并执行任务的方式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅