本文介绍了StateSight,一个用于评估视觉语言模型(VLM)潜在空间结构重建能力的程序化基准。现有综合基准常混淆感知、OCR、领域知识和推理,难以单独衡量模型从单张图像恢复空间结构的能力。StateSight包含三类任务:立方体对面推理、遮挡立方体塔计数和4邻域连通分量计数,每类300个单图提示,配有确定性标签和精确匹配评分。测试显示,GPT-5.5在三项任务上准确率分别为59.3%、33.3%和28.3%,Claude Sonnet 5为53.3%、18.7%和7.3%,均低于30名人类参与者的80.8%、68.8%和64.3%。可见推导分析揭示了模型在图像状态重建和推理流程中的重复性错误。此外,配套数据集StateSight-Steps包含900个图文交错示例和3600个确定性中间视觉状态。结果表明,格式有效的响应可能掩盖空间结构恢复的失败,凸显了当前VLM在可验证视觉推理上的局限。
| StateSight | 一个程序化生成的基准测试,用于评估视觉语言模型在特定空间推理任务上的表现。 |
| latent spatial-state reconstruction | 从图像中重建隐含的空间结构或状态,是视觉推理的关键能力。 |
| cube-net opposite-face reasoning | 一种空间推理任务,要求判断立方体展开图中相对面的关系。 |
| occluded cube-tower counting | 一种计数任务,要求统计被遮挡的立方体塔中的立方体数量。 |
| 4-neighbor connected-component counting | 一种图像分析任务,统计图像中通过四邻接关系连接的区域数量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅