SceneBench 是一个面向三维场景视觉语言理解的分层基准,旨在解决现有基准在视觉信息、标注结构和任务设计上的不足。该基准包含 966 个用高斯泼溅重建的逼真三维场景,并通过人机协同流程、约 1500 小时人工迭代精修,构建了覆盖场景、房间、功能区、物体组和单个物体的分层语义标注,共生成超过 18.3 万个带文本描述和三维边界框的标注节点。基于此,研究定义了存在性问答、空间智能问答以及需跨语义层级多步推理的接地 QRA 三元组三类任务。实验显示,当前先进视觉语言模型在基础识别任务上表现良好,检测准确率最高可达 85%,但在分层与组合推理上明显下降,计数任务准确率低至 60%,暴露出既有基准未能捕捉的能力短板。
| SceneBench | 一个用于评估视觉语言模型在三维场景中层级理解能力的基准测试集。 |
| Gaussian Splatting | 一种三维场景重建技术,通过高斯分布表示点云来生成逼真的新视角图像。 |
| Vision-Language Models | 能够同时处理视觉和语言信息的人工智能模型,如 CLIP、GPT-4V 等。 |
| Hierarchical Semantics | 对场景进行多层级语义标注,包括场景、房间、功能区域、物体组和单个物体。 |
| Grounded QRA Triplets | 需要结合三维空间定位进行多步推理的问答三元组,包含问题、推理和答案。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅