🔥 今日值得一读 966个3D场景+18万标注,SceneBench给视觉语言模型的三维推理能力泼了盆冷水!
SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes
arXiv CV (cs.CV) 🔥 重点 #评测基准#3D场景理解#视觉语言模型#空间推理 🕐 09-16 12:00
👨‍💼 主理人解读 · 为什么值得关注
3D场景理解分层评测基准,可用于诊断视觉语言模型在房间、功能区、物体组等层级的空间推理短板。

📖 AI 总结

SceneBench 是一个面向三维场景视觉语言理解的分层基准,旨在解决现有基准在视觉信息、标注结构和任务设计上的不足。该基准包含 966 个用高斯泼溅重建的逼真三维场景,并通过人机协同流程、约 1500 小时人工迭代精修,构建了覆盖场景、房间、功能区、物体组和单个物体的分层语义标注,共生成超过 18.3 万个带文本描述和三维边界框的标注节点。基于此,研究定义了存在性问答、空间智能问答以及需跨语义层级多步推理的接地 QRA 三元组三类任务。实验显示,当前先进视觉语言模型在基础识别任务上表现良好,检测准确率最高可达 85%,但在分层与组合推理上明显下降,计数任务准确率低至 60%,暴露出既有基准未能捕捉的能力短板。

🔑 关键词速览

SceneBench一个用于评估视觉语言模型在三维场景中层级理解能力的基准测试集。
Gaussian Splatting一种三维场景重建技术,通过高斯分布表示点云来生成逼真的新视角图像。
Vision-Language Models能够同时处理视觉和语言信息的人工智能模型,如 CLIP、GPT-4V 等。
Hierarchical Semantics对场景进行多层级语义标注,包括场景、房间、功能区域、物体组和单个物体。
Grounded QRA Triplets需要结合三维空间定位进行多步推理的问答三元组,包含问题、推理和答案。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅