🔥 今日值得一读 零3D训练数据!GoDeep用语言空间直接理解3D场景,超越CLIP定位未知物体!
GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting
arXiv AI (cs.AI) 🔥 重点 #3D视觉#开放词汇#多模态 🕐 09-08 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用GoDeep直接利用VLM生成实体描述并投影到3D,无需3D训练数据即可实现跨域开放词汇语义分割。

📖 摘要

提出GoDeep,无需标注和3D训练语料,通过语言空间提升实现开放词汇3D场景理解。

🔑 关键词速览

Open-Vocabulary 3D Semantic Segmentation一种3D语义分割方法,能够识别训练中未见过的物体类别,通常借助预训练的视觉-语言模型。
CLIP features由CLIP模型提取的图像和文本特征,用于跨模态理解,但在组合任务上可能表现不佳。
Language-Space Lifting将图像描述提升到纯语言嵌入空间的过程,用于3D场景理解,无需3D训练数据。
Out-of-Vocabulary (OOV) objects在训练或预定义词汇表中未出现的物体,模型需要能够识别和定位它们。
Explainability模型预测结果能够以人类可理解的方式解释,这里指通过离散文本实现点级别的可解释性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅