提出GoDeep,无需标注和3D训练语料,通过语言空间提升实现开放词汇3D场景理解。
| Open-Vocabulary 3D Semantic Segmentation | 一种3D语义分割方法,能够识别训练中未见过的物体类别,通常借助预训练的视觉-语言模型。 |
| CLIP features | 由CLIP模型提取的图像和文本特征,用于跨模态理解,但在组合任务上可能表现不佳。 |
| Language-Space Lifting | 将图像描述提升到纯语言嵌入空间的过程,用于3D场景理解,无需3D训练数据。 |
| Out-of-Vocabulary (OOV) objects | 在训练或预定义词汇表中未出现的物体,模型需要能够识别和定位它们。 |
| Explainability | 模型预测结果能够以人类可理解的方式解释,这里指通过离散文本实现点级别的可解释性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅