本文提出DSSR-3D,一个面向连续3D高斯场的视角相关指代分割推理框架。现有方法将语言特征嵌入全局视角不变空间,无法处理依赖相机位姿的观察者中心空间关系(如“在……左侧”)。该框架将任务形式化为两个接口:位姿不变的语义定位与位姿条件下的空间推理,任何满足约束的函数组合均可构成有效实例,无需重新训练底层语义场,也不依赖边界框等离散几何代理。作者以温度锐化softmax定位机制和基于投影的方向评分函数实现两个接口,并通过轻量级免训练步骤融合,证明其可零样本迁移至结构不同的语义场。同时提出ViewRef-GS基准,并与增强的Ref-LERF联合评估。实验表明,该方法在无需额外训练的情况下持续优于现有基于3DGS的指代方法。
| 3D Gaussian Splatting (3DGS) | 一种三维场景表示方法,使用大量三维高斯函数来建模场景,支持高效渲染和可微优化。 |
| Referring Segmentation | 根据自然语言描述(如“左边的椅子”)在图像或三维场景中分割出对应目标的任务。 |
| View-Dependent Referring | 指代分割中目标依赖于观察视角(相机位姿)的情况,例如“在……的左边”会随视角变化而改变。 |
| Pose-Invariant Semantic Localization | 一种与相机位姿无关的语义定位接口,用于在三维场中定位与语言描述语义匹配的区域。 |
| Zero-Shot Transfer | 模型在未经过任何针对新任务或新数据集的训练的情况下,直接应用于新场景的能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅