🔥 今日值得一读 零训练搞定3D高斯视角指代分割,DSSR-3D性能持续飙升!
DSSR-3D: Decoupled Reasoning for View-Dependent Referring in 3D Gaussians
arXiv CV (cs.CV) 🔥 重点 #3D高斯#指代分割#多模态 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做3D场景语言交互时,能正确理解'左边那个'这类随相机变化的指代,适合AR/机器人空间问答。

📖 AI 总结

本文提出DSSR-3D,一个面向连续3D高斯场的视角相关指代分割推理框架。现有方法将语言特征嵌入全局视角不变空间,无法处理依赖相机位姿的观察者中心空间关系(如“在……左侧”)。该框架将任务形式化为两个接口:位姿不变的语义定位与位姿条件下的空间推理,任何满足约束的函数组合均可构成有效实例,无需重新训练底层语义场,也不依赖边界框等离散几何代理。作者以温度锐化softmax定位机制和基于投影的方向评分函数实现两个接口,并通过轻量级免训练步骤融合,证明其可零样本迁移至结构不同的语义场。同时提出ViewRef-GS基准,并与增强的Ref-LERF联合评估。实验表明,该方法在无需额外训练的情况下持续优于现有基于3DGS的指代方法。

🔑 关键词速览

3D Gaussian Splatting (3DGS)一种三维场景表示方法,使用大量三维高斯函数来建模场景,支持高效渲染和可微优化。
Referring Segmentation根据自然语言描述(如“左边的椅子”)在图像或三维场景中分割出对应目标的任务。
View-Dependent Referring指代分割中目标依赖于观察视角(相机位姿)的情况,例如“在……的左边”会随视角变化而改变。
Pose-Invariant Semantic Localization一种与相机位姿无关的语义定位接口,用于在三维场中定位与语言描述语义匹配的区域。
Zero-Shot Transfer模型在未经过任何针对新任务或新数据集的训练的情况下,直接应用于新场景的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅