本文提出 SAM-V,一种面向多视角实例分割的几何感知分割模型。针对多视角下严重视点变化与遮挡导致的分割一致性难题,作者指出现有方法存在两难:基于点云的 3D 实例分割受限于 3D 标注稀缺,而离线 2D 掩码匹配流程则面临跨帧物体身份歧义。SAM-V 不再采用事后匹配,而是将前馈几何模型 VGGT 的特征直接融入 2D 分割基础模型 SAM,并端到端训练以实现跨视角实例预测。其核心设计包括提示融合机制,用视角相关的相机令牌与局部 VGGT 特征增强稀疏提示令牌,使提示兼具视角感知与空间定位能力,以及可同时关注稠密 2D 与 3D 特征的掩码解码器。该方法无需离线掩码匹配或显式三维重建,单次前向即可输出一致的多视角分割结果。在 IGGT 3D 跟踪基准上,SAM-V 于 ScanNet++ 划分上较当前最优多视角实例分割基线整体 IoU 提升 5 点、帧级召回提升 12 点,并在零样本 ScanNet 划分上全面领先。
| SAM-V | 一种几何感知的多视角实例分割模型,将前馈几何模型特征集成到分割基础模型中,实现端到端的跨视角实例预测。 |
| VGGT | 一种前馈几何模型,用于提取三维几何特征,为多视角分割提供空间基础。 |
| SAM | Segment Anything Model,一种强大的二维分割基础模型,通过提示令牌实现灵活分割。 |
| 提示融合机制 | SAM-V 中用于丰富稀疏提示令牌的机制,融合视角特定的相机令牌和局部几何特征,使提示表示兼具视角感知和空间基础。 |
| IGGT 3D 跟踪基准 | 一个用于评估三维跟踪性能的基准数据集,其中跨帧一致的实例身份是衡量性能的关键指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅