本文提出 ParticleSplat,一种自监督的以物体为中心的学习方法,通过前馈式三维高斯泼溅将场景分解为一组表示语义实体的潜在“粒子”。该方法基于深度潜在粒子(DLP)框架,针对其固有的二维局限——无法进行显式的三维空间与几何推理,从而制约机器人操作等下游任务——利用潜在粒子与三维高斯基元之间的结构相似性,引入三维潜在粒子空间,并以新视角合成作为训练目标。模型将多视角图像与相机位姿联合编码到共享的三维物体中心潜在空间中,再将粒子转换为粒子对齐的三维高斯,其组合可重建完整场景。在模拟与真实数据集上的实验表明,该公式能够无监督地学习物体掩码,并支持可控的三维场景编辑,例如通过在潜在空间中修改粒子来移动物体;同时,所学三维表示提升了下游机器人操作任务的性能。
| ParticleSplat | 本文提出的自监督以对象为中心的学习方法,通过前馈 3D 高斯泼溅将场景分解为潜在粒子。 |
| Deep Latent Particles (DLP) | 一种将图像表示为具有位置、尺度、外观等属性的潜在粒子集合的框架,但本质上是 2D 的。 |
| 3D Gaussian Splatting | 一种使用 3D 高斯基元表示场景并实现实时渲染的新颖视图合成技术。 |
| Object-centric Learning | 以对象为中心的学习,旨在将场景分解为独立的语义实体表示,而非整体表示。 |
| View Synthesis | 视图合成,根据给定视角的图像生成新视角下场景图像的任务,常用于训练 3D 表示。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅