S2Tok 是一个面向流式三维重建的前馈框架,其核心思路是将潜在空间令牌作为持续存在的场景状态,从未标定的图像流中在线维护。该框架区分对已有表示的更新与选择性扩展:空间感知 Transformer 将每个新观测与持久场景令牌融合,学习得到的准入模块则选择性扩展表示以抑制冗余存储;随后由分层解码器和高斯头将演化中的状态转换为非像素对齐的三维高斯,实现无需缓存历史帧的新视角渲染。在四个基准上的实验表明,该方法以紧凑的高斯表示取得了具有竞争力的流式渲染质量。这项工作支持将潜在空间令牌作为在线三维重建的持久计算状态,把可学习的场景更新与显式高斯渲染结合起来。
| S2Tok | 本文提出的前馈框架,用于从未标定图像流中在线维护持久场景状态。 |
| 潜在空间令牌 (Latent Spatial Tokens) | 一种紧凑的潜在表示,用于编码三维场景的空间信息,支持在线更新与渲染。 |
| 流式三维重建 (Streaming 3D Reconstruction) | 在观测数据连续到达的过程中,实时增量式地重建三维场景的技术。 |
| 非像素对齐三维高斯 (Non-pixel-aligned 3D Gaussians) | 一种三维场景表示,由高斯分布构成,其位置不限于像素网格,用于高质量渲染。 |
| 准入模块 (Admission Module) | 一个学习到的模块,用于决定何时扩展场景表示,以控制存储冗余。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅