该论文提出了一种名为ABot-Recon的流式3D重建方法,旨在解决从极长视频中在线估计相机运动与场景几何时,内存和计算受限导致的精度退化问题。与依赖持久化或多级长时记忆的现有方法不同,该方法坚持严格局部的学习状态,仅缓存前11帧的KV特征,并预测当前相机坐标系下的点图及相邻帧相对位姿,通过顺序组合恢复全局位姿与几何。为抑制累积漂移,论文引入轻量级时间精化器改善相对旋转,并设计组合感知位姿损失监督多步组合。在Oxford Spires等长序列基准上,ABot-Recon的ATE降至4.35米,RPE-R降至0.12度,相比最优先前结果误差均降低约40%,验证了局部上下文方法在长时程重建中的优越性与高效性。
| 流式三维重建 | 从连续视频流中在线重建三维场景,要求实时处理且内存有限。 |
| KV特征 | Transformer中的键值对特征,用于注意力机制,此处缓存以提供局部上下文。 |
| 点图 | 一种表示场景几何的密集深度图,每个像素对应一个三维点坐标。 |
| 相对姿态 | 相邻帧之间的相机运动(旋转和平移),用于组合全局轨迹。 |
| ATE和RPE-R | 绝对轨迹误差和相对姿态误差的旋转分量,用于评估相机轨迹估计精度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅