长视频3D重建新突破!仅缓存11帧,误差直降40%
Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
arXiv CV (cs.CV) 重要 #3D重建#流式处理#局部上下文 🕐 08-31 12:00

📖 AI 总结

该论文提出了一种名为ABot-Recon的流式3D重建方法,旨在解决从极长视频中在线估计相机运动与场景几何时,内存和计算受限导致的精度退化问题。与依赖持久化或多级长时记忆的现有方法不同,该方法坚持严格局部的学习状态,仅缓存前11帧的KV特征,并预测当前相机坐标系下的点图及相邻帧相对位姿,通过顺序组合恢复全局位姿与几何。为抑制累积漂移,论文引入轻量级时间精化器改善相对旋转,并设计组合感知位姿损失监督多步组合。在Oxford Spires等长序列基准上,ABot-Recon的ATE降至4.35米,RPE-R降至0.12度,相比最优先前结果误差均降低约40%,验证了局部上下文方法在长时程重建中的优越性与高效性。

🔑 关键词速览

流式三维重建从连续视频流中在线重建三维场景,要求实时处理且内存有限。
KV特征Transformer中的键值对特征,用于注意力机制,此处缓存以提供局部上下文。
点图一种表示场景几何的密集深度图,每个像素对应一个三维点坐标。
相对姿态相邻帧之间的相机运动(旋转和平移),用于组合全局轨迹。
ATE和RPE-R绝对轨迹误差和相对姿态误差的旋转分量,用于评估相机轨迹估计精度。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅