🔥 今日值得一读 仅用RGB训练,LVSPM在256视角下位姿估计碾压VGGT,新视角合成PSNR甚至超越依赖位姿的模型!
LVSPM: Long Sequence View Synthesis and Pose Estimation Model
arXiv CV (cs.CV) 🔥 重点 #位姿估计#新视图合成#测试时训练 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
从无标定图像集合同时做位姿估计和新视角合成,适合3D重建与场景浏览应用。

📖 AI 总结

LVSPM是一种可泛化模型,能够从未标定的图像集合中联合估计相机位姿并合成新视角。该模型仅使用RGB图像和位姿监督进行训练,无需稠密三维真值,并借助测试时训练层将处理规模扩展至数百个输入视角。在RealEstate10k、Co3Dv2和DL3DV数据集上,LVSPM在16至256个视角范围内位姿估计精度超越VGGT,在严格阈值下优势尤为明显。在新视角合成任务中,面对视角更多、场景更大的实际设定,LVSPM实现了无位姿条件下的最优质量,PSNR甚至超过依赖位姿的模型,且随场景规模增大仍保持高质量,而基线方法则出现性能崩溃。该工作为长序列、无标定场景下的三维重建与视角合成提供了新思路。

🔑 关键词速览

LVSPM本文提出的可泛化模型,用于联合估计相机位姿并合成新视角。
测试时训练 (TTT)在测试阶段对模型进行微调或适应,以处理大规模输入并提升泛化能力。
新视角合成 (NVS)根据一组输入图像生成从新相机视角观察到的场景图像。
相机位姿估计确定相机在三维空间中的位置和朝向的过程。
RealEstate10k一个常用于位姿估计和新视角合成研究的大规模室内外场景数据集。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅