LVSPM是一种可泛化模型,能够从未标定的图像集合中联合估计相机位姿并合成新视角。该模型仅使用RGB图像和位姿监督进行训练,无需稠密三维真值,并借助测试时训练层将处理规模扩展至数百个输入视角。在RealEstate10k、Co3Dv2和DL3DV数据集上,LVSPM在16至256个视角范围内位姿估计精度超越VGGT,在严格阈值下优势尤为明显。在新视角合成任务中,面对视角更多、场景更大的实际设定,LVSPM实现了无位姿条件下的最优质量,PSNR甚至超过依赖位姿的模型,且随场景规模增大仍保持高质量,而基线方法则出现性能崩溃。该工作为长序列、无标定场景下的三维重建与视角合成提供了新思路。
| LVSPM | 本文提出的可泛化模型,用于联合估计相机位姿并合成新视角。 |
| 测试时训练 (TTT) | 在测试阶段对模型进行微调或适应,以处理大规模输入并提升泛化能力。 |
| 新视角合成 (NVS) | 根据一组输入图像生成从新相机视角观察到的场景图像。 |
| 相机位姿估计 | 确定相机在三维空间中的位置和朝向的过程。 |
| RealEstate10k | 一个常用于位姿估计和新视角合成研究的大规模室内外场景数据集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅