OmniPoint 是一个面向单目图像度量三维几何重建的统一框架,旨在解决现有方法受固定相机模型假设和僵化输入方式制约、彼此割裂的问题。该研究的关键在于放弃传统的平面深度回归,转而采用解耦的射线与距离表示及配套训练目标,将相机投影模型与场景结构显式分离,从而兼容针孔、鱼眼和等距柱状等多种投影方式。针对非透视相机训练数据稀缺的难题,作者提出双向增强策略,在三维空间中桥接有标注的透视数据与无标注的全向域数据;同时设计鲁棒的信息注入机制,利用可学习的输入状态嵌入消除架构歧义,并通过向量化高斯平滑对稀疏深度等不规则测量进行稠密化,避免特征分布偏移导致网络失稳。实验表明,OmniPoint 在多个基准上取得领先的零样本性能,为统一单目三维重建树立了新的标准。
| OmniPoint | 本文提出的统一单目度量点云重建框架,支持多种相机模型。 |
| Metric Reconstruction | 恢复场景真实物理尺度的三维几何结构。 |
| Decoupled Ray and Distance Representation | 将相机投影模型与场景结构分离的表示方法,用射线和距离分别描述。 |
| Bidirectional Augmentation | 在三维空间中桥接透视与全向数据域的双向数据增强策略。 |
| Zero-shot Performance | 模型在未见过的新数据集上直接测试的性能,无需微调。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅