该研究针对深度补全中视觉基础模型先验与真实度量尺度对齐困难的问题展开。现有方法通常依赖预定义坐标系下的刚性仿射假设,导致系统性标定误差。作者指出,深度标定的线性关系取决于所选的响应坐标,因此提出“自适应响应几何”方法,将深度、对数深度或视差这一固定选择转化为图像级未知量,通过连续响应族统一这些坐标并定义显式的深度相关增益。研究推导了响应梯度关系,在度量空间中估计响应参数,并采用硬狄利克雷残差重建完成校准先验。在刻意不完整的度量观测条件下,该免训练流程取得宏平均AbsRel 0.0301和宏平均NMed 14.04°,在两项聚合指标上均优于PriorDA、LDCM和Any2Full。线性诊断进一步分析了所选响应如何改变深度关系及其度量误差,为深度补全的尺度对齐提供了新思路。
| 深度补全 (Depth Completion) | 从稀疏的深度测量(如激光雷达点云)恢复出每个像素都有深度值的稠密深度图的任务。 |
| 自适应响应几何 (Adaptive Response Geometry) | 本文提出的方法,将深度、对数深度或视差等响应坐标的选择视为图像级未知量,并自适应地估计其参数。 |
| 度量深度 (Metric Depth) | 具有真实物理尺度(如米)的深度值,而非仅表示相对远近的归一化深度。 |
| 视觉基础模型 (Visual Foundation Models) | 在大规模图像数据上预训练的通用视觉模型(如 DINOv2、Stable Diffusion),可提供丰富的几何先验。 |
| Hard-Dirichlet 残差重建 (Hard-Dirichlet Residual Reconstruction) | 一种用于完成标定后深度先验的残差重建方法,可能基于 Dirichlet 边界条件或分布假设。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅