本文介绍了一项名为Depth Anything V4(DAV4)的动态4D场景重建框架,旨在从单目视频中重建动态场景。其核心创新在于将黎曼流匹配(RFM)应用于4D高斯泼溅参数,直接在非欧几里得流形(如尺度、旋转、不透明度)上定义概率路径,从而确保所有中间状态的有效性。通过控制变量实验,研究将RFM的贡献与测试时优化(TTO)和预训练分离:在相同数据、架构和TTO条件下,确定性MLP基线F-score为0.762,而RFM达到0.806,提升了0.044,这一增益被归因于RFM的独立贡献。研究还修正了计算成本分析,指出预训练需360 GPU小时,但可在大规模部署(超过10,000个场景)中摊销。不确定性通过负高斯对数似然和期望校准误差进行量化。DAV4在动态重建和新视角合成上优于之前的Depth Anything模型及逐场景4D-GS方法,且训练过程中未使用人工标注的深度标签。不过,该论文因存在重大研究错误已被作者撤回。
| Riemannian Flow Matching (RFM) | 一种在非欧几里得流形上定义概率路径的生成建模方法,用于确保中间状态的有效性。 |
| 4D Gaussian Splatting | 一种将场景表示为4D高斯分布并进行渲染的技术,用于动态场景重建。 |
| Test-Time Optimization (TTO) | 在测试阶段对模型进行额外优化的技术,以提升特定场景的重建性能。 |
| Negative Gaussian Log-Likelihood | 一种衡量模型预测不确定性的指标,基于高斯分布的对数似然。 |
| Expected Calibration Error | 用于评估模型预测概率校准程度的指标,衡量预测置信度与实际准确性之间的差异。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅