VGGT-CAD 是一项面向参数化 CAD 三维模型重建的几何感知框架,旨在从单视图或多视图观测中同时恢复精确几何形状与可编辑的建模操作序列。针对现有方法依赖二维外观线索、缺乏多视图几何先验的问题,该工作将预训练的三维几何先验迁移至 CAD 重建任务,通过将相机参数编码为条件 token 并与图像 token 联合建模,同时引入可变视图跨视图上下文聚合模块以自适应融合不同数量的视角特征。此外,作者提出免训练的几何感知视图选择策略,在推理阶段筛选互补且可靠的帧,并采用非自回归解码器输出 CAD 命令序列。为支撑评测,研究还构建了基于现有 CAD 数据多视图重渲染的大规模多视图视频基准 VideoCAD。实验表明,该方法在不同观测配置下均能有效完成视觉 CAD 重建。
| 参数化CAD重建 | 从视觉观测中恢复CAD模型的精确几何形状及其可编辑的建模操作序列的过程。 |
| 几何先验 | 预训练模型中学到的关于三维空间结构和相机几何的知识,用于增强重建的准确性。 |
| 跨视角上下文聚合 | 一种自适应融合来自不同视角的特征的模块,以处理可变数量的输入视图。 |
| 非自回归解码器 | 一种并行生成输出序列的解码器,不同于逐词生成的自回归方法,可提高效率。 |
| VideoCAD | 一个通过多视角重渲染从现有CAD数据生成的大规模多视角视频基准数据集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅