CVSD-Reg提出了一种跨模态视觉语义先验蒸馏框架,用于提升全局LiDAR点云配准的鲁棒性。传统基于几何的方法对点密度、扫描模式和传感器差异敏感,该框架通过两阶段训练解决此问题:第一阶段利用冻结的DINOv2视觉基础模型作为教师,通过对比蒸馏和球面流形对齐,将视觉语义先验迁移至Point Transformer V3学生模型,并借助InfoNCE一致性和软SE(3)不变性增强描述符的视角鲁棒性;第二阶段通过对应学习、密度感知点丢弃增强和端到端位姿优化,将蒸馏表征适配至配准任务。CVSD-Reg在推理时无需相机输入,单一检查点即可泛化至单传感器和零样本跨传感器场景。在KITTI、nuScenes和HeLiPR数据集上,其严格成功率分别达97.7%、99.0%和99.3%,在稀疏16线Velodyne扫描上达97.3%,较最先进几何方法最高提升44个百分点,且无需ICP后处理。
| CVSD-Reg | 提出的跨模态视觉语义先验蒸馏框架,用于鲁棒LiDAR配准。 |
| Point Transformer V3 | 一种基于Transformer的点云处理网络,作为学生模型学习视觉语义。 |
| DINOv2 | 一种视觉基础模型,作为教师模型提供语义先验。 |
| 对比蒸馏 | 通过对比学习将教师模型的知识迁移到学生模型的方法。 |
| InfoNCE | 一种自监督对比损失函数,用于学习不变性特征。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅