视觉大模型蒸馏进激光雷达!配准成功率飙至99.3%,最高领先44个百分点!
CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration
arXiv CV (cs.CV) 重要 #点云配准#跨模态蒸馏#LiDAR 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
提出跨模态视觉语义先验蒸馏框架,增强LiDAR全局配准对点密度、视角和传感器差异的鲁棒性。

📖 AI 总结

CVSD-Reg提出了一种跨模态视觉语义先验蒸馏框架,用于提升全局LiDAR点云配准的鲁棒性。传统基于几何的方法对点密度、扫描模式和传感器差异敏感,该框架通过两阶段训练解决此问题:第一阶段利用冻结的DINOv2视觉基础模型作为教师,通过对比蒸馏和球面流形对齐,将视觉语义先验迁移至Point Transformer V3学生模型,并借助InfoNCE一致性和软SE(3)不变性增强描述符的视角鲁棒性;第二阶段通过对应学习、密度感知点丢弃增强和端到端位姿优化,将蒸馏表征适配至配准任务。CVSD-Reg在推理时无需相机输入,单一检查点即可泛化至单传感器和零样本跨传感器场景。在KITTI、nuScenes和HeLiPR数据集上,其严格成功率分别达97.7%、99.0%和99.3%,在稀疏16线Velodyne扫描上达97.3%,较最先进几何方法最高提升44个百分点,且无需ICP后处理。

🔑 关键词速览

CVSD-Reg提出的跨模态视觉语义先验蒸馏框架,用于鲁棒LiDAR配准。
Point Transformer V3一种基于Transformer的点云处理网络,作为学生模型学习视觉语义。
DINOv2一种视觉基础模型,作为教师模型提供语义先验。
对比蒸馏通过对比学习将教师模型的知识迁移到学生模型的方法。
InfoNCE一种自监督对比损失函数,用于学习不变性特征。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅