几何先验救场:无CAD也能识别物体,性能直逼CAD模型还反超图像识别!
Where Appearance Fails, Geometry Recognizes: A CAD-Free 3D Shape Prior That Complements Vision Foundation Models
arXiv CV (cs.CV) 重要 #3D重建#视觉识别#机器人 🕐 09-07 12:00

📖 AI 总结

该研究提出一种无需CAD模型的3D形状先验方法,用于补充视觉基础模型在无标签工业物体识别中的不足。核心思路是:对物体进行短时扫描,用3D高斯泼溅重建几何,生成每类形状原型,并与冻结的DINOv2图像特征融合。实验表明,RGB-D深度、3DGS和CAD几何在识别精度上相当,说明3DGS仅是获取点云的便捷途径,几何本身恢复了CAD的识别价值。在形状区分度高的家用物体上,纯几何识别达0.920,高于图像仅0.832;在形状易混淆的无纹理工业零件上,融合提升虽小但稳定。该先验具互补性,能挽救更多图像识别失败,且在部分遮挡下增益更大。研究强调价值在几何而非渲染像素,且识别对光照近乎不变。

🔑 关键词速览

3D Gaussian Splatting (3DGS)一种将场景表示为三维高斯分布并进行高效渲染的技术,用于从扫描数据重建物体几何。
CAD model计算机辅助设计模型,是物体的精确三维数字表示,常用于机器人识别,但实际中常不可得。
DINOv2一种自监督视觉基础模型,提取的图像特征可迁移用于多种视觉任务,此处作为冻结特征源。
shape prior关于物体形状的先验知识,用于辅助识别,本文中通过扫描重建获得。
frozen features预训练模型提取后不微调的特征,用于下游任务,本文中测试其对光照变化的鲁棒性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅