仅需一段视频和两张图,新零件识别准确率85.7%!
CALIPER: Metric-Grounded Model-Free Recognition of Visually Similar Industrial Parts
arXiv CV (cs.CV) 论文方法多模态 🕐 09-17 12:00

📖 AI 总结

CALIPER 是一个面向工业场景的无模型 RGB-D 识别框架,旨在解决外观高度相似、仅靠物理尺寸区分的零件细粒度识别难题。该方法无需 CAD 模型或大规模类别数据集,每个类别仅需一段转台 RGB-D 视频和一到两张标注真实图像即可完成注册:三维重建提供新视角外观支持,对齐深度生成类别专属的度量尺寸轮廓。推理阶段先用 YOLOv8n-seg 粗定位,再由冻结的 DINOv2 主干配合情景训练的嵌入头做细粒度匹配,并通过边际条件化的度量融合,仅在出现外观歧义时启用尺寸概率证据。在 18 类相似工业零件上的实验显示,闭集准确率达 88.2%,定位召回率 99.8%;对两个未见过螺丝进行 10 样本注册后整体准确率为 85.7%,度量融合使未见类准确率最高提升 37.4 个百分点,且未显著损害原有类别性能。机械臂部署中无需针对性重训练即可识别 18 类中的 17 类,表明该方法适合库存动态演化的工业应用。

🔑 关键词速览

CALIPER本文提出的无模型 RGB-D 框架,结合外观匹配与度量尺寸证据,用于视觉相似工业零件的细粒度识别。
RGB-D同时包含彩色(RGB)和深度(Depth)信息的图像数据,用于获取物体的三维结构。
DINOv2一种自监督预训练的视觉 Transformer 主干网络,可提取通用图像特征,本文中冻结使用。
YOLOv8n-segYOLOv8 系列中的轻量级实例分割模型,用于在推理阶段粗略定位工业零件。
度量融合(Metric Fusion)将基于深度的绝对尺寸证据与外观匹配结果结合,仅在决策模糊时激活尺寸信息以提升识别准确率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅