该研究针对一个公开葡萄病害数据集(含3288张图像、11995个标注框、6个类别)中的捷径学习现象展开系统分析。研究发现,在不同模型容量、输入分辨率和检测范式下,测试集mAP50的波动幅度与随机种子噪声相当,且所有五种架构的性能瓶颈均集中在小目标检测上。核心发现指向数据标注层面的不一致:其中一个类别采用整叶级标注(中位框面积占图像43.16%),而其余五类采用病斑级标注。在5156张不含葡萄的跨物种图像测试中,65.7%的误检框落入该整叶标注类别,其占比超出训练标注份额13.41倍。通过反事实重训练验证了标注粒度对捷径强度的因果效应:仅缩小该类别的标注框即可减少66%的跨物种误检,安慰剂对照实验确认了该效应的特异性。然而,反向操作(将最精细类别粗化至整叶级)并未产生预期效果,表明标注粒度只是捷径的调节因子而非根本原因——它能放大或减弱已存在的偏差,但无法创造新的偏差。研究还提出了无需图像和训练的粒度筛查统计量,并指出空中病斑级检测在光学上不可行,同时强调该失效模式在分布内评估中完全不可见。
| Shortcut Learning | 捷径学习,指模型利用数据中的非预期特征进行预测,导致泛化能力下降的现象。 |
| Annotation Granularity | 标注粒度,指目标检测中边界框的精细程度,如整叶级别或病斑级别。 |
| mAP50 | 平均精度均值(在IoU阈值为0.5时),用于评估目标检测模型性能的指标。 |
| Counterfactual Retraining | 反事实重训练,通过修改训练数据(如改变标注)来检验因果关系的方法。 |
| Cross-species False Positives | 跨物种假阳性,指在无目标物体的图像(如无葡萄图像)中模型产生的错误检测。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅