该研究针对视觉语言模型在农业识别任务中零样本表现不佳的问题,构建了涵盖116个数据集、834个类别、8324张图像的基准,覆盖病害、虫害、损伤、品质和物种识别等任务。线性探测表明,模型视觉编码器已能提取与自监督基线DINOv3接近可分的农业特征,说明瓶颈不在视觉表征,而在于未能将视觉特征与领域知识有效连接。以参考描述作为条件可大幅缩小差距,证明模型掌握的知识多于其表现。为此,作者提出基于固定诊断量规的测试时推理方法,通过生成多个候选并用概率枢轴锦标赛验证器择优,使F1几乎翻倍,部分任务甚至超过上界。但验证器的置信度评分与正确率负相关,无法作为不确定性度量,增益主要来自量规引导的生成而非成对验证。
| 视觉语言模型 (VLM) | 一种能同时处理图像和文本的多模态人工智能模型,常用于图像分类和描述生成。 |
| 线性探测 (Linear Probing) | 一种评估预训练模型特征质量的方法,通过在冻结特征上训练简单线性分类器来测试其可分性。 |
| 预言机参考描述 (Oracle Reference Description) | 在评估中作为上界使用的理想化描述,代表模型参数知识所能达到的最佳条件。 |
| 概率枢轴锦标赛 (PPT) | 一种基于成对比较的验证器,根据评分标准对候选响应进行评分并选出最佳响应。 |
| F1分数 | 衡量分类模型精确率和召回率调和平均的指标,常用于评估不平衡数据集的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅