该研究系统诊断了视觉-语言模型少样本适应中常用的原型混合方法,质疑其核心假设——混合比例是否真正决定性能。通过4,800组实验(覆盖十数据集、五种骨干网络、五种样本量等),作者发现理论上最优的混合比例(等价于正部James-Stein收缩系数)在实际中反而比测试集调优的基准低8.5个点,原因是78%的文本-图像原型距离属于类无关偏移,会被argmax操作抵消。研究进一步证明,仅用支持集的留一法即可将比例设定在接近最优水平(差距仅0.9点),无需验证数据。更关键的是,无验证线性探针(CLAP、LP++)在平均性能上分别超越最优调优混合1.9和1.5个点,且当K≥4时全部无验证基线均优于oracle调优。结论表明性能瓶颈在于模型类别本身而非超参数选择,混合比例可近乎免费地优化,但并非性能提升的关键所在。
| prototype blending | 原型混合,指将文本原型和图像特征均值按比例组合进行分类的方法。 |
| James-Stein coefficient | James-Stein系数,一种收缩估计量,用于将估计值向先验均值收缩以降低均方误差。 |
| zero-shot text prototype | 零样本文本原型,由类别文本描述编码得到的代表性向量,无需训练样本。 |
| oracle ratio | 神谕比例,指在测试集上通过搜索得到的最优混合比例,作为性能上界参考。 |
| linear probe | 线性探针,一种在冻结特征上训练线性分类器的简单方法,用于评估特征质量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅