少样本调参白费?理论最优比例竟比测试集调参还差8.5分,留一法免验证逼近神谕!
The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models
arXiv CV (cs.CV) 重要 论文方法多模态少样本学习 🕐 08-26 12:00

📖 AI 总结

该研究系统诊断了视觉-语言模型少样本适应中常用的原型混合方法,质疑其核心假设——混合比例是否真正决定性能。通过4,800组实验(覆盖十数据集、五种骨干网络、五种样本量等),作者发现理论上最优的混合比例(等价于正部James-Stein收缩系数)在实际中反而比测试集调优的基准低8.5个点,原因是78%的文本-图像原型距离属于类无关偏移,会被argmax操作抵消。研究进一步证明,仅用支持集的留一法即可将比例设定在接近最优水平(差距仅0.9点),无需验证数据。更关键的是,无验证线性探针(CLAP、LP++)在平均性能上分别超越最优调优混合1.9和1.5个点,且当K≥4时全部无验证基线均优于oracle调优。结论表明性能瓶颈在于模型类别本身而非超参数选择,混合比例可近乎免费地优化,但并非性能提升的关键所在。

🔑 关键词速览

prototype blending原型混合,指将文本原型和图像特征均值按比例组合进行分类的方法。
James-Stein coefficientJames-Stein系数,一种收缩估计量,用于将估计值向先验均值收缩以降低均方误差。
zero-shot text prototype零样本文本原型,由类别文本描述编码得到的代表性向量,无需训练样本。
oracle ratio神谕比例,指在测试集上通过搜索得到的最优混合比例,作为性能上界参考。
linear probe线性探针,一种在冻结特征上训练线性分类器的简单方法,用于评估特征质量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅