🔥 今日值得一读 小样本学习评估藏9.66个百分点乐观偏差,域内预训练虚高33.41个百分点!
Are We Really Doing Few-Shot Learning? A Critical Examination of Pre-Training Assumptions
arXiv CV (cs.CV) 🔥 重点 #少样本学习#评测基准#预训练#方法论 🕐 09-11 12:00
👨‍💼 主理人解读 · 为什么值得关注
提醒开发者少样本评测协议可能虚高,需按真实低数据场景重新评估模型泛化能力。

📖 AI 总结

这篇论文系统审视了小样本学习评估中普遍采用的预训练假设,指出仅保证类别不重叠并不足以排除目标域数据的影响。作者在八个数据集、三种小样本架构和多种way-shot设置下,对比了无预训练、类不重叠的同域预训练、有监督的跨域预训练以及无标签的跨域预训练四种条件。结果显示,同域预训练平均比无预训练提升33.41个百分点,而有监督跨域预训练仅提升23.75个百分点,两者相差9.66个百分点,反映出同域重叠带来的乐观偏差。研究还发现,标注源数据并非必需,基于增强的无标签策略平均提升27.71个百分点,接近有监督跨域预训练的27.97个百分点。此外,作者提出一种基于描述符的源域选择策略,可在预训练前评估源域适用性,与最优选择的中位差距仅1.37个百分点。该工作提示,将同域预训练作为默认评估协议会高估模型在目标域数据稀缺场景下的真实性能,亟需建立更贴近实际的小样本评估范式。

🔑 关键词速览

Few-Shot Learning小样本学习,指模型仅用少量标注样本就能识别新类别的学习范式。
Pre-Training预训练,指在大规模辅助数据上先训练模型,再迁移到目标任务的过程。
In-Domain Pre-Training域内预训练,指预训练数据与目标任务来自同一视觉域但类别不相交。
Out-of-Domain Pre-Training域外预训练,指预训练数据来自与目标任务不同的视觉域。
Label-Free Strategy无标签策略,指不依赖源域标注数据、仅利用数据增强等方式进行预训练的方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅