少样本提示竟拖后腿!12个模型实测:新闻任务涨24点,法律任务仅3.4点,两模型直接掉分
Few-Shot Degradation Is Not What It Seems: Behavioral Evidence, Representation Analysis, and a Random-Text Control Across 12 Models, 2 Tasks, and 2 Architectures
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-16 12:00

📖 AI 总结

该研究探讨了少样本提示有时反而损害语言模型性能这一现象,在12个开源模型、两项乌克兰语任务(新闻分类与法律案件结果预测)上进行了评估。行为层面发现效应高度依赖任务:同一批模型在新闻任务上平均提升24个百分点,在法律文本上仅提升3.4个百分点,且有两个模型出现性能下降。为解释原因,作者指出以往用隐藏状态偏移衡量少样本影响的做法存在缺陷,因为少样本提示本身更长,长度差异本身就会改变表征。为此提出以长度匹配的随机文本作为对照,扣除长度因素后得到“内容增量”指标,用以单独衡量示例内容对表征的影响。结果显示,原始偏移无法预测少样本是否有益(r=0.20),而内容增量具有显著预测力(rho=+0.65,p=0.043),且方向与直觉相反:模型因示例内容而重构表征越多,受益越大。在Llama 3.3 70B上遮蔽示例的因果实验进一步验证了该结论,准确率恢复至零样本基线之上。

🔑 关键词速览

Few-shot prompting在提示中提供少量示例来引导模型完成任务的提示方法。
Content delta本文提出的度量,通过减去长度匹配随机文本引起的表示变化,隔离出演示内容导致的表示变化。
Raw shift零样本和少样本模式之间隐藏状态的整体变化量,未区分长度和内容的影响。
Representation analysis分析模型内部隐藏状态或表示的方法,用于理解模型行为。
Random-text control用长度匹配的随机文本替换演示,以控制提示长度影响的实验设计。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅