该研究探讨了少样本提示有时反而损害语言模型性能这一现象,在12个开源模型、两项乌克兰语任务(新闻分类与法律案件结果预测)上进行了评估。行为层面发现效应高度依赖任务:同一批模型在新闻任务上平均提升24个百分点,在法律文本上仅提升3.4个百分点,且有两个模型出现性能下降。为解释原因,作者指出以往用隐藏状态偏移衡量少样本影响的做法存在缺陷,因为少样本提示本身更长,长度差异本身就会改变表征。为此提出以长度匹配的随机文本作为对照,扣除长度因素后得到“内容增量”指标,用以单独衡量示例内容对表征的影响。结果显示,原始偏移无法预测少样本是否有益(r=0.20),而内容增量具有显著预测力(rho=+0.65,p=0.043),且方向与直觉相反:模型因示例内容而重构表征越多,受益越大。在Llama 3.3 70B上遮蔽示例的因果实验进一步验证了该结论,准确率恢复至零样本基线之上。
| Few-shot prompting | 在提示中提供少量示例来引导模型完成任务的提示方法。 |
| Content delta | 本文提出的度量,通过减去长度匹配随机文本引起的表示变化,隔离出演示内容导致的表示变化。 |
| Raw shift | 零样本和少样本模式之间隐藏状态的整体变化量,未区分长度和内容的影响。 |
| Representation analysis | 分析模型内部隐藏状态或表示的方法,用于理解模型行为。 |
| Random-text control | 用长度匹配的随机文本替换演示,以控制提示长度影响的实验设计。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅