🔥 今日值得一读 上下文越长越中毒!干扰项一多,大模型找证据能力直接崩盘
Context Poisoning as Extreme-Value Attention Interference in Long-Context Language Models
arXiv CL (cs.CL) 🔥 重点 长上下文安全对齐论文方法 🕐 今天 12:00

📖 AI 总结

这篇论文研究长上下文语言模型中的"上下文投毒"现象,即随着无关或易混淆内容增加,模型定位并利用关键证据的能力下降。作者将其形式化为注意力机制中的极值干扰问题:决定性证据的得分存在上界,而有效干扰项的最大得分随其数量增长。在softmax检索抽象下,研究推导出有限样本上界,表明若要在基准率之上维持固定准确率,证据边际需按Ω(√log N)增长,其中N为有效干扰项数量而非原始上下文长度。该分析将长上下文性能退化与得分混叠、位置混叠及softmax稀释联系起来。对照实验显示,在嵌入难负样本时检索准确率随上下文增长而下降;在固定上下文长度下,同格式干扰构造造成的准确率降幅最大;检索门控可改善证据利用,但其净收益取决于能否保持证据召回率。研究据此提出证据瓶颈、抗混叠表示、先检索后推理架构、验证器中介记忆及对比式抗投毒训练等方向。

🔑 关键词速览

上下文中毒 (Context Poisoning)指长上下文中无关或易混淆信息干扰模型定位关键证据,导致性能下降的现象。
极值干扰 (Extreme-Value Interference)注意力机制中,决定性证据得分有上界,而干扰项最大得分随数量增长,形成极值竞争。
得分混叠 (Score Aliasing)不同上下文片段因得分相近而难以区分,导致检索时证据与干扰项混淆。
位置混叠 (Positional Aliasing)位置编码在长上下文中产生周期性或模糊性,使模型难以准确区分不同位置的信息。
检索门控 (Retrieval Gating)一种机制,通过门控函数动态选择是否使用检索到的证据,以平衡证据利用与召回。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅