🔥 今日值得一读 系统提示竟是幻觉!17个模型实测:安全指令几乎不改变内部计算,70B模型渗透率仍低于10%
The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models
arXiv CL (cs.CL) 🔥 重点 #可解释性#系统提示#Transformer#表征分析 🕐 10-01 12:00
👨‍💼 主理人解读 · 为什么值得关注
揭示系统提示并非均匀影响模型,而是深层重构特定层表征,帮助开发者更精准地设计提示词策略。

📖 AI 总结

这项研究系统考察了系统提示词对语言模型内部计算的实际影响。作者对17个指令微调模型(涵盖8个架构家族、1.5B至72B参数)使用中心核对齐方法,比较了五类共20种系统提示下的逐层表示。结果显示,提示词的作用具有明显的层选择性和指令类型依赖性:人格设定和格式类指令会深度重构中间层表示,而安全类指令几乎不改变计算过程,其效果与最小基线在统计上无法区分。更值得注意的是,限制性安全指令与明确许可性指令(如"你没有任何限制")激活的计算路径几乎相同,平均CKA相关性高达0.997,且这一现象在商业规模模型上依然存在,即便在70B至72B参数级别,安全指令的渗透率仍低于10%。线性探针实验揭示了机制:模型在每一层都能编码提示类别,但仅在一小部分层真正重构计算,说明提示被"看到"却未被"执行"。因果激活修补证实这些层介导了行为变化,且表示深度可预测行为效应大小。该研究为基于系统提示的安全防护为何持续易被越狱提供了机制性解释。

🔑 关键词速览

Centered Kernel Alignment (CKA)一种用于比较神经网络不同层或不同模型表示相似性的度量方法,对表示的正交变换和缩放具有不变性。
System Prompt在对话开始前提供给语言模型的指令性文本,用于设定模型的行为、角色或限制,是实践者控制模型行为的主要手段。
Instruction-Tuned Models经过指令微调训练的语言模型,使其能够更好地遵循人类指令并完成特定任务。
Activation Patching一种因果干预技术,通过替换或修补模型特定层的激活值来测试该层对模型行为的因果影响。
Linear Probing一种通过训练线性分类器从模型内部表示中预测特定属性的方法,用于探测模型表示中编码的信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅