潜意识提示让70B模型因果控制力暴涨0.286,18个概念全涨!
Subliminal Prompting Beyond Static Geometry: Causal Depth and Multi-Token Confounds
arXiv CL (cs.CL) 重要 大模型论文方法安全对齐 🕐 09-18 12:00

📖 AI 总结

该研究考察语言模型如何通过看似无关的输出传递隐藏特征,即“潜意识学习”现象。作者在固定的动物—数字提示协议下,分别测量输出共变、固定输出向量对齐、隐藏状态可读性以及因果控制这几种解释路径。结果显示,从Llama-3.1-8B到70B,固定输出向量相似度对行为的预测能力下降,配对平均相关变化为-0.080;而将答案位置状态跨提示复制后,供体控制AUC从0.254升至0.540,配对变化达+0.286,且18个概念均上升,说明因果时序与静态几何是不同性质。在Qwen模型中,逐位评分无法恢复单token正关联,按token平均则产生受数字长度混淆的虚假关联。研究的意义在于区分了固定几何、观测可读性、因果时序与多token测量四种属性,对token级解释构成约束,但尚未揭示训练时特征迁移的机制。

🔑 关键词速览

Subliminal Learning潜意识学习,指语言模型通过看似无关的输出传递隐藏特征的现象。
Token Entanglement词元纠缠,一种解释,认为模型输出词汇表中的动物和数字词元通过模型相互关联。
Causal Control因果控制,指通过干预隐藏状态来测试其是否因果地影响模型输出的方法。
Multi-Token Measurement多词元测量,指对序列中多个词元进行评分或平均的测量方式,可能引入长度混淆。
Length Confound长度混淆,指因序列长度差异导致的虚假关联,在控制数字宽度后消失。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅