该研究考察语言模型如何通过看似无关的输出传递隐藏特征,即“潜意识学习”现象。作者在固定的动物—数字提示协议下,分别测量输出共变、固定输出向量对齐、隐藏状态可读性以及因果控制这几种解释路径。结果显示,从Llama-3.1-8B到70B,固定输出向量相似度对行为的预测能力下降,配对平均相关变化为-0.080;而将答案位置状态跨提示复制后,供体控制AUC从0.254升至0.540,配对变化达+0.286,且18个概念均上升,说明因果时序与静态几何是不同性质。在Qwen模型中,逐位评分无法恢复单token正关联,按token平均则产生受数字长度混淆的虚假关联。研究的意义在于区分了固定几何、观测可读性、因果时序与多token测量四种属性,对token级解释构成约束,但尚未揭示训练时特征迁移的机制。
| Subliminal Learning | 潜意识学习,指语言模型通过看似无关的输出传递隐藏特征的现象。 |
| Token Entanglement | 词元纠缠,一种解释,认为模型输出词汇表中的动物和数字词元通过模型相互关联。 |
| Causal Control | 因果控制,指通过干预隐藏状态来测试其是否因果地影响模型输出的方法。 |
| Multi-Token Measurement | 多词元测量,指对序列中多个词元进行评分或平均的测量方式,可能引入长度混淆。 |
| Length Confound | 长度混淆,指因序列长度差异导致的虚假关联,在控制数字宽度后消失。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅