该研究揭示了大语言模型内部存在一类特殊的“磁性向量”标记,它们像物理磁铁一样通过吸引或排斥作用组织周围标记的几何表征。研究发现,功能词在模型早期层中一致地充当排斥磁体,且不同架构、规模和层配置的模型均表现出这一规律。通过因果实验,研究者发现移除早期层的排斥磁体会严重破坏句法任务性能(词性标注准确率从91%骤降至10%以下),而移除后期层的吸引磁体则主要损害语义任务。在问答任务中,答案跨度标记在最终层成为独特的排斥磁体,从几何上从上下文中“雕刻”出答案。该发现提供了首个无需探针即可理解语言模型跨层几何组织语言计算的方式,为解释LLM内部工作机制开辟了新路径。
| magnetic vectors | 在语言模型中,指一类特殊的令牌向量,通过吸引或排斥周围令牌来组织其表示,类似物理磁铁的作用。 |
| function words | 功能词,如介词、连词等,主要起语法作用,在早期层中表现为排斥磁铁。 |
| fine-tuning | 微调,指在预训练模型基础上,针对特定下游任务进行额外训练以调整模型参数。 |
| POS tagging | 词性标注,一种句法任务,用于为每个词分配词性标签,如名词、动词等。 |
| probe-free path | 无探针路径,指不依赖外部探针或分类器,直接通过模型内部几何结构理解其计算的方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅