该研究探讨语言模型激活空间中潜在结构的因果影响力为何存在显著差异,提出因果影响力由容量、响应性和对齐三个因素共同决定。容量衡量模型输出对沿该结构移动的敏感度,响应性反映概念在当前上下文中被激发的难易程度,对齐则体现结构与上下文特定概念表征的匹配程度。研究覆盖4个语言模型家族和50个概念,发现因果有效性需三个因素同时较高:容量和响应性偏低分别使因果效果下降84%和95%,而对齐偏低甚至会逆转效果、抑制概念表达。研究进一步表明,因果性并非结构的固有属性,而是依赖上下文,有效方向构成随语境变化的低维子空间。基于此,作者将线性探针训练限制在该子空间内,提出因果探针,在多个模型上实现17%至118%的引导性能提升,概念检测仅下降3%。
| 潜在结构 | 语言模型激活空间中编码特定概念或特征的内部表示模式。 |
| 因果影响力 | 一个潜在结构对模型输出行为产生因果效应的程度。 |
| 容量 | 模型输出对沿潜在结构方向移动的敏感度,即改变该结构时输出变化的幅度。 |
| 响应性 | 在给定上下文下,概念被提升或激活的容易程度。 |
| 对齐性 | 潜在结构与当前上下文中概念特定表示之间的匹配程度。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅