该研究探讨语言模型在事实回忆中,关系类信息(如“首都”)与实体类信息(如“法国—巴黎”)是否在同一网络深度、同一最终token位置同时产生因果作用。作者在四种解码器模型和八组提示上使用四种互补的因果诊断方法,发现稳定的时间不对称性:关系信息比实体信息更早成为生成的控制因素,在阈值0.4下领先10至16层,约占网络深度的31%至44%,且在阈值0.2至0.5的全部16种模型—阈值组合中均成立。关键的是,实体信息并非早期缺失,早期层实体token替换成功率高达90%至100%,但其对生成的承诺被推迟:实体信息在实体token位置已可获得,却需被路由至最终token后才真正控制生成。这一发现揭示了事实回忆中关系先于实体的分阶段承诺机制。
| 关系类型信息 | 指知识中抽象的关系类别,如“首都-属于”或“作者-作品”,不依赖于具体实体。 |
| 实体特定信息 | 指与具体实体相关的信息,如“法国”对应“巴黎”,是事实回忆中的具体内容。 |
| 因果诊断 | 通过干预模型内部状态(如激活修补)来测试信息是否对生成输出有因果影响的方法。 |
| 生成控制 | 指信息在模型生成过程中实际影响输出决策的状态,而不仅仅是内部表征。 |
| 实体标记修补 | 一种因果干预技术,将实体标记位置的激活替换为其他值,以测试该位置信息对生成的影响。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅