这篇论文研究思维链(CoT)中模型写出的推理步骤是否真正因果性地决定了其答案,而非仅仅是事后解释。作者提出一种在激活层面测量忠实性的方法,针对模型自生成的推理,用反事实运行中对应步骤的激活来替换残差流中该步骤所在的token片段,且每次干预都有可预测的目标实体。实验采用2至6跳的合成多跳查找任务。结果显示,对Qwen3-4B而言,在最敏感的中层网络中,76.9%±2.8%的陈述步骤具有因果承载性,远高于随机位置基线的11.3%,并达到直接替换底层提示事实所产生效应的约96%。但标准行为测试在同一批样本上给出88.2%的忠实度,高估了11.4个百分点,在简单样本上高估可达20个百分点。研究还发现能力维度差异:Qwen3-1.7B整体因果忠实度仅54.8%,且随推理深度增加从2跳的68%骤降至6跳的30%,而Qwen3-4B相对平稳。这表明陈述推理虽可具有因果意义,但行为测试会系统性高估其忠实性,尤其在模型推理看似最流畅的简单任务上。
| Chain-of-thought (CoT) | 思维链,指模型在给出最终答案前生成的一系列中间推理步骤。 |
| Causal load-bearing (CLB) | 因果承载性,衡量某个陈述的推理步骤是否对最终答案的产生具有因果必要性。 |
| Activation patching | 激活修补,一种因果干预技术,通过替换模型内部激活值来观察对输出的影响。 |
| Residual stream | 残差流,Transformer中贯穿各层的向量表示,承载并累积信息。 |
| Multi-hop lookup tasks | 多跳查找任务,需要模型通过多个推理步骤(跳)才能找到答案的合成任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅