这篇论文提出一种从单次前向传播中提取语言模型内部电路的新方法。作者将注意力机制视为一张路由图,从中筛选出指向答案的少量关键路径,并检验这些路径是否真正具有因果作用。在归纳头和IOI等已知电路的任务上,消融所提取边对模型性能的损害显著大于消融同等规模的随机边集。实验覆盖GPT-2 Small、GPT-2 Medium和Pythia-410M,每个条件使用100条提示,并采用配对差距检验与自助法置信区间。提取步骤仅需一次前向传播,而逐头补丁扫描的成本约高出两个数量级。作者强调这并非完整的电路图谱,而是一种廉价且能携带真实因果信号的草图,同时明确指出了失效情形。该工作为语言模型可解释性提供了一种高效、可扩展的电路发现思路。
| 回路提取 (Circuit Extraction) | 从神经网络中识别出对特定任务负责的子网络(即回路)的过程。 |
| 路由图 (Routing Graph) | 将注意力模式视为信息流动的路由映射,用于追踪从输入到输出的路径。 |
| 消融 (Ablation) | 通过移除或破坏模型中的某些组件(如边或头)来评估其对模型行为的影响。 |
| 归纳任务 (Induction Task) | 一种序列预测任务,模型需要根据前文重复的模式预测下一个词元。 |
| IOI 任务 (Indirect Object Identification) | 间接宾语识别任务,模型需从句子中识别出间接宾语,是研究回路的标准基准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅