该研究探讨了大型语言模型(LLM)在算术推理中跨格式泛化的内部机制。人类能轻松解决“2+5”和“two plus five”这类表面形式不同但本质相同的问题,而LLM在数字格式上表现近乎完美,但在语言表述上准确率显著下降。研究者采用归因修补技术,在英语、西班牙语和意大利语三种语言中,分别定位模型处理数字算术(如2+5)与语言算术(如“two plus five”)时调用的神经回路,并检验两者重叠程度是否能预测泛化能力。结果显示,电路重叠度在三个层面均有效预测泛化表现:解释不同语言格式的相对难度、预测模型对哪种格式泛化最佳,以及判断哪些具体题目能被正确解答。该方法的预测能力可与有监督探针相媲美,且无需任何标注数据。这一发现揭示了LLM跨格式推理的神经基础,为理解其泛化机制提供了新视角。
| LLM | 大型语言模型,如GPT系列,用于处理自然语言和推理任务。 |
| attribution patching | 一种用于定位模型内部特定计算路径(电路)的技术,通过干预激活来归因输出。 |
| circuit | 模型中负责特定功能的神经通路或子网络,此处指算术推理的专用计算路径。 |
| generalization | 模型对未见过的输入变体(如不同格式)的适应能力。 |
| supervised probes | 使用标注数据训练的分类器,用于检测模型内部表示中的特定信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅