🔥 今日值得一读 LLM解数学题:数字格式满分,换成文字就翻车?新研究用“电路重叠”精准预测哪些能泛化!
Shared circuits predict whether LLMs generalize across formats in arithmetic reasoning
arXiv CL (cs.CL) 🔥 重点 #可解释性#推理#Transformer 🕐 09-07 12:00
👨‍💼 主理人解读 · 为什么值得关注
通过内部电路分析预测模型泛化瓶颈,指导训练数据设计,提升跨格式推理鲁棒性。

📖 AI 总结

该研究探讨了大型语言模型(LLM)在算术推理中跨格式泛化的内部机制。人类能轻松解决“2+5”和“two plus five”这类表面形式不同但本质相同的问题,而LLM在数字格式上表现近乎完美,但在语言表述上准确率显著下降。研究者采用归因修补技术,在英语、西班牙语和意大利语三种语言中,分别定位模型处理数字算术(如2+5)与语言算术(如“two plus five”)时调用的神经回路,并检验两者重叠程度是否能预测泛化能力。结果显示,电路重叠度在三个层面均有效预测泛化表现:解释不同语言格式的相对难度、预测模型对哪种格式泛化最佳,以及判断哪些具体题目能被正确解答。该方法的预测能力可与有监督探针相媲美,且无需任何标注数据。这一发现揭示了LLM跨格式推理的神经基础,为理解其泛化机制提供了新视角。

🔑 关键词速览

LLM大型语言模型,如GPT系列,用于处理自然语言和推理任务。
attribution patching一种用于定位模型内部特定计算路径(电路)的技术,通过干预激活来归因输出。
circuit模型中负责特定功能的神经通路或子网络,此处指算术推理的专用计算路径。
generalization模型对未见过的输入变体(如不同格式)的适应能力。
supervised probes使用标注数据训练的分类器,用于检测模型内部表示中的特定信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅