这项研究探讨了大语言模型内部数学推理的组织方式。研究者提出一种"生成—重放"协议:先让模型生成解答,再重放完整的提示与生成轨迹,提取推理词元上的激活重要性特征,并对八个模型、五个数学推理来源的特征进行无监督聚类。结果显示,在全部40个模型—来源组合中,恢复出的聚类结构均优于同等规模的随机基线;两个独立的前沿模型评审在77%至82%的真实聚类中识别出"解题方法"层面的一致性,而对照条件仅为6%至11%。在控制方法的提示实验中,改变所要求的推理方法会使八个模型条件中的七个发生聚类归属变化,而改写表述则基本保持归属不变。这表明数学能力较强的模型是按可复用的推理方法来组织内部计算的,而非按基准测试的题目主题。其意义在于,按主题分层的评测基准和主题均衡的训练语料可能仍会遗漏真正关键的维度——即便语料在主题上刻意均衡,在推理方法上仍可能严重失衡。
| 生成-重放协议 | 一种分析模型内部计算的方法:先让模型生成解答,再重放提示和生成轨迹以提取推理标记上的激活重要性签名。 |
| 激活重要性签名 | 在模型生成推理标记时,从内部激活中提取的、反映各标记重要性的特征向量,用于聚类分析。 |
| 推理方法 | 模型解决数学问题时采用的通用策略或步骤模式(如代数操作、反证法),区别于具体的数学主题。 |
| 主题分层基准 | 按数学主题(如代数、几何)划分和评估的测试集,传统上用于衡量模型能力。 |
| 方法控制提示 | 在提示中明确指定所要求的推理方法,用于测试模型内部聚类是否随方法改变而变化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅