一项新研究探讨了语言模型文本输出中呈现的推理步骤是否同样存在于其内部状态中。韩国KAIST与Naver AI Lab的研究人员定义了提取、分解、公式回忆、演绎和计算等八种推理操作,让Qwen2.5-7B、Qwen3-8B和Gemma4-31B三个模型解答数学题,并用GPT-5对解题路径分段标注。结果显示,不同推理操作在模型内部表征中可被可靠区分,信号在中间层最强。仅依赖词汇的分类器表现更差,说明内部状态携带的信息超越了表层措辞。此外,常见功能词在不同推理步骤中获得不同表征,且当阻断对前30个token的注意力时,推理信号明显减弱,表明推理步骤并非孤立产生,而是依赖前文语境逐步构建。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅