🔥 今日值得一读 AI推理步骤竟能逐个看穿!中间层暴露隐藏思维,安全风险浮出水面
AI models' written reasoning steps correspond to distinct internal patterns, a new study finds
The Decoder 🔥 重点 可解释性安全对齐论文方法 🕐 09-12 21:39

📖 AI 总结

一项新研究探讨了语言模型文本输出中呈现的推理步骤是否同样存在于其内部状态中。韩国KAIST与Naver AI Lab的研究人员定义了提取、分解、公式回忆、演绎和计算等八种推理操作,让Qwen2.5-7B、Qwen3-8B和Gemma4-31B三个模型解答数学题,并用GPT-5对解题路径分段标注。结果显示,不同推理操作在模型内部表征中可被可靠区分,信号在中间层最强。仅依赖词汇的分类器表现更差,说明内部状态携带的信息超越了表层措辞。此外,常见功能词在不同推理步骤中获得不同表征,且当阻断对前30个token的注意力时,推理信号明显减弱,表明推理步骤并非孤立产生,而是依赖前文语境逐步构建。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅