该研究针对推理模型“知道答案后仍继续思考”的低效问题,提出了一种名为“halt vector”的因果干预方法。在DeepSeek-R1-Distill-Qwen-7B模型中,思维链长度约为答案概率稳定所需时长的两倍,且多余部分因问题而异,无法通过全局长度惩罚消除。研究者发现,第18层存在一个差均值方向,其操控强度可控制思考时长,但直接最大化该方向的标量投影会破坏下游读取器依赖的离轴维度,反而使生成变长。有效方法是将整个受控激活重建,并固定这些维度至自然值。仅基于24个问题拟合、无需强化学习,该方法在五个未见基准上保持准确率的同时削减了约四分之一思考量,削减程度与各问题可移除冗余的相关系数为0.70。此外,该方法还解决了随难度增长的非终止病理现象。研究者不声称优于精心调优的长度惩罚或解码时提前退出,贡献在于获取该机制的方法本身。
| halt vector | 一种因果干预向量,通过引导模型内部表示来控制推理长度,使模型在知道答案时停止思考。 |
| causal interpretability | 研究模型内部机制如何因果影响输出的方法,用于识别关键方向或组件。 |
| steering strength | 引导干预的强度参数,控制对模型行为的影响程度。 |
| difference-of-means direction | 通过比较两组激活均值差异得到的方向,常用于识别控制特定行为的特征。 |
| chain of thought | 推理模型生成的逐步思考过程,用于解决复杂问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅