该研究提出了一种名为“思维状态”(State of Thought,SoT)的新型推理范式,旨在让大语言模型实现内源性推理,即由模型内部推理状态主导推理过程的展开,而非依赖外部预设的推理程序或在受限搜索空间中进行高成本扩展。具体而言,SoT从模型内部信息传递中提取紧凑的动力学-几何状态,并在冻结的主干模型上使用仅含582个参数的控制器,选择性地激活当前推理状态下有用的历史推理支持,将推理重新定义为基于证据的状态条件过程。在3个模型和16个数据集上的实验显示,SoT在定量、通用、符号与代码以及长上下文推理任务中分别取得1.34倍、1.62倍、1.76倍和2.51倍的提升,同时减少62.6%的生成token和44.6%的端到端延迟。在视觉语言模型上,平均准确率提升3.8个百分点,完成token减少74.9%,延迟降低73.5%。该工作为构建可泛化且高效的推理系统提供了新思路。
| State of Thought (SoT) | 一种新的推理范式,让模型内部推理状态主导推理过程,实现内生推理而非外部控制。 |
| Test-time compute | 在推理阶段增加计算量以提升大语言模型能力的方法。 |
| Endogenous reasoning | 由模型内部状态驱动、而非外部程序或搜索控制的推理方式。 |
| Dynamics-geometric state | 从模型内部信息传递中提取的紧凑状态表示,用于刻画推理动态与几何特征。 |
| Frozen backbones | 保持参数不变的主干模型,仅在其上附加轻量控制器进行推理调控。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅