该研究提出一种名为“决策算子”的参数高效方法,通过低秩激活引导为冻结语言模型注入技能。其核心思路是用行为克隆训练一个“系统1”式决策模块,而非依赖强化学习流程。默认算子仅需33万参数,即可匹配133万参数强化学习算子的性能,并将3685个token的推理过程压缩为6个token的决策,且准确率不降。秩为4的变体仅2.3万参数,约为已发表最强技能算子的五十八分之一,在SearchQA上足够、在LiveMath上接近足够。该配方可跨五个任务和三种骨干网络迁移,并在训练数月后发布的新问题上保持分布外增益。作者指出,与先前工作的差距源于可训练性,由初始化与架构共同决定:先前算子的初始化在首步优化时使两个大因子矩阵梯度归零,而本文在共享低秩骨干内采用零初始化输出投影,可立即获得梯度。增益并非思维链压缩,逻辑探针显示算子沿模型已有的后层通路放大答案。技能可近似线性组合、插值与热插拔。
| System-1 decision operator | 一种快速、直觉式的决策模块,模仿人类系统1思维,用于高效决策而非逐步推理。 |
| Behavior cloning | 一种模仿学习方法,通过监督学习从专家演示中直接学习策略,无需强化学习。 |
| Low-rank activation steering | 通过低秩矩阵调整模型激活值来引导模型行为的技术,参数效率高。 |
| Logit-lens probe | 一种分析工具,通过检查模型中间层的logit输出来理解模型内部决策过程。 |
| Out-of-distribution | 指模型在训练时未见过的数据分布上的表现,衡量泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅