🔥 今日值得一读 33万参数干翻133万强化学习算子,3685token深思压缩成6token决策!
Learning to Decide, Not to Reason: Parameter-Efficient Decision Operators via Low-Rank Activation Steering
arXiv LG (cs.LG) 🔥 重点 #激活引导#参数高效#行为克隆#决策算子 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
用极少参数把大模型 deliberation 压成短决策,适合低成本给冻结LLM注入技能。

📖 AI 总结

该研究提出一种名为“决策算子”的参数高效方法,通过低秩激活引导为冻结语言模型注入技能。其核心思路是用行为克隆训练一个“系统1”式决策模块,而非依赖强化学习流程。默认算子仅需33万参数,即可匹配133万参数强化学习算子的性能,并将3685个token的推理过程压缩为6个token的决策,且准确率不降。秩为4的变体仅2.3万参数,约为已发表最强技能算子的五十八分之一,在SearchQA上足够、在LiveMath上接近足够。该配方可跨五个任务和三种骨干网络迁移,并在训练数月后发布的新问题上保持分布外增益。作者指出,与先前工作的差距源于可训练性,由初始化与架构共同决定:先前算子的初始化在首步优化时使两个大因子矩阵梯度归零,而本文在共享低秩骨干内采用零初始化输出投影,可立即获得梯度。增益并非思维链压缩,逻辑探针显示算子沿模型已有的后层通路放大答案。技能可近似线性组合、插值与热插拔。

🔑 关键词速览

System-1 decision operator一种快速、直觉式的决策模块,模仿人类系统1思维,用于高效决策而非逐步推理。
Behavior cloning一种模仿学习方法,通过监督学习从专家演示中直接学习策略,无需强化学习。
Low-rank activation steering通过低秩矩阵调整模型激活值来引导模型行为的技术,参数效率高。
Logit-lens probe一种分析工具,通过检查模型中间层的logit输出来理解模型内部决策过程。
Out-of-distribution指模型在训练时未见过的数据分布上的表现,衡量泛化能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅