该研究提出了一种奖励信息稀疏自编码器(RI-SAE),利用强化学习中的奖励信号将语言模型激活分解为可解释特征。作者将GRPO轨迹按奖励高低分为“好”与“坏”推理过程,在Llama-3.1-8B上训练JumpReLU SAE,发现稀疏特征子集能显著区分两类(轮廓系数0.79对比全编码的0.005)。然而,控制实验揭示这一分离主要反映的是“解决方案完整性”而非推理质量:TF-IDF文本分类器即可区分两类(AUC 0.75–0.83),仅凭长度、封闭推理块和框选答案三个结构线索就能达到AUC 0.70。未接触奖励的通用SAE无法区分两类,表明0.79的分离度是对特定信号的拟合而非通用结构。研究指出,奖励过滤虽能低成本复用RL信号用于可解释性,但多数结果反映的是完成形式,仅少数特征(如符号数学、程序性语言)具有可读性,应视为示例而非独立推理证据。
| Sparse Autoencoders (SAEs) | 稀疏自编码器,一种神经网络结构,用于将高维激活分解为稀疏、可解释的特征。 |
| Reward-Informed SAE (RI-SAE) | 奖励信息增强的稀疏自编码器,利用强化学习中的奖励信号来策划训练数据,以引导特征提取。 |
| GRPO trajectories | GRPO(一种强化学习算法)生成的轨迹,包含一系列状态、动作和奖励,用于训练和评估。 |
| JumpReLU | 一种激活函数,结合了ReLU和跳跃连接,用于稀疏自编码器中以促进稀疏性。 |
| Silhouette score | 轮廓系数,用于评估聚类或分类中样本间分离度的指标,值越高表示分离越清晰。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅