奖励信号筛选推理数据?RI-SAE分离好坏,但对照实验揭穿:主要是长度和格式,非推理质量!
Reward-Informed Sparse Autoencoders and the Solution-Completeness Confound
arXiv CL (cs.CL) 重要 可解释性大模型论文方法 🕐 08-28 12:00

📖 AI 总结

该研究提出了一种奖励信息稀疏自编码器(RI-SAE),利用强化学习中的奖励信号将语言模型激活分解为可解释特征。作者将GRPO轨迹按奖励高低分为“好”与“坏”推理过程,在Llama-3.1-8B上训练JumpReLU SAE,发现稀疏特征子集能显著区分两类(轮廓系数0.79对比全编码的0.005)。然而,控制实验揭示这一分离主要反映的是“解决方案完整性”而非推理质量:TF-IDF文本分类器即可区分两类(AUC 0.75–0.83),仅凭长度、封闭推理块和框选答案三个结构线索就能达到AUC 0.70。未接触奖励的通用SAE无法区分两类,表明0.79的分离度是对特定信号的拟合而非通用结构。研究指出,奖励过滤虽能低成本复用RL信号用于可解释性,但多数结果反映的是完成形式,仅少数特征(如符号数学、程序性语言)具有可读性,应视为示例而非独立推理证据。

🔑 关键词速览

Sparse Autoencoders (SAEs)稀疏自编码器,一种神经网络结构,用于将高维激活分解为稀疏、可解释的特征。
Reward-Informed SAE (RI-SAE)奖励信息增强的稀疏自编码器,利用强化学习中的奖励信号来策划训练数据,以引导特征提取。
GRPO trajectoriesGRPO(一种强化学习算法)生成的轨迹,包含一系列状态、动作和奖励,用于训练和评估。
JumpReLU一种激活函数,结合了ReLU和跳跃连接,用于稀疏自编码器中以促进稀疏性。
Silhouette score轮廓系数,用于评估聚类或分类中样本间分离度的指标,值越高表示分离越清晰。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅