稀疏自编码器(SAE)是解释语言模型激活的常用工具,但传统上需为每个模型单独训练和标注。本文提出SharedSAE方法,用单一共享字典替代多个专用SAE。该方法结合共享字典与模型专属的编码器-解码器对,仅归一化选择分数而非丢弃激活幅度,并通过模型丢弃实现单模型推理。研究在四个不同家族和分词器的10亿级基础模型上训练,结果显示:共享潜在特征保留了专用SAE平均解释方差的96.6%;潜在激活的跨模型相关性比事后对齐的独立SAE高1.8倍;潜在描述可跨模型迁移。字典冻结后,新模型可高效适配,重建质量接近专用SAE,同时复用共享描述。该研究显著降低了SAE训练和标注的重复成本,为跨模型可解释性分析提供了高效统一方案。
| Sparse Autoencoders (SAEs) | 稀疏自编码器,一种用于解释语言模型内部激活的神经网络结构,通过稀疏编码提取可解释的特征。 |
| SharedSAE | 本文提出的方法,通过共享字典和模型特定的编码器-解码器对,实现跨语言模型的统一特征字典。 |
| Dictionary | 字典,指SAE中用于表示潜在特征的基向量集合,共享字典意味着多个模型共用同一组特征。 |
| Model Dropout | 模型丢弃,一种训练技巧,在训练时随机忽略部分模型,以支持单模型推理。 |
| Explained Variance | 解释方差,衡量SAE重建激活时保留原始信息比例的量度,值越高表示重建质量越好。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅