🔥 今日值得一读 一个共享SAE搞定4个模型!解释力保留96.6%,跨模型相关性翻倍
SharedSAE: One Feature Dictionary Across Language Models
arXiv LG (cs.LG) 🔥 重点 #稀疏自编码器#可解释性#多模型 🕐 09-07 12:00
👨‍💼 主理人解读 · 为什么值得关注
用共享字典加模型特定编解码器,跨模型复用SAE,节省资源并保持解释质量。

📖 AI 总结

稀疏自编码器(SAE)是解释语言模型激活的常用工具,但传统上需为每个模型单独训练和标注。本文提出SharedSAE方法,用单一共享字典替代多个专用SAE。该方法结合共享字典与模型专属的编码器-解码器对,仅归一化选择分数而非丢弃激活幅度,并通过模型丢弃实现单模型推理。研究在四个不同家族和分词器的10亿级基础模型上训练,结果显示:共享潜在特征保留了专用SAE平均解释方差的96.6%;潜在激活的跨模型相关性比事后对齐的独立SAE高1.8倍;潜在描述可跨模型迁移。字典冻结后,新模型可高效适配,重建质量接近专用SAE,同时复用共享描述。该研究显著降低了SAE训练和标注的重复成本,为跨模型可解释性分析提供了高效统一方案。

🔑 关键词速览

Sparse Autoencoders (SAEs)稀疏自编码器,一种用于解释语言模型内部激活的神经网络结构,通过稀疏编码提取可解释的特征。
SharedSAE本文提出的方法,通过共享字典和模型特定的编码器-解码器对,实现跨语言模型的统一特征字典。
Dictionary字典,指SAE中用于表示潜在特征的基向量集合,共享字典意味着多个模型共用同一组特征。
Model Dropout模型丢弃,一种训练技巧,在训练时随机忽略部分模型,以支持单模型推理。
Explained Variance解释方差,衡量SAE重建激活时保留原始信息比例的量度,值越高表示重建质量越好。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅