AI模型内部机制大揭秘!新框架精准定位概念电路,准确率预测高达91%
How Do Linear Probes Emerge? A Circuit-Tracing Framework with Concept-Targeted Attribution
arXiv CL (cs.CL) 重要 #可解释性#电路分析#Transformer 🕐 08-31 12:00

📖 AI 总结

本文提出了一种名为概念定向归因(CTA)的新框架,用于解释线性探针在语言模型内部如何形成。传统归因图通常针对下一个词元的预测概率进行训练,而CTA则直接以线性探针方向为目标,生成探针特异的电路图,从而揭示内部概念表征产生的机制,而不受生成词元影响。研究发现,基于跨层转码器的探针定向图具有强预测性:图级特征在四个概念类别上预测探针准确率(相关系数0.91,R²=0.84),局部特征则能识别驱动单提示分类的稀疏组件。因果消融实验表明,探针定向与词元定向图对应功能不同的机制——移除探针相关特征会降低内部概念分数但基本保留生成词元,而移除词元相关特征则在92%至100%的案例中改变生成结果且几乎不影响探针分数。该框架将探针性能与可解释电路结构联系起来,为安全关键概念表征的机制性审计提供了新工具。

🔑 关键词速览

Concept-Targeted Attribution (CTA)一种新的归因图训练方法,针对线性探针方向而非特定词元,以解释内部概念表征的成因。
Transcoder attribution graphs使用跨层转码器构建的归因图,用于追踪模型内部计算路径。
Linear probe一种线性分类器,用于检测神经网络内部表征中是否编码了特定概念。
Cross-Layer Transcoders一种模型组件,用于跨层分解和追踪信息流动,支持归因分析。
Causal ablation通过移除或干扰特定组件来测试其因果影响的方法,用于验证机制的功能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅