本文提出“机制断层扫描”(Mechanistic Tomography)框架,将机械可解释性中的多种测量方法(如梯度、路径修补、Hessian-向量积等)统一为设计测量问题,形式化为 y = Ax + w,其中A为干预矩阵,x为目标映射,w包含非线性响应与误差。该框架提供实用流程:从低成本测量开始,在预期规模上验证,校准失配,并在残差结构化时扩展测量族。控制任务作为严格验证场景,研究发现:在双HMM模型中,控制误差随观测器误差上升,目标改善可能掩盖干扰态移动;前向访问下,稀疏聚合测量比坐标修补更高效;梯度访问下,有限探针改进局部归因;提升测量可恢复一阶方法遗漏的交互效应。在GPT-2-small IOI任务中,Name Mover与Negative Name Mover的交互是最大预测项;而在Qwen-2.5-7B上,有限校准使加性拒绝响应映射足够,无需成对提升。该工作为可解释性测量设计提供了系统化方法论。
| Mechanistic Tomography | 一种设计测量方法,用于恢复模型内部机制和干预效应,类比医学断层扫描。 |
| Mechanistic Interpretability | 研究如何解释神经网络内部状态和计算过程的领域。 |
| Hessian-vector products | 计算Hessian矩阵与向量乘积的方法,用于捕捉二阶相互作用效应。 |
| Subset interventions | 对模型部分组件进行干预以观察其影响的技术。 |
| Tracr | 一种将程序编译为Transformer权重的工具,用于验证机制可解释性方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅