ObserverBench是一个用于评估机械可解释性方法在实际干预任务中效用的基准框架。该研究指出,传统上仅关注估计准确率存在局限——即使内部估计在平均意义上准确,也可能导致次优的干预决策。为此,ObserverBench为每项任务固定了模型、信息边界、允许动作、决策规则和损失函数,并分别报告估计准确率与实际动作损失。实验在GPT-2-small、Qwen2.5-7B等模型上进行,结果显示:在电路干预任务中,成对观测器虽能更准确预测未见效应,却不一定选择更优动作;而基于动作损失训练的观测器则能实现更低损失。在安全分流场景中,AUROC指标与部署损失排名可能不一致,且最优信息源随模型变化。该框架通过固定任务契约和可运行基线,为通过实际干预效果评估可解释性方法提供了标准化途径。
| Mechanistic interpretability | 机制可解释性,指通过理解模型内部计算机制来解释其行为的方法。 |
| ObserverBench | 一个基准框架,用于测试内部估计器(观察者)是否足以指导干预、控制或安全任务。 |
| Activation steering | 激活引导,一种通过调整模型内部激活来影响输出的干预技术。 |
| Circuit removal | 电路移除,指删除模型中特定神经回路以改变行为的方法。 |
| AUROC | 受试者工作特征曲线下面积,衡量分类器区分正负样本能力的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅