该研究检验了一个被广泛默认的假设:模型内部表征越稀疏、越易分解,其因果计算结构是否也越简单。作者以对抗训练作为控制手段,从同一GPT-2 Small预训练检查点出发,分别进行匹配的标准与对抗持续训练,并要求两个模型在间接宾语识别任务上保持同等能力且通过独立鲁棒性验证,再从稀疏自编码器可分解性、任务归因中的特征参与度以及从原始计算图恢复的忠实电路规模三个维度进行比较。结果显示,鲁棒模型确实更具SAE可分解性,任务归因涉及的特征也更少,但电路规模呈现阈值依赖的分化:在85%忠实度以下标准模型领先或持平,而在90%和95%高忠实度下鲁棒模型所需边数显著更少。这一模式在七点扫描和第二语料上得到验证。该工作首次以受控实验表明,表征与归因层面的简洁性并不能直接预测因果电路的简洁性,二者在特定忠实度阈值下发生分离。
| Sparse Autoencoder (SAE) | 一种无监督方法,将模型激活分解为稀疏、可解释的特征方向,用于分析内部表征。 |
| Adversarial Training | 通过向训练数据添加对抗扰动来增强模型鲁棒性的训练技术,此处用作控制内部表征的工具。 |
| Circuit Size | 在计算图中恢复模型行为所需的最小因果边数,用于衡量机制复杂性。 |
| Faithfulness | 恢复的电路在多大程度上忠实于原模型的行为,通常以百分比表示。 |
| Indirect Object Identification (IOI) | 一种语言任务,要求模型识别句子中的间接宾语,常用于机制可解释性研究。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅