该研究系统分析了输入扰动在仅解码器语言模型中的传播机制,从输出行为、隐藏状态几何和注意力头功能三个层面展开评估。研究覆盖四种GPT-2和两种Qwen2.5检查点,采用中心核对齐和内在维度等方法分析逐层几何特征。结果显示,不同扰动类型产生可区分的度量特征,这些特征无法仅通过输出指标完整捕捉,且在不同检查点间仅部分一致。复制得分与标记替换和打乱下的激活修补恢复显著相关。梯度引导的HotFlip扰动比同等频率的随机标记替换在GPT-2中引发更强的行为和表征破坏,其行为影响在全部六个检查点中保持一致。研究结论指出,基于单一行为或表征指标的鲁棒性评估可能产生误导,建议采用多层次评估方法理解扰动如何改变语言模型的计算过程。
| 鲁棒性 | 模型对输入扰动(如拼写错误或词序变化)保持性能稳定的能力。 |
| 中心核对齐 | 一种衡量神经网络层间表示相似性的方法,通过比较核矩阵来评估几何结构。 |
| 内在维度 | 数据或表示实际所在低维空间的维度,用于刻画表示复杂度。 |
| 激活修补 | 一种干预技术,通过替换或修改特定激活来评估其对模型行为的影响。 |
| HotFlip扰动 | 一种基于梯度的对抗性扰动方法,通过替换词元来最大化模型损失。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅