🔥 今日值得一读 单看输出测鲁棒性会骗人!三层拆解GPT-2和Qwen2.5,发现HotFlip攻击比随机换词狠得多
How Perturbations Propagate: A Multi-Level Analysis of Robustness in Large Language Models
arXiv ML (stat.ML) 🔥 重点 #鲁棒性#语言模型#安全对齐 🕐 09-04 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可参考此分析理解模型对噪声输入的脆弱性,设计更鲁棒的预处理或架构,提升实际应用稳定性。

📖 AI 总结

该研究系统分析了输入扰动在仅解码器语言模型中的传播机制,从输出行为、隐藏状态几何和注意力头功能三个层面展开评估。研究覆盖四种GPT-2和两种Qwen2.5检查点,采用中心核对齐和内在维度等方法分析逐层几何特征。结果显示,不同扰动类型产生可区分的度量特征,这些特征无法仅通过输出指标完整捕捉,且在不同检查点间仅部分一致。复制得分与标记替换和打乱下的激活修补恢复显著相关。梯度引导的HotFlip扰动比同等频率的随机标记替换在GPT-2中引发更强的行为和表征破坏,其行为影响在全部六个检查点中保持一致。研究结论指出,基于单一行为或表征指标的鲁棒性评估可能产生误导,建议采用多层次评估方法理解扰动如何改变语言模型的计算过程。

🔑 关键词速览

鲁棒性模型对输入扰动(如拼写错误或词序变化)保持性能稳定的能力。
中心核对齐一种衡量神经网络层间表示相似性的方法,通过比较核矩阵来评估几何结构。
内在维度数据或表示实际所在低维空间的维度,用于刻画表示复杂度。
激活修补一种干预技术,通过替换或修改特定激活来评估其对模型行为的影响。
HotFlip扰动一种基于梯度的对抗性扰动方法,通过替换词元来最大化模型损失。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅