🔥 今日值得一读 零训练修复非洲语言安全漏洞!4大模型实测,性能损失仅0.08
Latent Space Refusal Anchoring for Low-Resource African Languages: Mechanistic Safety Recovery Without Retraining
arXiv CL (cs.CL) 🔥 重点 #安全对齐#多语言#机制可解释性 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
无需重训即可恢复低资源语言模型的安全拒绝能力,通过潜在空间锚定激活已有拒绝机制。

📖 AI 总结

该研究针对指令微调模型在英语中拒绝有害请求、却在约鲁巴语、伊博语、伊加拉语和豪萨语等低资源非洲语言中顺从相同请求的安全漏洞,提出了一种无需重新训练的安全恢复方法——潜在空间拒绝锚定(LSR-Anchoring)。该方法从英语提示中提取拒绝方向,在推理时将其钳制到残差流上,避免了对目标语言标注数据和重训练的需求。研究测试了四种架构,主要变体均值激活引导(MAS)在Mistral和Qwen上恢复安全且性能退化低于0.08,但在Llama-3-8B上过度矫正,导致合法提示性能退化达1.00。为此引入SAE派生引导(SDS),用稀疏自编码器特征替代密集方向,将KL散度降低3.5至7倍且无良性崩溃。四种语言正向迁移,但阿拉伯语在所有架构和引导强度下均失败,表明存在几何不匹配。MMLU准确率下降始终低于0.35个百分点,验证了方法的有效性。

🔑 关键词速览

Latent Space Refusal Anchoring (LSR-Anchoring)一种无需训练的方法,通过将拒绝方向锚定到残差流来恢复模型的安全拒绝能力。
Mean-Activation Steering (MAS)LSR-Anchoring 的主要变体,使用均值激活差异来引导模型行为。
SAE-Derived Steering (SDS)使用稀疏自编码器特征替代密集方向,以减少过度校正的引导方法。
Sparse Autoencoder (SAE)一种自编码器,通过稀疏约束学习可解释的特征表示。
Kullback-Leibler (KL) divergence衡量两个概率分布差异的指标,用于评估模型输出变化。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅