该研究针对指令微调模型在英语中拒绝有害请求、却在约鲁巴语、伊博语、伊加拉语和豪萨语等低资源非洲语言中顺从相同请求的安全漏洞,提出了一种无需重新训练的安全恢复方法——潜在空间拒绝锚定(LSR-Anchoring)。该方法从英语提示中提取拒绝方向,在推理时将其钳制到残差流上,避免了对目标语言标注数据和重训练的需求。研究测试了四种架构,主要变体均值激活引导(MAS)在Mistral和Qwen上恢复安全且性能退化低于0.08,但在Llama-3-8B上过度矫正,导致合法提示性能退化达1.00。为此引入SAE派生引导(SDS),用稀疏自编码器特征替代密集方向,将KL散度降低3.5至7倍且无良性崩溃。四种语言正向迁移,但阿拉伯语在所有架构和引导强度下均失败,表明存在几何不匹配。MMLU准确率下降始终低于0.35个百分点,验证了方法的有效性。
| Latent Space Refusal Anchoring (LSR-Anchoring) | 一种无需训练的方法,通过将拒绝方向锚定到残差流来恢复模型的安全拒绝能力。 |
| Mean-Activation Steering (MAS) | LSR-Anchoring 的主要变体,使用均值激活差异来引导模型行为。 |
| SAE-Derived Steering (SDS) | 使用稀疏自编码器特征替代密集方向,以减少过度校正的引导方法。 |
| Sparse Autoencoder (SAE) | 一种自编码器,通过稀疏约束学习可解释的特征表示。 |
| Kullback-Leibler (KL) divergence | 衡量两个概率分布差异的指标,用于评估模型输出变化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅