这篇论文提出“窄边界安全”概念,指出大语言模型的安全对齐不应仅按主题粗粒度划分,而需在同一主题内区分不同应用场景的拒绝边界。作者构建了一套离线自生成框架,包含受控主题生成、覆盖修复、分布内补偿数据及有害-良性配对数据。实验显示,单次生成导致19.88%的提示缺少可接受的拒绝痕迹,而升级重试策略可将该比例降至0.20%。在Qwen3-8B上的政治说服测试中,该方法将目标域拒绝率从9.47%提升至84.75%,平均不安全响应率从26.26%降至0.14%,但过度拒绝率从2.00%升至74.00%。配对比较表明,使用验证过的目标模型响应可显著降低过度拒绝,边界配对数据也能有效平衡安全与可用性。研究强调,数据构成直接控制安全与可用性的权衡,安全对齐评估应同时关注拒绝边界两侧的表现。
| Safety alignment | 安全对齐,指调整语言模型行为以符合安全规范的过程。 |
| Narrow-boundary safety | 窄边界安全,指在同一主题内根据具体场景设定精细的安全拒绝边界。 |
| Self-distillation | 自蒸馏,利用模型自身生成的响应来训练或优化模型的方法。 |
| Over-refusal | 过度拒绝,指模型对无害请求也进行拒绝的现象。 |
| Boundary-pair data | 边界配对数据,包含有害与良性配对样本的数据集,用于训练模型区分拒绝边界。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅