🔥 今日值得一读 拒绝率暴涨9倍!新方法让AI安全边界精准可控,过度拒绝率从32.94%暴跌至4.16%
Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
arXiv CL (cs.CL) 🔥 重点 #安全对齐#自蒸馏#训练方法 🕐 09-07 12:00
👨‍💼 主理人解读 · 为什么值得关注
定制安全边界,如教育助手区分政治操纵与事实问答,离线生成数据微调,无需在线干预。

📖 AI 总结

这篇论文提出“窄边界安全”概念,指出大语言模型的安全对齐不应仅按主题粗粒度划分,而需在同一主题内区分不同应用场景的拒绝边界。作者构建了一套离线自生成框架,包含受控主题生成、覆盖修复、分布内补偿数据及有害-良性配对数据。实验显示,单次生成导致19.88%的提示缺少可接受的拒绝痕迹,而升级重试策略可将该比例降至0.20%。在Qwen3-8B上的政治说服测试中,该方法将目标域拒绝率从9.47%提升至84.75%,平均不安全响应率从26.26%降至0.14%,但过度拒绝率从2.00%升至74.00%。配对比较表明,使用验证过的目标模型响应可显著降低过度拒绝,边界配对数据也能有效平衡安全与可用性。研究强调,数据构成直接控制安全与可用性的权衡,安全对齐评估应同时关注拒绝边界两侧的表现。

🔑 关键词速览

Safety alignment安全对齐,指调整语言模型行为以符合安全规范的过程。
Narrow-boundary safety窄边界安全,指在同一主题内根据具体场景设定精细的安全拒绝边界。
Self-distillation自蒸馏,利用模型自身生成的响应来训练或优化模型的方法。
Over-refusal过度拒绝,指模型对无害请求也进行拒绝的现象。
Boundary-pair data边界配对数据,包含有害与良性配对样本的数据集,用于训练模型区分拒绝边界。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅