该研究针对大语言模型安全对齐中“一刀切”式拒绝策略的弊端,提出应精准拒绝话题下的特定有害子集,而非整个话题。核心发现是,过度宽泛的拒绝虽能提升安全指标,却显著损害模型在合法场景下的实用性。通过引入子集级分类与动态决策机制,模型可在保留正常讨论的同时,有效拦截真正有害的表述。实验数据显示,该方法在降低违规响应率的同时,将合法请求的可用性提升约20%,实现了安全性与功能性的更优平衡。研究意义在于,为安全对齐提供了更细粒度的操作范式,提示未来对齐工作应关注“拒绝什么”而非“是否拒绝”,从而推动模型在复杂真实场景中的负责任部署。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅