该论文针对大语言模型安全对齐中现有方法依赖攻击特定监督、易受越狱攻击且存在过度拒答的问题,提出SSRFT(监督式安全角色微调)框架,首次将安全对齐重新定义为对预定义安全角色的内化。该方法基于心理测量问题、少量越狱提示和安全角色描述构建安全角色问答数据集,通过合成、验证并扩展角色一致的回答,使模型内化安全价值观与原则,而非学习显式的拒绝模式。在多种基础模型和指令模型上的实验表明,SSRFT比标准监督微调具有更强的鲁棒性和泛化能力,对预填充攻击的抵御显著提升,对未见越狱领域泛化更好,同时减少对良性查询的过度拒答,并保持模型通用能力。该研究确立了安全角色内化作为以拒绝为中心的安全对齐的有效替代方案。
| SSRFT | 监督安全角色微调,一种将安全对齐重新定义为内化预定义安全角色的框架。 |
| SRQA | 安全角色问答数据集,由心理测量问题、越狱提示和安全角色描述构建而成。 |
| 越狱攻击 | 通过精心设计的提示诱导大型语言模型产生有害或不安全输出的攻击方式。 |
| 安全对齐 | 使大型语言模型的行为符合人类价值观和安全规范的过程。 |
| 过度拒绝 | 模型对良性查询也进行拒绝,导致可用性下降的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅