该研究提出了一种名为“Statutory AI”的混合方法,旨在将大型语言模型与法律规范对齐。针对现有AI对齐方案(如依赖人类监督的Constitutional AI或过于宽泛的GfH原则)的局限,该方法直接采用法律文本作为宪法框架,使AI系统能依据既定规范自主批判和修正输出。其运行分两阶段,均使用思维链提示:先对用户提示进行主题分类,再结合该主题下的相关法律条文进行分析。实验采用1000个红队提示和五个刑事主题(歧视、泄密、暴力、欺诈和虐待弱势群体),结果显示Statutory AI将有害内容减少了52至59个百分点,比标准Constitutional AI高出约10个百分点,同时计算时间削减超过50%。该研究为生成式AI的可问责治理提供了更具操作性的对齐路径。
| Statutory AI | 一种混合AI对齐方法,利用法律文本作为宪法框架,使AI系统根据法律规范自主批判和修订输出。 |
| Constitutional AI | 一种AI对齐方法,通过人类监督和宪法原则指导AI行为,但依赖人工干预。 |
| Chain-of-Thought prompting | 一种提示技术,引导AI模型逐步推理,以提高复杂任务的性能。 |
| red-teaming prompts | 用于测试AI系统安全性和鲁棒性的对抗性输入,旨在触发有害或不当输出。 |
| Good-for-Humanity (GfH) principle | 一个广泛的伦理框架,强调AI应造福人类,但被认为过于笼统,缺乏具体指导。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅