法定AI让大模型有害内容暴降59%!比宪法AI强10个点,还快一半
Statutory AI: Aligning Large Language Models With Legal Norms
arXiv AI (cs.AI) 重要 大模型安全对齐 🕐 09-01 12:00

📖 AI 总结

该研究提出了一种名为“Statutory AI”的混合方法,旨在将大型语言模型与法律规范对齐。针对现有AI对齐方案(如依赖人类监督的Constitutional AI或过于宽泛的GfH原则)的局限,该方法直接采用法律文本作为宪法框架,使AI系统能依据既定规范自主批判和修正输出。其运行分两阶段,均使用思维链提示:先对用户提示进行主题分类,再结合该主题下的相关法律条文进行分析。实验采用1000个红队提示和五个刑事主题(歧视、泄密、暴力、欺诈和虐待弱势群体),结果显示Statutory AI将有害内容减少了52至59个百分点,比标准Constitutional AI高出约10个百分点,同时计算时间削减超过50%。该研究为生成式AI的可问责治理提供了更具操作性的对齐路径。

🔑 关键词速览

Statutory AI一种混合AI对齐方法,利用法律文本作为宪法框架,使AI系统根据法律规范自主批判和修订输出。
Constitutional AI一种AI对齐方法,通过人类监督和宪法原则指导AI行为,但依赖人工干预。
Chain-of-Thought prompting一种提示技术,引导AI模型逐步推理,以提高复杂任务的性能。
red-teaming prompts用于测试AI系统安全性和鲁棒性的对抗性输入,旨在触发有害或不当输出。
Good-for-Humanity (GfH) principle一个广泛的伦理框架,强调AI应造福人类,但被认为过于笼统,缺乏具体指导。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅