本文探讨大语言模型(LLM)的“规范能力”,即仅通过互动推断社区所执行规范的能力,而非依赖预训练中的静态知识。作者提出一个多智能体社区辩论框架,用合成规范控制辩论准入,从而将规范能力从预训练暴露中隔离出来加以研究。实验发现,基线LLM智能体即使在学习规范有助于提升准确率的情况下,仍无法学会规范;引入“规范模块”后,规范遵循效果对规范风格和底层模型高度敏感,缺乏泛化性。更关键的是,当真实规范伴随非规范性的个体行为时,模型表现出“无选择性归因失败”,即不加区分地模仿被执行的规则与无关噪声,即便明确惩罚模仿多余行为也无法纠正。该研究首次对LLM的规范能力进行操作化评估,表明当前AI擅长行为模仿,却缺乏辨别社会所执行秩序的能力。
| 规范能力 (Normative Competence) | 指AI系统仅通过互动推断社群所执行规范的能力,不依赖预训练知识。 |
| 规范模块 (Normative Modules) | 用于规范推断的架构组件,可嵌入LLM智能体中以增强其规范学习能力。 |
| 多智能体社群辩论 (Multi-Agent Community Debate) | 一种实验设置,多个智能体在合成规范支配下进行辩论,用于研究规范能力。 |
| 非选择性归因失败 (Unselective Attribution Failure) | LLM智能体不加区分地复制特异性噪声与真实规范的行为模式。 |
| 对齐 (Alignment) | 使AI系统的行为与人类社群的规范、价值观和意图保持一致的过程。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅