该研究提出了一种评估大语言模型(LLM)二阶社会推理能力的新框架,聚焦于“元规范”(metanorms)——即人们对违规行为如何反应的社会预期,涵盖情绪评价和行为反应两个维度。作者发布了多视角数据集NormReact,包含450个规范违反场景,并对违规者性别和观察者社会亲近度进行了手工标注。研究发现,在测试的六个模型中,LLM普遍预测了比人类预期更严厉的负面制裁,且随着社会距离增大,模型与人类判断的一致性下降。这表明AI系统在冲突调解、政策模拟等规范敏感领域可能产生扭曲的社会图景——过度强调惩罚,而低估了现实规范执行中的宽容、克制和关系调节因素。
| metanorms | 元规范,指关于如何回应违反社会规则行为的二阶期望,如惩罚或宽容。 |
| first-order social norms | 一阶社会规范,指直接规定行为可接受性的基本规则,如“不要偷窃”。 |
| emotional appraisal | 情绪评估,指对违规行为引发的情绪反应进行判断或预测。 |
| behavioral response | 行为反应,指个体在观察到违规行为后采取的行动或倾向。 |
| NormReact | 一个多视角数据集,包含450个规范违规场景,用于评估LLMs的元规范推理。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅