AI测出更冷酷的社会:6大模型高估惩罚、低估宽容!
Beyond Right and Wrong: Evaluating Second-order Social Reasoning in Large Language Models
arXiv AI (cs.AI) 重要 #评测基准#安全对齐#社会推理 🕐 09-09 12:00

📖 AI 总结

该研究提出了一种评估大语言模型(LLM)二阶社会推理能力的新框架,聚焦于“元规范”(metanorms)——即人们对违规行为如何反应的社会预期,涵盖情绪评价和行为反应两个维度。作者发布了多视角数据集NormReact,包含450个规范违反场景,并对违规者性别和观察者社会亲近度进行了手工标注。研究发现,在测试的六个模型中,LLM普遍预测了比人类预期更严厉的负面制裁,且随着社会距离增大,模型与人类判断的一致性下降。这表明AI系统在冲突调解、政策模拟等规范敏感领域可能产生扭曲的社会图景——过度强调惩罚,而低估了现实规范执行中的宽容、克制和关系调节因素。

🔑 关键词速览

metanorms元规范,指关于如何回应违反社会规则行为的二阶期望,如惩罚或宽容。
first-order social norms一阶社会规范,指直接规定行为可接受性的基本规则,如“不要偷窃”。
emotional appraisal情绪评估,指对违规行为引发的情绪反应进行判断或预测。
behavioral response行为反应,指个体在观察到违规行为后采取的行动或倾向。
NormReact一个多视角数据集,包含450个规范违规场景,用于评估LLMs的元规范推理。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅