该研究评估了大语言模型的礼貌判断是否与人类语用规范一致,采用两个英文数据集,分别包含连续人类评分和三类分类标签。对七个模型的测试显示,模型之间的判断一致性高于模型与人类之间的一致性。策略层面分析表明,模型与人类对齐主要依赖显性语言线索,而某些建立融洽关系的策略更常出现在不一致案例中。在分类任务中,模型预测呈现系统性的中性压缩,即过度输出“中性”标签而低估“不礼貌”标签,这一模式在使用专家共识作为参考的诊断子集上依然存在。研究意义在于,指出仅靠总体一致性指标不足以评估语用能力,需进一步考察模型与人类判断在方向上的分歧模式。
| 社会语用学 | 研究语言在社会互动中的使用规则和交际意图的学科。 |
| 礼貌判断 | 对语言表达是否礼貌以及礼貌程度的主观评估。 |
| 模型间一致性 | 不同语言模型之间在判断结果上的一致程度。 |
| 中性压缩 | 模型倾向于过度预测中性类别而低估其他类别的系统性偏差。 |
| 融洽关系策略 | 用于建立和维护人际和谐关系的语言交际策略。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅