LLM礼貌判断翻车:模型间共识远超人类,中性标签严重泛滥!
Polite but Misaligned: Evaluating LLM Politeness Judgments Against Human Pragmatic Norms
arXiv CL (cs.CL) 重要 #LLM评测#语用学#社会对齐 🕐 今天 12:00

📖 AI 总结

该研究评估了大语言模型的礼貌判断是否与人类语用规范一致,采用两个英文数据集,分别包含连续人类评分和三类分类标签。对七个模型的测试显示,模型之间的判断一致性高于模型与人类之间的一致性。策略层面分析表明,模型与人类对齐主要依赖显性语言线索,而某些建立融洽关系的策略更常出现在不一致案例中。在分类任务中,模型预测呈现系统性的中性压缩,即过度输出“中性”标签而低估“不礼貌”标签,这一模式在使用专家共识作为参考的诊断子集上依然存在。研究意义在于,指出仅靠总体一致性指标不足以评估语用能力,需进一步考察模型与人类判断在方向上的分歧模式。

🔑 关键词速览

社会语用学研究语言在社会互动中的使用规则和交际意图的学科。
礼貌判断对语言表达是否礼貌以及礼貌程度的主观评估。
模型间一致性不同语言模型之间在判断结果上的一致程度。
中性压缩模型倾向于过度预测中性类别而低估其他类别的系统性偏差。
融洽关系策略用于建立和维护人际和谐关系的语言交际策略。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅