该研究针对中文网络评论中间接、戏谑性语言难以理解的问题,构建了一个评估大语言模型社会语用推理能力的基准测试。研究者从超过20万条公开社交媒体互动记录中筛选出4,735个人工验证的诊断项目,每个项目包含目标评论、重构的前置语境及合理的错误解读。实验采用交叉写作设置,让八种大语言模型既充当问题编写者又充当解答者。结果显示该任务颇具挑战性:最强模型在留出写作人条件下的准确率为81.42%,八种模型平均准确率为68.70%,而人类准确率高达90.8%。案例分析进一步表明,模型往往能识别出宽泛的讽刺或戏谑语气,却难以准确把握其具体机制或互动意图。该研究为评估模型在真实语境中理解微妙社交含义的能力提供了新基准。
| Social Pragmatic Inference | 社交语用推理,指理解语言在特定社交情境中隐含意图的能力。 |
| LLMs (Large Language Models) | 大型语言模型,如GPT系列,用于处理自然语言任务。 |
| Benchmark | 基准测试,用于评估模型性能的标准任务集。 |
| Leave-writer-out accuracy | 留出编写者准确率,一种评估方法,测试模型对未见过的编写者生成内容的理解能力。 |
| Diagnostic items | 诊断项目,用于测试模型特定能力的结构化问题。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅