该研究提出了VakyArth,这是首个针对印度语言的语用能力评估基准,覆盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语四种语言。基准通过多项选择题、自然语言推理和翻译任务,系统评估模型在指示语、言语行为、含意、社交语用和连贯性五类语用现象上的表现,所有测试项目均由母语者编写。研究发现,多语言大语言模型在处理植根于印度语言和文化惯例的语用含义时存在系统性缺陷。具体而言,所有模型-语言组合中多项选择题准确率均高于自然语言推理准确率,翻译表现无法可靠反映语用理解水平,且印欧语系语言相较达罗毗荼语系语言在翻译任务上更具优势。此外,自动翻译指标可能遗漏流畅但语用上不忠实的输出,尤其在含意和指示语方面。该研究填补了非英语语用评估的空白,为改进多语言模型的深层语言理解提供了方向。
| VakyArth | 一个用于评估印度语言语用能力的基准测试,涵盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语。 |
| pragmatic competence | 理解和使用语境中隐含意义的能力,而非仅依赖字面表达。 |
| deixis | 指示语,指依赖语境确定指代的语言表达,如“这里”、“现在”等。 |
| implicature | 含义,指说话者通过话语间接传达的额外意义,需借助语境推断。 |
| natural language inference (NLI) | 自然语言推理,判断一个假设是否由前提蕴含、矛盾或中立的语言理解任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅