这篇论文系统评估了大语言模型在机器翻译质量标注任务中的表现,聚焦多维质量指标(MQM)和错误跨度标注(ESA)两种主流方案,通过覆盖70个语言对的长上下文测试集以及WMT23、WMT25公开数据,比较了模型与人工标注者之间的一致性。研究发现,在某些任务上模型与人工标注者的一致性甚至超过人工标注者之间的一致性,但整体一致性因标注方案、语言对和领域的不同而差异显著,在多数场景下仍不可靠。研究还揭示了两方面挑战:人工标注者在细粒度MQM标注和低资源语言对上表现吃力,而大语言模型则难以处理细微错误、错误语言变体及错误跨度标注。该工作表明,当前人机双方在翻译质量标注上均有明显局限,未来可通过人机协作标注流程来提升可靠性。
| Large Language Models (LLMs) | 大型语言模型,指基于海量文本训练的深度学习模型,能够生成和理解自然语言。 |
| Machine Translation (MT) | 机器翻译,利用计算机系统自动将一种自然语言翻译成另一种自然语言的技术。 |
| Multidimensional Quality Metrics (MQM) | 多维质量指标,一种机器翻译质量评估框架,从多个维度对翻译错误进行分类和评分。 |
| Error Span Annotation (ESA) | 错误跨度标注,一种标注方法,要求标注者标出翻译中错误出现的具体文本片段。 |
| Low-resource language pairs | 低资源语言对,指缺乏充足平行语料和标注数据的语言组合,通常导致翻译和评估性能较差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅