该研究系统评估了跨语言语言模型评测方法的可比性。作者使用基于平行数据训练的受控单语模型,并改变分词器词表大小和模型规模,同时验证了多语言大模型上的表现。研究发现,多种广泛使用的归一化指标会因分词、编码和正字法差异引入跨语言偏差,导致评测结论失真。相比之下,基于语义等价句子的句级负对数似然能提供更有意义且一致的跨语言比较。该工作揭示了现有跨语言评测方法中普遍存在的方法论缺陷,为多语言NLP领域的公平评测提供了重要参考,并强调了实现跨语言下游任务可比评估所面临的深层挑战。
| Crosslingual evaluation | 跨语言评估,指在不同语言上评估模型性能并进行比较的方法。 |
| Tokenizer vocabulary size | 分词器词汇表大小,影响模型处理文本的粒度,可能导致跨语言偏差。 |
| Normalized metrics | 归一化指标,如按长度或频率调整的评估指标,可能引入跨语言偏差。 |
| Negative log-likelihood (NLL) | 负对数似然,衡量模型对序列的预测概率,句子级NLL用于跨语言比较。 |
| Multilingual LLMs | 多语言大语言模型,如mBERT或GPT系列,支持多种语言的预训练模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅