该研究针对印度语言机器翻译长期受限于高质量平行语料和评测基准不足的问题,提出了以印度语言为中心的平行语料库COILD。现有资源多基于英语中转构建,难以体现印度语言的语言多样性、文化复杂性和领域特征。COILD包含超过116万条经人工翻译并验证的句对,覆盖印度-雅利安、达罗毗荼、藏缅和南亚语系共20个语言对,语料全部源自印度语言原创内容,涵盖八个具有实际应用价值的领域。研究还构建了包含2000条专家验证句子的领域评测基准,用于多语言和跨语言评估。通过在IndicTrans2-Distilled和NLLB-200两个多语言神经翻译模型上微调验证,结果显示各语言对、领域、自动指标和人工评价均取得一致提升,表明高质量印度语言中心监督数据能有效推动印度语言机器翻译及未来多语言模型的发展。
| COILD | 本文提出的以印度语言为中心的双语平行语料库,包含超116万条人工翻译并验证的句对,覆盖20个印度语言对。 |
| Indic-centric | 指以印度语言为源语言或核心构建资源,而非以英语为枢轴,旨在更好保留印度语言的语言与文化特征。 |
| IndicTrans2-Distilled | 一个面向印度语言的多语言神经机器翻译模型,本文将其作为微调与验证的代表性模型之一。 |
| NLLB-200 | Meta 发布的支持200种语言的多语言神经机器翻译模型,本文将其作为另一个代表性模型进行微调与评估。 |
| domain-centric benchmark | 本文构建的以领域为中心的评估基准,包含2000条专家验证句子,用于跨印度语言对的一致多语言与跨语言评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅