仅不相交词元就导致知识区隔化,逐词翻译可恢复12.6%母语效率,是基线14倍!
Why Pretraining Fails to Share Cross-Lingual Knowledge
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-18 12:00

📖 AI 总结

这篇论文研究了大语言模型在多语言预训练中跨语言知识迁移能力有限的根本原因。作者预训练了3.6亿和70亿参数的模型,发现跨语言知识泛化能力不足的问题在预训练阶段就已出现,且常规干预手段难以缓解。为定位成因,研究设计了一个受控的双语预训练实验:使用同一语言的两种副本,文本和分词方式完全相同,但映射到互不重叠的词元空间。结果显示,仅词元空间不重叠这一因素就足以导致知识被割裂存储,即使两种"语言"本质上是同一语言。这表明词元空间的不共享是跨语言知识泛化的根本障碍。基于此,作者提出通过简单的逐词翻译将不同语言映射到共享词元空间,实验表明该方法显著提升了跨语言知识泛化能力,最多可恢复12.6%的母语学习效率,达到基线的14倍。

🔑 关键词速览

跨语言知识迁移模型将一种语言中学到的知识应用到另一种语言任务上的能力。
词元空间模型将文本切分后的词元映射到的向量表示空间,不同语言可共享或分离。
知识区隔化不同语言的知识在模型中相互隔离、无法有效共享的现象。
受控双语预训练一种实验设置,通过控制变量(如使用同一语言的两个副本)来研究特定因素的影响。
逐词翻译将文本按单词逐个翻译成目标语言,以对齐不同语言的词元表示。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅