NE-BERT碾压两大模型!印度东北9种语言困惑度狂降15.97倍
NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages
arXiv CL (cs.CL) 重要 #多语言模型#低资源语言#预训练 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
为9种印度东北部低资源语言训练专用多语言编码器,提升表征质量。

📖 AI 总结

本文介绍了NE-BERT,一个针对印度东北部9种低资源语言及印地语、英语两种锚点语言训练的多语言编码器模型。该模型基于约830万条句子,通过加权数据采样和定制SentencePiece Unigram分词器,显著提升了低资源语言的处理能力。实验显示,NE-BERT在9种语言上的平均困惑度比IndicBERT-V2低15.97倍,比MuRIL低7.64倍,分词效率比mBERT高1.5倍。针对极低资源语言(如Pnar仅1002句、Kokborok仅2463句)的词汇碎片化问题,模型采用激进上采样策略加以缓解。下游词性标注任务验证了其在三种语言上的实用性。NE-BERT及其测试集和训练语料以CC-BY-4.0协议开源,旨在推动印度东北部社区的自然语言处理研究和数字包容性发展。

🔑 关键词速览

NE-BERT一种针对印度东北部九种语言训练的多语言编码器模型,基于BERT架构。
低资源语言指在自然语言处理研究中可用数据极少、模型覆盖不足的语言。
SentencePiece Unigram分词器一种无监督的子词分词工具,通过Unigram语言模型学习词汇表,适用于多语言和低资源场景。
困惑度衡量语言模型预测能力的指标,值越低表示模型对数据的拟合越好。
过采样一种数据增强策略,通过重复或增加低资源语言样本的权重来平衡训练数据分布。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅