本文介绍了NE-BERT,一个针对印度东北部9种低资源语言及印地语、英语两种锚点语言训练的多语言编码器模型。该模型基于约830万条句子,通过加权数据采样和定制SentencePiece Unigram分词器,显著提升了低资源语言的处理能力。实验显示,NE-BERT在9种语言上的平均困惑度比IndicBERT-V2低15.97倍,比MuRIL低7.64倍,分词效率比mBERT高1.5倍。针对极低资源语言(如Pnar仅1002句、Kokborok仅2463句)的词汇碎片化问题,模型采用激进上采样策略加以缓解。下游词性标注任务验证了其在三种语言上的实用性。NE-BERT及其测试集和训练语料以CC-BY-4.0协议开源,旨在推动印度东北部社区的自然语言处理研究和数字包容性发展。
| NE-BERT | 一种针对印度东北部九种语言训练的多语言编码器模型,基于BERT架构。 |
| 低资源语言 | 指在自然语言处理研究中可用数据极少、模型覆盖不足的语言。 |
| SentencePiece Unigram分词器 | 一种无监督的子词分词工具,通过Unigram语言模型学习词汇表,适用于多语言和低资源场景。 |
| 困惑度 | 衡量语言模型预测能力的指标,值越低表示模型对数据的拟合越好。 |
| 过采样 | 一种数据增强策略,通过重复或增加低资源语言样本的权重来平衡训练数据分布。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅