该研究针对尼泊尔法律语言复杂、信息分散以及农村地区法律服务资源严重不足的问题,提出了NepLEGiT——一个面向尼泊尔法律领域的专用小型语言模型。研究团队从零预训练了一个基于GPT-2解码器架构的模型,参数量约3000万,使用约400万token的尼泊尔法律文本语料,涵盖宪法、民刑法典及行政法规。在验证集上,该模型取得0.5684的交叉熵损失、1.8的困惑度和82.9%的下一词预测准确率。此外,研究还对mBERT和MuRIL在同一语料上进行持续掩码语言模型预训练,其中mBERT困惑度为2.35,优于MuRIL的6.07,为生成式模型提供了互补的编码器基线。该工作为尼泊尔法律知识的普及和法律服务可及性的提升提供了技术路径。
| NepLEGiT | 本文提出的尼泊尔法律领域小型语言模型,基于GPT-2架构,用于生成和抽取法律知识。 |
| SLM (Small Language Model) | 小型语言模型,参数规模较小,适合在资源有限的环境中部署和训练。 |
| GPT-2 | 一种基于Transformer解码器的生成式预训练语言模型,擅长文本生成任务。 |
| mBERT | 多语言BERT,一种基于Transformer编码器的多语言预训练模型,适用于多种自然语言理解任务。 |
| MuRIL | 多语言印度语言表示模型,针对印度语言优化的BERT变体,支持多种印度语言。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅