该文章提出了一种名为SuTRA的新型分词算法,旨在解决现有子词分词器在形态丰富的印度语言中忽略词根与词缀结构的问题。传统基于频率的方法(如BPE)会过度切分词汇,导致“形态破碎”现象,即任意拆分词根和词缀。SuTRA通过保留akshara(复杂音节)的不可分割性,并惩罚跨越形态边界的合并操作,实现了结构感知的分词。研究还发布了针对印地语、马拉地语和古吉拉特语的新形态分割数据集。实验结果显示,SuTRA在形态对齐(边界F1)上最高提升14.7%,在印地语的语义可恢复性上提升34%,并在机器翻译任务中平均提高8.08 chrF2分数。这表明结构化的分词方法能显著改善形态丰富语言的建模效果。
| Subword tokenizers | 子词分词器,将文本分割成子词单元以平衡词汇表大小和表示效率的算法。 |
| Morphological Shattering | 形态破碎,指分词过程中任意分割词根和词缀,破坏词形结构完整性的现象。 |
| SuTRA | 结构统一且具有词根意识的分词算法,旨在保持音节不可分割并避免跨形态边界合并。 |
| Akshara | 印度语言中的正字法音节,是基本的书写单位,通常包含辅音和元音的组合。 |
| Boundary F1 | 边界F1分数,用于衡量分词结果与真实形态边界对齐程度的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅