该研究探讨了历时词嵌入方法能否从现代高资源语言迁移至梵语这一古老低资源语言。梵语的音变连读、形态屈折、复合构词和多义性构成独特挑战。作者构建了覆盖四个经典时期的270万词元语料库,利用神经字节级连读切分器和词元还原器恢复词边界,并训练各时期词嵌入。评估采用历史学界整理的验证集,通过锚点位移检验语义变化方向。在21项可测试的语义演变中,19项与文献学考证方向一致,符号检验p值为0.00011,表明该方法在梵语上具有显著有效性。研究还揭示了该语言对模型配置的特定要求,并讨论了改进空间。这项工作为低资源、形态复杂语言的语义演变计算研究提供了可行路径与实证支持。
| 历时词嵌入 | 一种将词语映射为向量并随时间变化追踪其语义演变的技术。 |
| 连声 | 梵语中音素在词界处发生融合的音系过程,导致书面文本中词边界模糊。 |
| 词元还原 | 将屈折词形还原为词典原形(词元)的自然语言处理任务。 |
| 锚点位移 | 通过追踪特定锚点词在嵌入空间中的位置变化来评估语义变化方向的方法。 |
| 符号检验 | 一种非参数统计检验,用于判断观察到的方向性变化是否显著偏离随机。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅