该论文提出“有依据的词汇表生成”这一新任务,旨在让模型从梵语诗节及其译文中恢复语义相关的短语并生成基于翻译的释义,将传统注释实践转化为可评估的NLP目标。研究构建了包含31,316组诗节-译文-词汇表三元组的基准数据集,来源为《罗摩衍那》和《薄伽梵歌》,并采用Jaccard系数和意义忠实度两项指标进行评测。实验对比了多种模型在零样本、少样本和指令微调条件下的表现,结果显示指令微调显著优于提示方法,显式分词也能带来性能提升。错误分析表明,过度切分sandhi和samasa复合词是主要失败原因,揭示形态建模是梵语词汇分解的关键瓶颈。该研究为古典梵语的自然语言处理提供了标准化评估框架。
| grounded glossary generation | 一种生成词汇表任务,要求模型基于翻译对恢复梵语短语并生成有依据的意义。 |
| patha | 传统梵语注释实践,指对诗节进行逐词解释和意义阐述。 |
| sandhi | 梵语中的连音规则,指词与词之间音变合并的现象。 |
| samasa | 梵语中的复合词构词法,多个词根组合成一个复合词。 |
| Meaning Faithfulness | 评估生成意义与参考意义语义一致性的指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅