该研究复现了Mohd等人(2020)提出的基于分布语义的抽取式摘要方法,并将其适配到印地语,在每一个语言相关步骤中替换为适合天城文的组件。系统在两个独立语料库上评估:XL-Sum印地语部分和FIRE ILSUM 2.0印地语,采用天城文感知的ROUGE实现,并以1000次重采样配对自助法进行比较。结果显示,在原始等权重配置下,复现系统在两个语料库上均显著劣于三句首句基线,ROUGE-1分别落后0.042和0.265。特征消融表明,句子位置是唯一有贡献的特征,位置单独即可精确复现首句基线,去除位置则性能最差,经验证集调优的权重最多只能与Lead-3持平。TextRank表现相同,说明这是方法类别层面的问题而非实现层面。选择分析显示,其余特征倾向于抽取长且实体密集的正文句子,而参考摘要则复用文章首句。这表明印地语基准无法奖励非首句内容选择,亟需专门构建的评估资源。
| 抽取式摘要 | 从原文中直接选取重要句子组成摘要的方法。 |
| 分布语义 | 基于词语在大量文本中的共现分布来表示语义的方法。 |
| ROUGE | 评估自动摘要质量的常用指标,通过比较生成摘要与参考摘要的n-gram重叠度。 |
| Lead-3 | 一种简单的基线方法,直接取文章的前三句话作为摘要。 |
| TextRank | 一种基于图排序的无监督关键词或句子抽取算法,常用于摘要。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅