180万参数碾压数十亿模型!多语言法律摘要新SOTA
LexLattice: Multilingual Extractive Summarization via Neural Cellular Automata on Document Hierarchies
arXiv CL (cs.CL) 重要 #抽取式摘要#法律NLP#神经细胞自动机 🕐 今天 12:00

📖 AI 总结

本文提出LexLattice,一种面向法律文本的多语言抽取式摘要方法。针对法律摘要对忠实性的高要求,该方法将法律文本的层级结构映射为二维语义格,并利用带掩码的二维神经细胞自动机在文档层级上进行证据整合,而非孤立地对段落或结构单元排序,从而捕捉分散于文档远端的共享显著性信息。在EUR-Lex-Sum全部24种语言上,LexLattice在多语言与跨语言设置下均取得最优ROUGE分数,超越参数量达数十亿的指令微调基线,而其可训练参数仅集中在冻结多语言编码器之上的180万参数整合器中。仅在高资源语言上训练的整合器还能近乎无损地迁移至未见语言,保留率达0.99,表明模型依赖的是语言无关的语义几何结构而非表层形式。该结果说明,对文档结构进行显式整合,可作为多语言法律摘要中替代规模扩张的紧凑且可追溯的方案。

🔑 关键词速览

LexLattice本文提出的抽取式摘要模型,将法律文档层级映射为二维语义晶格并用神经细胞自动机进行证据整合。
Neural Cellular Automata神经细胞自动机,一种通过局部规则迭代更新网格单元状态的神经网络模型,用于在语义晶格上传播和整合信息。
Extractive Summarization抽取式摘要,直接从原文中选取句子或段落等单元组成摘要,保证内容可追溯至来源。
EUR-Lex-Sum一个涵盖 24 种语言的法律文本摘要数据集,基于欧盟法律文件构建,用于多语言摘要评测。
ROUGE召回导向的摘要评估指标,通过比较生成摘要与参考摘要之间的重叠单元(如 n-gram)来衡量摘要质量。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅