该研究针对QMSum查询聚焦会议摘要缺乏统一评测标准、结果难以比较的问题,在同一实现下重新评测或生成了15个系统。核心发现是:一个已发布的406M Fusion-in-Decoder专用模型从截断长输入切换到2000词检索片段后,ROUGE-1下降6.30,但在该片段机制上微调可完全恢复损失,测试集得分达36.33 ROUGE-1,而1.2B系统仅为35.41,两者差异的95%置信区间跨越零点,说明QMSum在统计上无法区分二者,且小模型总参数量约为前者的三分之一,峰值推理内存不到一半。在固定1.2B基座内,片段机制微调带来5.29的提升,用2000个检索词替换前4500个转写词在测试集和验证集分别提升1.55和0.29。此外,在统一简洁提示和参考重叠评分下,该406M专用模型至少超出五个专有托管模型6.2 ROUGE-1,但受输出长度及缺乏人工与事实性评估限制,该排序结论有限。研究结论仅适用于QMSum和自动指标。
| QMSum | 一个以查询为中心的会议摘要基准数据集,包含会议记录和对应查询,用于评估摘要系统。 |
| Fusion-in-Decoder | 一种结合检索与生成的模型架构,将多个检索到的段落融合到解码器中以生成答案。 |
| ROUGE-1 | 一种自动摘要评估指标,计算生成摘要与参考摘要之间一元词组(单词)的重叠程度。 |
| 检索片段(Retrieved Spans) | 从长文档中检索出的相关文本片段,用于替代完整输入以提升处理效率和效果。 |
| 会议聚类置信区间 | 一种考虑会议内部相关性的统计方法,用于估计系统性能差异的置信区间。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅