406M小模型靠检索片段逆袭1.2B大模型,省三分之二参数还打平!
Retrieved-Span Training for Efficient Query-Focused Meeting Summarization on QMSum
arXiv CL (cs.CL) 论文方法评测检索增强 🕐 今天 12:00

📖 AI 总结

该研究针对QMSum查询聚焦会议摘要缺乏统一评测标准、结果难以比较的问题,在同一实现下重新评测或生成了15个系统。核心发现是:一个已发布的406M Fusion-in-Decoder专用模型从截断长输入切换到2000词检索片段后,ROUGE-1下降6.30,但在该片段机制上微调可完全恢复损失,测试集得分达36.33 ROUGE-1,而1.2B系统仅为35.41,两者差异的95%置信区间跨越零点,说明QMSum在统计上无法区分二者,且小模型总参数量约为前者的三分之一,峰值推理内存不到一半。在固定1.2B基座内,片段机制微调带来5.29的提升,用2000个检索词替换前4500个转写词在测试集和验证集分别提升1.55和0.29。此外,在统一简洁提示和参考重叠评分下,该406M专用模型至少超出五个专有托管模型6.2 ROUGE-1,但受输出长度及缺乏人工与事实性评估限制,该排序结论有限。研究结论仅适用于QMSum和自动指标。

🔑 关键词速览

QMSum一个以查询为中心的会议摘要基准数据集,包含会议记录和对应查询,用于评估摘要系统。
Fusion-in-Decoder一种结合检索与生成的模型架构,将多个检索到的段落融合到解码器中以生成答案。
ROUGE-1一种自动摘要评估指标,计算生成摘要与参考摘要之间一元词组(单词)的重叠程度。
检索片段(Retrieved Spans)从长文档中检索出的相关文本片段,用于替代完整输入以提升处理效率和效果。
会议聚类置信区间一种考虑会议内部相关性的统计方法,用于估计系统性能差异的置信区间。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅