2B小模型竟碾压70B大模型!LLM叙事填充新基准揭示规模不是关键
Evaluating Whether LLMs Can Reliably Connect the DOTs?
arXiv CL (cs.CL) 重要 #文本填充#评测基准#叙事推理#LLM评估 🕐 10-01 12:00

📖 AI 总结

这篇论文关注大语言模型在真实叙事文本补全任务中的实际能力。作者构建了一个覆盖百科文本、常识故事、新闻报道和视觉叙事四种类型、约9200条实例的多领域基准,通过遮蔽一至三句话来测试模型重建缺失内容并保持局部与全局一致性的表现。研究评估了20个参数规模从1.5B到70B的指令微调开源模型,并考察了指令具体程度和推理引导的影响。结果显示,模型规模并不能可靠预测补全质量:Gemma-2-2B取得最高的定性评分4.02/5,超过参数量十倍以上的DeepSeek-Qwen-32B和LLaMA-3.3-70B。此外,思维链推理仅带来约0.6%的边际提升,而叙事长度和领域特征比缺失位置更能预测任务难度。该研究揭示了当前LLM在真实叙事补全上的局限,并为评估与改进提供了新基准。

🔑 关键词速览

文本填充 (Text Infilling)在给定上下文中重建缺失文本片段的任务,要求与局部和全局叙事保持一致。
叙事填充 (Narrative Infilling)文本填充的一种,特指在故事或叙事中重建缺失的句子或段落。
指令微调 (Instruction Tuning)在预训练语言模型上使用指令-响应对进行微调,使其能更好地遵循人类指令。
思维链推理 (Chain-of-Thought Reasoning)让模型在给出最终答案前生成中间推理步骤,以提高复杂任务的表现。
定性框架 (Qualitative Framework)基于人工或规则对模型输出进行多维度质量评估的方法,而非仅依赖自动指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅