该研究评估了大型语言模型(LLMs)在短上下文和长上下文设置下生成的文献综述质量,旨在探究上下文窗口大小对AI生成综述的影响及其在学术写作中的辅助作用。研究者基于Semantic Scholar和Arxiv的文献资源生成了20篇AI文献综述,并由两名研究人员从15个维度进行评价。结果显示,AI生成的文献综述需要人工监督才能达到学术出版标准;随着上下文窗口增大,LLMs虽能纳入更广泛信息并保持长文本连贯性,但也加剧了内容重复、关键文献遗漏以及重描述轻综合等问题。研究表明,AI生成的综述可作为基础性概览,但必须由领域专家进行批判性评估和润色。未来研究应探索结合多模型、微调模型及人机混合策略,以弥补当前局限。
| Large Language Models (LLMs) | 大型语言模型,如GPT系列,能够理解和生成自然语言文本的深度学习模型。 |
| Context Window | 上下文窗口,指模型在生成文本时能够考虑的前文输入长度,影响信息整合和连贯性。 |
| Literature Review | 文献综述,对特定领域已有研究进行系统梳理和评价的学术文本。 |
| Semantic Scholar | 语义学者,一个基于人工智能的学术搜索引擎,提供论文检索和引用数据。 |
| Fine-tuned Models | 微调模型,在预训练模型基础上针对特定任务或领域进行进一步训练的模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅