该研究探讨了语言模型在自然叙事中追踪实体(即理解事物位置与状态变化)的能力,并与人类表现进行了对比。通过48名人类参与者和多种规模的语言模型,在多层次复杂度的自然叙事任务中测试,发现人类实体追踪能力随叙事复杂度增加而显著下降,但不受叙事长度影响。语言模型方面,仅4.1亿参数规模的模型即可达到人类水平,远低于此前研究认为需要数十亿参数或代码专用模型的门槛,且模型规模越大表现越优,当代模型已大幅超越人类。结果表明,实体追踪作为语言理解的核心能力,在远小于预期的模型规模下即可涌现,挑战了先前关于该能力需要大规模模型的假设,为理解语言模型的能力发展提供了新视角。
| Entity tracking | 实体追踪,指在文本中跟踪实体(如人物、物体)的位置和状态变化的能力。 |
| Naturalistic narratives | 自然叙事文本,指接近真实语言使用的故事或叙述,而非人工构造的测试句子。 |
| Language models | 语言模型,指通过大量文本训练的人工智能模型,用于理解和生成自然语言。 |
| Parameters | 参数,指模型中可学习的权重数量,通常用于衡量模型规模大小。 |
| Emergence | 涌现,指在模型规模增大到一定程度时,新能力突然出现或显著提升的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅