这篇论文系统梳理了大语言模型评测基准的设计演变,试图回答研究者究竟期望模型具备何种能力。作者收集了2022年1月至2026年8月间arXiv上共14767篇提出或更新评测资源的论文,通过分阶段筛选与自动化全文编码,分析了目标系统与领域、评测材料与条件、评分机制等方面的变化。研究发现,评测日益强调行动、交互与专业应用,新旧设计元素常常并存;模型参与评测的方式发展不均衡,基于LLM的评分在智能体与非智能体任务中均持续增长,而模型生成评测材料则未见同等幅度的上升。该研究揭示了公共研究如何将能力期望转化为具体测试与成功标准,并提出一个值得警惕的问题:当AI同时参与构建测试、执行任务和评判回答时,不断扩张的评测究竟提供了更多独立证据,还是可能复制参与模型自身的偏好与盲区。
| LLM Benchmarks | 用于评估大型语言模型性能的标准化测试集和评分标准。 |
| Agent | 指能够自主感知环境、做出决策并采取行动以达成目标的人工智能系统。 |
| Automated Full-Text Coding | 利用自动化工具对论文全文进行系统化编码和分类的分析方法。 |
| Model-Generated Materials | 由语言模型自动生成的评估材料,如测试问题或任务描述。 |
| Scoring Mechanisms | 用于评估模型输出质量并给出分数的具体方法和规则。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅