14767篇论文揭示LLM基准测试大变局:智能体与专业应用成新宠!
What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks
arXiv AI (cs.AI) 重要 大模型论文方法 🕐 09-18 12:00

📖 AI 总结

这篇论文系统梳理了大语言模型评测基准的设计演变,试图回答研究者究竟期望模型具备何种能力。作者收集了2022年1月至2026年8月间arXiv上共14767篇提出或更新评测资源的论文,通过分阶段筛选与自动化全文编码,分析了目标系统与领域、评测材料与条件、评分机制等方面的变化。研究发现,评测日益强调行动、交互与专业应用,新旧设计元素常常并存;模型参与评测的方式发展不均衡,基于LLM的评分在智能体与非智能体任务中均持续增长,而模型生成评测材料则未见同等幅度的上升。该研究揭示了公共研究如何将能力期望转化为具体测试与成功标准,并提出一个值得警惕的问题:当AI同时参与构建测试、执行任务和评判回答时,不断扩张的评测究竟提供了更多独立证据,还是可能复制参与模型自身的偏好与盲区。

🔑 关键词速览

LLM Benchmarks用于评估大型语言模型性能的标准化测试集和评分标准。
Agent指能够自主感知环境、做出决策并采取行动以达成目标的人工智能系统。
Automated Full-Text Coding利用自动化工具对论文全文进行系统化编码和分类的分析方法。
Model-Generated Materials由语言模型自动生成的评估材料,如测试问题或任务描述。
Scoring Mechanisms用于评估模型输出质量并给出分数的具体方法和规则。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅