该研究将大语言模型(LLM)评估中的“测试框架”(harness)视为独立变量,系统性地考察其对模型排名的影响。作者构建了“脆弱性网格”,让12个开源指令微调模型在4个基准测试的3679个题目上,于26种同样合理的配置下作答,仅改变选项顺序、提示措辞和答案读取方式。结果显示,模型得分呈现为一个区间而非固定点,例如gemma4-31b的得分仅因框架不同就在31%至89%之间波动。关键发现包括:相邻模型间的分数差距中,95.7%来自对配置敏感的题目;12个模型中有4个在特定配置下可排到第一,意味着框架本身决定了冠军归属;基准压缩方法所优化的题目区分度与脆弱性相关度达0.28,导致压缩反而保留了脆弱题目。研究指出,评分方式的选择是影响结果的关键轴心,而非通常被规范的选项顺序。该研究公开了全部逐题记录和分析脚本,可供排行榜发布前进行稳健性检验。
| harness | 评估框架,指在基准测试中除题目和答案外,影响模型输出的设置,如选项顺序、提示措辞和评分方式。 |
| fragility grid | 脆弱性网格,一种系统化评估方法,通过多种配置测试模型,以揭示分数对框架的敏感性。 |
| config-fragile items | 配置脆弱性题目,指那些在不同评估配置下答案会变化的题目,导致模型分数不稳定。 |
| item discrimination | 题目区分度,衡量一个题目区分不同能力水平模型的程度,常用于基准压缩方法。 |
| open-weight instruction-tuned LLMs | 开放权重指令微调大语言模型,指权重公开且经过指令微调以适应特定任务的模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅