这篇论文研究大语言模型排行榜中的成绩差距在多大程度上可能源于对未公开模型变体的选择性挑选。作者在高斯边际模型下提出一条敏感性曲线,用以计算在给定家族内相关性下限时,一个已公布的成绩优势最多能容纳多少个隐藏变体,同时仍保持统计上显著优于固定对照模型的证据。研究强调,所需相关性必须与排名所用分数及采样模型相匹配:在受控家族中,合并项目相关性为0.90,而复合分数相关性在项目重采样下为0.46,在MMLU学科重采样下为0.92。基于项目的审计考察了Open LLM Leaderboard上394项相邻排名声明,发现其中391项即便在考虑选择效应之前就已缺乏统计支持;而在通过未校正检验的声明中,认证结果又取决于对隐藏家族相关性的假设。该研究的意义在于,它使这些通常不可见的假设变得明确,而无需估计未观测到的搜索规模,从而为解读排行榜声明提供了更审慎的统计框架。
| LLM Leaderboard | 大型语言模型排行榜,用于公开比较不同模型在基准测试上的性能排名。 |
| Hidden Model Selection | 隐藏模型选择,指在私下评估多个模型变体后只报告最佳结果,导致排行榜成绩可能被夸大。 |
| Sensitivity Curve | 敏感性曲线,描述在给定相关性下界时,已发表性能差距所能支持的最大隐藏变体数量的曲线。 |
| Within-family Correlation | 家族内相关性,指同一模型家族中不同变体之间评估分数的相关程度。 |
| MMLU | 大规模多任务语言理解基准,用于评估语言模型在多学科知识上的表现。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅