该论文探讨了基准测试数据泄露对模型评估分数的影响,指出仅证明评测材料曾进入训练数据,并不能说明其对评测结果的实际贡献程度。为此,作者提出LeakScale框架,通过构建需要私有信息的可执行任务并控制信息访问权限,来估计基准暴露带来的因果效应。研究覆盖2048个任务家族、两个模型系列、两个可执行领域,共生成262144次结果,发现暴露在所有模型与领域组合中均提升准确率,增益范围为7.17至27.31个百分点。该工作将“是否发生基准接触”与“分数在多大程度上依赖接触”两个问题区分开来,使后者可被直接测量,为受污染基准分数的解读提供了量化方法。
| LeakScale | 一种干预框架,通过创建需要私有信息的可执行任务并控制信息访问,来估计基准暴露对模型性能的因果影响。 |
| 基准暴露 (Benchmark Exposure) | 指评估材料(如基准测试数据)在模型训练过程中被接触或使用的程度。 |
| 反事实 (Counterfactual) | 在因果推断中,指与事实相反的情境,用于量化如果未发生某事件(如基准暴露)结果会如何变化。 |
| 可执行准确率 (Executable Accuracy) | 模型在可执行任务(如代码生成)上正确执行并得到预期结果的比率。 |
| 控制调整变化 (Control-adjusted Change) | 在控制其他变量后,由特定干预(如暴露于私有信息)引起的性能变化。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅