🔥 今日值得一读 47个模型实测:基准污染只抬分不改排名,排行榜依然靠谱!
Contamination Inflates Scores but Rarely Reorders Large Language Model Leaderboards
arXiv CL (cs.CL) 🔥 重点 #评测基准#LLM#安全对齐 🕐 09-04 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可据此理解基准污染的真实影响,不必过度担忧排名失真,但需关注绝对分数膨胀,用于模型评测和选择时更合理。

📖 AI 总结

该研究重新审视了大语言模型基准测试中的“数据污染”问题,指出其影响需区分两个层面:是否虚增绝对分数,以及是否改变模型排名。作者将污染视为对锚定项目不变性的违背,通过对比原始题目与语义等价改写题目的表现差异来测量记忆与能力的分离。基于47个公开模型及74个已知污染程度的微调模型,在ARC、GSM8K、HellaSwag和MMLU四个基准上的实验显示,该测量方法能剂量反应性地恢复注入的污染,且不会误报仅使用合法训练数据的对照组。关键发现是,标准排行榜与经改写控制的排行榜之间的排名相关性高达0.997,在188个模型-基准组合中仅3例存在跨参考验证的差异污染。这表明公开模型间的污染大体均匀,主要虚增绝对分数而极少改变排名,真正的排名扭曲需依赖罕见的差异污染。研究提供了校准的审计工具,并建议排行榜发布经改写控制的排名及置信区间。

🔑 关键词速览

Benchmark contamination基准污染,指测试集数据泄漏到训练集中,可能影响模型评估的公正性。
Anchor-item invariance锚定项目不变性,指测试项目在不同条件下应保持测量一致性,污染会违反这一性质。
Differential functioning差异功能,指原始项目与改写项目在模型表现上的差异,用于检测记忆而非能力。
Paraphrase-controlled leaderboard改写控制排行榜,通过使用语义等价改写项目来调整排名,以减少污染影响。
Dose-responsive剂量反应性,指测量结果随污染程度增加而相应变化,用于验证检测方法的有效性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅