🔥 今日值得一读 同一输出换参考标准,基准分数竟差4.95个F1点!
Same Output, Different Gold: Measuring How Reference Choice Moves a Multilingual Benchmark Score
arXiv CL (cs.CL) 🔥 重点 #评测基准#多语言#标注质量 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
做多语言评测的开发者需警惕:换一份金标同一模型分数可差近5个F1,报告分数时应说明参考来源。

📖 AI 总结

这篇论文关注多语言基准评测中被长期忽视的参照标准(reference)问题。作者利用一个六语言个人身份信息识别基准的留存标注记录,其中包含两套独立标注、作为金标准发布的聚合结果,以及由专家重新标注的审核金标准,在保持系统输出不变的前提下替换参照标准。结果显示,同一输出在不同参照下的F1分数分别变动4.95和2.00分,最差语言中高达7.55分;两个系统之间的比较也随之改变,参照与系统的配对交互效应达2.95分,且通过多重检验校正后依然显著,甚至直接改变某一语言的优劣结论。作者指出,根源在于一个未公开的聚合默认设置,使发布的参照标准在多数情况下仅保留单一标注者,从而成为被评输出的部分副本。论文据此提出“参照敏感度区间”这一指标,并主张应将其与基准分数一并报告。

🔑 关键词速览

F1一种常用的分类性能指标,综合了精确率和召回率。
gold指作为基准真值的参考标准或标注。
reference在评估中用于与系统输出进行比较的标准答案。
annotator负责对数据进行标注的人员。
adjudication解决标注者之间分歧的过程,通常由专家裁决。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅