这篇论文关注多语言基准评测中被长期忽视的参照标准(reference)问题。作者利用一个六语言个人身份信息识别基准的留存标注记录,其中包含两套独立标注、作为金标准发布的聚合结果,以及由专家重新标注的审核金标准,在保持系统输出不变的前提下替换参照标准。结果显示,同一输出在不同参照下的F1分数分别变动4.95和2.00分,最差语言中高达7.55分;两个系统之间的比较也随之改变,参照与系统的配对交互效应达2.95分,且通过多重检验校正后依然显著,甚至直接改变某一语言的优劣结论。作者指出,根源在于一个未公开的聚合默认设置,使发布的参照标准在多数情况下仅保留单一标注者,从而成为被评输出的部分副本。论文据此提出“参照敏感度区间”这一指标,并主张应将其与基准分数一并报告。
| F1 | 一种常用的分类性能指标,综合了精确率和召回率。 |
| gold | 指作为基准真值的参考标准或标注。 |
| reference | 在评估中用于与系统输出进行比较的标准答案。 |
| annotator | 负责对数据进行标注的人员。 |
| adjudication | 解决标注者之间分歧的过程,通常由专家裁决。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅