这篇论文检验了当前AI偏见审计实践中的一个核心假设:不同的审计工具是否测量同一构念、其评分能否用于模型间的排名比较。研究者通过统一的推理网关,用十种外部审计工具对十个前沿模型进行测评,依次考察职业性别偏见、年龄偏见和社会经济地位偏见。结果显示,检测与排名出现明显分离:十种工具中有八种能以置信区间远离零的方式检出偏见,但两个被广泛引用的直接探测基准已因前沿模型趋于中性回答而饱和;跨工具的排名一致性却与随机无异(Kendall's W=0.07,p=0.83)。作者用六个刻意弱化的模型做阳性对照,发现工具内部信度在能力差距拉大后可以恢复,但跨工具排名始终无法恢复,说明各工具测量的是不同构念,而非同一构念的噪声。偏见方向也随审计形式而分裂:强制选择类工具多表现为过度矫正,而自由生成和默认共指则保持刻板印象一致。该结论在年龄维度上同样成立。论文的实践含义是,单一审计可在其自身操作化框架内检出偏见并估计方向,但不足以支撑模型间的排名比较。
| Bias Audits | 偏见审计:系统性地评估AI模型是否存在对特定群体(如性别、种族)的偏见或歧视的程序。 |
| Frontier Models | 前沿模型:指当前最先进、能力最强的人工智能模型,通常由领先的AI研究机构开发。 |
| Kendall's W | 肯德尔W系数:一种衡量多个评判者对多个对象排名一致性的统计指标,取值0到1,0表示完全不一致,1表示完全一致。 |
| Extrinsic Audit Instruments | 外部审计工具:独立于模型开发者的第三方评估工具,用于从外部检测模型的偏见等特性。 |
| Forced-choice Decision Tools | 强制选择决策工具:一种审计方法,要求模型在给定的选项(如两个候选人)中做出选择,常用于评估决策偏见。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅