这篇论文对人类偏见构念在大语言模型评估中的适用性提出系统性批评。作者指出,研究者日益借助内隐偏见、刻板印象激活等社会认知构念,以及锚定效应、框架效应、确认偏误等认知偏差来研究大语言模型,这类方法在直接提问可能掩盖偏见时具有优势。然而,将原本为研究人类认知与社会行为而设计的心理学工具迁移至大语言模型,会产生推断鸿沟:模型评估依赖概率、文本补全、排序或模拟决策,与人类心理测量所依据的行为数据存在本质差异。论文剖析了这一鸿沟的三类来源,即人类构念本身、人机差异与评估情境之间的错配,并指出这些错配会模糊对模型偏见的不同解读。为此,作者提出一个分析框架,围绕目标构念、操作化方式、推断范围与人类类比限度,帮助研究者判断何种偏见解释是合理的。该研究的意义在于为跨学科借用人类偏见概念设定方法论边界,推动大语言模型偏见评估走向更严谨、更具解释效度的方向。
| 内隐偏见 | 一种无意识影响判断和行为的自动联想,通常通过间接测量而非直接自我报告来评估。 |
| 刻板印象激活 | 指社会类别线索自动触发对某群体刻板印象的认知过程。 |
| 锚定效应 | 一种认知偏差,指个体在决策时过度依赖最先获得的信息(锚点)。 |
| 框架效应 | 指同一信息因表述方式不同而导致决策或判断发生改变的现象。 |
| 推断鸿沟 | 指从人类心理构念直接推断LLM内部状态或行为倾向时存在的逻辑与方法论缺口。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅