该研究探讨了语言模型在职业场景中的偏见问题,提出即使模型在行为层面通过偏见评估,其内部表征仍可能保留潜在偏见。作者引入因果框架,将职业偏见分解为模型对用户能力的内部表征和可观察输出两个测量点,并通过推导表征用户专业能力的转向向量,验证其在问答和招聘任务中的因果中介作用。实验覆盖多个开源权重模型,发现性别、种族和社会经济地位等人口统计属性会影响模型对用户能力的内部表征,即便行为指标未显示群体间差异。研究还表明,这些内部表征在干预条件下可影响下游行为,揭示仅依赖行为指标可能遗漏的潜在失败模式。该工作为理解语言模型偏见的机制提供了新视角,强调评估内部表征的重要性。
| Language models (LMs) | 语言模型,基于大规模文本训练的人工智能模型,用于理解和生成自然语言。 |
| Behavioral bias | 行为偏见,指模型在输出中表现出的对特定群体的不公平倾向。 |
| Representational bias | 表征偏见,指模型内部表示中隐含的偏见,即使输出中未显现。 |
| Causal framework | 因果框架,一种分析方法,用于确定变量之间的因果关系,而非仅相关性。 |
| Steering vectors | 转向向量,用于调整模型内部表示以影响其输出的向量,常用于干预实验。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅