这篇论文提出了一种新的评估框架——中东文化敏感度评分(MECSS),用于测量大语言模型中的结构性话语偏见。研究基于萨义德的东方主义理论,将其七种操作转化为可量化的维度,并引入“萨义德式洗白”概念,指模型先否认泛化、又复现其否认结构的现象。通过对280段对话(1120次交流)的分析,研究发现GPT-4和Falcon3-7B-Instruct都系统性地复现了东方主义模式,而非通过公开刻板印象。GPT-4的平均MECSS为1.73,而Falcon3-7B-Instruct为2.18——尽管后者在阿布扎比构建并包含阿拉伯语训练内容,这挑战了“区域性构建即减少偏见”的假设。两模型在“认知中心”维度得分接近最高,即西方框架被视为默认普遍标准。GPT-4对话中87.9%出现萨义德式洗白,这是现有公平性指标无法捕捉的。研究结论指出,减少此类偏见需改变模型的学习来源,而非仅增加语言或迁移机构。
| MECSS | 中东文化敏感性评分,一种将萨义德东方主义理论转化为可量化维度的评估框架。 |
| Orientalism | 东方主义,萨义德提出的概念,指西方对东方的系统性偏见性表征,否认其主体性。 |
| Said-washing | 萨义德式洗白,指模型否认概括却复现其否认的东方主义结构的现象。 |
| Epistemic Center | 认识论中心,指将西方框架视为中立普遍标准,而将非西方知识视为特殊的倾向。 |
| Structural framing | 结构性框架,指通过话语组织方式而非显性偏见来传递偏见的机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅