该研究提出SWORD基准,通过受控扰动Wikidata三元组,在八种主要语言中生成语法通顺但事实错误的陈述,用以评估大语言模型能否跨语言一致地拒绝事实性错误。研究揭示两个被传统基准掩盖的关键发现:其一,模型在语义上合理的扭曲陈述上准确率反而高于随机实体替换,说明其更依赖分布熟悉度而非真正的事实核验;其二,基线准确率相近的模型在面对扭曲陈述时,东亚语言表现显著下降,跨语言性能差距最高达28个百分点,相对降幅达49%。这表明多语言事实推理能力存在不对称性,而聚合准确率指标系统性地掩盖了这一问题,对多语言模型的可靠性评估具有重要警示意义。
| SWORD | 一种基于维基数据三元组扰动生成的基准,用于评估大语言模型跨语言拒绝事实错误的一致性。 |
| Wikidata triples | 维基数据中的结构化知识单元,由主体、属性和客体组成,用于生成事实性陈述。 |
| Cross-lingual inconsistencies | 模型在不同语言间对相同事实错误拒绝表现出的不一致行为。 |
| Factual error rejection | 模型识别并拒绝接受事实错误陈述的能力。 |
| Distributional familiarity | 模型基于训练数据中语言模式的熟悉程度而非真实事实验证来做出判断的倾向。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅