🔥 今日值得一读 大模型跨语言事实核查漏洞:亚洲语言错误拒绝率暴跌28个百分点!
SWORD: Wikidata-based Distortions Reveal Hidden Cross-Lingual Inconsistencies in LLM Factual Error Rejection
arXiv CL (cs.CL) 🔥 重点 评测基准多语言安全对齐 🕐 09-10 12:00

📖 AI 总结

该研究提出SWORD基准,通过受控扰动Wikidata三元组,在八种主要语言中生成语法通顺但事实错误的陈述,用以评估大语言模型能否跨语言一致地拒绝事实性错误。研究揭示两个被传统基准掩盖的关键发现:其一,模型在语义上合理的扭曲陈述上准确率反而高于随机实体替换,说明其更依赖分布熟悉度而非真正的事实核验;其二,基线准确率相近的模型在面对扭曲陈述时,东亚语言表现显著下降,跨语言性能差距最高达28个百分点,相对降幅达49%。这表明多语言事实推理能力存在不对称性,而聚合准确率指标系统性地掩盖了这一问题,对多语言模型的可靠性评估具有重要警示意义。

🔑 关键词速览

SWORD一种基于维基数据三元组扰动生成的基准,用于评估大语言模型跨语言拒绝事实错误的一致性。
Wikidata triples维基数据中的结构化知识单元,由主体、属性和客体组成,用于生成事实性陈述。
Cross-lingual inconsistencies模型在不同语言间对相同事实错误拒绝表现出的不一致行为。
Factual error rejection模型识别并拒绝接受事实错误陈述的能力。
Distributional familiarity模型基于训练数据中语言模式的熟悉程度而非真实事实验证来做出判断的倾向。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅