XHotpotQA是一个用于评估跨语言知识组合能力的多跳问答基准数据集。现有多语言问答基准通常将整个实例翻译成单一语言,掩盖了推理链中语言边界处的失败。该研究构建了包含15,661条训练和7,405条验证实例的受控数据集,每个实例通过证据依赖图明确标注问题、桥接证据、答案证据和干扰项的语言分配。验证集中99.81%的实例跨越问题到黄金证据的语言界面,95.60%使用不同语言的黄金段落。实验发现,在三个阅读器上,完整的问题-证据语言不匹配比部分对齐导致Unicode感知F1分数低10.25至15.79分,不同文字的证据造成11.98至23.70分的差距,而选择器的相应差距仅为1.71和1.78分。这表明在给定候选条件下,阅读器比选择器对语言不匹配更为敏感。XHotpotQA提供角色感知诊断和模块化评估,为跨语言知识整合系统提供了审计测试平台。
| XHotpotQA | 一个用于跨语言知识组合的受控基准数据集,基于HotpotQA扩展,支持多跳问答中的混合语言证据。 |
| multi-hop question answering | 多跳问答,一种需要系统通过多个推理步骤组合多个证据片段来回答问题的任务。 |
| cross-lingual knowledge composition | 跨语言知识组合,指在推理过程中整合来自不同语言的证据信息以形成答案。 |
| evidence-dependency graph | 证据依赖图,一种表示问题、证据和答案之间依赖关系的结构化模型,用于分析推理链。 |
| Unicode-aware answer F1 | Unicode感知的答案F1,一种考虑Unicode字符的答案匹配评估指标,用于衡量跨语言答案的准确性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅