本文介绍了首个针对大语言模型幻觉检测与答案验证的共享任务 HalluScoring 2026,聚焦阿拉伯语问答场景下的泛化能力评估。任务分为两类共四个子任务:任务一评估二元幻觉检测,分别考察对未见问题(子任务1.1)和未见模型生成回答(子任务1.2)的泛化表现;任务二在检测基础上进一步要求系统从六个候选答案中识别正确事实,覆盖伊斯兰知识与通用知识两个领域。任务基于 HalluScore 和 HalluTruthQA 两个阿拉伯语数据集,共有13支队伍参与,其中10支提交了系统描述论文。结果显示,幻觉检测仍具挑战性:任务一测试集上,子任务1.1最高 AUC-ROC 为0.7717,子任务1.2为0.7670;在辅助评估下,子任务2.1和2.2的检测与答案选择综合得分最高分别为0.8824和0.8565。该工作为阿拉伯语幻觉检测与事实核查提供了统一的评测基准。
| Hallucination Detection | 幻觉检测,指识别大语言模型生成内容中与事实不符或无依据信息的过程。 |
| AUC-ROC | 受试者工作特征曲线下面积,一种衡量二分类模型性能的常用指标,值越接近1表示性能越好。 |
| Generalization | 泛化,指模型在训练时未见过的数据或场景上仍能保持良好性能的能力。 |
| HalluScore | 本文使用的阿拉伯语幻觉检测数据集之一,用于评估模型在问答中的幻觉识别能力。 |
| HalluTruthQA | 本文使用的另一个阿拉伯语数据集,侧重于事实核查与答案验证任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅