本文介绍了AtomCite,一个用于验证和纠正多页文档中页面级引用的智能框架。研究指出,大型语言模型在回答多页文档问题时,提供的引用有时不准确,而现有评估体系缺乏对此类问题的验证能力。AtomCite通过将答案拆分为独立声明,并对照引用页面的图像进行逐一核验,再采用确定性修复策略来纠正错误引用。为评估该框架,作者构建了DocCite基准,这是首个针对页面级引用验证与纠正的测试集,包含928个注入实例和1909个经人工确认的自然错误。实验结果显示,AtomCite在三个模型系列上达到约93%的二元验证准确率,显著优于仅依赖OCR的对照组,并将引用精确率从34%提升至87-90%。此外,该框架具有良好的迁移性,能提升其他模型的幻觉检测能力。研究还发现,自动标签中的噪声可能扭曲验证准确率的测量,甚至改变系统排名,提示仅依赖合成或自动标签的评估存在风险。
| AtomCite | 提出的智能体框架,用于验证和纠正多页文档中答案的页面级引用。 |
| DocCite | 首个针对文档图像中页面级引用验证与纠正系统的基准测试。 |
| MP-DocVQA | 多页文档视觉问答数据集,用于构建DocCite基准。 |
| DUDE | 文档理解数据集,与MP-DocVQA一起用于构建DocCite。 |
| 页面级引用 | 引用文档中特定页面作为答案支持的引用形式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅