长篇小说幻觉检测没基准?LongNovel来了:8类幻觉+中英双语,29部小说16k到100k词元全覆盖!
LongNovel: A Multi-Scale Benchmark for Hallucination Detection in Long-Context Novel Summarization
arXiv CL (cs.CL) 重要 #评测基准#幻觉检测#长文本 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
构建多尺度长篇小说摘要幻觉检测基准,覆盖细粒度事件与对话,助力长上下文评测。

📖 AI 总结

该研究提出了LongNovel,一个面向长上下文小说摘要幻觉检测的多尺度中英双语基准。当前大模型上下文窗口虽大幅扩展,但长文本摘要中的幻觉问题依然突出,而现有研究缺乏针对小说的多尺度评测基准,也未充分探讨幻觉随上下文增长的变化规律。LongNovel由29部中文小说(16k至100k词元)及BookSum数据集的章节级数据构建,设计了8种幻觉类型,并通过多模型仲裁与实体参照幻觉生成相结合的方式,确保数据真实性与类别分布均衡;测试集经人工修订以保证可靠性。实验表明该基准具有较高挑战性,相关代码已开源。该工作为长上下文摘要幻觉研究提供了标准化评测工具,有助于推动该方向的发展。

🔑 关键词速览

LongNovel一个用于长上下文小说摘要中幻觉检测的多尺度双语基准数据集。
Hallucination Detection检测生成文本中与源内容不一致或虚构信息的过程。
Multi-Scale Benchmark包含不同长度或粒度级别的基准,用于评估模型在不同上下文规模下的性能。
Multi-Model Arbitration一种通过多个模型协商或投票来生成或验证数据的方法,以提高数据质量。
Entity-Referenced Hallucination Generation一种基于实体引用生成幻觉样本的技术,确保幻觉与源文本中的实体相关。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅