该研究提出了LongNovel,一个面向长上下文小说摘要幻觉检测的多尺度中英双语基准。当前大模型上下文窗口虽大幅扩展,但长文本摘要中的幻觉问题依然突出,而现有研究缺乏针对小说的多尺度评测基准,也未充分探讨幻觉随上下文增长的变化规律。LongNovel由29部中文小说(16k至100k词元)及BookSum数据集的章节级数据构建,设计了8种幻觉类型,并通过多模型仲裁与实体参照幻觉生成相结合的方式,确保数据真实性与类别分布均衡;测试集经人工修订以保证可靠性。实验表明该基准具有较高挑战性,相关代码已开源。该工作为长上下文摘要幻觉研究提供了标准化评测工具,有助于推动该方向的发展。
| LongNovel | 一个用于长上下文小说摘要中幻觉检测的多尺度双语基准数据集。 |
| Hallucination Detection | 检测生成文本中与源内容不一致或虚构信息的过程。 |
| Multi-Scale Benchmark | 包含不同长度或粒度级别的基准,用于评估模型在不同上下文规模下的性能。 |
| Multi-Model Arbitration | 一种通过多个模型协商或投票来生成或验证数据的方法,以提高数据质量。 |
| Entity-Referenced Hallucination Generation | 一种基于实体引用生成幻觉样本的技术,确保幻觉与源文本中的实体相关。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅