本文提出PARCEL,一个用于检测法律主张是否被所引权威来源支持的基准。研究基于纽约州上诉法院近期判决,构建了包含3396条括注式主张的数据集,将每条主张标注为“被支持”“被反驳”或“未找到”,并转化为三分类自然语言推理任务,在零样本设定下评测多个先进大语言模型。结果显示,最强模型准确率可达0.97,但仍存在明显缺陷:即使提供完整判决意见文本,模型仍会把缺乏支持的主张误判为有支持。跨模型来看,识别“缺失支持”比识别“直接矛盾”更难,而看似合理但实为捏造的引注会导致性能下降最严重。该基准为法律检索增强生成系统中的主张级事实落地检测提供了实用工具。
| PARCEL | 本文提出的基准数据集,用于检测法律论断是否被引用来源支持。 |
| 法律幻觉 | 大型语言模型生成看似合理但缺乏引用来源支持的法律论断的现象。 |
| 三向自然语言推理 | 将任务建模为判断前提与假设之间关系为支持、反驳或未找到的三分类问题。 |
| 零样本设置 | 模型在未针对特定任务进行微调的情况下直接进行推理评估。 |
| 法律 RAG 系统 | 结合检索增强生成技术的法律系统,用于从外部知识库检索信息并生成回答。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅