🔥 今日值得一读 法律AI翻车实锤:3396条论断测试,最强模型0.97准确率仍会误判无依据引用!
When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection
arXiv CL (cs.CL) 🔥 重点 #幻觉检测#法律AI#评测基准#自然语言推理 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可用来检测法律AI生成的主张是否有引用支撑,适合法律科技产品做事实核查与幻觉过滤。

📖 AI 总结

本文提出PARCEL,一个用于检测法律主张是否被所引权威来源支持的基准。研究基于纽约州上诉法院近期判决,构建了包含3396条括注式主张的数据集,将每条主张标注为“被支持”“被反驳”或“未找到”,并转化为三分类自然语言推理任务,在零样本设定下评测多个先进大语言模型。结果显示,最强模型准确率可达0.97,但仍存在明显缺陷:即使提供完整判决意见文本,模型仍会把缺乏支持的主张误判为有支持。跨模型来看,识别“缺失支持”比识别“直接矛盾”更难,而看似合理但实为捏造的引注会导致性能下降最严重。该基准为法律检索增强生成系统中的主张级事实落地检测提供了实用工具。

🔑 关键词速览

PARCEL本文提出的基准数据集,用于检测法律论断是否被引用来源支持。
法律幻觉大型语言模型生成看似合理但缺乏引用来源支持的法律论断的现象。
三向自然语言推理将任务建模为判断前提与假设之间关系为支持、反驳或未找到的三分类问题。
零样本设置模型在未针对特定任务进行微调的情况下直接进行推理评估。
法律 RAG 系统结合检索增强生成技术的法律系统,用于从外部知识库检索信息并生成回答。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅