法律LLM幻觉不是事实错误,是法律授权失败!
Legal LLM Hallucination Should Be Evaluated as Failure of Legal Warrant
arXiv CL (cs.CL) 重要 #法律LLM#幻觉评估#评测基准 🕐 09-17 12:00

📖 AI 总结

这篇立场论文提出,法律大语言模型的“幻觉”不应被简单视为事实错误或引用失败,而应被评估为法律授权(legal warrant)的失效。作者将“主张—权威授权”定义为一种情境敏感关系:一项具有法律后果的主张,必须对应真实存在、适用于相关司法辖区、在分析日期仍然有效、具备系统所声称的法律地位、且确实支持该主张的权威依据。在此基础上,论文提出“有授权的法律生成”这一更广义的系统行为,涵盖作答、限缩、追问、警示、纠正错误前提或拒绝回答等表现。作者预测,授权度量能够揭示答案准确性、引用存在性、通用归因以及现有基准(如LegalHalBench、CitaLaw)所遗漏的实质性失败,并通过对比案例和可复现的小规模试点加以验证。论文进一步给出基准记录、主张边界、支持标签、混合响应评分、风险权重、标注可靠性报告及辖区特定权威本体等具体规范,为以“主张是否获得法律许可”为核心评估法律AI系统提出了研究议程。

🔑 关键词速览

Legal Warrant法律授权,指一项法律主张得到现行有效、适用且支持该主张的权威依据的许可。
Claim-Authority Warrant主张-权威授权,衡量法律主张与权威之间语境敏感关系的标准,要求权威存在、适用、现行、地位正确且支持主张。
Warranted Legal Generation有法律授权的生成,系统根据法律授权关系进行回答、提问、警告、纠正或弃权等行为。
LegalHalBench一个法律基准测试,侧重于评估法规相关性,但可能遗漏授权失败。
CitaLaw一个法律基准测试,侧重于句子与引用的对齐,但可能无法捕捉授权失败。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅