这篇立场论文提出,法律大语言模型的“幻觉”不应被简单视为事实错误或引用失败,而应被评估为法律授权(legal warrant)的失效。作者将“主张—权威授权”定义为一种情境敏感关系:一项具有法律后果的主张,必须对应真实存在、适用于相关司法辖区、在分析日期仍然有效、具备系统所声称的法律地位、且确实支持该主张的权威依据。在此基础上,论文提出“有授权的法律生成”这一更广义的系统行为,涵盖作答、限缩、追问、警示、纠正错误前提或拒绝回答等表现。作者预测,授权度量能够揭示答案准确性、引用存在性、通用归因以及现有基准(如LegalHalBench、CitaLaw)所遗漏的实质性失败,并通过对比案例和可复现的小规模试点加以验证。论文进一步给出基准记录、主张边界、支持标签、混合响应评分、风险权重、标注可靠性报告及辖区特定权威本体等具体规范,为以“主张是否获得法律许可”为核心评估法律AI系统提出了研究议程。
| Legal Warrant | 法律授权,指一项法律主张得到现行有效、适用且支持该主张的权威依据的许可。 |
| Claim-Authority Warrant | 主张-权威授权,衡量法律主张与权威之间语境敏感关系的标准,要求权威存在、适用、现行、地位正确且支持主张。 |
| Warranted Legal Generation | 有法律授权的生成,系统根据法律授权关系进行回答、提问、警告、纠正或弃权等行为。 |
| LegalHalBench | 一个法律基准测试,侧重于评估法规相关性,但可能遗漏授权失败。 |
| CitaLaw | 一个法律基准测试,侧重于句子与引用的对齐,但可能无法捕捉授权失败。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅