这篇论文构建了一个句子级基准,用于评估大语言模型对法律解释方法的分类能力。作者将拉伦茨在萨维尼传统下提出的解释准则操作化为分类标准,并基于德国联邦宪法法院的判决书构建了句子级标注数据集。研究对来自三个模型家族的四个大语言模型进行了基线评测,分别使用专家手写提示和经遗传-帕累托算法(GEPA)优化的提示。结果显示,七个二分类子任务的平均F1值在70.4至79.2之间,其中语法解释通常最易识别,体系解释通常最难。在测试配置下,GEPA优化提示并未系统性优于手写提示,表明专家提示可作为有意义的基线。该工作为法律推理这一LLM难题提供了可复用的评测资源。
| 解释准则 | 法律解释中用于确定法律条文含义的指导原则或方法,如语法、系统、历史、目的解释等。 |
| 拉伦茨 | 德国著名法学家,其法学方法论对法律解释理论有重要影响。 |
| 萨维尼 | 德国历史法学派代表人物,其解释理论为现代法律解释学奠定了基础。 |
| 德国联邦宪法法院 | 德国最高宪法机构,其判决对德国法律体系具有重要影响。 |
| 遗传-帕累托(GEPA) | 一种结合遗传算法和帕累托优化的提示优化方法,用于自动改进提示效果。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅