本研究以LexGLUE中的欧洲人权法院涉嫌侵权语料为对象,考察法律文书分类中公平性与解释忠实度之间的关系。作者以LegalBERT为基线,对比一种在微调阶段惩罚刻板“热情—能力”表征的公平正则化变体,并从预测性能、人口统计公平性及SHAP解释忠实度三个维度,在五个随机种子下进行评估。结果显示,在性能最优的正则化强度下,该干预并未降低人口统计差异,这一零结果在两种公平定义及性别轴上的常规词对控制下均成立,分类性能也基本不变;但干预在全部五个种子和三个阈值下持续削弱解释充分性。打乱词对的控制实验重现了这种削弱,而性能与公平性不变,说明该效应源于对比式表征正则化本身,而非特定的热情—能力结构。研究由此揭示公平性与解释忠实度之间的分离:解释行为的变化未必反映公平性的变化,公平性必须被直接评估。
| LegalBERT | 一种针对法律领域预训练的 BERT 模型,用于法律文本理解任务。 |
| SHAP | 一种基于博弈论的特征归因方法,用于解释机器学习模型的预测。 |
| 公平性正则化 | 在模型训练中引入惩罚项以减少偏见、提升公平性的技术。 |
| 解释忠实度 | 衡量模型解释是否真实反映其内部推理过程的指标。 |
| ECtHR | 欧洲人权法院,其判决文书常用于法律 NLP 研究。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅