LegalBERT去偏后公平性没变,解释忠实度却暴跌!
SCM-based Fairness and Faithful Explainability for Legal Document Classification
arXiv CL (cs.CL) 重要 #法律NLP#公平性#可解释性 🕐 今天 12:00

📖 AI 总结

本研究以LexGLUE中的欧洲人权法院涉嫌侵权语料为对象,考察法律文书分类中公平性与解释忠实度之间的关系。作者以LegalBERT为基线,对比一种在微调阶段惩罚刻板“热情—能力”表征的公平正则化变体,并从预测性能、人口统计公平性及SHAP解释忠实度三个维度,在五个随机种子下进行评估。结果显示,在性能最优的正则化强度下,该干预并未降低人口统计差异,这一零结果在两种公平定义及性别轴上的常规词对控制下均成立,分类性能也基本不变;但干预在全部五个种子和三个阈值下持续削弱解释充分性。打乱词对的控制实验重现了这种削弱,而性能与公平性不变,说明该效应源于对比式表征正则化本身,而非特定的热情—能力结构。研究由此揭示公平性与解释忠实度之间的分离:解释行为的变化未必反映公平性的变化,公平性必须被直接评估。

🔑 关键词速览

LegalBERT一种针对法律领域预训练的 BERT 模型,用于法律文本理解任务。
SHAP一种基于博弈论的特征归因方法,用于解释机器学习模型的预测。
公平性正则化在模型训练中引入惩罚项以减少偏见、提升公平性的技术。
解释忠实度衡量模型解释是否真实反映其内部推理过程的指标。
ECtHR欧洲人权法院,其判决文书常用于法律 NLP 研究。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅