这篇论文针对法律文本数据分析中一个长期被默认沿用的预处理步骤——停用词移除——提出了系统性质疑。作者指出,实证法律研究常依赖TF-IDF特征与线性分类器这类可解释流程,但其预处理惯例源自上世纪信息检索领域,从未针对分类准确性加以验证。研究以美国最高法院判决文本为数据,匹配最高法院数据库标签与判例访问项目意见书,设计了两项二元分类任务:意识形态方向(不移除停用词的基线F1约0.68)与宪法/非宪法法律类型(约0.92),分别覆盖7668份和7001份意见书。作者采用穷举式单词消融方法,逐一移除约18500个候选词并直接测量对下游目标的影响,以此逼近专家可能构建的最优停用词表。结果发现:常用通用停用词表在所有测试中均低于不移除的基线;即便经过优化的停用词表,其效果与完全不删除在统计上也无法区分;基于词级特征训练的元模型无法预测哪些移除有益,说明词表筛选缺乏可优化目标。该结论对可解释法律文本研究具有警示意义:一个悄然改变模型所见特征的预处理步骤,可能扭曲研究本欲恢复的教义与意识形态信号,是否保留停用词因而关乎测量效度问题。
| Stopword Removal | 停用词移除,指在文本预处理中删除常见但通常被认为无信息量的词(如'the'、'of'),以简化特征空间。 |
| TF-IDF | 词频-逆文档频率,一种用于信息检索和文本挖掘的数值统计方法,反映词语对文档的重要程度。 |
| Single-word Ablation | 单字消融,一种通过逐一移除单个特征(此处为单词)并测量其对模型性能影响来评估特征重要性的方法。 |
| F1 Score | F1分数,精确率和召回率的调和平均数,用于衡量分类模型的综合性能。 |
| Text-as-Data | 文本即数据,一种将文本视为可量化分析的数据而非仅作定性解读的研究范式,常见于计算社会科学。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅