该研究提出了一种训练阶段的可解释性框架,旨在提升多语言仇恨言论检测模型的准确性与可解释性,尤其针对针对穆斯林社群的隐性、文化编码式仇恨内容。研究在HateXplain(英语)和BullySent(印地英语混合)两个数据集上开展实验,采用LIME、Integrated Gradients、Grad×Input和注意力机制等方法,将模型推理过程与人工标注的理性依据对齐。结果显示,基于梯度和注意力的正则化方法能有效提升F值,增强解释的合理性与忠实度,并捕捉到检测隐性反穆斯林仇恨所需的文化特定线索。该研究为构建多语言、文化敏感的内容审核系统提供了可行路径,有助于减少AI审核中的偏见、过度审查或漏审问题。
| training-time explainability | 训练时可解释性,指在模型训练过程中融入解释机制,使模型推理与人类理由对齐。 |
| HateXplain | 一个用于仇恨言论检测的基准数据集,包含英文文本及人工标注的理由。 |
| BullySent | 一个用于欺凌检测的印地英语(Hinglish)数据集,用于评估多语言仇恨言论检测。 |
| LIME | 一种局部可解释模型,通过扰动输入来近似解释模型预测。 |
| Integrated Gradients | 一种基于梯度的特征归因方法,通过积分梯度来量化输入特征对预测的贡献。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅