多语言反穆斯林仇恨AI审核准确率飙升!训练时对齐人类推理,F分暴涨还防偏见
Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales
arXiv CL (cs.CL) 安全对齐多语言论文方法 🕐 08-28 12:00

📖 AI 总结

该研究提出了一种训练阶段的可解释性框架,旨在提升多语言仇恨言论检测模型的准确性与可解释性,尤其针对针对穆斯林社群的隐性、文化编码式仇恨内容。研究在HateXplain(英语)和BullySent(印地英语混合)两个数据集上开展实验,采用LIME、Integrated Gradients、Grad×Input和注意力机制等方法,将模型推理过程与人工标注的理性依据对齐。结果显示,基于梯度和注意力的正则化方法能有效提升F值,增强解释的合理性与忠实度,并捕捉到检测隐性反穆斯林仇恨所需的文化特定线索。该研究为构建多语言、文化敏感的内容审核系统提供了可行路径,有助于减少AI审核中的偏见、过度审查或漏审问题。

🔑 关键词速览

training-time explainability训练时可解释性,指在模型训练过程中融入解释机制,使模型推理与人类理由对齐。
HateXplain一个用于仇恨言论检测的基准数据集,包含英文文本及人工标注的理由。
BullySent一个用于欺凌检测的印地英语(Hinglish)数据集,用于评估多语言仇恨言论检测。
LIME一种局部可解释模型,通过扰动输入来近似解释模型预测。
Integrated Gradients一种基于梯度的特征归因方法,通过积分梯度来量化输入特征对预测的贡献。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅