可解释AI框架检测仇恨言论,多分类F1最高97%,准确率超99%!
An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection
arXiv CL (cs.CL) #仇恨言论检测#可解释性#文本分类 🕐 今天 12:00

📖 AI 总结

该研究针对社交媒体仇恨言论检测中现有方法多局限于二分类、依赖单一数据集且缺乏可解释性的问题,提出了一种可解释的多层级检测框架。模型将DistilBERT嵌入与双向长短期记忆网络及注意力机制相结合,以同时捕捉文本的上下文语义与序列依赖关系,并引入LIME方法对预测结果进行解释,突出影响决策的关键文本特征。研究在两个基准数据集上分别开展二分类与多分类评估,并辅以消融实验验证各组件的作用。结果显示,二分类任务中F1值分别达到96.78%和99.53%,多分类任务中达到97.00%和94.99%,均优于现有基线方法。该框架在性能与效率之间取得平衡,为需要准确、可泛化且可解释决策的实际内容审核系统提供了可行方案。

🔑 关键词速览

DistilBERT一种轻量化的BERT模型,通过知识蒸馏技术压缩模型规模,同时保留大部分语言理解能力。
Bi-LSTM双向长短期记忆网络,一种能够同时从前向和后向捕捉文本序列依赖关系的循环神经网络。
Attention Mechanism注意力机制,一种让模型在处理序列时动态聚焦于重要部分的计算方法。
LIME局部可解释模型无关解释,一种通过扰动输入样本来解释任何黑盒模型预测结果的技术。
Ablation Study消融研究,通过移除或替换模型组件来评估各组件对整体性能贡献的实验方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅