该研究针对社交媒体仇恨言论检测中现有方法多局限于二分类、依赖单一数据集且缺乏可解释性的问题,提出了一种可解释的多层级检测框架。模型将DistilBERT嵌入与双向长短期记忆网络及注意力机制相结合,以同时捕捉文本的上下文语义与序列依赖关系,并引入LIME方法对预测结果进行解释,突出影响决策的关键文本特征。研究在两个基准数据集上分别开展二分类与多分类评估,并辅以消融实验验证各组件的作用。结果显示,二分类任务中F1值分别达到96.78%和99.53%,多分类任务中达到97.00%和94.99%,均优于现有基线方法。该框架在性能与效率之间取得平衡,为需要准确、可泛化且可解释决策的实际内容审核系统提供了可行方案。
| DistilBERT | 一种轻量化的BERT模型,通过知识蒸馏技术压缩模型规模,同时保留大部分语言理解能力。 |
| Bi-LSTM | 双向长短期记忆网络,一种能够同时从前向和后向捕捉文本序列依赖关系的循环神经网络。 |
| Attention Mechanism | 注意力机制,一种让模型在处理序列时动态聚焦于重要部分的计算方法。 |
| LIME | 局部可解释模型无关解释,一种通过扰动输入样本来解释任何黑盒模型预测结果的技术。 |
| Ablation Study | 消融研究,通过移除或替换模型组件来评估各组件对整体性能贡献的实验方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅