隐性仇恨检测新框架FAID:按难度分级处理,性能碾压SOTA!
Sledgehammer or Scalpel? A Fine-grained Adaptive Framework for Implicit Hate Speech
arXiv CL (cs.CL) 重要 #安全对齐#训练方法#文本分类 🕐 08-31 12:00

📖 AI 总结

该研究针对隐晦仇恨言论检测提出了一种细粒度自适应框架(FAID)。与现有方法对所有样本采用统一推理流程不同,该框架将隐晦仇恨言论划分为浅层、定向和上下文依赖三类:浅层样本采用轻量提示调优快速分类,定向样本通过知识增强迭代揭示隐藏目标,上下文依赖样本则利用智能体框架自动生成提示以补全背景信息。在四个基准数据集上的实验表明,FAID显著优于现有最优方法。该研究的核心价值在于揭示了隐晦仇恨言论的异质性,并通过自适应架构将计算资源集中于复杂样本,在提升检测精度的同时避免了简单样本上的冗余计算,为在线内容审核提供了更高效的解决方案。

🔑 关键词速览

Implicit Hate Speech隐性仇恨言论,指通过隐喻或上下文暗示隐藏恶意,而非直接使用辱骂性语言的言论。
PLM预训练语言模型,如BERT,通过大规模语料预训练后用于下游任务。
LLM大型语言模型,如GPT,具有强大的生成和推理能力。
FAID细粒度自适应隐性仇恨言论检测框架,根据样本类别动态调整处理策略。
Prompt-tuning提示调优,一种轻量级微调方法,通过设计提示模板适应下游任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅