该研究针对隐晦仇恨言论检测提出了一种细粒度自适应框架(FAID)。与现有方法对所有样本采用统一推理流程不同,该框架将隐晦仇恨言论划分为浅层、定向和上下文依赖三类:浅层样本采用轻量提示调优快速分类,定向样本通过知识增强迭代揭示隐藏目标,上下文依赖样本则利用智能体框架自动生成提示以补全背景信息。在四个基准数据集上的实验表明,FAID显著优于现有最优方法。该研究的核心价值在于揭示了隐晦仇恨言论的异质性,并通过自适应架构将计算资源集中于复杂样本,在提升检测精度的同时避免了简单样本上的冗余计算,为在线内容审核提供了更高效的解决方案。
| Implicit Hate Speech | 隐性仇恨言论,指通过隐喻或上下文暗示隐藏恶意,而非直接使用辱骂性语言的言论。 |
| PLM | 预训练语言模型,如BERT,通过大规模语料预训练后用于下游任务。 |
| LLM | 大型语言模型,如GPT,具有强大的生成和推理能力。 |
| FAID | 细粒度自适应隐性仇恨言论检测框架,根据样本类别动态调整处理策略。 |
| Prompt-tuning | 提示调优,一种轻量级微调方法,通过设计提示模板适应下游任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅