本文提出 MemeTAG,一种面向有害网络迷因分类的双目标框架,核心创新在于关键词驱动的语义引导机制。该方法首先利用预训练视觉语言模型生成描述性关键词以捕捉高层语义,再通过基于注意力的聚合标签推断网络(ATIN)将这些关键词提炼为单一语义嵌入,并将其作为辅助重建损失的目标,从而促使模型学习深度对齐的视觉与文本特征。配合高效的三阶段训练策略,MemeTAG 在 HarMeme、Hateful Memes Challenge 和 PrideMM 三个数据集上均取得新的最优结果,显著超越现有方法。该研究为多模态有害内容检测提供了新的语义引导思路,发表于 WACV 2026。
| MemeTAG | 本文提出的关键词驱动的迷因分类双目标框架,通过标签嵌入重建实现分类。 |
| Aggregated Tag Inference Network (ATIN) | 一种基于注意力的模块,将多个描述性关键词聚合为单个语义嵌入。 |
| Vision-Language Model (VLM) | 预训练的视觉-语言模型,用于生成描述迷因高层语义的关键词。 |
| Reconstruction Loss | 辅助损失函数,通过重建目标嵌入促使模型学习对齐的视觉和文本特征。 |
| HarMeme | 用于有害迷因分类的基准数据集,常被用于评估模型性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅