仅靠合成数据训练,新策略零真实违规样本也能达到全数据模型99.8%效果!
Summarize, Judge, Refine: Decoupled Content Understanding and Policy Learning for Multimodal Content Moderation
arXiv CL (cs.CL) 重要 多模态内容审核论文方法 🕐 今天 12:00

📖 AI 总结

该研究针对多模态内容审核中理解与政策分类耦合、政策变更需全流程重训以及标注数据稀缺等痛点,提出“总结—判定—精炼”(SJR)双模型架构。其核心思路是通过自然语言接口解耦内容理解与政策学习:多模态内容模型生成结构化文本摘要,纯文本政策模型据此对照政策定义进行分类;同时借助迭代协同训练与GRPO优化内容模型,并利用文本空间增强生成对抗性摘要变体,实现少样本政策冷启动。在误导性广告检测任务上,SJR相比零样本思维链基线将非误导类F1相对提升23.6%,优于端到端SFT、STaR/RFT和RLFT等方法。更值得注意的是,一个完全未使用真实违规样本、正类数据全部由合成生成的变体模型,其违规类F1与全量数据模型仅相差0.2%,表明新政策可在缺乏真实违规数据的情况下直接上线。该工作为内容审核提供了一条可解释、易迁移且数据高效的路径。

🔑 关键词速览

Summarize-Judge-Refine (SJR)一种双模型架构,通过自然语言接口解耦多模态内容理解与策略分类,包含内容模型和策略模型。
GRPO一种强化学习优化方法,用于迭代优化内容模型以生成策略相关的摘要。
文本空间增强在文本摘要空间生成对抗性变体的数据增强技术,避免了对原始多媒体数据的直接增强。
少样本策略引导利用少量样本快速适应新策略的方法,通过文本空间增强实现。
误导性广告检测一个评估任务,旨在识别广告中是否包含误导性内容。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅