该研究针对多模态内容审核中理解与政策分类耦合、政策变更需全流程重训以及标注数据稀缺等痛点,提出“总结—判定—精炼”(SJR)双模型架构。其核心思路是通过自然语言接口解耦内容理解与政策学习:多模态内容模型生成结构化文本摘要,纯文本政策模型据此对照政策定义进行分类;同时借助迭代协同训练与GRPO优化内容模型,并利用文本空间增强生成对抗性摘要变体,实现少样本政策冷启动。在误导性广告检测任务上,SJR相比零样本思维链基线将非误导类F1相对提升23.6%,优于端到端SFT、STaR/RFT和RLFT等方法。更值得注意的是,一个完全未使用真实违规样本、正类数据全部由合成生成的变体模型,其违规类F1与全量数据模型仅相差0.2%,表明新政策可在缺乏真实违规数据的情况下直接上线。该工作为内容审核提供了一条可解释、易迁移且数据高效的路径。
| Summarize-Judge-Refine (SJR) | 一种双模型架构,通过自然语言接口解耦多模态内容理解与策略分类,包含内容模型和策略模型。 |
| GRPO | 一种强化学习优化方法,用于迭代优化内容模型以生成策略相关的摘要。 |
| 文本空间增强 | 在文本摘要空间生成对抗性变体的数据增强技术,避免了对原始多媒体数据的直接增强。 |
| 少样本策略引导 | 利用少量样本快速适应新策略的方法,通过文本空间增强实现。 |
| 误导性广告检测 | 一个评估任务,旨在识别广告中是否包含误导性内容。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅