该研究提出并系统验证了多模态大语言模型(MLLM)在视频审核中的一个安全盲区——“分布式隐式危害”(DIH)。这类危害并非来自视频中任何单一显性内容,而是源于各无害组件在时间序列或跨模态组合后涌现出的整体有害含义。研究聚焦两种典型形式:时间维度上跨视觉片段的分布式危害,以及音视频跨模态组合产生的危害。为弥补现有安全数据集缺乏此类样本的不足,研究者开发了多智能体合成框架,生成了超过9000个带推理标注的DIH视频。对30余个前沿及开源MLLM的基准测试显示,这些模型普遍难以识别DIH,即便最强模型能正确判断各独立组件,却无法理解组合后的危害含义。在真实社交媒体DIH视频上的验证同样暴露此缺陷,表明该问题在实际视频审核场景中具有现实威胁,亟待进一步研究。
| Distributed Implicit Harm (DIH) | 分布式隐式危害,指视频中多个看似无害的组件组合后产生有害含义的现象。 |
| Compositional safety blind spot | 组合安全盲点,指模型无法识别由良性组件组合而成的有害内容。 |
| Multimodal large language models (MLLMs) | 多模态大语言模型,能处理文本、图像、音频等多种模态的AI模型。 |
| DIH-T (Temporally distributed harm) | 时间分布式危害,指危害分布在视频的不同时间片段中。 |
| DIH-M (Cross-modal harm) | 跨模态危害,指危害源于音频和视觉流之间的交互。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅