该研究首次系统性地探讨了多模态离散扩散视觉语言模型(dVLMs)的安全漏洞,填补了现有视觉越狱研究几乎只关注自回归架构的空白。作者发现,与自回归模型将视觉嵌入作为一次性前缀不同,扩散模型在每一步反向去噪过程中都会反复利用视觉条件,导致对抗性视觉语义被持续传播和放大,这一现象被称为“跨步条件传播”。基于此,他们提出了DIVA框架,采用跨模态意图混淆和扩散感知的多时间步对抗优化方法。实验表明,在三种dVLMs上,DIVA在Beaver奖励模型指标下达到了58.8%至69.1%的攻击成功率,显著优于为自回归模型设计的基线方法。该工作揭示了扩散式多模态模型独特的安全风险,对AI安全评估具有重要参考价值。
| 视觉语言模型(VLMs) | 能够同时处理视觉和文本信息的模型,用于图像理解、生成等任务。 |
| 离散扩散视觉语言模型(dVLMs) | 一种基于离散扩散过程的视觉语言模型,通过逐步去噪生成数据。 |
| 跨步骤条件传播 | 扩散模型中视觉嵌入在每个去噪步骤中被重复利用,导致对抗性语义被放大的现象。 |
| DIVA | 一种针对离散扩散视觉语言模型的白盒视觉越狱攻击框架。 |
| HADES ASR | 一种衡量越狱攻击成功率的指标,表示攻击使模型生成有害内容的比率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅