🔥 今日值得一读 扩散模型也中招!DIVA越狱成功率最高69.1%,专攻视觉语言模型新漏洞
DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models
arXiv CV (cs.CV) 🔥 重点 #安全对齐#扩散模型#多模态#越狱攻击 🕐 09-09 12:00
👨‍💼 主理人解读 · 为什么值得关注
这篇论文揭示了扩散型多模态模型的安全漏洞,开发者可据此设计防御机制,防止恶意视觉输入诱导模型生成违规内容。

📖 AI 总结

该研究首次系统性地探讨了多模态离散扩散视觉语言模型(dVLMs)的安全漏洞,填补了现有视觉越狱研究几乎只关注自回归架构的空白。作者发现,与自回归模型将视觉嵌入作为一次性前缀不同,扩散模型在每一步反向去噪过程中都会反复利用视觉条件,导致对抗性视觉语义被持续传播和放大,这一现象被称为“跨步条件传播”。基于此,他们提出了DIVA框架,采用跨模态意图混淆和扩散感知的多时间步对抗优化方法。实验表明,在三种dVLMs上,DIVA在Beaver奖励模型指标下达到了58.8%至69.1%的攻击成功率,显著优于为自回归模型设计的基线方法。该工作揭示了扩散式多模态模型独特的安全风险,对AI安全评估具有重要参考价值。

🔑 关键词速览

视觉语言模型(VLMs)能够同时处理视觉和文本信息的模型,用于图像理解、生成等任务。
离散扩散视觉语言模型(dVLMs)一种基于离散扩散过程的视觉语言模型,通过逐步去噪生成数据。
跨步骤条件传播扩散模型中视觉嵌入在每个去噪步骤中被重复利用,导致对抗性语义被放大的现象。
DIVA一种针对离散扩散视觉语言模型的白盒视觉越狱攻击框架。
HADES ASR一种衡量越狱攻击成功率的指标,表示攻击使模型生成有害内容的比率。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅