🔥 今日值得一读 块级对齐+非平衡传输,IAU-FOA让闭源多模态大模型攻击迁移性飙升!
Visual-Invariance-Augmented Feature Optimal Alignment for Transferable Adversarial Attacks against Closed-Source MLLMs
arXiv CV (cs.CV) 🔥 重点 #对抗攻击#多模态大模型#迁移攻击 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
提升黑盒迁移对抗样本对闭源MLLM的攻击成功率,可用于安全红队测试。

📖 AI 总结

该研究针对闭源多模态大语言模型在黑盒场景下易受可迁移对抗样本攻击的问题,指出现有定向迁移攻击仅依赖图像级全局特征(如编码器CLS嵌入)进行对齐,忽略块级视觉结构,导致跨异构闭源模型的迁移性受限。为此,作者提出IAU-FOA方法,在全局与局部两个层面同时对齐对抗样本与目标样本:以余弦目标缩小全局语义差距,并将图像块令牌聚类为紧凑局部模式,通过最优传输实现细粒度匹配。针对无可靠对应簇的局部聚类,研究引入置信度自适应非平衡传输,放松弱匹配簇的边际约束,以减少误导性对齐梯度。此外,作者提出视觉不变性增强策略,通过双向像素强度缩放与逐通道白平衡调整模拟曝光、对比度、光照和色温变化,促使扰动跨视觉编码器泛化。在开源与闭源MLLM上的大量实验表明,IAU-FOA持续优于现有最先进的可迁移攻击方法。

🔑 关键词速览

MLLMs多模态大语言模型,能够同时处理图像、文本等多种模态输入的大规模语言模型。
IAU-FOA本文提出的视觉不变性增强特征最优对齐攻击方法,用于提升针对闭源多模态大模型的对抗迁移性。
Optimal Transport最优传输,一种在概率分布之间寻找最小成本匹配方案的数学框架,本文用于局部特征对齐。
Visual-Invariance Augmentation视觉不变性增强,通过模拟曝光、对比度、光照和色温等变化,促使对抗扰动在不同视觉编码器间泛化。
Transferable Adversarial Attacks可迁移对抗攻击,指在替代模型上生成的对抗样本能够成功欺骗其他未知目标模型的攻击方式。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅