🔥 今日值得一读 VLM被攻破!ε≤4/255即可完全替换图像语义,视频仅需1/255成功率35.9%
It Takes Little to Rewrite Perception: Targeted Semantic Substitution in Vision-Language Models at $\epsilon \leq 4/255$
arXiv CV (cs.CV) 🔥 重点 #对抗攻击#VLM#安全 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
提醒你VLM在极小扰动下可被操控感知,部署安全敏感应用时需加强对抗防御。

📖 AI 总结

这篇论文研究视觉语言模型(VLM)在极小对抗扰动下的可控性问题。作者指出,以往的表征对齐攻击在扰动幅度不超过4/255时效果有限,使模型看似具备鲁棒性,但这一结论并不成立。他们提出针对性的语义替换方法,在白盒威胁模型下,将源图像各流与目标图像对应流在受害模型合并后的token空间中对齐。在严格成功标准下(模型须同时说出目标、确认其存在并否认源),图像任务中目标语义在2/255时即出现,4/255时完全替换率达38%;视频任务中1/255时完全替换率达35.9%。研究还发现“语义融合”现象,即大语言模型会将相互矛盾的视觉信号合理化为连贯叙述。该工作表明VLM的感知可被低成本改写,对安全关键场景中的可信度评估具有警示意义。

🔑 关键词速览

视觉语言模型 (VLM)一种能同时处理视觉和文本信息的人工智能模型,常用于图像描述、视觉问答等任务。
对抗扰动对输入数据添加的微小、精心设计的噪声,旨在欺骗机器学习模型,使其产生错误输出。
表示对齐攻击一种攻击方法,通过操纵模型内部表示,使模型将输入感知为攻击者指定的目标。
定向语义替换一种攻击目标,旨在让模型将源图像中的语义内容替换为指定的目标语义。
语义融合模型将相互矛盾的视觉信号整合成一个连贯叙述的现象,可能导致错误但合理的解释。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅