这篇论文研究视觉语言模型(VLM)在极小对抗扰动下的可控性问题。作者指出,以往的表征对齐攻击在扰动幅度不超过4/255时效果有限,使模型看似具备鲁棒性,但这一结论并不成立。他们提出针对性的语义替换方法,在白盒威胁模型下,将源图像各流与目标图像对应流在受害模型合并后的token空间中对齐。在严格成功标准下(模型须同时说出目标、确认其存在并否认源),图像任务中目标语义在2/255时即出现,4/255时完全替换率达38%;视频任务中1/255时完全替换率达35.9%。研究还发现“语义融合”现象,即大语言模型会将相互矛盾的视觉信号合理化为连贯叙述。该工作表明VLM的感知可被低成本改写,对安全关键场景中的可信度评估具有警示意义。
| 视觉语言模型 (VLM) | 一种能同时处理视觉和文本信息的人工智能模型,常用于图像描述、视觉问答等任务。 |
| 对抗扰动 | 对输入数据添加的微小、精心设计的噪声,旨在欺骗机器学习模型,使其产生错误输出。 |
| 表示对齐攻击 | 一种攻击方法,通过操纵模型内部表示,使模型将输入感知为攻击者指定的目标。 |
| 定向语义替换 | 一种攻击目标,旨在让模型将源图像中的语义内容替换为指定的目标语义。 |
| 语义融合 | 模型将相互矛盾的视觉信号整合成一个连贯叙述的现象,可能导致错误但合理的解释。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅