该研究聚焦于视觉语言模型(VLMs)在个性化安全场景中的缺陷。作者构建了MPS-Bench基准,包含来自584张真实图像的5181个高风险场景,覆盖12个领域,每个场景均配有隐藏的用户画像。对八种前沿VLM的评估显示,模型在86%至99%的情况下直接作答而非主动询问缺失的上下文信息,个性化安全评分最高仅为2.6/5。研究揭示了“视觉主导”机制:视觉信息在早期层进入文本表征并抑制文本风险信号,因果干预表明视觉影响先转移至文本流,再通过被改变的文本表征影响最终决策,导致后期内部修正失效。基于此,作者提出轻量级输入监控器PRISM,利用双向跨模态调制预测何时应延迟回答,其AUC达0.978,在所有测试模型上严格优于安全性与实用性的帕累托前沿。
| 视觉语言模型(VLMs) | 能够同时处理图像和文本输入的人工智能模型,用于生成响应或执行任务。 |
| 个性化安全 | 确保模型输出对特定用户是安全的,考虑到用户的个人背景和情境。 |
| MPS-Bench | 一个用于评估多模态系统个性化安全的基准测试,包含多种高风险场景。 |
| 视觉主导性 | 在多模态融合中,视觉信息对文本表示的早期影响,可能抑制文本中的风险信号。 |
| PRISM | 一种轻量级输入监视器,通过双向跨模态调制预测查询是否需要延迟响应。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅