爆!VLM竟敢用一张脸“诊断”自闭症?新研究:超半数模型乱答,表情还能带偏结果!
Knowing When Not to Answer: Abstention and Refusal Reasoning in Vision--Language Models
arXiv CV (cs.CV) 重要 #安全对齐#医学影像#多模态 🕐 09-09 12:00

📖 AI 总结

该研究关注视觉语言模型(VLM)在医疗相关图像查询中的“弃权”能力,指出许多疾病(如自闭症谱系障碍)无法仅凭静态面部照片诊断,但VLM仍可能被要求作出此类判断,带来安全隐患。作者提出PARITY数据集,包含身份受控的合成人脸配对图像,所有身份均无真实ASD状态,因此任何非弃权的选择均被视为有害归因。实验发现,当代VLM在“拒绝优先”与“推测性”模型间存在明显分化,后者中特定面部表情会不成比例地触发有害选择。研究还表明,加入临床护栏或将图像改为单张呈现能显著提升弃权率,提示提示词与界面设计可作为可行的缓解手段。该工作为评估和改善VLM在医疗场景中的安全边界提供了实证基础。

🔑 关键词速览

Vision-Language Models (VLMs)视觉-语言模型,能同时处理图像和文本的AI模型,用于图像理解与问答等任务。
Abstention弃权,指模型在无法可靠回答问题时选择不给出答案的行为。
PARITY配对评估与身份复用,一个合成的、身份受控的图像数据集,用于测试模型对无法回答问题的反应。
ASD自闭症谱系障碍,一种需要行为和发展证据诊断的神经发育状况。
Refusal-first models拒绝优先模型,指倾向于在不确定时主动拒绝回答的AI模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅