该研究关注视觉语言模型(VLM)在医疗相关图像查询中的“弃权”能力,指出许多疾病(如自闭症谱系障碍)无法仅凭静态面部照片诊断,但VLM仍可能被要求作出此类判断,带来安全隐患。作者提出PARITY数据集,包含身份受控的合成人脸配对图像,所有身份均无真实ASD状态,因此任何非弃权的选择均被视为有害归因。实验发现,当代VLM在“拒绝优先”与“推测性”模型间存在明显分化,后者中特定面部表情会不成比例地触发有害选择。研究还表明,加入临床护栏或将图像改为单张呈现能显著提升弃权率,提示提示词与界面设计可作为可行的缓解手段。该工作为评估和改善VLM在医疗场景中的安全边界提供了实证基础。
| Vision-Language Models (VLMs) | 视觉-语言模型,能同时处理图像和文本的AI模型,用于图像理解与问答等任务。 |
| Abstention | 弃权,指模型在无法可靠回答问题时选择不给出答案的行为。 |
| PARITY | 配对评估与身份复用,一个合成的、身份受控的图像数据集,用于测试模型对无法回答问题的反应。 |
| ASD | 自闭症谱系障碍,一种需要行为和发展证据诊断的神经发育状况。 |
| Refusal-first models | 拒绝优先模型,指倾向于在不确定时主动拒绝回答的AI模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅