医学视觉模型换数据就失灵?跨域迁移最多提效30%,对抗训练还越调越崩!
What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift
arXiv CV (cs.CV) 重要 #多模态#安全对齐 🕐 08-27 12:00

📖 AI 总结

该研究系统考察了医学视觉语言模型(VLM)在放射学任务中的表现,揭示其在单一评估协议下看似可靠,但面对数据分布变化时存在深层缺陷。基于NIH ChestXray14、CheXpert、PadChest和OpenI等多个数据集,研究分别评估了跨数据集视觉迁移、多模态对齐以及嵌入中的源代理信息泄漏。关键发现包括:自监督视觉初始化在NIH到CheXpert的迁移中优于监督式ImageNet初始化,而对抗适应仅在狭窄条件下有效且随压力增大趋于不稳定;多模态精确配对检索在外部数据集上表现不佳,且源代理信息仍可从学习表征中恢复。定性分析显示模型能捕捉临床相关的胸廓注意力模式,但在设备依赖和假阳性案例上仍显模糊。研究强调,单一协议下的表面能力可能掩盖迁移、对齐和捷径学习等失败模式,呼吁对医学VLM进行压力测试式评估。

🔑 关键词速览

Vision-Language Models (VLMs)视觉语言模型,结合图像和文本数据进行联合学习的模型。
Distribution Shift分布偏移,指训练和测试数据分布不一致的情况,导致模型性能下降。
Unsupervised Domain Adaptation无监督域适应,利用未标记的目标域数据调整模型以适应新域的技术。
Source-Proxy Leakage源代理泄漏,指模型嵌入中保留的元数据信息,可能作为捷径影响模型行为。
Grad-CAM梯度加权类激活映射,一种可视化技术,用于解释模型关注图像中的哪些区域。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅