该研究系统考察了医学视觉语言模型(VLM)在放射学任务中的表现,揭示其在单一评估协议下看似可靠,但面对数据分布变化时存在深层缺陷。基于NIH ChestXray14、CheXpert、PadChest和OpenI等多个数据集,研究分别评估了跨数据集视觉迁移、多模态对齐以及嵌入中的源代理信息泄漏。关键发现包括:自监督视觉初始化在NIH到CheXpert的迁移中优于监督式ImageNet初始化,而对抗适应仅在狭窄条件下有效且随压力增大趋于不稳定;多模态精确配对检索在外部数据集上表现不佳,且源代理信息仍可从学习表征中恢复。定性分析显示模型能捕捉临床相关的胸廓注意力模式,但在设备依赖和假阳性案例上仍显模糊。研究强调,单一协议下的表面能力可能掩盖迁移、对齐和捷径学习等失败模式,呼吁对医学VLM进行压力测试式评估。
| Vision-Language Models (VLMs) | 视觉语言模型,结合图像和文本数据进行联合学习的模型。 |
| Distribution Shift | 分布偏移,指训练和测试数据分布不一致的情况,导致模型性能下降。 |
| Unsupervised Domain Adaptation | 无监督域适应,利用未标记的目标域数据调整模型以适应新域的技术。 |
| Source-Proxy Leakage | 源代理泄漏,指模型嵌入中保留的元数据信息,可能作为捷径影响模型行为。 |
| Grad-CAM | 梯度加权类激活映射,一种可视化技术,用于解释模型关注图像中的哪些区域。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅