医学AI判读肺癌筛查:微调后AUC从0.70飙至0.83,碾压原生模型!
Performance vs Consistency: Evaluating a Foundation Model in Lung-RADS Screening
arXiv CV (cs.CV) 重要 #医学影像#基础模型#评测基准 🕐 今天 12:00

📖 AI 总结

本研究评估了医学基础模型MedGemma在肺癌筛查中执行Lung-RADS v2022结构化判读的表现,并与12位放射科医生的多读者评估结果进行对比。结果显示,放射科医生的平均AUC为0.90,但读者间差异显著(0.80至0.94);未经调整的基础模型AUC仅为0.70,未达到临床可用水平;经微调后模型AUC提升至0.83,接近放射科医生表现的下限。研究揭示了一个核心权衡:模型在固定条件下输出具有确定性,消除了重复运行间的变异,而放射科医生之间存在固有的读者间差异。这表明微调后的基础模型有望作为临床决策支持的辅助工具,尤其在专业资源有限的场景中,但研究基于NLST的病例富集队列,未考虑真实世界患病率且缺乏外部验证,临床推广仍受限。

🔑 关键词速览

MedGemma源自Gemini的医学通用基础模型,本研究评估其原生版本及针对肺癌检测与诊断微调后的版本。
Lung-RADS肺癌筛查报告与数据系统,用于标准化肺癌筛查的判读与分类。
AUC受试者工作特征曲线下面积,衡量模型或读者区分阳性与阴性病例的判别能力。
NLST美国国家肺癌筛查试验数据集,本研究用于评估模型与放射科医生在肺癌筛查中的表现。
Inter-reader variability不同放射科医生对同一病例判读结果之间的差异,反映判读的主观性与不一致性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅