本研究评估了医学基础模型MedGemma在肺癌筛查中执行Lung-RADS v2022结构化判读的表现,并与12位放射科医生的多读者评估结果进行对比。结果显示,放射科医生的平均AUC为0.90,但读者间差异显著(0.80至0.94);未经调整的基础模型AUC仅为0.70,未达到临床可用水平;经微调后模型AUC提升至0.83,接近放射科医生表现的下限。研究揭示了一个核心权衡:模型在固定条件下输出具有确定性,消除了重复运行间的变异,而放射科医生之间存在固有的读者间差异。这表明微调后的基础模型有望作为临床决策支持的辅助工具,尤其在专业资源有限的场景中,但研究基于NLST的病例富集队列,未考虑真实世界患病率且缺乏外部验证,临床推广仍受限。
| MedGemma | 源自Gemini的医学通用基础模型,本研究评估其原生版本及针对肺癌检测与诊断微调后的版本。 |
| Lung-RADS | 肺癌筛查报告与数据系统,用于标准化肺癌筛查的判读与分类。 |
| AUC | 受试者工作特征曲线下面积,衡量模型或读者区分阳性与阴性病例的判别能力。 |
| NLST | 美国国家肺癌筛查试验数据集,本研究用于评估模型与放射科医生在肺癌筛查中的表现。 |
| Inter-reader variability | 不同放射科医生对同一病例判读结果之间的差异,反映判读的主观性与不一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅