该研究提出并评估了一种专门用于头颈癌PET/CT影像解读的大型多模态模型(LMM)。针对通用大模型在医学领域缺乏专业知识、存在隐私顾虑及输出冗长等问题,研究者基于LLaVA-NeXT,采用两级课程策略进行微调:第一级利用28,000对图像-对话数据学习基础影像特征,第二级使用12,975对数据学习原发肿瘤存在性及颈部淋巴结转移的定位。外部验证涵盖四家机构。结果显示,该专用模型在多项评估指标上显著优于ChatGPT和基础LLaVA-NeXT,原发肿瘤分类内部准确率达83.14%,外部为69.03%。研究表明,专用LMM在快速、准确的PET/CT辅助诊断和医学教育方面具有较大潜力,为临床转化提供了可行方向。
| Large Multimodal Model (LMM) | 大型多模态模型,能够处理并关联图像和文本等多种数据类型的人工智能模型。 |
| PET/CT | 正电子发射断层扫描/计算机断层扫描,一种结合功能代谢和解剖结构的医学影像技术。 |
| LLaVA-NeXT | 一种开源的大型多模态模型,用于图像和文本的联合理解,此处作为基础模型进行微调。 |
| ROUGE-L | 一种评估自动生成文本与参考文本相似度的指标,基于最长公共子序列计算。 |
| 自回归训练 | 一种训练方法,模型逐步生成输出序列,每一步依赖先前生成的内容。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅