PET/CT看头颈癌,专用AI准确率碾压ChatGPT,F1高达0.875!
A Specialized Large Multimodal Model for Interpreting PET/CT in Head and Neck Cancer
arXiv CV (cs.CV) 重要 #多模态#医学影像#大模型 🕐 09-09 12:00

📖 AI 总结

该研究提出并评估了一种专门用于头颈癌PET/CT影像解读的大型多模态模型(LMM)。针对通用大模型在医学领域缺乏专业知识、存在隐私顾虑及输出冗长等问题,研究者基于LLaVA-NeXT,采用两级课程策略进行微调:第一级利用28,000对图像-对话数据学习基础影像特征,第二级使用12,975对数据学习原发肿瘤存在性及颈部淋巴结转移的定位。外部验证涵盖四家机构。结果显示,该专用模型在多项评估指标上显著优于ChatGPT和基础LLaVA-NeXT,原发肿瘤分类内部准确率达83.14%,外部为69.03%。研究表明,专用LMM在快速、准确的PET/CT辅助诊断和医学教育方面具有较大潜力,为临床转化提供了可行方向。

🔑 关键词速览

Large Multimodal Model (LMM)大型多模态模型,能够处理并关联图像和文本等多种数据类型的人工智能模型。
PET/CT正电子发射断层扫描/计算机断层扫描,一种结合功能代谢和解剖结构的医学影像技术。
LLaVA-NeXT一种开源的大型多模态模型,用于图像和文本的联合理解,此处作为基础模型进行微调。
ROUGE-L一种评估自动生成文本与参考文本相似度的指标,基于最长公共子序列计算。
自回归训练一种训练方法,模型逐步生成输出序列,每一步依赖先前生成的内容。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅