本研究构建了包含62家医院349份脱敏门诊病例的临床案例库,从中选取60份代表性案例,对16个大语言模型与60名执业中医师进行对比评估,由五位资深中医专家在九个诊疗维度上匿名打分。结果显示,前沿通用大语言模型在专家评分上整体高于医师对照组,尤其在医疗建议、治疗原则及部分诊断任务上表现突出。但处方层面的分析揭示,模型在药物选择、剂量及治疗策略上与医师存在差异,定性安全审查还发现幻觉和模板化输出等问题。该研究既表明大语言模型在中医决策支持方面具有潜力,也强调其临床应用仍需医师监督、安全约束和前瞻性临床验证。
| Large Language Models (LLMs) | 大型语言模型,一种基于深度学习的自然语言处理模型,能够生成和理解文本。 |
| Traditional Chinese Medicine (TCM) | 中医药,中国传统医学体系,包括中药、针灸、推拿等疗法。 |
| Clinical Case Evaluation | 临床病例评估,对真实临床病例进行系统分析和评价的过程。 |
| Hallucinations | 幻觉,指AI模型生成看似合理但实际错误或虚构的信息。 |
| Physician Oversight | 医师监督,指在AI辅助医疗中由医师进行审核和把关。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅