16个AI大模型中医考试超60名真人医师,但开药方露馅了!
Large Language Models Versus Physicians in Traditional Chinese Medicine: A Real-World Clinical Case Evaluation
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-17 12:00

📖 AI 总结

本研究构建了包含62家医院349份脱敏门诊病例的临床案例库,从中选取60份代表性案例,对16个大语言模型与60名执业中医师进行对比评估,由五位资深中医专家在九个诊疗维度上匿名打分。结果显示,前沿通用大语言模型在专家评分上整体高于医师对照组,尤其在医疗建议、治疗原则及部分诊断任务上表现突出。但处方层面的分析揭示,模型在药物选择、剂量及治疗策略上与医师存在差异,定性安全审查还发现幻觉和模板化输出等问题。该研究既表明大语言模型在中医决策支持方面具有潜力,也强调其临床应用仍需医师监督、安全约束和前瞻性临床验证。

🔑 关键词速览

Large Language Models (LLMs)大型语言模型,一种基于深度学习的自然语言处理模型,能够生成和理解文本。
Traditional Chinese Medicine (TCM)中医药,中国传统医学体系,包括中药、针灸、推拿等疗法。
Clinical Case Evaluation临床病例评估,对真实临床病例进行系统分析和评价的过程。
Hallucinations幻觉,指AI模型生成看似合理但实际错误或虚构的信息。
Physician Oversight医师监督,指在AI辅助医疗中由医师进行审核和把关。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅