该论文提出了MTDiag,一个面向临床多轮诊断对话的大型数据集,旨在解决当前医学大语言模型评估中静态问答基准与真实临床交互脱节的问题。研究团队整合了DDXPlus、MIMIC-IV及病例报告三类异构数据源,覆盖急诊常见病与罕见非典型病例,并统一映射至UMLS概念标识符和ICD-10编码,构建了标准化数据模式。同时,论文发布了基于UserLM-8B的语句生成流程及经医生验证的数据集,将结构化临床证据转化为自然语言对话。更重要的是,作者引入了基于临床知识的多维评估指标,超越单纯诊断准确率,用于衡量模型在多轮鉴别诊断中的表现。该工作为临床诊断场景下LLM的可靠评估提供了新基准,对推动医学AI从静态测试走向动态交互验证具有参考价值。
| MTDiag | 一个多轮诊断对话数据集,用于评估LLMs在动态临床环境中的诊断能力。 |
| LLM (Large Language Model) | 大型语言模型,如GPT系列,用于处理自然语言任务。 |
| DDXPlus | 一个包含鉴别诊断信息的医学数据集,用于构建诊断对话。 |
| MIMIC-IV | 一个公开的重症监护医学数据库,包含临床记录和诊断信息。 |
| UMLS (Unified Medical Language System) | 统一医学语言系统,提供标准化的医学概念标识符。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅