该研究针对医院出院教育这一互动教学任务,指出现有LLM评估多聚焦静态文本生成,未能衡量开放式对话中患者的真实理解程度。为此,作者提出DischargeBench,一种基于人格设定的模拟框架:由候选LLM扮演教育者,与虚拟患者进行多轮对话,并由教育监测代理在不干预教育者的前提下维持患者真实性,以保护评估信号。研究构建了MIMIC-IV-Ext-DischargeBench数据集,涵盖24个ICD章节的477个案例,并沿性格、教育水平、健康素养和病史回忆等人格维度进行分层分析。每次模拟从对话质量、主题清单、理解度和事实一致性四个维度评分,采用与医生标注对齐的LLM评判。结果显示,总体得分掩盖了不同ICD章节和患者人格间具有临床意义的差异,难度较高的人格会暴露覆盖失败、理解缺口及源答案一致性下降等问题。研究据此主张,出院教育的LLM评估应聚焦患者理解,而非仅看文本质量或答案准确性。
| DischargeBench | 一种基于人物设定的模拟基准,用于评估LLM作为出院教育者在多轮对话中提升患者理解的能力。 |
| Virtual Patient | 虚拟患者,在模拟中扮演具有特定个性、教育水平、健康素养和记忆能力的患者角色。 |
| Education Monitor Agent | 教育监测代理,负责调节虚拟患者的真实感而不修改教育者,以保护评估信号。 |
| MIMIC-IV-Ext-DischargeBench | 基于MIMIC-IV扩展构建的数据集,包含477个案例,覆盖24个ICD章节,并标注了人物属性轴。 |
| LLM-as-a-Judge | 使用大型语言模型作为评判者,对模拟对话的四个维度进行评分,并与医生标注对齐。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅