LLM出院教育新基准:477案例模拟真实患者,暴露AI教学盲区!
From Discharge Notes to Patient Understanding: Persona-Grounded, Open-Ended Simulation of LLMs as Discharge Educators
arXiv CL (cs.CL) 重要 医疗Agent评估 🕐 今天 12:00

📖 AI 总结

该研究针对医院出院教育这一互动教学任务,指出现有LLM评估多聚焦静态文本生成,未能衡量开放式对话中患者的真实理解程度。为此,作者提出DischargeBench,一种基于人格设定的模拟框架:由候选LLM扮演教育者,与虚拟患者进行多轮对话,并由教育监测代理在不干预教育者的前提下维持患者真实性,以保护评估信号。研究构建了MIMIC-IV-Ext-DischargeBench数据集,涵盖24个ICD章节的477个案例,并沿性格、教育水平、健康素养和病史回忆等人格维度进行分层分析。每次模拟从对话质量、主题清单、理解度和事实一致性四个维度评分,采用与医生标注对齐的LLM评判。结果显示,总体得分掩盖了不同ICD章节和患者人格间具有临床意义的差异,难度较高的人格会暴露覆盖失败、理解缺口及源答案一致性下降等问题。研究据此主张,出院教育的LLM评估应聚焦患者理解,而非仅看文本质量或答案准确性。

🔑 关键词速览

DischargeBench一种基于人物设定的模拟基准,用于评估LLM作为出院教育者在多轮对话中提升患者理解的能力。
Virtual Patient虚拟患者,在模拟中扮演具有特定个性、教育水平、健康素养和记忆能力的患者角色。
Education Monitor Agent教育监测代理,负责调节虚拟患者的真实感而不修改教育者,以保护评估信号。
MIMIC-IV-Ext-DischargeBench基于MIMIC-IV扩展构建的数据集,包含477个案例,覆盖24个ICD章节,并标注了人物属性轴。
LLM-as-a-Judge使用大型语言模型作为评判者,对模拟对话的四个维度进行评分,并与医生标注对齐。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅