该研究首次系统性地刻画了电子健康记录(EHR)处理中的“临床长上下文迷失”问题。随着单份病历轻松超过10万词元,大语言模型在长上下文推理中表现出明显的“中间迷失”效应,即位于上下文中心的关键信息检索可靠性显著下降,而临床记录中最关键的结论往往恰好位于此区域。研究基于MedAlign数据集,在2196对指令-回答样本和六个语言模型上验证了这一现象:峰值准确率(59.5%)与低谷准确率(37.6%)之间存在21.9个百分点的显著差距,且67.8%的参考答案落在CLitM低谷区间。为缓解该问题,作者提出轻量级的查询条件临床抑制(QCCS)选择门控机制,并与BM25、稠密检索、交叉编码器重排序等五种策略对比。结果显示,QCCS在中间位置指令上的准确率达16.7%,显著优于检索基线(最高3.3%),且其优势并非源于检索召回率——即使BM25在98.8%的指令中检索到金标准证据句,其准确率仍不超过2.6%。该研究表明,查询对齐的上下文选择比单纯的金句检索召回更能预测EHR指令遵循准确率,为临床长上下文推理提供了新的优化方向。
| Lost-in-the-Middle (LitM) effect | 长上下文模型中,中间位置信息检索可靠性低于边缘位置的现象。 |
| Clinical Lost-in-the-Middle (CLitM) problem | 电子健康记录处理中,关键临床信息位于上下文中心导致检索失败的问题。 |
| Query-Conditioned Clinical Suppression (QCCS) | 一种轻量级查询条件选择门控,用于改善临床长上下文中的指令遵循。 |
| MedAlign | 用于评估临床指令遵循的基准数据集,包含电子健康记录和指令-响应对。 |
| BM25 | 一种经典的词频-逆文档频率检索算法,用于信息检索。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅