🔥 今日值得一读 病历10万词元,大模型中间信息准确率暴跌21.9%!新门控QCCS直接逆袭
Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing
arXiv CL (cs.CL) 🔥 重点 #长上下文#医疗#推理优化 🕐 08-24 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法优化EHR处理模型,减少关键信息在长文档中间被忽略的风险,提升临床决策支持可靠性。

📖 AI 总结

该研究首次系统性地刻画了电子健康记录(EHR)处理中的“临床长上下文迷失”问题。随着单份病历轻松超过10万词元,大语言模型在长上下文推理中表现出明显的“中间迷失”效应,即位于上下文中心的关键信息检索可靠性显著下降,而临床记录中最关键的结论往往恰好位于此区域。研究基于MedAlign数据集,在2196对指令-回答样本和六个语言模型上验证了这一现象:峰值准确率(59.5%)与低谷准确率(37.6%)之间存在21.9个百分点的显著差距,且67.8%的参考答案落在CLitM低谷区间。为缓解该问题,作者提出轻量级的查询条件临床抑制(QCCS)选择门控机制,并与BM25、稠密检索、交叉编码器重排序等五种策略对比。结果显示,QCCS在中间位置指令上的准确率达16.7%,显著优于检索基线(最高3.3%),且其优势并非源于检索召回率——即使BM25在98.8%的指令中检索到金标准证据句,其准确率仍不超过2.6%。该研究表明,查询对齐的上下文选择比单纯的金句检索召回更能预测EHR指令遵循准确率,为临床长上下文推理提供了新的优化方向。

🔑 关键词速览

Lost-in-the-Middle (LitM) effect长上下文模型中,中间位置信息检索可靠性低于边缘位置的现象。
Clinical Lost-in-the-Middle (CLitM) problem电子健康记录处理中,关键临床信息位于上下文中心导致检索失败的问题。
Query-Conditioned Clinical Suppression (QCCS)一种轻量级查询条件选择门控,用于改善临床长上下文中的指令遵循。
MedAlign用于评估临床指令遵循的基准数据集,包含电子健康记录和指令-响应对。
BM25一种经典的词频-逆文档频率检索算法,用于信息检索。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅