这篇论文关注临床语言模型评估中的后见之明偏差问题。作者指出,临床决策本质上是前瞻性的,但现有模型评估多基于包含最终诊断与治疗结果的回顾性病历,可能奖励模型利用未来信息而非在决策时点的不确定性下进行推理。为此,研究构建了一个配对基准,包含171份来自PubMed Central开放获取子集的病例报告,涵盖40例脓毒症和131例GLP-1/糖尿病案例,并以文本叙述及人工标注和LLM生成的时间序列两种形式呈现。每个问题绑定于临床有意义的截断点,并配对前瞻性参考答案与结果一致的“后见陷阱”。研究在GPT 5.6 Sol、Gemma 4、GLM 5.2和Opus 5上评估准确率、后见陷阱率、答案不稳定率及后见偏差率,发现完整时间线暴露会引发一致的后见敏感偏移,而时间遮蔽可在不降低准确率的前提下减少偏差。该工作为临床时序推理的偏差测量提供了可复用的评估框架。
| Hindsight Bias | 后见之明偏差,指在已知结果后,人们倾向于高估事前预测该结果的可能性。 |
| Clinical Temporal Reasoning | 临床时间推理,指在临床决策中基于时间序列信息进行推理的过程。 |
| Textual Time Series (TTS) | 文本时间序列,将临床事件按时间顺序以文本形式表示的数据结构。 |
| Hindsight Trap | 后见之明陷阱,一种与已知结果一致的错误答案选项,用于检测模型是否受到未来信息影响。 |
| Temporal Masking | 时间掩蔽,指在评估时隐藏决策点之后的时间信息,以模拟真实前瞻性场景。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅