该研究评估了大语言模型能否在无专项训练的情况下提供准确的生存预测。作者提出Survprompt框架,将结构化患者协变量转化为自由文本临床小故事,以零样本方式提示预训练大语言模型预测生存时间,并在MSK-CHORD公开队列和Providence St. Joseph健康网络新建队列两个多机构泛癌种队列上,与传统生存模型(包括随机生存森林)进行基准比较,采用删失平均绝对误差和一致性指数评估,并通过特征消融识别影响预测的变量。结果显示,前沿大语言模型在个体生存时间预测上取得了出人意料且有竞争力的删失平均绝对误差,GPT-5.6-Sol在多种癌症类型上误差与专门训练的随机生存森林相差不到10%,在前列腺癌上甚至更低;特征消融表明大语言模型对临床变量的优先级排序与专用生存模型相似。但大语言模型在不同癌症类型和机构间准确性不一致,且对高风险与低风险患者的区分能力较差,一致性指数偏低。研究表明,零样本大语言模型无需专门训练即可生成相当准确的预后估计,但其跨癌种和跨机构表现的波动性仍是临床应用中不可忽视的局限。
| Survprompt | 本文提出的框架,将结构化患者协变量转换为自由文本临床情景描述,以提示预训练大语言模型进行零样本生存预测。 |
| cMAE(删失平均绝对误差) | 一种针对生存数据中删失观测设计的平均绝对误差指标,用于评估模型预测个体生存时间的准确性。 |
| c-index(一致性指数) | 衡量生存模型对患者风险排序能力的指标,值越高表示模型区分高风险与低风险患者的能力越强。 |
| 随机生存森林(RSF) | 一种专为生存分析设计的集成学习方法,通过构建多棵生存树来预测事件发生时间,常作为生存预测的基准模型。 |
| 零样本预测 | 指模型在未针对特定任务进行额外训练或微调的情况下,直接根据提示完成预测任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅