该研究构建了肿瘤学决策边界基准(ODBB),包含2005个基于NCCN指南和结直肠癌病例的决策点,系统评估了2025年6月至2026年4月间发布的九种前沿大语言模型。研究发现,将九个模型视为一个集合超级模型时,42.1%的决策点没有任何模型能正确回答,其中指南相关项目的失败率为35.7%,结直肠癌病例的失败率高达66.4%。失败主要集中在指南路径选择阶段,而非路径内的推理过程,这揭示了临床元判断中的系统性盲区。此外,针对决策性优化的模型(GPT-5.5、Gemini 3.1 Pro Preview)产生不安全承诺的频率是谨慎模型的3至5倍,且得分并未更高。在3%至9%的案例中,模型能陈述正确步骤却未做出相应承诺,表明问题出在决策执行而非知识缺失。研究结论指出,模型质量已不再是临床部署的主要瓶颈,关键在于需要架构层面的创新来识别模型能力边界,并在必要时将决策转交给临床医生。
| Oncology Decision Boundary Benchmark (ODBB) | 肿瘤学决策边界基准,用于评估LLMs在肿瘤学决策中的表现,包含2,005个决策点。 |
| NCCN guidelines | 美国国家综合癌症网络指南,提供肿瘤学临床实践的标准路径。 |
| frontier LLMs | 前沿大型语言模型,指当前最先进、能力最强的LLMs。 |
| clinical meta-judgment | 临床元判断,指在具体推理前选择指南路径的决策能力,是LLMs的盲点。 |
| decisiveness tuning | 果断性调整,一种模型优化方法,使模型更倾向于做出明确承诺,但可能增加不安全决策风险。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅