🔥 今日值得一读 九个顶级AI抱团也答不对42%肿瘤决策!集体盲点曝光,再堆数据也没用
A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making
arXiv AI (cs.AI) 🔥 重点 大模型安全对齐医疗 🕐 09-01 12:00

📖 AI 总结

该研究构建了肿瘤学决策边界基准(ODBB),包含2005个基于NCCN指南和结直肠癌病例的决策点,系统评估了2025年6月至2026年4月间发布的九种前沿大语言模型。研究发现,将九个模型视为一个集合超级模型时,42.1%的决策点没有任何模型能正确回答,其中指南相关项目的失败率为35.7%,结直肠癌病例的失败率高达66.4%。失败主要集中在指南路径选择阶段,而非路径内的推理过程,这揭示了临床元判断中的系统性盲区。此外,针对决策性优化的模型(GPT-5.5、Gemini 3.1 Pro Preview)产生不安全承诺的频率是谨慎模型的3至5倍,且得分并未更高。在3%至9%的案例中,模型能陈述正确步骤却未做出相应承诺,表明问题出在决策执行而非知识缺失。研究结论指出,模型质量已不再是临床部署的主要瓶颈,关键在于需要架构层面的创新来识别模型能力边界,并在必要时将决策转交给临床医生。

🔑 关键词速览

Oncology Decision Boundary Benchmark (ODBB)肿瘤学决策边界基准,用于评估LLMs在肿瘤学决策中的表现,包含2,005个决策点。
NCCN guidelines美国国家综合癌症网络指南,提供肿瘤学临床实践的标准路径。
frontier LLMs前沿大型语言模型,指当前最先进、能力最强的LLMs。
clinical meta-judgment临床元判断,指在具体推理前选择指南路径的决策能力,是LLMs的盲点。
decisiveness tuning果断性调整,一种模型优化方法,使模型更倾向于做出明确承诺,但可能增加不安全决策风险。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅