本文探讨如何提升临床语言模型在数值计算上的可靠性。由于大模型算术易出错,而临床计算器中单个数值错误即可改变诊疗建议,作者提出“程序—求解”接口:模型不直接计算,而是生成针对具体病例的Python代码,由受限的本地执行器作为确定性求解器运行,模型只负责决定如何使用。研究在MedCalc-Bench Verified(1100个案例、55个计算器)上,以Qwen2.5-7B和32B-AWQ对比直接算术与手写22计算器库,并审计发现55个公式中有16个存在版本、用途或系数问题。结果显示,在公式与金标准变量齐备时,7B模型使用求解器无显著优势(75.31%对72.02%),32B模型则有明显提升(90.53%对83.47%)。手写库在其支持的440例上完全准确,但整体仅40.0%。研究表明,引入执行器对部分开源模型有帮助,但不能替代经验证的公式与可靠的变量提取。
| Program-Solve interface | 一种接口范式,模型不直接计算,而是生成针对具体病例的Python代码,由受限执行器作为确定性求解器运行。 |
| MedCalc-Bench Verified | 一个经过验证的临床计算器基准测试,包含1,100个病例和55个计算器,用于评估模型在临床数值计算上的表现。 |
| deterministic solver | 确定性求解器,指执行给定代码时输出完全可预测、无随机性的计算程序,用于保证数值结果的可靠性。 |
| calculator-cluster interval | 计算器聚类区间,一种考虑同一计算器内病例相关性的置信区间估计方法,用于评估性能差异的统计显著性。 |
| gold variables | 黄金变量,指基准测试中提供的、从临床记录中人工标注或提取的正确变量值,用于隔离变量提取误差。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅