大型语言模型在医学考试和问答任务上表现良好,但在需要精确数值输出的医学计算任务中仍不可靠,而这类计算直接关系到用药剂量、器官功能评估和预后评分等高风险临床决策。为此,研究者提出MedCode框架,通过训练模型生成嵌入式可执行代码来改进医学计算:模型根据临床情境识别所需计算器、提取输入变量,并生成将算术运算交由确定性解释器执行的脚本,最终返回计算结果、解释说明及相应单位。研究基于MedCalc基准构建了监督微调和偏好数据集,并额外整理了ICU场景的计算任务数据,同时提出加权直接偏好优化方法,自适应地强化模型难以区分的偏好对。在LLaMA3-8B、Qwen2.5-7B和Mistral-7B上的实验显示,绝对准确率提升达20至30个百分点,表明嵌入式代码生成对医学计算任务具有显著效果。
| MedCode | 一个通过训练大语言模型生成嵌入式可执行代码来提升医学计算准确性的框架。 |
| 嵌入式代码生成 | 模型在输出中生成可执行代码片段,将算术运算委托给确定性解释器执行。 |
| 加权直接偏好优化(wDPO) | 一种改进的偏好优化方法,自适应地强调模型难以区分的偏好对以提升训练效果。 |
| MedCalc基准 | 用于评估医学计算任务的基准数据集,包含多种临床计算器。 |
| ICU场景计算任务 | 针对重症监护室中常见计算任务(如药物剂量、评分等)整理的数据集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅