本文研究锥形束CT颌面部报告的自动生成,其评估采用复合目标:80%权重来自大语言模型对事实蕴含的判断,20%来自词汇重叠,而开发阶段仅能看到后者。作者用纯Python复现了BLEU-4与METEOR,并构建离线蕴含代理模型,以0.987的AUC区分不同患者的报告,使复合目标可直接优化。在622例公开数据上,仅按可见词汇排名选出的报告得分0.2909,按复合目标选出则为0.4122,因为追求n-gram重叠会使蕴含精确率从0.522降至0.266。实验还发现,一个2900万参数编码器在985条陈述上的AUC仅0.486,与语料先验无异;而图像头信息中的九个数字对下颌骨和髁突覆盖的预测分别达0.945和0.872,采集中心单独预测句子选择的准确率为0.718,高于图像模型的0.663,说明词汇指标奖励的是口述惯例而非解剖结构。最终系统在未见中心的50例上METEOR为0.3542。
| 锥形束计算机断层扫描 (CBCT) | 一种利用锥形X射线束进行三维成像的医学影像技术,常用于口腔颌面部检查。 |
| 复合目标 (Composite Objective) | 由多个子目标加权组合而成的评分标准,本文中结合了语言模型判断和词汇重叠度。 |
| 事实蕴含 (Factual Entailment) | 判断一个陈述是否在事实上被另一个陈述所支持或蕴含的任务。 |
| BLEU-4 | 一种常用的机器翻译和文本生成评价指标,基于4-gram精确度衡量生成文本与参考文本的重叠程度。 |
| METEOR | 一种综合考虑精确率、召回率和词序的文本生成评价指标,常用于机器翻译评估。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅