0.5B小模型本地跑,证据可审计F1超7B大模型7.6分!
ChestPheNoT: Deployable, Auditable Label-Status-Evidence Extraction from Radiology Reports
arXiv CL (cs.CL) 重要 大模型安全对齐论文方法 🕐 今天 12:00

📖 AI 总结

本文提出 ChestPheNoT,一种可在本地部署的紧凑型语言模型(0.5–3B 参数),用于从放射学报告中联合抽取发现标签、三分类状态(存在/不存在/不确定)以及逐字支持证据片段。研究针对临床文本难以离开机构基础设施、专家标注稀缺、传统标注器缺乏证据支持等实际部署难题,采用 CheXbert 与 72B 模型混合生成的银监督数据,结合监督微调与轻量级 GRPO 优化进行训练。在三个涵盖同分布、跨分类体系和跨机构场景的人工标注金标准集上,3B 模型在同分布下略逊于其银监督教师模型,但在分布偏移下表现相当,跨机构检测 F1 较 CheXbert 提升 2.0,并在多数检测与状态比较中达到或超过更大规模的提示模型。证据抽取方面,超过 99% 的最终证据片段可在源报告中定位,3B 模型取得 47.5 的可审计 F1,优于 Qwen2.5-7B 单样本提示 7.6 分,接近 Qwen2.5-72B。结果表明,本地可部署模型无需依赖外部推理 API,即可提供具竞争力且可直接审计的放射报告抽取能力。

🔑 关键词速览

CHESTPHENOT本文提出的紧凑型语言模型,用于从放射学报告中联合提取发现标签、状态和证据片段。
CheXbert一种基于BERT的放射学报告标注模型,常用于生成结构化标签作为银监督。
GRPOGroup Relative Policy Optimization,一种强化学习优化方法,用于轻量级精炼模型输出。
auditable-F1衡量提取证据可审计性的F1指标,要求证据片段能在源报告中定位。
silver supervision使用自动标注器(如CheXbert或大模型)生成的标签作为训练监督信号,而非人工标注。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅