40亿参数开源模型读论文答随机试验,校准误差仅0.0168,四项发布标准全过!
Calibrated Answers About Randomized Trials From a 4-Billion-Parameter Open Model: A Registered Test and a License-Clean Release
arXiv CL (cs.CL) 重要 #医学NLP#开源模型#校准 🕐 今天 12:00

📖 AI 总结

该研究发布了一个名为Fiorillo v0.5的开放模型,能够针对随机对照试验文章回答干预措施对结局的影响方向,并为每个答案给出概率。模型基于Qwen3-4B-Base,通过低秩适配器和决策头微调,仅使用2657篇训练文章中1431篇许可允许复用的文章进行训练。研究在测试前于开放科学框架注册了四项发布标准,并在EI测试集上全部通过:期望校准误差为0.0168(限值0.05),对数损失显著低于先验和Gemma 4 31B-it,宏F1达0.9248。消融实验显示,仅用干净许可文章训练带来0.0123的准确率损失;无文章输入时宏F1降至0.4384,仅标题即可提升0.0939;交换干预与对照使0.6652的方向判断反转。发布文件与评估预测一致,采用Apache 2.0许可。该工作为医学证据合成提供了校准良好、许可清晰的开放模型方案。

🔑 关键词速览

Fiorillo v0.5一个开放模型,对输入问题给出每个答案的概率,专门用于回答随机试验相关问题。
Evidence Inference 2.0 (EI)一个用于评估模型从随机试验文章中推断干预效果的数据集和基准。
期望校准误差 (Expected Calibration Error)衡量模型预测概率与实际结果频率之间差异的指标,值越小表示校准越好。
低秩适配器 (Low-rank Adapters)一种参数高效微调方法,通过注入低秩矩阵来适应下游任务,减少可训练参数。
宏平均 F1 (Macro-F1)一种评估指标,计算每个类别的 F1 分数后取平均,对类别不平衡不敏感。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅