该研究发布了一个名为Fiorillo v0.5的开放模型,能够针对随机对照试验文章回答干预措施对结局的影响方向,并为每个答案给出概率。模型基于Qwen3-4B-Base,通过低秩适配器和决策头微调,仅使用2657篇训练文章中1431篇许可允许复用的文章进行训练。研究在测试前于开放科学框架注册了四项发布标准,并在EI测试集上全部通过:期望校准误差为0.0168(限值0.05),对数损失显著低于先验和Gemma 4 31B-it,宏F1达0.9248。消融实验显示,仅用干净许可文章训练带来0.0123的准确率损失;无文章输入时宏F1降至0.4384,仅标题即可提升0.0939;交换干预与对照使0.6652的方向判断反转。发布文件与评估预测一致,采用Apache 2.0许可。该工作为医学证据合成提供了校准良好、许可清晰的开放模型方案。
| Fiorillo v0.5 | 一个开放模型,对输入问题给出每个答案的概率,专门用于回答随机试验相关问题。 |
| Evidence Inference 2.0 (EI) | 一个用于评估模型从随机试验文章中推断干预效果的数据集和基准。 |
| 期望校准误差 (Expected Calibration Error) | 衡量模型预测概率与实际结果频率之间差异的指标,值越小表示校准越好。 |
| 低秩适配器 (Low-rank Adapters) | 一种参数高效微调方法,通过注入低秩矩阵来适应下游任务,减少可训练参数。 |
| 宏平均 F1 (Macro-F1) | 一种评估指标,计算每个类别的 F1 分数后取平均,对类别不平衡不敏感。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅