该研究系统评估了15种冷冻血液学基础模型在跨数据采集域(扫描仪、站点、染色和制备流程)下的可靠性与校准能力。结果显示,尽管这些模型在域内线性探测的宏F1分数接近饱和(0.98-0.997),但跨数据集时宏F1下降34-72%,且模型排名发生显著重排:域内表现最佳的DinoBloom-L在最具迁移挑战的目标域上跌至第10位。研究还发现,基于源域拟合的线性探针在域外校准严重失效(ECE从0.004恶化至0.35),而温度缩放迁移效果不佳。此外,作者识别出基准测试中存在的预训练数据暴露问题,并指出无标签自适应方法在真实类别先验偏移下失效。他们提出的免训练类平衡重标准化方法能改善多数目标场景的平均性能,但仍有残余误差。研究强调,血液学基础模型基准测试必须同时评估准确性、校准、数据暴露和类别先验鲁棒性。
| 基础模型(Foundation Model, FM) | 在大规模数据上预训练的深度学习模型,可适应多种下游任务。 |
| 采集偏移(Acquisition Shift) | 由于扫描仪、站点、染色或制备流程不同导致的数据分布变化。 |
| 线性探针(Linear Probe) | 在冻结特征上训练线性分类器以评估表示质量的方法。 |
| 期望校准误差(Expected Calibration Error, ECE) | 衡量模型预测置信度与实际正确率之间一致性的指标。 |
| 类平衡重标准化(Class-Balanced Re-standardization, CBR) | 一种无需训练的伪标签平衡特征归一化方法,用于改善目标域性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅