该研究提出了一种审计临床预测模型性能瓶颈的新框架,将预测饱和的原因区分为“学习者差距”(模型未能提取可用信息)和“测量通道上限”(变量本身的信息限制)。通过总变差分离刻画最优平衡准确率,研究建立了架构不变性、部分识别结果及交叉拟合上限估计量,并开发了两种有限样本诊断工具。在UCI再入院、BRFSS糖尿病和NHANES HbA1c三个真实队列上的验证显示,调优的梯度提升模型几乎达到估计的前沿,而缺陷模型仍存在较大差距;NHANES数据表明客观测量模态并非必然优于问卷,二者存在互补增益。对104项临床任务的系统综述进一步证实,跨18个疾病类别存在共同规律:结构化临床区域广泛但非普遍,同通道增益递减,跨通道变化可提升性能。该框架将饱和从经验观察转化为可审计决策,指导应改进模型还是测量手段。
| learner gap | 学习器差距,指拟合的学习器未能提取可用信息而导致的性能损失。 |
| measurement-channel ceiling | 测量通道上限,指记录变量所施加的总体预测性能边界。 |
| total-variation separation | 全变差分离,一种度量概率分布差异的方法,用于刻画最优平衡准确率。 |
| cross-fitted ceiling estimator | 交叉拟合上限估计器,一种通过交叉验证估计性能上限的统计方法。 |
| Bayes decision-flip rate | 贝叶斯决策翻转率,指预测模型改变个体决策标签的比例。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅