本文把机器学习模型发布前的测试套件视为一个设计问题:与其要求所有测试全部通过,不如选择模型必须通过的测试数量,使其在满足既定可靠性目标的同时,尽可能保留更多本可服务用户的合格模型。作者提出一个两类潜因子模型,将误拒好模型与放行差模型两种代价显式化,并把计算化简为一维积分。核心发现是:当两类共享同一潜相关时,门控越严格可靠性越高,因此最优门控是仍能满足目标的最宽松方案;测试之间的相关性决定了代价——在通过全部测试的门控下,任何非完美的可靠性目标理论上都可达到,但随着测试套件扩大,被保留的好模型比例趋于零。例如99%的目标在测试相互独立时只需8个测试,潜相关为0.3时需74个,为0.5时则需5182个,此时保留的好模型不足十分之一。作者还基于精确二项界给出验证流程,可在门控从固定候选集中选出的情况下,用带标签数据对门控进行认证。
| 发布门控 | 模型发布前必须通过的测试集合,决定模型是否被放行。 |
| 潜在因子模型 | 一种统计模型,用未观测的潜在变量解释测试结果之间的相关性。 |
| 潜在相关性 | 测试之间共享的潜在因子导致的相关程度,影响门控的严格性。 |
| 可靠性目标 | 被放行模型需要达到的期望可靠性水平,例如99%的通过率。 |
| 精确二项式边界 | 基于二项分布计算的置信区间,用于从有限数据中验证门控的可靠性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅