该研究提出了一种名为RiskBlend的多信号测试输入优先级排序框架,用于解决机器学习分类器在重新训练后出现的回归故障检测问题。当模型更新后,原本正确分类的输入可能被错误分类,而验证这些预测结果往往需要昂贵的人工标注或专家审查。现有方法主要依赖单一模型的置信度分数,未能充分利用模型版本间的预测变化、决策边界移动和局部邻域变化等信息。RiskBlend框架整合了四种互补的风险信号:历史失败模式、预测偏移、决策边界偏移和邻域变化,并通过验证集学习的APFD平方加权进行组合。研究在4个数据集、5种分类器、4种回归更新场景和15个随机种子下进行了1200组实验配置,结果显示RiskBlend在全部80种数据集-分类器-场景组合中均取得最高平均APFD,相比最强基线最高提升0.32。该研究表明,跨版本行为信号为机器学习系统的回归故障优先级排序提供了重要的互补信息。
| Test Input Prioritization | 测试输入优先级排序,一种通过排序测试输入以在有限预算内最大化发现回归故障的技术。 |
| Regression Faults | 回归故障,指模型更新后,先前正确分类的输入被错误分类的情况。 |
| APFD | 平均故障检测百分比,用于评估优先级排序方法有效性的指标,APFD平方是其加权变体。 |
| RiskBlend | 本文提出的多信号优先级排序框架,结合四种风险信号以提升回归测试效率。 |
| Decision-Boundary Shift | 决策边界偏移,指模型版本更新后分类边界的变化,用于识别可能受影响的输入。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅