本文提出一套分阶段、可问责的传感器AI评估协议,将部署模型的评估视为带有明确参考基准和量化不确定性的测量过程。协议设置四个累积泛化阶段,分别留出设备、受试者和时间,并以重复训练的分位数而非均值作为判定依据,同时引入“超出当前范围率”以揭示模型对已消失类别的隐性误判。作者以智能手机地磁定位在真实矿井中验证该协议,模型在训练34个月后、面对未知设备代际和留出测量员时,其当前条件精确率的5%分位数为0.39,是随机水平的16.5倍,但不同位置类别间波动达±0.08,超过重复运行间的差异。研究还表明,均值评估会严重误导:某双峰配置可通过均值检验,其5%分位数却低于随机水平一个数量级。该工作为分布偏移下的AI部署决策提供了更稳健、可追溯的评估范式。
| 分布偏移 | 指训练数据和部署数据分布不一致的现象,如设备、人员或时间变化导致的性能下降。 |
| 分阶段评估协议 | 一种逐步留出设备、受试者和时间等变量的评估方法,以量化模型泛化能力。 |
| 分位数 | 统计学中用于描述数据分布位置的指标,如5%分位数表示有5%的数据低于该值。 |
| 地磁定位 | 利用地球磁场特征进行位置估计的技术,常用于无基础设施的室内或地下环境。 |
| 循环分类器 | 一种处理序列数据的神经网络模型,如RNN,适用于时间序列传感器数据分类。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅