本文探讨了机器学习系统中阈值设定在数据聚类情况下的有效样本量问题。许多系统(如共形预测器、弃权门、安全过滤器)依赖校准集的特定分位数设定阈值,并假设校准样本独立,但现代流水线中样本常共享提示、文档或推理轨迹,导致相关性。作者证明,阈值所需的“超限设计效应”不同于传统调查统计中针对平均值的修正,它取决于聚类分数落在阈值同侧的概率,而非分数数值相似性,并推导出有效样本量和覆盖率分布的闭式法则。关键发现包括:现有共形文献中的修正量是错误的,可能双向偏差;数据集没有单一有效样本量,而是随阈值水平变化;这种影响在多次运行的平均覆盖率中不可见,但对单次部署者影响显著。在25,028个样本的校准集上,作者实测了约1,300个有效样本的可靠性,凸显了相关数据下阈值可靠性的严重高估问题。
| Exceedance Design Effect | 一种衡量在聚类数据下设定阈值时有效样本量减少的效应,类似于调查统计中的设计效应,但针对阈值而非平均值。 |
| Conformal Predictors | 一种机器学习方法,通过校准集的分位数提供有统计保证的预测区间或覆盖率。 |
| Effective Sample Size | 在存在相关性的数据中,样本实际相当于的独立观测数量,用于评估统计推断的可靠性。 |
| Clustering | 数据点因共享共同因素(如提示、文档或推理轨迹)而分组相关,导致样本非独立。 |
| Coverage | 模型预测区间或阈值在实际应用中包含真实值的概率或频率,通常以百分比表示。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅