该研究探讨了固定采样次数下pass@k评估的可识别性问题。作者证明,在池化随机任务的条件下,固定n次采样成功计数仅能识别潜在每任务成功分布的前n个自由矩,因此当k不超过n时pass@k可直接识别,但当k大于n时,外推的pass@k、尾部指数与尾部常数均不可识别,即使任务数量任意增加也无法改善。研究给出了保持计数律不变的精确构造及唯一扩展的例外情形,并通过Hausdorff主表示计算了尖锐的总体可识别区间。在公开的每问题10000次采样数据集上,反事实n=16的评估使k=1000处的失败率在四种配置下存在1.5至2600倍以上的模糊性。该结果并不否定参数化推理扩展律,而是为其假设检验提供了非参数基线,并提出了区分直接估计、可识别集与模型条件预测的报告标准。
| pass@k | 一种评估指标,衡量模型在 k 次尝试中至少成功一次的概率。 |
| 条件二项式模型 | 一种统计模型,假设在给定任务成功概率下,成功次数服从二项分布。 |
| 可识别性 | 统计模型中参数能否从观测数据中唯一确定的性质。 |
| Hausdorff 主表示 | 一种用于计算矩问题中可识别区间的方法,基于 Hausdorff 矩问题的极值表示。 |
| 推理时间缩放定律 | 描述模型性能如何随推理时计算量(如采样次数)增加而变化的规律。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅