🔥 今日值得一读 重复采样评估的pass@k外推被证明在k>n时根本不可识别,1万次rollout下k=1000的失败率模糊因子最高超2600倍!
What Fixed-Rollout pass@k Evaluations Can Identify
arXiv ML (stat.ML) 🔥 重点 #评测方法#pass@k#统计推断 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
提醒开发者:pass@k外推超过采样数n时结果不可信,评测设计需谨慎。

📖 AI 总结

该研究探讨了固定采样次数下pass@k评估的可识别性问题。作者证明,在池化随机任务的条件下,固定n次采样成功计数仅能识别潜在每任务成功分布的前n个自由矩,因此当k不超过n时pass@k可直接识别,但当k大于n时,外推的pass@k、尾部指数与尾部常数均不可识别,即使任务数量任意增加也无法改善。研究给出了保持计数律不变的精确构造及唯一扩展的例外情形,并通过Hausdorff主表示计算了尖锐的总体可识别区间。在公开的每问题10000次采样数据集上,反事实n=16的评估使k=1000处的失败率在四种配置下存在1.5至2600倍以上的模糊性。该结果并不否定参数化推理扩展律,而是为其假设检验提供了非参数基线,并提出了区分直接估计、可识别集与模型条件预测的报告标准。

🔑 关键词速览

pass@k一种评估指标,衡量模型在 k 次尝试中至少成功一次的概率。
条件二项式模型一种统计模型,假设在给定任务成功概率下,成功次数服从二项分布。
可识别性统计模型中参数能否从观测数据中唯一确定的性质。
Hausdorff 主表示一种用于计算矩问题中可识别区间的方法,基于 Hausdorff 矩问题的极值表示。
推理时间缩放定律描述模型性能如何随推理时计算量(如采样次数)增加而变化的规律。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅