该论文针对随机大语言模型评测成本高的问题,提出在固定 rollout 预算下最小化基准均值的方差。作者指出,均匀重复采样忽略了任务间 rollout 方差的显著差异,因而设计了“推测性评测”方法,采用分层贝叶斯 Neyman(HBN)策略,先进行短时均匀试点,再用分层贝叶斯模型汇总各任务成功次数,并依据任务级采样方差的后验期望进行精确的正整数 Neyman 分配;同时提出 HBN-async 以推测执行方式缓解试点同步屏障。在 6 个检查点、18 个基准组共 107 个非退化配置上,每任务 8 至 64 次 rollout 的预算下,该方法较均匀采样平均降低方差 12.8% 至 33.6%,优于事后调优的经验与独立贝叶斯基线;真实生成实验表明 HBN-async 能抵消同步开销,将统计效率转化为实际评测收益。
| Speculative Evaluation | 一种通过分层贝叶斯Neyman分配策略,在固定采样预算下最小化基准均值方差的评估方法。 |
| Hierarchical Bayesian Neyman (HBN) | 结合分层贝叶斯模型与Neyman最优分配的策略,用于估计任务级方差并分配采样资源。 |
| Neyman allocation | 一种最优分配采样资源的方法,根据各层方差大小按比例分配样本量以最小化总体方差。 |
| rollout budget | 评估过程中允许对每个任务进行随机采样的总次数限制。 |
| pilot synchronization barrier | 在评估中,由于需要等待试点阶段完成才能进行后续分配而导致的并行计算延迟。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅