该研究指出,当前学术界日益依赖大语言模型(LLM)评判分数和小样本AI评估来支撑显著性结论,但若缺乏良好校准的置信区间、假设检验和评判偏差校正,这些结论并不可靠。作者发现,直接对原始LLM评判分数做统计会导致假阳性率膨胀,且在多种评分者一致性指标中,假阳性风险反而在“近乎完美”的人机一致性处达到峰值。为此,研究提出面向人机混合评判设计的统计分析与工具,基于预测驱动推断(PPI)实现九种假设检验,包括首次针对四种秩检验的PPI校正,并引入自助自适应功效调优以提升小样本校准下的稳定性。通过蒙特卡洛模拟,作者给出样本量小于100时置信区间、p值与族错误率校正方法的选择建议,并警告慎用自助置信区间。相关方法打包为开源Python工具evalstats,可自动选择校准方法,并在示例中揭示了一个被“高度一致”评判掩盖的虚假发现。
| LLM judge | 使用大型语言模型作为自动评判者,对文本生成质量或模型输出进行评分和比较。 |
| Prediction-Powered Inference (PPI) | 一种利用机器学习预测结果辅助小规模人工标注数据进行统计推断的方法,能提高估计效率和检验功效。 |
| Bootstrap-Adaptive Power Tuning | 一种针对小样本校准集的自助法自适应权重调整技术,通过收缩估计权重并考虑其抽样方差来稳定PPI++。 |
| False Positive Risk | 在假设检验中错误拒绝原假设(即误报)的概率,通常用假阳性率或错误发现率衡量。 |
| FWER (Family-Wise Error Rate) | 多重比较中至少出现一次假阳性的概率,常用Bonferroni或Holm等方法进行校正控制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅