本文研究链式思维(CoT)验证器在现实校准预算(数十至数百个标注问题)下的分布无关选择性保证问题,基于七个开源模型、五种验证信号和37000条已评分推理轨迹展开实验。核心发现是"弃权有效性":一个以概率P_fire发放证书的(α,δ)-有效程序,其失败概率仅被δ/P_fire约束,因此极少触发的证书可能名义有效却每次使用都出错——模拟中标准证书在至多0.3%的校准抽样中失败,但在其实际触发的抽样中失败率高达69%。作者提出认证下限与格条件来解释弃权现象,并给出一种无需单调性假设的下限启动固定序列证书,在每一模型-信号组合上覆盖范围均超过Bonferroni证书,将非平凡目标0.75π₀下的覆盖率从0.05提升至0.16。研究还揭示证书无法预见部署后的变化:基准偏移下被接受轨迹的错误率跟随新任务的基础错误率,而在针对验证器的最优n选策略下,错误率超过目标值,但经验失败频率仍低于δ,因为弃权吸收了失败。该工作为CoT验证器的可靠性认证提供了理论框架与实证依据。
| 思维链 (Chain-of-Thought, CoT) | 一种提示大语言模型逐步推理并输出中间步骤的方法,以提高复杂任务的准确性。 |
| 无分布保证 (Distribution-Free Guarantees) | 不依赖于数据分布假设的统计保证,通常基于有限样本的集中不等式或保形预测。 |
| 弃权有效性 (Validity by Abstention) | 一种通过允许算法在不确定时弃权(不颁发证书)来保证所颁发证书错误率受控的机制。 |
| 保形选择 (Conformal Selection) | 将保形预测框架扩展到多重选择问题,控制错误发现率或家族错误率的方法。 |
| Benjamini-Hochberg 过程 | 一种控制错误发现率(FDR)的多重假设检验方法,常用于大规模同时检验。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅