🔥 今日值得一读 CoT验证器新突破:小校准预算下覆盖率从0.05飙到0.16!
Certified by Abstention: Distribution-Free Guarantees for Chain-of-Thought Verifiers at Small Calibration Budgets
arXiv ML (stat.ML) 🔥 重点 #推理验证#CoT#不确定性量化 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
让CoT验证器在少量标注下给出可靠阈值保证,提升推理结果可信度。

📖 AI 总结

本文研究链式思维(CoT)验证器在现实校准预算(数十至数百个标注问题)下的分布无关选择性保证问题,基于七个开源模型、五种验证信号和37000条已评分推理轨迹展开实验。核心发现是"弃权有效性":一个以概率P_fire发放证书的(α,δ)-有效程序,其失败概率仅被δ/P_fire约束,因此极少触发的证书可能名义有效却每次使用都出错——模拟中标准证书在至多0.3%的校准抽样中失败,但在其实际触发的抽样中失败率高达69%。作者提出认证下限与格条件来解释弃权现象,并给出一种无需单调性假设的下限启动固定序列证书,在每一模型-信号组合上覆盖范围均超过Bonferroni证书,将非平凡目标0.75π₀下的覆盖率从0.05提升至0.16。研究还揭示证书无法预见部署后的变化:基准偏移下被接受轨迹的错误率跟随新任务的基础错误率,而在针对验证器的最优n选策略下,错误率超过目标值,但经验失败频率仍低于δ,因为弃权吸收了失败。该工作为CoT验证器的可靠性认证提供了理论框架与实证依据。

🔑 关键词速览

思维链 (Chain-of-Thought, CoT)一种提示大语言模型逐步推理并输出中间步骤的方法,以提高复杂任务的准确性。
无分布保证 (Distribution-Free Guarantees)不依赖于数据分布假设的统计保证,通常基于有限样本的集中不等式或保形预测。
弃权有效性 (Validity by Abstention)一种通过允许算法在不确定时弃权(不颁发证书)来保证所颁发证书错误率受控的机制。
保形选择 (Conformal Selection)将保形预测框架扩展到多重选择问题,控制错误发现率或家族错误率的方法。
Benjamini-Hochberg 过程一种控制错误发现率(FDR)的多重假设检验方法,常用于大规模同时检验。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅