🔥 今日值得一读 新方法CCPS让LLM推理不训练就暴涨,15个设置中13个提升覆盖率!
Chopthin-Consensus Power Sampling: A Diversity-Preserving Approach to LLM Decoding
arXiv CL (cs.CL) 🔥 重点 #推理优化#解码策略#蒙特卡洛 🕐 09-14 12:00
👨‍💼 主理人解读 · 为什么值得关注
可在推理时提升LLM推理且不丢多样性,适合无需微调的推理增强场景。

📖 AI 总结

本文提出Chopthin-Consensus Power Sampling(CCPS),一种面向大语言模型解码的多样性保持方法。现有基于序贯蒙特卡洛的推理时幂采样多采用等权重重采样,会激进剪除低权重轨迹,丢弃潜在正确推理路径并削弱搜索空间的多样性。CCPS引入Chopthin重采样器,通过限制最大与最小权重之比并保留非等权重,维持更丰富的推理路径,同时保证重采样后有效样本量下界,且不改变加权近似的条件期望。为充分利用扩充后的样本群,作者进一步设计语义多数选择机制,合并词元相同的最终轨迹、聚类语义等价答案并返回被最多独立轨迹支持的答案。在三个开源模型和五个推理基准上,Chopthin在15个设置中的13个提升了预言覆盖率;结合语义多数选择后,CCPS在14个设置中达到或超过Power-SMC基线的最终答案准确率,绝对增益最高达10.6个百分点。

🔑 关键词速览

Sequential Monte Carlo (SMC)序贯蒙特卡洛,一种通过逐步采样和重采样来近似复杂概率分布的粒子滤波方法。
Chopthin Resampler一种重采样技术,通过限制粒子权重的最大最小比值来避免权重过度集中,从而保持粒子多样性。
Effective Sample Size (ESS)有效样本量,衡量加权粒子集合中实际有效粒子数量的指标,ESS 越低表示权重越集中。
Semantic-Majority Selection语义多数选择,一种从多条推理轨迹中聚类语义等价答案并选择支持轨迹最多的答案的机制。
Oracle Coverage预言机覆盖率,衡量采样得到的轨迹集合中是否包含正确答案的指标,反映搜索空间的探索能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅