该论文提出了一种基于采样的灵活框架,用于引导和扩展自回归大语言模型(LLM)的生成过程。作者设计了两种算法,分别基于序贯蒙特卡洛(SMC)和副本交换(RE),能够将生成过程导向基础模型分布的幂次、乘积或倾斜形式。实验表明,在无需外部监督或奖励模型的情况下,该方法在扩展生成质量方面优于Best-of-N和标准MCMC基线。论文为通过采样实现LLM的概率推断提供了系统化方案,为提升模型生成能力开辟了新路径。
| Sequential Monte Carlo (SMC) | 序贯蒙特卡洛,一种通过一系列重要性采样和重采样步骤来近似复杂概率分布的统计方法。 |
| Replica Exchange (RE) | 副本交换,一种通过在不同温度下并行运行多个副本并交换状态来加速采样收敛的马尔可夫链蒙特卡洛技术。 |
| Autoregressive factorization | 自回归分解,将联合概率分解为条件概率的乘积,是LLMs生成文本的基本方式。 |
| Best-of-N | 一种采样策略,从N个独立样本中选择最佳结果,常用于提高生成质量。 |
| MCMC | 马尔可夫链蒙特卡洛,一类通过构造马尔可夫链来从目标分布中采样的算法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅