该研究考察了一种推理时干预机制——PRM剪枝片段嫁接(PPFG),其设计思路是:当过程奖励模型(PRM)剪除某条思维链时,将其高PRM前缀提取并原样嫁接为上下文示例,注入仍在解码的兄弟链中,以实现跨轨迹的步骤级迁移。作者在Qwen2.5-7B-Instruct配合Math-Shepherd、完整MATH500数据集(n=500,三个随机种子)上测试该机制,发现无论采用停滞目标还是随机目标变体,其结果在所有测量维度上均与独立的并行思维链基线在统计上无法区分。对322次停滞规则注入事件的四类分析显示,仅14%真正针对陷入困境的链,其余均落在已成功、接近完成或处于PRM平台期的链上,这类状态无法被救援式嫁接改变。该惰性结论在三个基础模型、六个基准、第二个PRM及兼容性门控扫描中均得到复现,并通过双单侧检验在全部十二个Qwen/LLaMA测试单元上将"无差异"提升为正向等价。事后分析表明,选择PPFG相对于独立基线的每题收益上限仅为+0.13个百分点。研究贡献了一套用于确立推理时机制零效应的等价性检验模板,所有结论均限定于所测试的操作点。
| PRM-Pruned Fragment Grafting (PPFG) | 一种推理时干预方法,将过程奖励模型修剪掉的高分前缀片段移植到其他正在解码的思维链中作为演示。 |
| Process Reward Model (PRM) | 过程奖励模型,用于评估推理步骤正确性的模型,常被用于指导思维链的修剪或选择。 |
| Parallel Chain-of-Thought (Parallel CoT) | 并行思维链,同时生成多条推理路径以探索不同解决方案的推理方法。 |
| Diversity Collapse | 多样性崩溃,指并行生成的思维链逐渐趋同,失去多样性的现象。 |
| Two-One-Sided-Tests (TOST) | 双单侧检验,一种统计方法,用于检验两个条件是否等价而非仅仅无差异。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅