提出ThinkPrior,用零回滚难度先验解决RLVR中提示选择的冷启动问题。
| RLVR | 可验证奖励强化学习,一种使用可验证奖励信号进行策略优化的强化学习范式。 |
| GRPO | 组相对策略优化,一种通过组内奖励相对比较来更新策略的强化学习算法。 |
| rollout | 展开,指在环境中执行策略生成轨迹的过程,用于收集奖励数据。 |
| zero-advantage silent groups | 零优势静默组,指组内所有展开结果相同(全对或全错)导致优势为零的样本组。 |
| Beta posterior | Beta后验,使用Beta分布作为先验,结合观测数据更新得到的后验概率分布。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅