本文提出SPLIT-RL,一种面向视觉语言推理的分阶段后训练方法。针对现有可验证奖励强化学习将视觉推理与语言推理混于单一思维链、以最终答案奖励统一分配序列级优势、无法区分能力特异性错误的局限,该方法将两类能力拆分到互不重叠的训练阶段,使组内 rollout 每次仅沿一种能力产生差异,从而隔离并优化对应能力。作者进一步提出声明级优势方法CLA-GRPO,将视觉推理阶段的 rollout 分解为原子视觉声明,基于视觉类型分组提供细粒度优势。尽管分两阶段训练,推理时仍采用单次思维链调用。在Qwen3-VL系列(2B至30B-A3B)及InternVL3.5-8B上,SPLIT-RL较GRPO平均准确率提升1.4至6.1个百分点;基于oracle的诊断评估显示,仅答案奖励的GRPO未改善感知能力,而SPLIT-RL同时提升了视觉推理与语言推理。
| SPLIT-RL | 一种分阶段后训练方法,将视觉推理和语言推理在不相交的阶段分别训练,以隔离不同能力的错误。 |
| Claim-Level Advantage (CLA-GRPO) | 一种细粒度优势估计方法,将视觉推理阶段的 rollout 分解为原子视觉声明,并在声明级别提供优势。 |
| GRPO | Group Relative Policy Optimization,一种强化学习算法,通过组内相对比较计算优势,常用于训练语言模型。 |
| Vision-Language (VL) reasoning | 视觉-语言推理,指模型同时处理图像和文本信息,进行跨模态理解和推理的任务。 |
| Chain-of-Thought (CoT) | 思维链,一种提示或训练技术,让模型逐步生成中间推理步骤,以提高复杂推理任务的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅