VICO 是一套面向视觉语言模型推理能力的协同进化训练框架,旨在解决当前基于可验证奖励的强化学习(RLVR)依赖静态训练环境所导致的信号衰减问题。研究指出,随着模型能力提升,固定任务会逐渐变得过于简单或始终无法解决,使学习信号失效。为此,VICO 让执行模型与一个“环境改写器”(EnvRewriter)联合训练:后者通过编辑场景图、图表表格或受保护区域掩码等图像侧结构并重新渲染,生成标签有效、难度与模型当前能力相匹配的新样本,其难度由基于通过率的奖励进行校准,整个过程无需额外人工标注。在九个涵盖数学推理与视觉基础理解的多模态基准上,VICO-8B 在域外任务上较基座模型最高提升 5.0%,分别超过最强的自进化基线和文本编辑协同进化基线 4.3% 与 8.4%,并在使用少 16 至 160 倍标注样本的情况下达到与图表专用 RLVR 方法相当的水平。该工作将监督来源从人工标注转向图像编辑协同进化,为视觉推理训练提供了超越静态语料 RLVR 的可扩展路径。
| RLVR | 基于可验证奖励的强化学习,一种利用可自动验证的答案作为奖励信号来后训练模型的方法。 |
| VLM | 视觉语言模型,能够同时处理图像和文本输入并生成文本输出的多模态模型。 |
| EnvRewriter | 环境重写器,VICO 框架中负责编辑图像侧结构并重新渲染以生成难度适配训练样本的模块。 |
| 场景图 | 一种结构化表示图像中物体及其相互关系的图结构,常用于视觉推理任务。 |
| 协同演化 | 指智能体与环境(或任务生成器)在训练过程中相互适应、共同提升的机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅