本文针对从自然语言指令生成 SVG 代码这一开放任务展开研究。由于该任务缺乏绝对的视觉真值,传统基于自然图像的标量指标(如 CLIP、Aesthetic)难以迁移到风格化矢量内容,用作强化学习奖励时还容易引发奖励劫持。作者首先通过实验证明,采用多维度评分标准提示视觉语言评判模型,其评分与人类判断的相关性显著优于标量指标。在此基础上提出 RULER 方法,将每条指令转化为涵盖语义、视觉和风格三个维度的六项实例化评分标准,由评判模型对渲染结果逐项打分,加权后的满意度构成细粒度奖励,并通过组相对策略优化进行训练。该方法仅依赖文本,无需配对 SVG 真值或人工偏好标注。在 MMSVG-Illustration 和 MMSVG-Icon 数据集上,评分分别从 0.432 和 0.395 提升至 0.693 和 0.683,超过专用 SVG 模型并媲美规模更大的 DeepSeek-V3,消融实验表明评分标准设计是开放 SVG 生成强化学习的关键因素。
| RULER | 本文提出的方法,将每条指令转化为实例感知的评分量规,用视觉语言模型逐项打分作为强化学习的细粒度奖励。 |
| Rubric | 评分量规,一种由多个维度(如语义、视觉、风格)组成的结构化评分标准,用于替代单一标量指标进行细粒度评估。 |
| SVG | 可缩放矢量图形,一种基于 XML 的矢量图像格式,可由代码生成且缩放不失真。 |
| GRPO | 组相对策略优化,一种强化学习算法,通过比较同一提示下多个候选输出的相对优劣来优化策略。 |
| Reward Hacking | 奖励黑客,指模型利用奖励函数的缺陷获取高分,而非真正提升任务质量的现象。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅