SVG生成新突破:评分量规奖励让得分从0.432飙至0.693,无需真值超越专家模型!
RULER: Instance-aware Rubric Rewards for SVG Generation
arXiv CV (cs.CV) 重要 论文方法多模态 🕐 09-23 12:00

📖 AI 总结

本文针对从自然语言指令生成 SVG 代码这一开放任务展开研究。由于该任务缺乏绝对的视觉真值,传统基于自然图像的标量指标(如 CLIP、Aesthetic)难以迁移到风格化矢量内容,用作强化学习奖励时还容易引发奖励劫持。作者首先通过实验证明,采用多维度评分标准提示视觉语言评判模型,其评分与人类判断的相关性显著优于标量指标。在此基础上提出 RULER 方法,将每条指令转化为涵盖语义、视觉和风格三个维度的六项实例化评分标准,由评判模型对渲染结果逐项打分,加权后的满意度构成细粒度奖励,并通过组相对策略优化进行训练。该方法仅依赖文本,无需配对 SVG 真值或人工偏好标注。在 MMSVG-Illustration 和 MMSVG-Icon 数据集上,评分分别从 0.432 和 0.395 提升至 0.693 和 0.683,超过专用 SVG 模型并媲美规模更大的 DeepSeek-V3,消融实验表明评分标准设计是开放 SVG 生成强化学习的关键因素。

🔑 关键词速览

RULER本文提出的方法,将每条指令转化为实例感知的评分量规,用视觉语言模型逐项打分作为强化学习的细粒度奖励。
Rubric评分量规,一种由多个维度(如语义、视觉、风格)组成的结构化评分标准,用于替代单一标量指标进行细粒度评估。
SVG可缩放矢量图形,一种基于 XML 的矢量图像格式,可由代码生成且缩放不失真。
GRPO组相对策略优化,一种强化学习算法,通过比较同一提示下多个候选输出的相对优劣来优化策略。
Reward Hacking奖励黑客,指模型利用奖励函数的缺陷获取高分,而非真正提升任务质量的现象。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅