该论文针对AI生成学术图表难以达到人类设计水准的问题,提出名为ViCo的视觉导向编码训练框架。作者指出,现有具备自反思能力的编码智能体视觉推理薄弱、反思遵循度低,导致奖励信号稀疏,严重制约强化学习效果。ViCo通过自监督预热阶段,将蒙特卡洛树搜索与一致性剪枝结合,合成高质量反思轨迹;随后设计多步强化学习算法,利用反事实基线估计反思与动作步骤的优势值,缓解奖励稀疏问题;并提出基于分层异构布局图结构的自动多维评估框架,从风格、布局和语义一致性三方面高效评估图表。实验表明,基于80亿参数模型训练的ViCo在三个公开基准上接近具备充分反思能力的专有大型语言模型的表现,为提升AI图表复制的视觉保真度提供了新路径。
| ViCo | 本文提出的面向视觉编码的训练框架,通过迭代反思使生成的图表图像逐步与参考对齐。 |
| 自反思机制 | 智能体在生成过程中对自身输出进行反思和修正的机制,用于提升生成质量。 |
| 蒙特卡洛树搜索 | 一种用于决策过程的启发式搜索算法,本文中用于合成高质量的反思轨迹。 |
| 强化学习 | 一种通过与环境交互并根据奖励信号优化策略的机器学习方法,本文用于训练编码智能体。 |
| 分层异构图结构 | 一种用于表示图表布局的图结构,能够捕捉不同层次和类型的元素关系,用于评估图表的一致性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅