本文提出 AgenticGen,一个面向广告视频生成的奖励引导智能体框架。作者指出,广告视频生成不仅是视频合成任务,更是以在线业务指标衡量的、以产品为条件的推理问题,而现有视频基础模型无法优化产品如何转化为有效广告,也难以利用在线业务反馈改进后续生成。为此,AgenticGen 将广告视频生成拆解为策略选择与草稿生成两个可训练推理阶段,使在线业务反馈能够直接监督优化目标。该框架同时学习基于表现的奖励(来自积累的在线反馈)和与人类质量标准对齐的评分规则奖励,并用于策略优化:先通过 DPO 使智能体策略贴近在线偏好,再用 GRPO 结合过程与结果奖励进一步精炼两个阶段。离线实验验证了奖励模型与逐步策略优化的有效性;在 TikTok 广告系统开展的在线 A/B 实验显示,经过 DPO 和 GRPO 训练后,AgenticGen 相较 SFT 基线将点击率提升 2.72%、转化率提升 2.63%、广告观看量提升 9.61%。该工作为广告视频生成建立了从在线业务反馈到生成策略的闭环优化路径,具有明确的工业应用价值。
| AgenticGen | 本文提出的奖励引导智能体框架,将广告视频生成分解为策略选择和草稿生成两个可训练推理阶段。 |
| DPO | 直接偏好优化,一种利用偏好数据直接优化策略的强化学习方法,此处用于使智能体策略对齐在线偏好。 |
| GRPO | 组相对策略优化,一种基于组内相对比较的强化学习算法,此处用于利用过程与结果奖励进一步细化策略。 |
| CTR | 点击率,衡量广告被点击比例的在线业务指标。 |
| CVR | 转化率,衡量广告点击后完成预期转化动作比例的在线业务指标。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅