本文提出MVAgent,一种面向多镜头智能体视频生成的多智能体流水线,旨在解决角色外观、空间布局与角色状态在跨镜头间难以保持一致的问题。作者将任务重新定义为条件构建,通过类型化条件输入让多个智能体协同工作:空间定位智能体从生成的运镜片段中采样视角,为每个镜头匹配对应视图;观察者智能体记录每个镜头的结尾状态并存入连续性记忆,过渡智能体据此为下一镜头构建角色动作与空间参考;编排智能体则将这些输入组合成生成请求。由于请求效果只有在渲染后才能显现,作者采用Trunk-GDPO进行智能体强化学习,在每个镜头处比较渲染候选并延续最优分支。在生成器与评判模型冻结的条件下,MVAgent在ViMax-Bench上取得最高的跨镜头一致性与叙事规划质量,并在人工评估中优于最强的智能体基线方法。
| MVAgent | 一种多智能体视频生成流水线,通过类型化条件输入协作实现多镜头视频生成。 |
| Spatial Grounding agent | 空间定位智能体,从生成的摄像机遍历片段中采样视图,为每个镜头锚定匹配的视角。 |
| Trunk-GDPO | 一种智能体强化学习方法,在每个镜头处比较渲染候选并继续最佳者作为主干。 |
| ViMax-Bench | 用于评估多镜头视频生成中跨镜头一致性和叙事规划质量的基准测试。 |
| continuity memory | 连续性记忆,记录每个镜头的结束状态,用于构建下一镜头的角色动作和空间参考。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅