DramaAgent 是一套面向长篇故事视频生成的层次化智能体框架,旨在解决现有扩散与自回归模型在长序列生成中普遍存在的叙事漂移、角色身份不稳定、跨场景连续性薄弱以及音画不同步等问题。该框架不改进底层视频生成模型,而是在其上构建控制层,将生成过程拆解为故事规划、持久化角色条件、逐场景合成与反思引导的定向修复四个阶段,并在场景间维护可复用的故事与角色状态,从而能够诊断身份漂移、场景语义缺失、时间不连续和跨模态不匹配等失败情形,并针对具体环节修复问题片段。在多种视频生成骨干模型上的实验表明,DramaAgent 在长时程连贯性、角色一致性、叙事保真度和场景级音画一致性上均优于直接生成与已有强基线,说明层次化智能体控制是实现可控长篇视听生成的一条可行路径。
| DramaAgent | 本文提出的分层智能体框架,用于长篇故事视频和音频的生成与控制。 |
| 叙事漂移 (Narrative Drift) | 在长视频生成中,故事内容逐渐偏离原始叙事意图的现象。 |
| 角色身份一致性 (Character Identity Consistency) | 在多个场景中保持同一角色外观和身份特征稳定的能力。 |
| 跨模态不匹配 (Cross-Modal Mismatch) | 生成的视频画面与对应音频之间在语义或时间上不一致的问题。 |
| 反思引导修复 (Reflection-Guided Repair) | 通过诊断生成失败原因,针对性地修复有问题的视频片段的机制。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅