STARFlow2提出了一种统一多模态生成模型,旨在解决现有方法在文本-图像交错生成中的结构碎片化问题。文章指出,自回归归一化流与自回归Transformer在因果掩码、KV缓存和从左到右结构上本质相同,因此成为实现连续、单遍、纯因果多模态生成的理想范式。该模型基于Pretzel架构,通过残差跳跃连接垂直交错冻结的预训练视觉-语言模型(VLM)流与TARFlow流,共享同一因果掩码,从而保留预训练理解能力,同时实现高保真连续图像生成。结合深-浅流设计和统一FAE潜在空间,STARFlow2支持缓存友好的交错生成,文本和视觉输出直接进入KV缓存,无需重新编码。实验表明,该模型在图像生成和多模态理解基准上表现优异,验证了自回归流作为统一多模态建模基础的可行性。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅