视频扩散训练中仅4%注意力头专司跨帧协调,均值掩盖稀疏真相!
Temporal-Attention Head Specialization During Video Diffusion Training
arXiv CV (cs.CV) 重要 #视频扩散#注意力机制#训练动态#可解释性 🕐 今天 12:00

📖 AI 总结

该研究对视频扩散Transformer中时间注意力机制的形成过程进行了系统考察。以往相关认知多来自对已训练模型的分析,训练过程中时间注意力结构何时、何处形成尚不清楚,且群体平均会掩盖少数特化注意力头的信号。为此,作者对九个Open-Sora STDiT训练运行中的每个时间注意力头进行逐检查点普查,覆盖306M至1.03B三种模型规模,采用熵归一化的跨帧注意力集中度指标并预设变点与效应量筛选规则。结果显示,总体集中度在各次运行中持平或下降,但约4%至13%的头发展出显著集中;可复现信号体现在块级别而非具体头坐标,特化头反复出现在首个时间块,其注意力图收敛为自帧对角线和相邻帧带等少量局部帧路由模式。相关性与消融分析未能确立其与生成视频质量的因果联系。该工作还提供了一套可迁移的逐头、逐检查点分析方法。

🔑 关键词速览

时间注意力Transformer中用于跨帧协调信息的注意力机制,是视频扩散模型的核心组件。
CFAC跨帧注意力集中度,一种熵归一化的度量,用于量化注意力头对跨帧信息的聚焦程度。
STDiTOpen-Sora中使用的时空扩散Transformer,将空间和时间注意力因子化处理。
检查点分辨在训练过程中保存的多个模型检查点上进行分析,以追踪结构随时间的演变。
帧路由模式注意力头在帧间分配注意力的典型模式,如自帧对角线和相邻帧带。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅