Nunchux AI 发布了 VC-Attention,一种无需训练的低比特注意力内核,专为视频扩散 Transformer(DiT)设计,同时解决值量化误差与 softmax 阶段过慢两大瓶颈。视频 DiT 将片段展平为时空 token 序列并逐层执行全自注意力,5 秒 720p 的 Wan2.2-14B 片段约含 7 万 token,在 RTX 5090 上注意力占用超过 64% 的生成时间。此前方法如 SageAttention2 对查询和键做平滑后,值项仍占 Wan2.2 输出误差的 82%,且 softmax 仍以 FP32 运行,成为 B200 与 H200 上最长的流水线阶段。VC-Attention 通过 V-Smooth 方案,先以在线 k-means 对值 token 分组并同步置换键值,再对每个 128 token 硬件块去均值、仅量化残差,最后利用在线 softmax 已有的行和恢复均值,无需二次遍历或额外缓冲。该方法在去噪前 25% 步骤执行分组,置换结果在相邻 4 步间复用,为视频生成加速提供了免训练的新路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅