阿里巴巴Qwen团队发布了Qwen-Image-2.1-Turbo,这是其开源权重模型Qwen-Image-2.1的加速版本。该模型在保持7B视觉生成架构不变的前提下,将去噪步数从基础版的40步压缩至8步,实现5倍加速,同时保留2K分辨率图像生成与编辑能力。模型搭配Qwen3-VL 8B文本编码器,采用单流DiT架构与块因果注意力机制,通过前缀KV缓存复用文本和参考图像上下文,并支持原生透明通道。基础版Qwen-Image-2.1在Qwen-Image-Bench上得分60.28,为Qwen报告的开源权重最高分。该模型可通过Diffusers加载,支持CUDA GPU的BF16推理,并提供托管API。需注意其仅限研究许可,商业自托管需另行授权。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅