阿里巴巴Qwen团队发布Qwen-Image-2.1,一款统一的文本生成图像与图像编辑模型。其视觉生成部分为7B参数,采用32层单流DiT架构,单一检查点即可覆盖文生图、多参考编辑、局部编辑及透明RGBA输出。相比2025年8月发布的20B原版Qwen-Image,新模型将生成与编辑功能合并,体积缩减至约三分之一,但需注意7B仅指扩散Transformer,管线还加载8B的Qwen3-VL编码器。模型采用混合粒度注意力机制,通过复用条件前缀的KV缓存,在多参考图场景下显著提速。该模型已获Diffusers、ComfyUI、vLLM-Omni等Day 0支持,可用于研究与评估,商业部署需另行获得许可。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅