阿里通义千问开源了 Qwen-Image-2.1,其核心思路是在生成效果、推理效率与成本之间取得平衡。该模型视觉生成部分仅 7B 参数,却将文生图、透明图生成和图像编辑整合进同一模型,并原生支持透明图像的生成与编辑。技术层面,它采用 32 层 Single-Stream DiT 架构,以较小体量实现较强效果。这一发布的意义在于,它降低了高质量视觉生成与编辑的部署门槛,同时把多种能力收敛到单一模型中,为开发者和研究者提供了更轻量、更集成的开源选择。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅