阿里巴巴Qwen团队发布开源权重图像生成与编辑模型Qwen-Image-2.1,其视觉生成组件仅70亿参数,据称在自家基准测试中超越多数闭源模型,但独立评测尚未出炉。该模型可在3090等消费级GPU上运行,原生支持透明图像(RGBA)的生成与编辑,可同时处理多达十张参考图,用于合影、虚拟试穿和室内设计等场景,并支持通过圆圈、蒙版或涂鸦标记进行局部编辑。团队称架构调整与KV缓存复用提升了推理速度。模型已在Hugging Face、GitHub和Model Scope上线,但研究许可证禁止商业使用,企业需另行申请授权。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅