9月20日,阿里巴巴千问团队宣布,正式开源旗下图像生成模型Qwen-Image-2.1。凭借自研高性能通用 GPU 与 MXMACA 软件栈一体化协同的产品优势,沐曦股份率先完成对Qwen-Image-2.1模型的 Day 0 适配,实现“上线即适配”。
自2025年12月以来,沐曦股份已完成39个主流旗舰模型的Day 0适配。范围涵盖智谱、阿里千问、MiniMax、DeepSeek、阶跃星辰、腾讯混元等头部模型厂商,适配速度、数量、生态广度均位居行业前列。
此次成功完成模型的Day 0适配,充分验证了沐曦股份软硬件一体协同的产品优势。未来,沐曦股份将长期致力推动国产算力从“可用”走向“好用”“易用”,持续深化与国内顶尖AI团队的技术协同,构建自主可控、创新繁荣的国产 AI 生态。
关于模型

Qwen-Image-2.1目前是千问当前最平衡、性价比最高开源生图模型。模型主打四个维度的性能提升:1)小模强效,极致价比;2)原生透明,创改一体;3)全能编辑,多局保全;4)真实质感,字雅人美。
小模强效,极致价比
模型结构上,Qwen-lmage-2.1轻量简洁,视觉生成部分参数量仅7B,包括32层Single-Stream Dit,参数小于大部分开源模型。生图效果上,Qwen-lmage-2.1超过大部分闭源模型,显著超过其他所有开源模型。

Qwen-Image-Bench公开评测对比
推理速度上,Qwen-lmage-2.1进行了大幅推理加速优化,这一优势在多图输入上更为明显。在2K分辨率生图任务上,编辑输入由1张增至3张,2.1-Pro 耗时增加9.3%,3.0-Pro增加234.8%。

Qwen-Image-2.1推理速度对比
这一推理优化来源于Qwen-Image-2.1的算法采用混合粒度注意力结构,对文本和图像采用了差异化的处理策略:文本部分(系统前缀、编辑指令)遵循传统的Token级因果掩码,逐词进行严格的序列计算以保证语义逻辑理解的连贯性;而图像生成部分则采用Chunk级掩码,并通过KV Cache复用机制将“输入图像”与“编辑指令”作为静态上下文在首步预计算并缓存,以提升推理效率并降低显存开销。

Qwen-Image-2.1混合粒度注意力结构
原生透明,创改一体
Qwen-lmage-2.1模型的一项重要功能更新在于新增了透明图的生成,模型依靠prompt描述自动决定输出图片是普通图片还是透明图片,并支持对透明图的编辑。


全能编辑,多局保全
Qwen-lmage-2.1在编辑任务上相比前作进行了大幅度效果提升,能够做到:多图编辑、局部编辑、编辑保真与多类编辑。
多图编辑:多可支持10张图片编辑。

局部编辑:Qwen-Image-2.1支持多种局部编辑条件。例如,下方展示了“圈选”的例子,要求模型“去掉蓝色圈的金属手表,把红色圈的头发颜色改为黑色,把绿色圈替换为灰色短袖亚麻睡衣”,同时进行三个指定区域的删改。

编辑保真:Qwen-Image-2.1模型在图像编辑的保真方面,重点强化了两类场景:第一,人像保真。第二,商品保真。编辑后尽可能保持人脸、商品文字与纹理、形态的一致性。
真实质感,字雅人美
Qwen-Image-2.1模型在质感上相比前作也有了提升,更多体现在文字和人物的美学上。例如在人物表现上,模型对光影、细节进行了增强。



多类编辑:同时支持全景图、信息图、分镜图等多类图片编辑任务。


VIP复盘网