据 MarkTechPost 报道,阿里巴巴通义千问团队发布 Qwen-Image-2.1,将文生图与图像编辑合并进同一套权重。其视觉生成部分为 70 亿参数、32 层单流 DiT,一个检查点即可完成文生图、多参考图编辑、局部编辑和带透明通道的 RGBA 输出。
与 2025 年 8 月发布的 Qwen-Image 相比,上一代是 20B 模型,以 Apache 2.0 协议开放,编辑功能另设 Qwen-Image-Edit 检查点。Qwen-Image-2.1 把两项任务合入一个模型,体量约为原来的三分之一,Qwen 团队称其为 Qwen-Image 系列中最为均衡、性价比最高的模型。需要注意的是,70 亿参数只覆盖扩散 Transformer 部分,推理管线还需加载 8B 的 Qwen3-VL 编码器。
按 GitHub 仓库列出的结构,模型由四部分组成:32 层、70 亿参数的单流 Transformer,采用块因果注意力;把文本指令与条件图像编码为同一表示的 Qwen3-VL 8B 文本编码器;具备 16 倍空间压缩和原生透明度的 64 通道 RGBA VAE;以及采用欧拉离散调度与动态移位的流匹配调度器。
速度来自注意力掩码的设计。文本 token 使用 token 级因果掩码,图像 token 在每张图像内使用块级双向掩码,Qwen 称之为混合粒度注意力。条件前缀位于带噪潜变量之前,不会对其做注意力计算,其键值因此在各去噪步中保持固定。模型只在第一步计算一次文本与输入图像,其余步骤复用前缀 KV 缓存,参考图越多,节省越明显。
功能上,模型支持原生透明输出,可由文本生成 RGBA 图像、编辑透明图层、从照片中抠取主体;多参考编辑最多接受 10 张参考图,仓库示例包括由 6 张人像合成合影、由 5 张参考图生成整套穿搭;局部控制可通过圈选、涂画标注或独立掩码指定区域,并保持人物与商品的身份一致性。默认输出 2048×2048,支持 7 种长宽比,最高 2752×1536。
在 Qwen 自建的 Qwen-Image-Bench 上,Qwen-Image-2.1 综合得分 60.28,高于 Nano Banana 2.0 的 59.82,也高于该榜单中所有开放权重模型;32B 的开放模型 FLUX 2 Max 为 55.33。有 6 个闭源模型得分更高,居首的 GPT Image 2.5 Sunburst 为 67.01。该榜单由 Qwen 研究团队自建,属其自评结果。
部署方面,研究评估用途可直接使用,商业部署需另行获得 Qwen 授权。首日支持覆盖 Diffusers、ComfyUI、vLLM-Omni、SGLang 和 LightX2V;运行需 PyTorch 2.4.0 及以上、transformers 5.17 及以上、源码版本 Diffusers、accelerate 与 pillow。vLLM-Omni 提供 FP8 量化、前缀 KV 缓存、CUDA Graph 解码和张量并行,SGLang 提供 Cache-DiT、CUDA 图、多 GPU 并行与组件卸载,ComfyUI 提供原生节点与转换后的权重。除 NVIDIA 外,该版本还通过 ROCm 支持 AMD Radeon GPU,并通过 FlagOS 覆盖 8 个芯片平台。Qwen 团队同时发布两个提示词改写模型,为微调过的 Qwen3.5-VL 9B 检查点,分别用于文生图和编辑,可把简短提示扩展为详细描述并选择长宽比。