据MarkTechPost报道,阿里巴巴Qwen团队于10月9日发布Qwen-Image-2.1-Turbo,这是其开放权重模型Qwen-Image-2.1的加速检查点。它在保持同一7B视觉生成架构的前提下,把去噪步数从基础模型默认的40步压缩到8步,同时提供托管API选项。

该模型由7B参数的视觉生成器与Qwen3-VL 8B文本编码器组成,可通过Diffusers中的QwenImage21Pipeline直接加载。使用需要从源码安装Diffusers,并要求transformers 5.17.0及以上版本;检查点依赖Diffusers PR #14950,该改动加入管道可配置的采样sigma。检查点内置推荐的8步采样计划,生成默认使用CFG=1,前缀KV缓存让文本与参考图上下文在去噪步骤之间复用。

底层架构为单流DiT,共32层、7B参数,采用块级因果注意力,文本token使用token级因果掩码,图像使用块级双向掩码。文本编码器Qwen3-VL 8B同时编码指令与条件图像;VAE为64通道RGBA自编码器,具备16倍空间压缩并支持原生透明;调度器采用Flow Matching,配合欧拉离散调度与动态偏移。Qwen方面称,正是这一注意力设计使前缀缓存得以生效:输入图像与文本在第一步计算一次,后续每一步复用该缓存,8步下缓存前缀覆盖了大部分条件计算开销。

输出与编辑功能集与Qwen-Image-2.1一致,为原生2K(2048×2048)生成与编辑。基础模型最多支持10张参考图像,并可通过圆圈、涂画标注或蒙版进行局部编辑。模型卡展示覆盖8类场景,包括人像、人体姿态、透明图像、字体排版与海报、UI布局等;编辑示例包括单图变换、多参考合成和4图室内合成。支持的预设尺寸从2048×2048方形到2752×1536的16:9比例。Qwen同时提示,单独设置num_inference_steps并不会覆盖已保存的采样计划,只有显式传入sigmas参数才能覆盖,且其他调度方案尚未测试。

阿里云百炼平台现已同时托管Turbo与Pro两个版本。qwen-image-2.1-turbo在多数地区每张图像收费0.1元,请求速率上限为每分钟120次;qwen-image-2.1-pro每张0.25元,上限为每分钟20次。Turbo单价约为Pro的四成,请求速率是后者的6倍。

硬件方面,Qwen未公布Turbo的显存最低要求;Unsloth估算基础模型在GGUF下约需11GB显存,INT8或FP8下约需24GB。许可方面,Turbo沿用Qwen研究许可,商用自托管需另行获得授权。基准测试上,目前尚无Turbo专属成绩,基础模型Qwen-Image-2.1在Qwen-Image-Bench上得分60.28,为Qwen公布的最佳开放权重成绩。

与其他快速图像模型相比,阿里通义MAI的Z-Image-Turbo使用6B生成器、8步采样,采用Apache 2.0许可,示例分辨率为1024×1024,不提供编辑功能;Black Forest Labs的FLUX.2 klein 9B使用9B生成器、4步采样,支持多参考编辑,采用非商业许可,运行约需29GB显存及RTX 4090以上显卡。