探见世界

模型

阿里通义千问发布Qwen-Image-2.1-Turbo:开源8步去噪模型,统一图像生成与编辑

2026年10月9日,阿里巴巴通义千问团队发布图像生成与编辑模型 Qwen-Image-2.1-Turbo。该模型采用70亿参数架构,官方宣称仅需8步去噪即可完成生成与编辑。模型权重已面向研究用途公开,阿里云百炼平台亦同步上线了API推理服务。

管理员上传的文章候选图片
编辑视觉管理员上传的文章候选图片。图片来源:管理员上传

响应社区诉求推出8步加速检查点

2026年10月9日,阿里巴巴通义千问(Qwen)团队正式发布了图像生成与编辑模型 Qwen-Image-2.1-Turbo。该模型是 Qwen-Image-2.1 的加速检查点(accelerated checkpoint),其模型权重已在 Hugging Face 和 ModelScope 平台公开。

基础模型 Qwen-Image-2.1 于 2026年9月20日发布,其视觉生成组件包含 32 层 Single-Stream DiT 层。基础版发布后,社区曾有用户在 Hugging Face 提出请求,希望官方提供需要更少步数的加速版本,此次发布直接回应了该需求。官方在 X 平台及模型主页宣布,该 Turbo 模型仅需 8 步去噪即可完成图像的生成与编辑。

统一架构设计与多模态编辑能力

Qwen-Image-2.1-Turbo 沿用了与基础版相同的 70亿(7B)参数视觉生成架构,将文本到图像生成与图像编辑功能统一在单一模型中。官方技术文档说明,模型默认使用 CFG=1 进行生成,并在去噪步骤中复用文本和参考图像上下文的 prefix KV 缓存,以提升整体推理效率。

在具体功能维度,官方公布的核心能力包括:支持最高 2K 分辨率图像生成、自然语言连续编辑,以及原生支持透明背景(RGBA)图像的生成与编辑。在编辑任务中,模型支持最多 10 张参考图像输入,允许通过画圈、涂抹注释或独立蒙版进行局部控制,并能够在编辑过程中保持人物和产品的特征一致性。

生态接入支持与商用许可边界

在部署与生态集成方面,开发者可以通过 Diffusers 库直接加载 QwenImage21Pipeline 使用该模型;发布的检查点已内置推荐采样调度器,Diffusers 会自动加载,无需手动配置。与此同时,社区已迅速跟进生态支持,ComfyUI 社区提供了重新打包的权重支持该 8 步模型,Hugging Face Spaces 上也上线了基于 Gradio 的工作流演示。

需要注意的是,Qwen-Image-2.1-Turbo 的开源权重采用严格的非商业许可(Qwen Research License Agreement),媒体与独立分析指出免费下载的模型权重仅限研究与评估,商用需单独解决授权问题。除开源权重外,阿里云百炼平台已同步上线 Qwen-Image-2.1 的 Pro 和 Turbo API 推理服务,官方公布的 qwen-image-2.1-turbo 图像生成原价为:国际/全球节点(如美国弗吉尼亚、德国法兰克福、日本东京等)每张 0.014133 美元,新加坡节点每张 0.016 美元。

信息来源(1)

这篇文章对你有帮助吗?