Qwen Image 2.1 开源,文生图和图像编辑并进一个模型

Qwen Image 2.1 在 2026 年 9 月 20 日开源,属于 Qwen 系列。它是一个 7B 视觉生成组件的模型,把文生图、图像编辑和透明图层生成统一到一份权重里,发布当天就进入了主流推理框架。要做本地出图、批量素材和编辑工作流的团队可以直接评估它,不需要为生成和编辑分别部署两个模型。

这个模型统一了哪些能力

一份权重覆盖三类任务。文生图按提示词直接出图,图像编辑支持最多 10 张参考图输入,透明图生成直接输出带 Alpha 通道的 RGBA 图。编辑时可以用圈选、涂抹标注或独立蒙版指定局部修改范围,官方强调能在多次修改中保持人物和商品的身份一致。对电商素材、角色设定这类需要反复改同一批主体的场景,身份保持比单次画质更关键。

架构上做了什么取舍

视觉生成组件有 7B 参数,由 32 个 Single-Stream DiT 层组成。官方明说的目标是质量、推理效率和多功能三者的平衡,手段是混合粒度注意力加前缀 KV 缓存复用,用较低的算力换到可用画质。示例中文生图和编辑都默认 40 步推理,想再压成本可以调步数或换量化方案,但出图质感会跟着变。

透明图和参考图编辑解决什么问题

传统流程里做透明素材要先出图再抠图,RGBA 原生生成把这一步省掉了。推荐写法是在提示词里明确声明要一张带透明背景的 RGBA 图,放在描述主体内容的前后都可以。编辑侧,多参考图加局部标注让换背景、改局部、统一人物长相这类操作可以一次给足上下文,减少反复试提示词的次数。

主流框架的部署路径怎么选

发布当天的生态支持已经很完整,按团队习惯选即可。

  • Diffusers 提供 QwenImage21Pipeline,适合研究和脚本化批处理。
  • ComfyUI 原生支持,官方给了文生图和图像编辑两套示例工作流,适合可视化搭流程。
  • vLLM-Omni 支持前缀 KV 缓存、CUDA Graph 解码、FP8 量化和 TP/Ulysses 并行,适合高吞吐服务。
  • SGLang 提供前缀缓存、Cache-DiT、CUDA 图、多种并行和组件卸载,卸载对显存紧张的机器有意义。
  • LightX2V 提供独立加速方案,可作为备选压测。

运行依赖 torch 2.4.0 以上、transformers 5.17 以上,加上 diffusers、accelerate 和 pillow。权重在 HuggingFace 和 ModelScope 都能拿到,两个平台都有在线演示空间可以先试效果再上卡。

什么场景下它不合适

显存需求取决于量化方案和并行设置,官方没有给出具体数字,需要按自己的卡实测,消费级显卡建议先从 FP8 量化加组件卸载试起。需要严格照片级写实且已有成熟商业管线的大图团队,迁移成本要算进评估。只做简单文生图、不需要编辑和透明图的轻量场景,小模型可能更省。涉及人脸商用和商品素材商用时,生成内容的授权与合规边界仍要自己把关,模型能力不改变这一点。

常见问题

问,生成透明图提示词怎么写。答,在描述主体前后明确声明输出带透明背景的 RGBA 图,比事后抠图稳定。

问,10 张参考图是一次都用上吗。答,按编辑任务需要选,参考图越多上下文越足,推理开销也越高,建议从少量开始逐步加。

问,本地跑不动怎么办。答,先试 SGLang 的组件卸载和 FP8 量化,再考虑更高并行,仍不够就退回 Diffusers 调低步数。