为什么值得本地跑这一版
Qwen-Image-2.1 与常见的「生成一个模型、编辑另一个模型」不同:同一套权重既接文生图提示词,也接编辑指令,工作流里不需要在两个模型之间切换。对本地部署来说,这一点直接省掉了显存占用与模型切换的等待。
它有三项能力值得单独拿出来说:第一是原生 2K,可以直接生成到 2048×2048,不必先出小图再放大;第二是排版,针对密集小字与复杂版式做过优化,做信息图、幻灯片、界面稿、海报和包装设计时不容易糊;第三是透明通道,VAE 带四个通道,透明背景可以生成也可以编辑,省掉事后抠图这一整道工序。
先说限制,避免白做一遍:模型的许可字段是 Qwen Research,许可证正文写明只授予非商业目的的使用、复制、分发与修改权,并明确未另行取得商业许可不得用于任何商业用途。也就是说它适合研究、评估与内部试验,产品化和收费服务都需要单独申请授权。
前置条件:把 ComfyUI 先更新到最新
Qwen-Image-2.1 用的是 ComfyUI 的核心节点,因此第一件事是把 ComfyUI 更新到最新版本。官方文档写得很直接:如果加载工作流时提示节点缺失,通常是因为没有用最新的 ComfyUI(部分核心节点要先在 Nightly 版本里才有),或者启动时有节点导入失败。稳定版会晚一个版本跟进,遇到缺节点先考虑这条,而不是急着找第三方节点包。
- 工作流模板:在 ComfyUI 的模板库(Workflow Templates)里搜索 Qwen-Image-2.1,也可以直接从官方文档下载两个模板的 JSON;
- 权重来源:官方文档给出的下载入口包含 Comfy-Org/Qwen-Image-2.1 与 GitHub 仓库 QwenLM/Qwen-Image-2.1;
- 磁盘预留:int8 扩散模型加文本编码器与 VAE,留出几十 GB 的模型目录空间比较稳。
第二步:放对模型文件
两个模板加载的是同一批文件。扩散模型默认使用 int8 量化版(占用更低),需要更高精度时可以换成 bf16 版。目录结构按下面这样放,文件名不要改。
ComfyUI/
└── models/
├── text_encoders/
│ └── qwen3vl_8b_bf16.safetensors
├── diffusion_models/
│ ├── qwen_image_2.1_int8_convrot.safetensors <- 模板默认加载,更省显存
│ └── qwen_image_2.1_bf16.safetensors <- 全精度,更吃显存
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors文本编码器是独立的 Qwen3-VL 8B,属于必须下载的一项;如果只下扩散模型,工作流会停在文本编码器节点上报找不到文件。
第三步:文生图模板与采样参数
文生图模板按你选定的宽高比与百万像素目标出图,上限是原生 2K。两个模板的采样参数是统一的:steps 25、cfg 1、euler 采样器、simple 调度器。cfg 为 1 意味着这个模型不依赖无分类器引导的放大作用,硬把它调到 7 之类的值通常不会更好。
采样:steps 25 / cfg 1 / euler / simple
分辨率:原生 2K(最高 2048×2048),按宽高比 + 百万像素目标设定
种子:文生图模板固定,图像编辑模板随机两个模板的种子策略不同是有原因的:文生图固定种子方便对比提示词改动带来的差异;编辑模板随机化,是为了避免每次都落到同一个细节解上,尤其在批量改图时更容易看出不稳定样本。做可复现实验时,记得把编辑模板的种子手动固定回来。
第四步:指令编辑、多参考图与局部修改
编辑模板的工作方式是把原图放进去,再用一句指令描述要改什么。如果需要原图里不存在的内容(例如把第二张照片里的衣服穿到第一张图的人身上),就把参考图一并上传:参考图会按槽位顺序拼进文本编码器,节点提供 image_1 到 image_16 共十六个槽位,提示词里用 <image1> 这样的索引来引用——写的是 image_1,引用时写 <image1>,这个下划线有无的差别是最常见的报错来源。
- 官方示例的输入素材挂在两个 LoadImage 节点上(示例里是节点 470 的人像图与节点 475 的衣服图),把这两张换成你自己的图即可;
- 局部编辑:只描述要改的对象或区域,其余画面保持不动,不需要额外画蒙版;
- 多图引用:<image1> 对应 image_1 槽位;节点一共提供 16 个槽位,而模型侧官方说明最多支持 10 张参考图,超出的槽位没有意义。
第五步:透明图层怎么出
透明背景不需要额外节点:VAE 带四个通道(红、绿、蓝、阿尔法),因此可以在生成阶段就产出带 alpha 的图,也可以在编辑阶段把已有图像的背景改为透明。对 UI 素材、贴纸、图标这类需要 alpha 的产出,这一步直接去掉了「生成带背景图 → 抠图 → 修边缘」的整条后处理链路。
实践中唯一要留意的是导出格式:alpha 通道需要 PNG 或 WebP 这类支持透明的容器,导出成 JPEG 会把透明区域压成实色。
常见坑与排查顺序
- 模板里找不到 Qwen-Image-2.1:ComfyUI 版本旧了,先更新(必要时用 Nightly);
- 提示节点缺失:多为核心节点尚未进入稳定版,或启动时有节点导入失败;
- 报找不到模型文件:逐个核对三处目录与文件名,尤其是文本编码器;
- 多图没生效:检查提示词里写的是 <image1> 而不是 image_1;
- 出图发灰或边缘有杂边:检查是否导出成了不支持透明的格式;
- 想把结果用于商业项目:先解决许可问题,Qwen Research 许可只覆盖非商用用途。
本地跑这一版的实际收益不在「省了调用费」,而在把透明通道与局部编辑合进同一条流程——原来属于后处理的两道工序可以删掉。