两个任务,同一套代码
这个系列包含两个 6B 模型:Design 做文生图,产出 UI、信息图、海报这类文字密集的设计稿;Design-Layer 做拆层,把一张扁平化的设计图还原成可编辑的 RGBA 图层。两者共用一个代码仓库,权重分别发布,安装步骤完全一样。
前置条件
- Python 环境(按仓库 requirements 安装依赖);
- 显卡:官方验证配置是单张 80GB 显存的 CUDA 卡,精度 BF16;
- 有 flash-attention 2 时推理更快,拆层示例里就是用它;
- 磁盘:两个模型各约 6B 参数,权重目录要留出足够空间。
第一步:拉代码、装依赖
git clone https://github.com/inclusionAI/Ming-Image
cd Ming-Image
pip install -r requirements.txt第二步:文生图
python infer.py \
--model inclusionAI/Ming-Image-0.1-Design \
--task text-to-image \
--prompt assets/t2i_four_seasons_cabin_prompt.json \
--resolution 2048 \
--output-dir outputs/t2i- 推荐参数:分辨率 2048×2048(要快可用 1024×1024)、采样步数 12、CFG 1.0、BF16;
- 分辨率请求会被映射到 1024 或 2048 两个档位,不是任意值;
- 透明背景:需要在提示词最前面加上官方推荐的那句 RGBA 短语,不会自动出透明图。
第三步:把成品图拆回图层
python infer.py \
--model inclusionAI/Ming-Image-0.1-Design-Layer \
--task layer-decompose \
--input-image assets/layer_samples/card_making_input.png \
--prompt assets/layer_samples/card_making_prompt.txt \
--attn-implementation flash_attention_2 \
--resolution 1024 \
--output-dir outputs/layers- 层数控制两种方式:给了 --prompt,就按提示词里声明的层数输出;不给提示词时用 --num-layers N 走默认请求;
- 推荐参数:工作分辨率 1024(512 更快)、采样步数 12、CFG 2.0;
- 输出是独立的 RGBA PNG 文件,可以直接导入设计工具继续编辑。
第四步:接进自己的工作流
- 提示词增强(PE)可以用 Ling-3.0-flash-VL 或 qwen3.8-27B,仓库文档里有对应的改写流程;
- 服务化部署官方推荐 vLLM-Omni,仓库里给了 recipe 与安装指引;
- 仓库还带了两个现成的技能包(UI 设计与「图片转可编辑 PPT」),可以直接装到编码智能体里用。
踩坑清单
- 显存不够就老老实实降分辨率:2048→1024→512,质量会退,别指望靠调其他参数补回来;
- 用了 --attn-implementation flash_attention_2 就必须真的装上 flash-attention,环境不支持时把参数去掉,而不是等它自动回退;
- 评估拆层效果要看图层数量与合并关系是否符合交付标准,不同图片差异很大,先拿真实项目图试;
- 两个模型都是 MIT 许可,但商用前仍建议走一遍自己的合规流程。
把「改稿」从重画变成编辑,是这个拆层模型比文生图更值得先试的地方。