两个任务,同一套代码

这个系列包含两个 6B 模型:Design 做文生图,产出 UI、信息图、海报这类文字密集的设计稿;Design-Layer 做拆层,把一张扁平化的设计图还原成可编辑的 RGBA 图层。两者共用一个代码仓库,权重分别发布,安装步骤完全一样。

前置条件

  • Python 环境(按仓库 requirements 安装依赖);
  • 显卡:官方验证配置是单张 80GB 显存的 CUDA 卡,精度 BF16;
  • 有 flash-attention 2 时推理更快,拆层示例里就是用它;
  • 磁盘:两个模型各约 6B 参数,权重目录要留出足够空间。

第一步:拉代码、装依赖

git clone https://github.com/inclusionAI/Ming-Image
cd Ming-Image
pip install -r requirements.txt

第二步:文生图

python infer.py \
  --model inclusionAI/Ming-Image-0.1-Design \
  --task text-to-image \
  --prompt assets/t2i_four_seasons_cabin_prompt.json \
  --resolution 2048 \
  --output-dir outputs/t2i
  • 推荐参数:分辨率 2048×2048(要快可用 1024×1024)、采样步数 12、CFG 1.0、BF16;
  • 分辨率请求会被映射到 1024 或 2048 两个档位,不是任意值;
  • 透明背景:需要在提示词最前面加上官方推荐的那句 RGBA 短语,不会自动出透明图。

第三步:把成品图拆回图层

python infer.py \
  --model inclusionAI/Ming-Image-0.1-Design-Layer \
  --task layer-decompose \
  --input-image assets/layer_samples/card_making_input.png \
  --prompt assets/layer_samples/card_making_prompt.txt \
  --attn-implementation flash_attention_2 \
  --resolution 1024 \
  --output-dir outputs/layers
  • 层数控制两种方式:给了 --prompt,就按提示词里声明的层数输出;不给提示词时用 --num-layers N 走默认请求;
  • 推荐参数:工作分辨率 1024(512 更快)、采样步数 12、CFG 2.0;
  • 输出是独立的 RGBA PNG 文件,可以直接导入设计工具继续编辑。

第四步:接进自己的工作流

  • 提示词增强(PE)可以用 Ling-3.0-flash-VL 或 qwen3.8-27B,仓库文档里有对应的改写流程;
  • 服务化部署官方推荐 vLLM-Omni,仓库里给了 recipe 与安装指引;
  • 仓库还带了两个现成的技能包(UI 设计与「图片转可编辑 PPT」),可以直接装到编码智能体里用。

踩坑清单

  • 显存不够就老老实实降分辨率:2048→1024→512,质量会退,别指望靠调其他参数补回来;
  • 用了 --attn-implementation flash_attention_2 就必须真的装上 flash-attention,环境不支持时把参数去掉,而不是等它自动回退;
  • 评估拆层效果要看图层数量与合并关系是否符合交付标准,不同图片差异很大,先拿真实项目图试;
  • 两个模型都是 MIT 许可,但商用前仍建议走一遍自己的合规流程。
把「改稿」从重画变成编辑,是这个拆层模型比文生图更值得先试的地方。