同一套设计流程上的两个环节
9 月 23 日开源的 Ming-Image-0.1-Design 系列包含两个模型,都是 6B 参数:Design 负责从文字生成完整的视觉设计,Design-Layer 负责把一张已经扁平化的设计图拆回可编辑的图层。两者共用同一个代码仓库(GitHub 上的 inclusionAI/Ming-Image),权重分别发布在 Hugging Face 与 ModelScope 上。
Design:面向「排版密集」的设计稿
它的场景不是泛泛的文生图,而是 UI、信息图、海报这类文字密集的视觉设计:要出的是完整构图,而不是一张好看的插图。官方能力清单里两项值得注意——一是支持 RGBA 输出,也就是直接生成带透明背景的成品,省掉抠图这一道;二是配有 UI/UX 设计榜的对比图,用来支撑它在开源模型里的位次。落地前建议自己看模型卡里的榜单与对比样例,别只看结论。
Design-Layer:把成品拆回可编辑
第二个模型解决更现实的问题:拿到一张设计图,怎么继续改。它接受一张扁平图和一个拆层计划,输出指定数量的 RGBA 图层(官方示例给了六层的卡片制作案例),让设计师能在图层上继续编辑,而不是对着导出的位图重画。注意拆层数量在提供提示词时由提示词里声明的层数决定,也可以不写提示词、直接用参数指定层数。
怎么跑起来,以及硬件底线
git clone https://github.com/inclusionAI/Ming-Image
cd Ming-Image
pip install -r requirements.txt
# 文生图
python infer.py --model inclusionAI/Ming-Image-0.1-Design \
--task text-to-image --prompt assets/t2i_four_seasons_cabin_prompt.json \
--resolution 2048 --output-dir outputs/t2i
# 拆图层
python infer.py --model inclusionAI/Ming-Image-0.1-Design-Layer \
--task layer-decompose --input-image assets/layer_samples/card_making_input.png \
--prompt assets/layer_samples/card_making_prompt.txt \
--attn-implementation flash_attention_2 --resolution 1024 --output-dir outputs/layers- 推荐参数:文生图分辨率 2048×2048(要快可用 1024)、采样步数 12、CFG 1.0;拆层推荐工作分辨率 1024(512 更快)、采样步数 12、CFG 2.0;
- 精度与硬件:BF16,官方验证配置是单张 80GB 显存的 CUDA 卡;
- 许可:两个模型都是 MIT 许可,用于商用前仍建议按自己的合规流程再确认一次;
- 服务化:官方推荐用 vLLM-Omni 部署,仓库里有对应的 recipe。
这套模型的价值不在「生成一张图」,而在把「改稿」从重画变成编辑——交付物从图片变成可继续编辑的文件。