Midjourney 好用但有天花板:你没法控制人物的具体姿势、没法固定角色的长相、没法做商业级的产品图。这时候就需要 Stable Diffusion(以下简称 SD)+ ControlNet 这套组合拳了。本教程面向已经用过 Midjourney/Leonardo 等在线工具、想进阶本地出图的朋友。

为什么选 Stable Diffusion?
- 完全免费,开源,本地运行,无出图次数限制
- ControlNet 精确控制构图、姿势、线稿、深度
- LoRA 插件固定角色长相/画风,适合做 IP 和系列图
- 真人模型(ChilloutMix、MajicMix)生成的照片级人像,远超 Midjourney
硬件要求
SD 对显卡有硬性要求:NVIDIA 显卡 + 至少 6GB 显存。推荐配置:
- 最低:GTX 1060 6GB(可运行 SD 1.5 模型,速度较慢)
- 推荐:RTX 3060 12GB / RTX 4060 Ti 16GB
- 最佳:RTX 4090 24GB(可流畅运行 SDXL 和 Flux 模型)
- 注意:AMD 显卡和 Mac 可以用,但体验差很多,不推荐新手踩坑
如果你没独显或只有 AMD/Apple Silicon,Colab 是备选方案——每月 10 美元的 Colab Pro 就能在云��跑 T4 GPU。本教程以本地 Windows 安装为例。
第一步:安装 Stable Diffusion WebUI(Automatic1111)
- 安装 Python 3.10.6(必须这个版本!新版 Python 不兼容)→ python.org 下载
- 安装 Git → git-scm.com 下载,一路默认即可
- 打开命令提示符,输入以下命令下载 WebUI:
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git下载完成后进入目录,运行 webui-user.bat。第一次启动会下载约 10GB 的依赖,耐心等待 20-30 分钟。启动成功后会看到浏览器自动打开 http://127.0.0.1:7860。

第二步:下载模型
SD 本体只包含基础框架,模型文件需要额外下载。推荐从 Civitai.com 或 Hugging Face 获取:
- 写实人像:MajicMix Realistic(Civitai 下载,.safetensors 格式)→ 放入 models/Stable-diffusion/
- 二次元:Anything V5 → 同样放入 models/Stable-diffusion/
- 通用高质:SDXL 1.0(约 7GB)→ Hugging Face 搜索 stabilityai/stable-diffusion-xl-base-1.0
下载后放到对应文件夹,在 WebUI 左上角下拉菜单刷新即可看到新模型。
第三步:安装 ControlNet 插件
这是本教程最核心的部分。ControlNet 让你能用线稿、姿势骨架、深度图、甚至另一张图片来精确控制生成结果。
- 在 WebUI 顶部菜单点「Extensions」→「Available」→「Load From」
- 搜索「sd-webui-controlnet」,点 Install
- 安装完成后重启 WebUI
- 下载 ControlNet 模型文件(约 5-8GB)→ Hugging Face 搜索 lllyasviel/ControlNet-v1-1,下载 .pth 文件放入 extensions/sd-webui-controlnet/models/
需要下载哪些 ControlNet 模型?至少这四个:
- control_v11p_sd15_openpose.pth → 控制人物姿势(Openpose 骨架)
- control_v11p_sd15_canny.pth → 基于线稿/边缘检测生图(Canny)
- control_v11f1p_sd15_depth.pth → 基于深度图生图(Depth)
- control_v11p_sd15_lineart.pth → 基于精细线稿生图(Lineart)
第四步:ControlNet 实战操作
场景:你有一张参考图(比如某位模特的动作姿势),想生成另一个角色做同样的动作。
- 在 txt2img 标签页,展开下方的 ControlNet 面板,勾选「Enable」
- 拖入参考图到 ControlNet 的图片框
- Preprocessor 选「openpose_full」,Model 选「control_v11p_sd15_openpose」
- 在上方提示词框写你的生图描述(人物、背景、风格),注意不要写姿势描述,因为姿势由 ControlNet 接管
- 点 Generate
同理,如果你有一张建筑的线稿,Preprocessor 选「canny」,Model 选对应的 canny 模型,就能在保持建筑结构的前提下改变风格——线稿变水彩、变油画、变赛博朋克渲染,全部可控。
第五步:LoRA — 固定角色长相和画风
LoRA(Low-Rank Adaptation)是一种小型插件模型,通常 10-200MB,叠加在 SD 主模型上使用,用来锁定特定的角色、画风、服装等。Civitai 上有海量 LoRA:特定动漫角色、某个网红的脸、中国风水墨画法……几乎什么都有。
提示词里加 <lora:hanfu_style:0.7> 就会启用汉服风格的 LoRA,权重 0.7 表示混合强度使用方法:下载 .safetensors 格式的 LoRA 文件 → 放入 models/Lora/ → 在提示词中用 <lora:文件名:权重> 语法调用。
精华点总结
- SD 进阶的核心竞争力是 ControlNet + LoRA 的组合:前者控构图,后者定风格
- Civitai.com 是 SD 用户最大的模型和作品分享社区,遇到好图可以点进去看参数(Generate Info),直接复制到本地出图
- 提示词写法与 Midjourney 不同,SD 更重参数和负面提示词(Negative Prompt),比如你需要在负面提示词里写 low quality, blurry, distorted face 来排除低质量输出
- SD 单张图生成耗时约 5-30 秒(取决于显卡和模型),比 Midjourney 快得多,适合批量生产