Stable Diffusion 是给「想自己动手」的人准备的。你可以把控从模型、参数、到出图流程的每一个环节——代价是你得有足够的耐心去学习。它不是一个「输入 prompt 就给你图」的工具,它是一个「你可以搭建自己的 AI 绘画工作台」的框架。
为什么有人愿意折腾
答案是 ControlNet。这是 SD 生态的杀手级功能——你可以用线稿、深度图、人体姿态、甚至另一张图片的构图来精确控制生成结果。比如你想让人物摆一个非常具体的姿势,只要给一张骨骼姿态图,ControlNet 就能让 AI 照着画。这种精细控制在商用场景里(游戏原画、产品设计、建筑效果图)是无法替代的。
LoRA 模型生态同样庞大。你想画某个特定角色、特定画风、特定服装——大概率有人已经训练好了 LoRA,你下载就能用。这种社区驱动的模型丰富度,是任何闭源产品都做不到的。
你需要知道自己在做什么
- 至少要有一张 6GB 以上显存的显卡。笔记本集显就别想了——虽然可以跑 CPU 模式,但慢到怀疑人生。
- 安装环境是个坎。Python 版本、PyTorch、CUDA、各种依赖——任何一个版本不对都可能让你折腾半天。建议直接用 AUTOMATIC1111 或 ComfyUI 的整合包,省心很多。
- 出图不像 Midjourney 那样「输入提示词就完了」。你得调采样器、步数、CFG、分辨率、种子——每一个参数都影响结果。新手至少需要几个周末才能上手。
- SD 的商业许可比较复杂。基础模型和社区模型的许可条款不一样,商用前最好仔细看清楚。
如果你追求精确控制和自由定制——SD 是唯一的选择。如果你只是想轻松出好看的图——Midjourney 或即梦更适合。
自由度最高的 AI 绘画。但自由是有代价的——你需要花时间学习和调试。