扩散模型(Diffusion Model)的思路可以概括为:训练时给图片不断加噪直到变成纯噪声,推理时从纯噪声出发一步步「去噪」,最终还原出图片。文生图就是在这个去噪过程中加入文本引导。

关键名词

  • Denoising(去噪):从噪声中逐步恢复图像的迭代过程
  • Text Encoder(文本编码器):把提示词转成模型能理解的向量,如 CLIP、T5
  • Sampler(采样器):决定去噪步数与算法,如 Euler、DPM++、DDIM,影响速度与画质
  • CFG(Classifier-Free Guidance):提示词对生成结果的引导强度,数值越高越贴合提示词,过高会过饱和
  • Seed(随机种子):相同的种子+参数可复现同一张图

文生图 vs 图生图

文生图(txt2img)从噪声生成全新图像;图生图(img2img)以一张现有图为起点,在保留构图的同时重绘或变换风格。ControlNet 则通过线稿、骨骼、深度图等额外控制生成结构。