Stable Diffusion完全指南

从安装部署到高级出图技巧,全面掌握开源AI绘画神器

⏱️ 阅读时间:50分钟 📊 难度:初级到高级 📝 更新:2026.07.23 👁️ 4.2万次学习

📋 本文目录

一、Stable Diffusion基础入门

1.1 什么是Stable Diffusion

Stable Diffusion(简称SD)是2022年由Stability AI开源的潜在扩散模型(Latent Diffusion Model),它能根据文字描述生成高质量图像,是目前最流行的开源AI绘画模型。与闭源商业工具不同,SD将模型权重和代码完全开源,任何人都可以在本地电脑上免费部署、训练、微调,从而诞生了繁荣的生态——包括各种WebUI、ComfyUI、上千个微调模型、ControlNet、LoRA等扩展组件。

SD的工作原理是在低维潜在空间(latent space)中逐步去噪,最终解码为像素图像。这种"潜在扩散"设计让它对显存更友好,普通消费级显卡(8GB显存起)即可流畅运行,这也是它能普及开来的关键原因。截至2026年,主流版本包括SD 1.5、SDXL、SD3以及社区持续优化的各种衍生模型。

1.2 Stable Diffusion与Midjourney的区别

很多新手会在SD和Midjourney之间纠结,二者各有定位:

对比维度Stable DiffusionMidjourney
开源情况完全开源,可本地部署闭源,仅云端服务
使用成本本地免费(需硬件),云端按量订阅制,$10/月起
可控性极高,可精调每个参数中等,参数相对收敛
上手难度较高,需要折腾环境低,Discord里输入即可
模型生态海量checkpoint/LoRA/ControlNet官方统一模型
隐私性本地生成,数据不出门数据上传到服务器
出图风格自定义空间极大美学统一,艺术感强

简单来说:如果你想"开箱即用、追求艺术感",选Midjourney;如果你"追求极致可控、想做商业项目、需要本地隐私或定制化",Stable Diffusion是更好的选择。两者并不冲突,很多专业创作者会同时使用。

💡 选型建议

零基础新手可先用Midjourney或云端SD服务(如国内各大模型平台)感受出图乐趣;当你想深度定制、批量生成、做电商主图或工作流自动化时,再转向本地部署的Stable Diffusion。

二、安装部署

2.1 硬件准备

本地运行SD对硬件有基本要求,建议配置如下:

2.2 WebUI (Automatic1111) 安装

WebUI是最经典、生态最完善的图形界面,适合新手和大多数日常出图需求。安装步骤如下:

  1. 安装Python:安装Python 3.10.6(注意版本,3.11+会有兼容问题),安装时勾选"Add Python to PATH"。
  2. 安装Git:从git-scm.com下载安装Git for Windows。
  3. 克隆WebUI仓库:在你想安装的目录下打开终端,执行 git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
  4. 下载模型:从Civitai或HuggingFace下载一个checkpoint模型(.safetensors格式),放到 stable-diffusion-webui/models/Stable-diffusion/ 目录下。
  5. 启动WebUI:双击运行 webui-user.bat,首次启动会自动下载依赖和CLIP模型(需要科学上网,过程可能持续20-40分钟)。
  6. 访问界面:启动完成后浏览器打开 http://127.0.0.1:7860 即可使用。

建议在 webui-user.bat 中配置 COMMANDLINE_ARGS,例如8GB显存可加上 --medvram --opt-split-attention,可显著降低显存占用。

⚠️ 首次启动注意

首次运行会从HuggingFace和GitHub下载大量依赖,国内网络很可能超时失败。建议提前配置好代理,或将 HUGGINGFACE_HUB 镜像源切换为国内镜像。失败后不要反复重试,先检查网络。

2.3 ComfyUI安装

ComfyUI是节点式(node-based)界面,类似Blender或Nuke的工作流,对高级用户更友好,显存效率更高,也是2025年后社区发展的主流方向。

  1. 下载ComfyUI:访问github.com/comfyanonymous/ComfyUI,下载Release压缩包并解压。
  2. 放置模型:将checkpoint模型放入 ComfyUI/models/checkpoints/,VAE放 models/vae/,LoRA放 models/loras/
  3. 安装依赖:进入解压目录,运行 python -m pip install -r requirements.txt
  4. 启动:双击 run_nvidia_gpu.bat(N卡)或对应启动脚本,浏览器访问 http://127.0.0.1:8188
  5. 加载工作流:ComfyUI默认空白,可将他人分享的JSON工作流拖入界面,或从comfyworkflows.com下载模板。

WebUI偏向"所见即所得"的表单操作,ComfyUI偏向"搭积木"的工作流编排。建议新手先学WebUI熟悉概念,再过渡到ComfyUI做高级流程。两者模型库互通,迁移成本不高。

三、提示词详解

3.1 正向提示词结构

SD的提示词写法与Midjourney不同,更强调关键词堆叠而非自然语言长句。一个高质量正向提示词通常按以下结构组织:

正向提示词公式
[主体描述] + [细节特征] + [环境/背景] + [光影氛围] + [构图视角] + [风格/艺术家] + [画质增强词]

下面是一个完整示例,描述一位赛博朋克风格的女武士:

正向 Prompt 示例
1girl, female samurai, cyberpunk outfit, glowing neon katana, (detailed face:1.2), long black hair with red streaks, standing in rain-soaked tokyo street at night, neon signs reflection on wet ground, dramatic cinematic lighting, volumetric fog, low angle shot, masterpiece, best quality, ultra-detailed, 8k, photo realistic, sharp focus

解析:开头用 1girl, female samurai 锁定主体;中段细化服装、武器、面部、场景;后段控制光影、构图;结尾用 masterpiece, best quality, 8k 等画质词提升精细度。逗号分隔,越靠前的词权重越大。

3.2 负向提示词

负向提示词告诉模型"不要生成什么",对SD出图质量影响极大。通用负向提示词模板:

通用负向 Prompt
lowres, bad anatomy, bad hands, extra fingers, missing fingers, extra limbs, fused fingers, deformed, ugly, duplicate, morbid, mutilated, blurry, watermark, signature, text, cropped, worst quality, low quality, jpeg artifacts, poorly drawn face, mutation

建议把这段保存为预设,每次出图都加载。针对特定场景还可补充,例如人像加 asymmetric eyes, cross-eyed,全身加 missing legs, extra arms

3.3 权重控制

SD通过多种语法精确控制关键词权重:

💡 权重实战

面部崩坏时优先用 (detailed face:1.3), (perfect eyes:1.2) 增强面部;想要更明显的风格,把风格词权重拉到1.2-1.4。但切记权重不是越高越好,叠加过多会过曝或失真。

四、常用参数详解

参数推荐范围作用说明
Steps(采样步数)20-40去噪迭代次数,越多越精细但越慢。SDXL建议25-30,过50收益递减
CFG Scale(提示词相关性)5-12越高越忠于提示词,过高会过饱和失真。人像建议7-9
Sampler(采样器)DPM++ 2M Karras / Euler a不同算法效果差异明显。DPM++ 2M Karras速度快质量高,Euler a适合速览
Seed(随机种子)-1(随机)或固定数值固定种子可复现结果,便于微调对比
Batch Size(批大小)4-8同时生成的图片数量,越大显存占用越高
Batch Count(批次数)按需循环生成的批次,配合小Batch Size可生成更多图
Width / Height512x512 / 1024x1024SD1.5原生512,SDXL原生1024。非正方形按64倍数调整
Hires. fix(高清修复)放大1.5-2倍低分辨率出图后放大重绘,能显著提升细节

一个稳健的出图参数组合:Steps 28、CFG 7、Sampler DPM++ 2M Karras、分辨率1024x1024(SDXL)或512x768(SD1.5人物),生成满意后开Hires. fix放大1.5倍精修。这是大多数创作者的"舒适区"配置。

⚠️ CFG过高的坑

CFG Scale超过15后图像会色彩过饱和、出现"塑料感"和异常纹理,新手常常误以为是模型问题。如果你发现出图又艳又假,先把CFG降到7-8试试。

五、模型推荐

Stable Diffusion的魅力在于海量社区模型。下面按风格推荐几类经典checkpoint:

5.1 写实人像

5.2 二次元/动漫

5.3 艺术插画

5.4 SDXL系列

SDXL原生模型质量已很高,推荐 SDXL Base 1.0 + SDXL Refiner 两阶段出图,或直接用 Juggernaut XL、DreamShaper XL 等微调版一步到位。SDXL对显存要求更高,建议12GB以上显卡。

💡 模型下载渠道

主要在 civitai.com(俗称C站)和 huggingface.co 下载。C站可直接看示例图和提示词,方便参考。下载时认准 .safetensors 格式,避免 .ckpt(存在pickle注入安全风险)。

六、高级技巧

6.1 ControlNet使用

ControlNet是SD最具革命性的扩展,它能让模型依据参考图控制构图、姿态、边缘、深度等,是商业出图的核心工具。常用类型:

使用流程:在WebUI的ControlNet面板上传参考图 → 选择预处理和模型 → 设置控制权重(建议0.6-1.0)→ 生成。多个ControlNet可串联(如OpenPose+Canny同时用),实现"姿态+构图"双重控制。

6.2 图生图(Img2Img)

图生图以一张已有图片为基础,按提示词重新绘制,是修图、风格转换的常用功能。关键参数:

典型场景:把照片重绘为油画(重绘0.5)、修复老照片(重绘0.3)、把草图细化为成品(重绘0.6)。

6.3 局部重绘(Inpaint)

局部重绘只修改蒙版区域,是修脸、换背景、补物件的利器。操作步骤:

  1. 切换到Img2Img → Inpaint标签页。
  2. 上传原图,用画笔涂抹需要修改的区域(如脸部)。
  3. 写好对应提示词(如修复脸: perfect face, detailed eyes)。
  4. 设置Mask blur(1-2像素)、Denoising(0.5-0.7),生成。

进阶可用 Inpaint Anywhere 插件分区重绘,或结合ControlNet实现精准局部修改。商业项目几乎都靠局部重绘来精修出图。

6.4 LoRA使用

LoRA是轻量化微调模型,几百MB就能让基础模型学会特定人物、画风、物件,是SD生态的灵魂。使用方法:

C站有海量角色、明星、画风、服饰LoRA。下载时注意LoRA适配的基础模型版本(SD1.5的LoRA不能用于SDXL),并参考作者给出的示例提示词。

💡 LoRA叠加技巧

多个LoRA叠加容易"打架"导致画面崩坏。建议每加一个先单独测试权重,确认无冲突再组合;总权重之和不超过1.5比较稳妥。出现崩图时优先降低LoRA权重而非调其他参数。

七、实用Prompt模板

7.1 人像摄影

人像模板
1girl, solo, (detailed face:1.2), portrait, looking at viewer, professional makeup, [hair color] long hair, wearing [clothing], soft bokeh background, golden hour lighting, shot on Sony A7R IV, 85mm f1.4, shallow depth of field, masterpiece, best quality, ultra realistic, 8k Negative: lowres, bad anatomy, deformed hands, extra fingers, ugly, blurry, watermark, text

7.2 风景大片

风景模板
breathtaking landscape, [mountain range / ocean / forest], dramatic sky at sunset, volumetric clouds, god rays, reflections on water, ultra wide angle, cinematic composition, highly detailed, photorealistic, 8k, award winning photography, National Geographic style Negative: lowres, blurry, people, text, watermark, oversaturated

7.3 动漫人物

动漫模板
1girl, anime style, [character description], school uniform / fantasy armor, expressive eyes, dynamic pose, cherry blossoms background, soft cell shading, vibrant colors, key visual, studio ghibli inspired, masterpiece, high quality Negative: 3d, realistic, photo, lowres, bad anatomy, extra limbs, text, signature

7.4 产品/电商

电商产品模板
professional product photography, [product name] on marble podium, soft studio lighting, gradient background, sharp focus, high detail, commercial photography, 8k, octane render, centered composition Negative: lowres, blurry, hand, person, text, watermark, distorted, cluttered background

使用时把方括号部分替换成你的具体需求,再根据出图效果微调权重和负向词。建议把这些模板保存为WebUI的"Presets",一键调用。

八、常见问题与避坑指南

Q1:出图全是糊的、像马赛克怎么办?

九成是分辨率没选对。SD1.5原生512,用1024会糊;SDXL原生1024,用512会糊。其次检查Steps是否过低(建议≥20)、是否误开了"low quality"预设。模型版本和分辨率必须匹配。

Q2:人物手部一直崩坏?

手部是所有AI绘画的难点。综合方案:①负向加 bad hands, extra fingers, fused fingers, deformed hands;②用ControlNet的OpenPose Hand模型精准控制手部姿态;③出图后用局部重绘单独修手;④用 ADetailer 插件自动修复面部和手部。

Q3:模型加载报错 "out of memory"?

显存不足。优先尝试:①启动参数加 --medvram--lowvram;②关闭后台占显存程序;③降低分辨率和Batch Size;④改用更省显存的ComfyUI;⑤实在不行升级到12GB+显存显卡。

Q4:生成的图跟提示词对不上?

提示词太长或冲突会导致模型"听不懂"。建议:①关键词控制在75个token以内;②按"主体-细节-风格"顺序排列;③删除矛盾的词(如同时要"realistic"和"anime");④适当提高CFG Scale(7-9)。

Q5:LoRA加载了没效果?

排查:①LoRA版本和基础模型是否匹配(SD1.5 LoRA只能配SD1.5系模型);②权重是否过低(从0.7开始试);③触发词是否写了(很多LoRA需要特定关键词激活,作者页面会注明)。

⚠️ 商用版权避坑

不同模型License差异大:部分写实模型禁止商用,部分LoRA禁止用于真实明星形象。商业项目务必查阅模型License,优先选MIT/Apache协议的模型,避免使用涉及真人肖像的LoRA。

九、总结

Stable Diffusion的上手曲线确实比Midjourney陡,但回报是极致的可控性和无限的定制空间。本篇教程带你走完了从安装、提示词、参数、模型到ControlNet、LoRA、图生图的全流程,掌握了这些你已超过90%的SD用户。

学习路径建议:先用WebUI+DreamShaper熟悉基础出图 → 再玩LoRA做角色和画风 → 接着学ControlNet实现构图控制 → 最后转ComfyUI搭建自动化工作流。坚持每天产出10张图、对照C站优秀作品分析提示词,一个月就能形成自己的出图方法论。

AI绘画是工具,更是审美和表达力的延伸。愿你用SD创造出独属于自己的视觉世界!