一、Stable Diffusion基础入门
1.1 什么是Stable Diffusion
Stable Diffusion(简称SD)是2022年由Stability AI开源的潜在扩散模型(Latent Diffusion Model),它能根据文字描述生成高质量图像,是目前最流行的开源AI绘画模型。与闭源商业工具不同,SD将模型权重和代码完全开源,任何人都可以在本地电脑上免费部署、训练、微调,从而诞生了繁荣的生态——包括各种WebUI、ComfyUI、上千个微调模型、ControlNet、LoRA等扩展组件。
SD的工作原理是在低维潜在空间(latent space)中逐步去噪,最终解码为像素图像。这种"潜在扩散"设计让它对显存更友好,普通消费级显卡(8GB显存起)即可流畅运行,这也是它能普及开来的关键原因。截至2026年,主流版本包括SD 1.5、SDXL、SD3以及社区持续优化的各种衍生模型。
1.2 Stable Diffusion与Midjourney的区别
很多新手会在SD和Midjourney之间纠结,二者各有定位:
| 对比维度 | Stable Diffusion | Midjourney |
|---|---|---|
| 开源情况 | 完全开源,可本地部署 | 闭源,仅云端服务 |
| 使用成本 | 本地免费(需硬件),云端按量 | 订阅制,$10/月起 |
| 可控性 | 极高,可精调每个参数 | 中等,参数相对收敛 |
| 上手难度 | 较高,需要折腾环境 | 低,Discord里输入即可 |
| 模型生态 | 海量checkpoint/LoRA/ControlNet | 官方统一模型 |
| 隐私性 | 本地生成,数据不出门 | 数据上传到服务器 |
| 出图风格 | 自定义空间极大 | 美学统一,艺术感强 |
简单来说:如果你想"开箱即用、追求艺术感",选Midjourney;如果你"追求极致可控、想做商业项目、需要本地隐私或定制化",Stable Diffusion是更好的选择。两者并不冲突,很多专业创作者会同时使用。
零基础新手可先用Midjourney或云端SD服务(如国内各大模型平台)感受出图乐趣;当你想深度定制、批量生成、做电商主图或工作流自动化时,再转向本地部署的Stable Diffusion。
二、安装部署
2.1 硬件准备
本地运行SD对硬件有基本要求,建议配置如下:
- 显卡(GPU):NVIDIA显卡是首选,显存8GB起步(如RTX 3060/4060),推荐12GB以上(RTX 4070及以上)以运行SDXL及更大模型。AMD显卡和苹果M系列芯片也可运行但兼容性稍差。
- 内存(RAM):16GB起步,推荐32GB。
- 硬盘:建议预留100GB以上SSD空间,单个checkpoint模型动辄2-7GB,加上LoRA、VAE、ControlNet模型很快就会塞满。
- 系统:Windows 10/11、Linux、macOS均可,Windows生态最成熟。
2.2 WebUI (Automatic1111) 安装
WebUI是最经典、生态最完善的图形界面,适合新手和大多数日常出图需求。安装步骤如下:
- 安装Python:安装Python 3.10.6(注意版本,3.11+会有兼容问题),安装时勾选"Add Python to PATH"。
- 安装Git:从git-scm.com下载安装Git for Windows。
- 克隆WebUI仓库:在你想安装的目录下打开终端,执行
git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git - 下载模型:从Civitai或HuggingFace下载一个checkpoint模型(.safetensors格式),放到
stable-diffusion-webui/models/Stable-diffusion/目录下。 - 启动WebUI:双击运行
webui-user.bat,首次启动会自动下载依赖和CLIP模型(需要科学上网,过程可能持续20-40分钟)。 - 访问界面:启动完成后浏览器打开
http://127.0.0.1:7860即可使用。
建议在 webui-user.bat 中配置 COMMANDLINE_ARGS,例如8GB显存可加上 --medvram --opt-split-attention,可显著降低显存占用。
首次运行会从HuggingFace和GitHub下载大量依赖,国内网络很可能超时失败。建议提前配置好代理,或将 HUGGINGFACE_HUB 镜像源切换为国内镜像。失败后不要反复重试,先检查网络。
2.3 ComfyUI安装
ComfyUI是节点式(node-based)界面,类似Blender或Nuke的工作流,对高级用户更友好,显存效率更高,也是2025年后社区发展的主流方向。
- 下载ComfyUI:访问github.com/comfyanonymous/ComfyUI,下载Release压缩包并解压。
- 放置模型:将checkpoint模型放入
ComfyUI/models/checkpoints/,VAE放models/vae/,LoRA放models/loras/。 - 安装依赖:进入解压目录,运行
python -m pip install -r requirements.txt。 - 启动:双击
run_nvidia_gpu.bat(N卡)或对应启动脚本,浏览器访问http://127.0.0.1:8188。 - 加载工作流:ComfyUI默认空白,可将他人分享的JSON工作流拖入界面,或从comfyworkflows.com下载模板。
WebUI偏向"所见即所得"的表单操作,ComfyUI偏向"搭积木"的工作流编排。建议新手先学WebUI熟悉概念,再过渡到ComfyUI做高级流程。两者模型库互通,迁移成本不高。
三、提示词详解
3.1 正向提示词结构
SD的提示词写法与Midjourney不同,更强调关键词堆叠而非自然语言长句。一个高质量正向提示词通常按以下结构组织:
下面是一个完整示例,描述一位赛博朋克风格的女武士:
解析:开头用 1girl, female samurai 锁定主体;中段细化服装、武器、面部、场景;后段控制光影、构图;结尾用 masterpiece, best quality, 8k 等画质词提升精细度。逗号分隔,越靠前的词权重越大。
3.2 负向提示词
负向提示词告诉模型"不要生成什么",对SD出图质量影响极大。通用负向提示词模板:
建议把这段保存为预设,每次出图都加载。针对特定场景还可补充,例如人像加 asymmetric eyes, cross-eyed,全身加 missing legs, extra arms。
3.3 权重控制
SD通过多种语法精确控制关键词权重:
- 圆括号增强:
(keyword)提升约1.1倍,((keyword))约1.21倍,可叠加。 - 数值精确控制:
(keyword:1.3)表示权重1.3,范围建议0.5-1.5,超过2.0容易画面崩坏。 - 方括号减弱:
[keyword]降低权重,[keyword:0.5]精确减弱到0.5。 - 渐变切换:
[keyword1:keyword2:0.6]表示前60%步数用keyword1,之后切换到keyword2,可做风格过渡。 - 交替词:
[cow|horse]在每步交替使用,能融合两种概念。
面部崩坏时优先用 (detailed face:1.3), (perfect eyes:1.2) 增强面部;想要更明显的风格,把风格词权重拉到1.2-1.4。但切记权重不是越高越好,叠加过多会过曝或失真。
四、常用参数详解
| 参数 | 推荐范围 | 作用说明 |
|---|---|---|
| Steps(采样步数) | 20-40 | 去噪迭代次数,越多越精细但越慢。SDXL建议25-30,过50收益递减 |
| CFG Scale(提示词相关性) | 5-12 | 越高越忠于提示词,过高会过饱和失真。人像建议7-9 |
| Sampler(采样器) | DPM++ 2M Karras / Euler a | 不同算法效果差异明显。DPM++ 2M Karras速度快质量高,Euler a适合速览 |
| Seed(随机种子) | -1(随机)或固定数值 | 固定种子可复现结果,便于微调对比 |
| Batch Size(批大小) | 4-8 | 同时生成的图片数量,越大显存占用越高 |
| Batch Count(批次数) | 按需 | 循环生成的批次,配合小Batch Size可生成更多图 |
| Width / Height | 512x512 / 1024x1024 | SD1.5原生512,SDXL原生1024。非正方形按64倍数调整 |
| Hires. fix(高清修复) | 放大1.5-2倍 | 低分辨率出图后放大重绘,能显著提升细节 |
一个稳健的出图参数组合:Steps 28、CFG 7、Sampler DPM++ 2M Karras、分辨率1024x1024(SDXL)或512x768(SD1.5人物),生成满意后开Hires. fix放大1.5倍精修。这是大多数创作者的"舒适区"配置。
CFG Scale超过15后图像会色彩过饱和、出现"塑料感"和异常纹理,新手常常误以为是模型问题。如果你发现出图又艳又假,先把CFG降到7-8试试。
五、模型推荐
Stable Diffusion的魅力在于海量社区模型。下面按风格推荐几类经典checkpoint:
5.1 写实人像
- Realistic Vision:老牌写实模型,皮肤质感、光影真实,适合人像、电商、产品图。
- ChilloutMix / MajicMix Realistic:亚洲面孔表现优秀,常用于写真、汉服、人像摄影。
- Juggernaut XL:基于SDXL的高质量写实模型,电影感和商业摄影质感出色。
5.2 二次元/动漫
- Anything V5:经典二次元模型,泛用性强,新手友好。
- Counterfeit / MeinaMix:日系插画风格,色彩通透,适合人物立绘。
- Nijijourney风格模型:模仿Midjourney Niji的二次元质感。
5.3 艺术插画
- DreamShaper:通用泛化强,写实与插画之间平衡,新手推荐。
- Deliberate:油画、概念艺术风格,适合场景插画。
- Pony Diffusion XL:SDXL底座,风格化能力强,社区扩展多。
5.4 SDXL系列
SDXL原生模型质量已很高,推荐 SDXL Base 1.0 + SDXL Refiner 两阶段出图,或直接用 Juggernaut XL、DreamShaper XL 等微调版一步到位。SDXL对显存要求更高,建议12GB以上显卡。
主要在 civitai.com(俗称C站)和 huggingface.co 下载。C站可直接看示例图和提示词,方便参考。下载时认准 .safetensors 格式,避免 .ckpt(存在pickle注入安全风险)。
六、高级技巧
6.1 ControlNet使用
ControlNet是SD最具革命性的扩展,它能让模型依据参考图控制构图、姿态、边缘、深度等,是商业出图的核心工具。常用类型:
- Canny(边缘检测):保留线稿轮廓,适合保持构图、二改同人。
- OpenPose(姿态):提取人物骨架,精准控制人物姿势。
- Depth(深度图):保留空间前后关系,适合场景重构。
- Tile(分块):放大重绘时保持细节一致,强烈推荐用于高清修复。
- IP-Adapter:以图生图风格迁移,可参考图片的画风、人物特征。
使用流程:在WebUI的ControlNet面板上传参考图 → 选择预处理和模型 → 设置控制权重(建议0.6-1.0)→ 生成。多个ControlNet可串联(如OpenPose+Canny同时用),实现"姿态+构图"双重控制。
6.2 图生图(Img2Img)
图生图以一张已有图片为基础,按提示词重新绘制,是修图、风格转换的常用功能。关键参数:
- Denoising strength(重绘幅度):0-1之间。0.3-0.5做微调(保留原图结构),0.5-0.7做大改风格,0.7以上基本是全新生成。
- Resize mode:控制缩放模式,注意原图比例与目标分辨率尽量一致,避免拉伸。
典型场景:把照片重绘为油画(重绘0.5)、修复老照片(重绘0.3)、把草图细化为成品(重绘0.6)。
6.3 局部重绘(Inpaint)
局部重绘只修改蒙版区域,是修脸、换背景、补物件的利器。操作步骤:
- 切换到Img2Img → Inpaint标签页。
- 上传原图,用画笔涂抹需要修改的区域(如脸部)。
- 写好对应提示词(如修复脸:
perfect face, detailed eyes)。 - 设置Mask blur(1-2像素)、Denoising(0.5-0.7),生成。
进阶可用 Inpaint Anywhere 插件分区重绘,或结合ControlNet实现精准局部修改。商业项目几乎都靠局部重绘来精修出图。
6.4 LoRA使用
LoRA是轻量化微调模型,几百MB就能让基础模型学会特定人物、画风、物件,是SD生态的灵魂。使用方法:
- 将LoRA文件(.safetensors)放入
models/Lora/目录,刷新WebUI。 - 在正向提示词中通过
<lora:文件名:0.7>调用,权重0.6-0.9常用。 - 可叠加多个LoRA,如
<lora:characterA:0.7> <lora:styleB:0.5>,组合人物+画风。
C站有海量角色、明星、画风、服饰LoRA。下载时注意LoRA适配的基础模型版本(SD1.5的LoRA不能用于SDXL),并参考作者给出的示例提示词。
多个LoRA叠加容易"打架"导致画面崩坏。建议每加一个先单独测试权重,确认无冲突再组合;总权重之和不超过1.5比较稳妥。出现崩图时优先降低LoRA权重而非调其他参数。
七、实用Prompt模板
7.1 人像摄影
7.2 风景大片
7.3 动漫人物
7.4 产品/电商
使用时把方括号部分替换成你的具体需求,再根据出图效果微调权重和负向词。建议把这些模板保存为WebUI的"Presets",一键调用。
八、常见问题与避坑指南
Q1:出图全是糊的、像马赛克怎么办?
九成是分辨率没选对。SD1.5原生512,用1024会糊;SDXL原生1024,用512会糊。其次检查Steps是否过低(建议≥20)、是否误开了"low quality"预设。模型版本和分辨率必须匹配。
Q2:人物手部一直崩坏?
手部是所有AI绘画的难点。综合方案:①负向加 bad hands, extra fingers, fused fingers, deformed hands;②用ControlNet的OpenPose Hand模型精准控制手部姿态;③出图后用局部重绘单独修手;④用 ADetailer 插件自动修复面部和手部。
Q3:模型加载报错 "out of memory"?
显存不足。优先尝试:①启动参数加 --medvram 或 --lowvram;②关闭后台占显存程序;③降低分辨率和Batch Size;④改用更省显存的ComfyUI;⑤实在不行升级到12GB+显存显卡。
Q4:生成的图跟提示词对不上?
提示词太长或冲突会导致模型"听不懂"。建议:①关键词控制在75个token以内;②按"主体-细节-风格"顺序排列;③删除矛盾的词(如同时要"realistic"和"anime");④适当提高CFG Scale(7-9)。
Q5:LoRA加载了没效果?
排查:①LoRA版本和基础模型是否匹配(SD1.5 LoRA只能配SD1.5系模型);②权重是否过低(从0.7开始试);③触发词是否写了(很多LoRA需要特定关键词激活,作者页面会注明)。
不同模型License差异大:部分写实模型禁止商用,部分LoRA禁止用于真实明星形象。商业项目务必查阅模型License,优先选MIT/Apache协议的模型,避免使用涉及真人肖像的LoRA。
九、总结
Stable Diffusion的上手曲线确实比Midjourney陡,但回报是极致的可控性和无限的定制空间。本篇教程带你走完了从安装、提示词、参数、模型到ControlNet、LoRA、图生图的全流程,掌握了这些你已超过90%的SD用户。
学习路径建议:先用WebUI+DreamShaper熟悉基础出图 → 再玩LoRA做角色和画风 → 接着学ControlNet实现构图控制 → 最后转ComfyUI搭建自动化工作流。坚持每天产出10张图、对照C站优秀作品分析提示词,一个月就能形成自己的出图方法论。
AI绘画是工具,更是审美和表达力的延伸。愿你用SD创造出独属于自己的视觉世界!