Flux AI概述
Flux是由Black Forest Labs(由Stable Diffusion原班核心成员Robin Rombach等人创立)推出的新一代图像生成模型系列。2024年8月首次发布后,Flux迅速成为开源图像生成领域的新标杆,在图像质量、文字渲染和人体结构等关键指标上全面超越此前的Stable Diffusion系列。
Flux系列基于全新的混合Transformer架构(Rectified Flow Transformers),不同于Stable Diffusion的U-Net架构。这一架构创新使得Flux在相同参数量下能实现更高效的训练和推理,同时显著提升了图像的细节表现力和语义理解能力。简单来说,Flux用更少的步数就能生成比SDXL更精细的图像。
Flux.1三大模型
| 特性 | Flux.1 Pro | Flux.1 Dev | Flux.1 Schnell |
|---|---|---|---|
| 定位 | 商业旗舰 | 开源开发 | 极速推理 |
| 图像质量 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 推理步数 | 20-50步 | 20-50步 | 1-4步 |
| 文字渲染 | ✅ 优秀 | ✅ 良好 | ⚠️ 一般 |
| 开源许可 | ❌ 商业闭源 | ✅ 非商业开源 | ✅ Apache 2.0 |
| 访问方式 | API/Replicate | ComfyUI/HF | ComfyUI/HF |
| 适合场景 | 商业生产 | 研究/创作 | 快速预览 |
Flux与Stable Diffusion的核心区别
Flux与Stable Diffusion虽然出自同一团队,但在架构和能力上有本质区别:
- 架构变革:SD使用U-Net+CLIP架构,Flux采用DiT(Diffusion Transformer)+T5-XXL文本编码器。T5-XXL的引入让Flux对长文本Prompt的理解能力大幅提升,不再受限于CLIP的77 token限制。
- 参数规模:Flux.1系列为12B参数模型,远超SDXL的6.6B。更多参数意味着更精细的图像细节和更强的概念组合能力。
- 文字生成:这是Flux最大的杀手级特性。Stable Diffusion在图像中生成文字几乎是灾难,而Flux.1 Pro能准确渲染较长的英文文本,使其直接可用于海报、Logo等设计场景。
- 人体结构:Flux在手部、肢体比例等传统AI痛点上表现显著优于SDXL,减少了"多指""畸形肢体"等常见缺陷。
- 推理效率:Schnell版本仅需1-4步即可生成高质量图像,相比SDXL的20-50步,速度提升10倍以上。
- 追求极致质量:使用Flux.1 Pro,通过Replicate或官方API调用
- 本地部署/研究:使用Flux.1 Dev,需要24GB+显存的GPU
- 快速出图/批量生成:使用Flux.1 Schnell,1-4步极速推理
快速开始
Flux不像Midjourney那样有官方Web界面,而是以模型/API的形式提供。你需要选择一个平台来访问Flux。以下是主流接入方式:
Replicate API
Replicate是最简单的Flux接入方式,无需本地GPU,按次付费。支持所有三个Flux模型,还提供LoRA组合功能。
# 安装Replicate Python SDK
pip install replicate
# 设置API Token(在replicate.com获取)
export REPLICATE_API_TOKEN=r8_xxxxx
# Flux.1 Schnell - 极速生成
import replicate
output = replicate.run(
"black-forest-labs/flux-schnell",
input={
"prompt": "A majestic dragon perched on a crystal mountain, fantasy art, detailed scales, volumetric lighting",
"num_outputs": 1,
"aspect_ratio": "16:9",
"output_format": "webp",
"output_quality": 90
}
)
print(output)
Replicate的计费按运行时间计算,Flux.1 Schnell约$0.003/张,Flux.1 Pro约$0.05/张,性价比极高。
HuggingFace Spaces
HuggingFace提供免费的Flux体验空间,适合快速试用:
- 访问 HuggingFace Flux Spaces
- 选择一个Flux.1 Dev或Schnell的Demo空间
- 输入Prompt,调整参数,点击生成
- 免费版需要排队,付费Pro账号可跳过队列
免费Spaces存在排队等待(可能数分钟)、单次生成限制和较低优先级。如果需要频繁使用,建议使用Replicate API或本地部署。
ComfyUI本地部署
ComfyUI是功能最强大的本地部署方案,支持完整的节点化工作流,可以灵活组合ControlNet、LoRA等组件。
- 安装ComfyUI(
git clone https://github.com/comfyanonymous/ComfyUI) - 下载Flux.1 Dev模型文件(约24GB),放入
models/unet/目录 - 下载T5-XXL文本编码器(约10GB),放入
models/text_encoders/目录 - 下载VAE模型,放入
models/vae/目录 - 启动ComfyUI,加载Flux工作流模板
🖥️ 显存需求
- Flux.1 Dev (FP16):约24GB显存(RTX 4090/A100)
- Flux.1 Dev (NF4量化):约8-12GB显存(RTX 4070/4080)
- Flux.1 Schnell:同Dev,但推理速度快5-10倍
- Flux.1 Dev (GGUF量化):约6-8GB显存(RTX 3060/4060)
量化模型会略微降低画质,但对于大多数应用场景仍然足够优秀。推荐使用NF4量化作为质量和显存的平衡点。
Fal.ai
Fal.ai是另一个优秀的Flux API平台,提供实时流式生成、LoRA训练和图像编辑功能:
- 实时生成:支持WebSocket流式传输,边生成边预览
- LoRA训练:上传20-30张图片即可训练专属风格LoRA
- 图像编辑:支持inpainting和outpainting
- 定价:与Replicate相当,部分功能免费试用
先在HuggingFace Spaces免费体验 → 满意后用Replicate API做项目 → 有GPU后迁移到ComfyUI本地部署获得最大自由度。
Prompt工程技巧
Flux的文本编码器是T5-XXL,相比Stable Diffusion的CLIP,它能理解更长、更复杂的自然语言描述。这意味着你可以用更接近自然对话的方式来写Prompt,而不需要像SD那样堆砌关键词。
结构化Prompt写法
虽然Flux理解自然语言,但结构化写法仍然能帮助获得更可控的结果。推荐以下结构:
[主体描述], [动作/状态], [环境/场景], [光影/氛围], [风格/参考], [技术规格]
🎯 高质量Prompt示例
写实人像:
Portrait of a young woman with freckles and green eyes, soft smile, wearing a linen blouse, standing in a sunlit garden with blooming lavender, golden hour lighting, shallow depth of field, shot on Hasselblad X2D, photorealistic, 8K
概念设计:
Futuristic floating city above the clouds, crystalline architecture with bioluminescent pathways, aerial gardens cascading down the sides, dawn light filtering through transparent buildings, concept art style, highly detailed, ArtStation trending
文字渲染(Flux特长):
A minimalist movie poster with bold text "BEYOND THE HORIZON" at the top, silhouette of a lone figure standing on a cliff edge overlooking a vast ocean, dramatic sunset sky with orange and purple gradients, clean sans-serif typography, cinematic poster design
产品摄影:
Professional product photo of a matte black wireless headphone on a polished concrete surface, subtle reflection, single dramatic key light from the left, deep shadows, minimalist composition, commercial photography, 4K
权重语法
Flux支持通过语法调整特定词汇的权重,实现更精细的控制:
# 基础权重(ComfyUI中)
(cat:1.3) # 增强"猫"的权重
(blue:0.7) # 降低"蓝色"的权重
# 嵌套权重
((detailed fur:1.5)) # 强调毛发细节
# Flux中权重使用的建议
# 1.0 = 默认权重
# 1.1-1.3 = 轻微增强,适合微调
# 1.4-1.8 = 明显增强,适合突出关键元素
# >2.0 = 过强,可能导致画面失真
Flux对权重的敏感度高于Stable Diffusion。在SD中1.5的权重很常见,但在Flux中1.3就可能有明显效果。建议从1.1-1.2开始微调,避免过度加权导致图像崩坏。
负向提示
与Stable Diffusion不同,Flux.1对负向提示(negative prompt)的支持有限。Flux基于Rectified Flow的训练方式使其天然对低质量生成有更强的抵抗力,因此在很多场景下不需要负向提示。
如果在ComfyUI中需要使用负向提示,常见做法是:
- 使用Flux Guidance节点设置负向引导
- 使用
blurry, low quality, watermark, text等通用负面词 - 在图像到图像工作流中,通过调整denoise强度来规避不想要的元素
实用Prompt技巧
- 自然语言优先:Flux理解完整句子,"a cat sitting on a windowsill looking outside on a rainy day"比"cat, windowsill, rain"效果更好
- 风格引用有效:"in the style of Studio Ghibli"或"ArtStation trending"在Flux中非常有效
- 指定相机/镜头:"shot on Canon R5, 85mm f/1.4"能显著影响景深和画面质感
- 文字用引号包裹:需要渲染文字时,用引号明确标注,如text "HELLO WORLD"
- 避免矛盾描述:不要同时要求"minimalist"和"highly detailed intricate patterns"
参数详解
理解Flux的核心参数是获得理想输出的关键。以下是每个重要参数的详细说明:
推理步数(num_inference_steps)
推理步数决定模型去噪的迭代次数。步数越多,细节越精细,但生成越慢。
- Flux.1 Schnell:设计为1-4步即可出图。4步已是最佳,更多步数不会提升质量。
- Flux.1 Dev/Pro:推荐20-30步。20步足够大多数场景,30步适合极端细节需求。超过50步几乎无额外收益。
📊 步数与质量关系
| 步数 | 质量等级 | 适用场景 | 耗时参考(Dev) |
|---|---|---|---|
| 1-4 | 快速预览 | Schnell专用,批量筛选 | ~2秒 |
| 10-15 | 良好 | 日常使用,速度快 | ~8秒 |
| 20-25 | 优秀 | 推荐默认值 | ~15秒 |
| 30-40 | 极致 | 最终输出、打印 | ~25秒 |
引导系数(guidance_scale)
引导系数控制图像对Prompt的遵从程度。值越高,输出越严格遵循Prompt但可能显得"过度处理";值越低,模型自由度越大但可能偏离Prompt。
- Flux.1 Schnell:通常设为0(无引导),因为Schnell在训练时已内置了引导。
- Flux.1 Dev:推荐3.0-4.0。默认3.5是最佳平衡点。
- Flux.1 Pro:推荐3.0-5.0,具体取决于Prompt复杂度。
简单Prompt(如"a cat")用3.0-3.5即可;复杂Prompt(长段落+多概念组合)可以提高到4.0-5.0确保模型不遗漏细节。如果发现图像"过于AI化"或色彩过饱和,适当降低guidance_scale到2.5-3.0。
随机种子(seed)
Seed控制生成的随机性。相同Prompt+参数+seed = 完全相同的输出。
- 设为-1或random:每次生成不同结果,用于探索创意
- 固定seed:用于复现特定结果或微调Prompt时保持一致性
- 实用技巧:找到满意结果后记下seed,后续修改Prompt的小细节(如调整颜色)时保持seed不变,可以直观看到Prompt变化的影响
其他重要参数
- 宽度/高度:Flux.1原生支持多种分辨率,推荐使用预设比例(1:1、16:9、9:16、4:3、3:4)而非任意尺寸,以获得最佳构图。
- 输出格式:webp格式文件更小且质量足够,推荐用于Web;需要无损存档时用png。
- denoise强度(图生图模式):0.3-0.5轻度修改,0.5-0.7中度修改,0.7-0.9大幅重绘。Flux在低denoise下比SD更稳定。
高级技巧
掌握基础生成后,以下高级技巧可以将Flux的能力发挥到极致:
ControlNet条件控制
ControlNet允许你通过线稿、深度图、姿态图等条件精确控制生成结果,是Flux走向专业生产的关键工具。
- Canny边缘控制:上传线稿或边缘图,Flux将按线稿结构生成图像。适合将草图转为成品、保持特定轮廓。
- Depth深度控制:通过深度图控制空间结构,适合保持3D场景的空间关系、建筑室内设计。
- Pose姿态控制:使用OpenPose骨架图精确控制人物姿态,解决AI生成人体姿势不可控的问题。
- IP-Adapter:上传参考图片,将参考图的风格/人物迁移到新图像中。非常适合风格一致性要求高的项目。
Flux.1的ControlNet适配器仍在快速迭代中。截至2026年初,Canny和Depth已稳定可用,Pose支持逐步完善。使用ControlNet会增加约30-50%的推理时间和显存占用,建议至少16GB显存。
IP-Adapter风格迁移
IP-Adapter是Flux生态中极具价值的功能,它允许你用一张参考图来引导生成,实现风格、角色或氛围的迁移:
- 风格迁移:上传一幅水彩画作为参考,Flux生成的新图将继承水彩风格
- 角色一致:上传角色设计图,在不同场景中保持角色外观一致
- 产品变体:上传产品图,快速生成不同背景/角度的变体
在ComfyUI中,IP-Adapter通过专用节点接入,需要额外下载约300MB的适配器权重文件。调节IP-Adapter的强度参数(0.0-1.0)可以控制参考图的影响力——0.5左右是风格迁移的最佳范围。
LoRA微调
LoRA(Low-Rank Adaptation)是最经济高效的方式,让Flux生成特定风格、角色或对象:
- 训练数据:20-30张高质量图片即可训练一个LoRA,远少于全量微调
- 训练平台:Fal.ai和Replicate都提供一键LoRA训练服务,无需写代码
- 训练时间:约15-30分钟(云端A100),费用约$2-5
- LoRA强度:0.6-0.8为推荐范围,超过1.0可能导致过拟合
🎯 LoRA应用场景
- 品牌风格:用品牌视觉素材训练,确保AI生成内容符合品牌调性
- 角色设计:游戏/动画角色一致性维护,避免每次生成外观不同
- 产品模型:训练特定产品的LoRA,快速生成不同场景的产品图
- 艺术风格:训练特定艺术家风格(需注意版权),实现风格化批量创作
图像到图像(Img2Img)
图像到图像是Flux最实用的功能之一,允许在已有图像基础上进行修改和增强:
- 低denoise重绘(0.2-0.4):保留原图大部分内容,仅微调细节。适合修复瑕疵、微调风格、增强细节。
- 中denoise重绘(0.5-0.7):保留构图和主要元素,重新渲染风格和细节。适合风格转换、材质替换。
- Inpainting:选择图像局部区域进行重绘,其余区域保持不变。适合移除/替换物体、修复局部。
- Outpainting:扩展图像边界,生成更大的画面。适合将竖图扩展为横图、补充被裁切的内容。
Flux在Img2Img模式下的稳定性优于Stable Diffusion。建议先用低denoise(0.3)试探效果,逐步提高而非一步到位。对于Inpainting,mask区域边界要留出足够的过渡区,避免生成内容与原图产生硬边。
商业应用案例
Flux在商业场景中的表现已经达到了生产可用级别,以下是一些典型的应用案例:
案例1:电商产品图批量生成
需求:某跨境电商需为200个SKU生成白底产品图和场景图
解决方案:
- 拍摄每个产品1张基础照片
- 用Flux Img2Img + Inpainting移除原有背景
- 用Flux生成不同场景背景(家居、户外、办公室等)
- 如需品牌一致性,训练品牌风格LoRA统一视觉调性
成本:约$20 API费用 + 2小时人工 vs 传统拍摄$10000+ / 数天周期
案例2:营销素材快速制作
需求:社交媒体运营需要每天产出3-5张不同风格的推广图
解决方案:
- 编写5-10个品牌相关的基础Prompt模板
- 每天更换产品/活动信息、调整风格词和色彩关键词
- 利用Flux.1 Schnell快速批量生成候选图(每张2秒)
- 挑选最佳候选,用Flux.1 Dev/Pro重新生成高质量版本
成本:约$5/天 API费用 vs 外包设计$200-500/天
案例3:UI/UX设计辅助
需求:设计团队需要快速出界面概念图和Icon素材
解决方案:
- 用Flux生成界面概念图("modern dashboard UI with dark theme, data visualization, sidebar navigation")
- 用ControlNet + 线稿图控制布局,Flux填充视觉细节
- 批量生成不同风格的Icon("minimalist line icon set for [category], consistent style, 64x64 grid")
- 用Img2Img在已有设计基础上快速迭代修改方案
成本:几乎为零(Schnell快速生成) vs 图库购买$500+/月
案例4:海报与印刷品设计
需求:活动海报需要包含特定文字和视觉元素
解决方案:
- 利用Flux.1 Pro优秀的文字渲染能力,直接在Prompt中指定文字内容
- 用结构化Prompt控制文字位置和风格("text 'SUMMER SALE' at top, bold sans-serif")
- 生成后在Photoshop中微调文字位置和排版细节
- 输出高分辨率(1024x1024或更大)用于印刷
成本:约$0.1/张 vs 设计师$100-300/张
Flux.1 Pro为商业闭源模型,通过API调用可用于商业项目。Flux.1 Dev为非商业开源(非商用许可),商业项目需联系Black Forest Labs获取授权。Flux.1 Schnell为Apache 2.0许可,可自由商用。务必根据项目性质选择正确的模型版本。
与其他工具对比
2026年AI图像生成领域群雄逐鹿,Flux如何与Midjourney、DALL-E 3、SDXL等主流工具相比?
| 特性 | Flux.1 Pro | Midjourney v6 | DALL-E 3 | SDXL |
|---|---|---|---|---|
| 图像质量 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
| 文字渲染 | ✅ 优秀 | ⚠️ 一般 | ✅ 良好 | ❌ 差 |
| Prompt理解 | 非常强 | 中等 | 非常强 | 较弱 |
| 人体结构 | 优秀 | 优秀 | 良好 | 一般 |
| 可定制性 | ✅ LoRA/ControlNet | ❌ 有限 | ❌ 无 | ✅ 全面 |
| 本地部署 | ✅ Dev/Schnell | ❌ 仅云端 | ❌ 仅API | ✅ 完全开源 |
| 价格 | $0.003-0.05/张 | $10/月起 | $0.04/张 | 免费(需GPU) |
| 生成速度 | 2-15秒 | 30-60秒 | 10-20秒 | 5-30秒 |
| 开源 | 部分(Schnell) | ❌ | ❌ | ✅ 完全 |
- 追求极致美学:Midjourney v6仍然是最省心的选择,审美风格独特
- 需要精确控制:Flux.1 Pro/Dev + ControlNet,可控性最强
- 文字+图像一体化:Flux.1 Pro文字渲染最佳,DALL-E 3次之
- 预算有限/本地部署:Flux.1 Schnell或SDXL,完全免费
- 快速原型/头脑风暴:DALL-E 3(通过ChatGPT),交互最方便
- 专业工作流/批量生产:Flux.1 + ComfyUI,自动化程度最高
常见问题与资源
生成质量问题
Q:Flux生成的图像出现色彩过饱和怎么办?
A:降低guidance_scale到2.5-3.0,或在Prompt中加入"natural colors, subtle tones"等引导词。过饱和通常是引导系数过高导致的。
Q:文字渲染不准确怎么办?
A:确保使用Flux.1 Pro或Dev(Schnell文字能力较弱)。文字用引号包裹,Prompt中明确指定字体风格和位置。短文字(1-3个词)成功率最高,长文字可能需要多次尝试。
Q:生成的图像有噪点或模糊?
A:检查步数是否足够(Dev至少20步)、guidance_scale是否过高、分辨率设置是否正确。如果使用量化模型,尝试切换到更高精度的版本。
部署与性能问题
Q:显存不够运行Flux怎么办?
A:依次尝试以下方案:(1) 使用NF4量化版本(8-12GB显存);(2) 使用GGUF量化(6-8GB显存);(3) 启用ComfyUI的显存优化选项(offload到CPU);(4) 使用云端API(Replicate/Fal.ai)替代本地部署。
Q:Flux生成速度太慢?
A:使用Schnell模型(1-4步),启用torch.compile()优化,使用TensorRT加速,或切换到云端API获得A100/H100的推理速度。
Q:ComfyUI中Flux工作流报错?
A:确保ComfyUI更新到最新版本,Flux相关节点包已安装(ComfyUI-FluxTools等),模型文件路径正确,T5-XXL编码器已下载。常见问题是缺少T5编码器或版本不匹配。
授权与合规问题
Q:Flux可以用于商业项目吗?
A:Flux.1 Schnell(Apache 2.0)可自由商用;Flux.1 Dev仅限非商业用途,商用需单独授权;Flux.1 Pro通过API调用默认包含商用授权。如果项目有商业性质,请优先使用Pro或Schnell。
Q:用LoRA训练的模型版权归谁?
A:LoRA权重本身属于训练者,但生成图像的版权归属取决于基础模型的许可。使用Flux.1 Schnell生成的图像可自由使用;使用Flux.1 Dev生成的图像在非商业场景下可使用。
推荐资源
📚 学习资源
- 官方文档:Black Forest Labs GitHub - 模型下载和基础文档
- ComfyUI工作流:ComfyUI Flux示例 - 官方示例工作流
- LoRA训练:Fal.ai LoRA训练 - 一键云端训练
- CivitAI:CivitAI Flux模型 - 社区LoRA和模型分享
- Reddit社区:r/LocalLLaMA - 本地部署讨论和技巧分享
🛠️ 工具与平台
- Replicate:replicate.com - 最便捷的API调用
- Fal.ai:fal.ai - 实时生成+LoRA训练
- HuggingFace:huggingface.co - 模型下载+在线Demo
- ComfyUI:GitHub - 最强大的本地工作流
- Forge/WebUI:支持Flux的Stable Diffusion WebUI分支,适合SD用户迁移
- Midjourney完整指南 - 对比理解不同工具的Prompt差异
- AI视频生成指南 - 将Flux图像作为视频生成素材
- ChatGPT完整指南 - 用AI辅助优化Flux Prompt