一句话定义
FLUX.1 是 Black Forest Labs 的 12B DiT 模型家族:16 通道潜空间 + CLIP-L/T5-XXL 双文本编码器 + 引导蒸馏(cfg 恒为 1,改用 FluxGuidance 节点)——工作流从"Checkpoint 一拖三"变成"UNET+双 CLIP+VAE 三路加载",提示词从咒语变回自然语言。
为什么重要
Flux 代表了 2024 后新模型家族的共性形态(MMDiT/DiT 架构、大文本编码器、蒸馏引导、拆分发布);拿下它,SD3、Qwen-Image 等一众新模型的工作流都是"同款套路"。时效注:2025 年末 BFL 又发布 FLUX.2,规模与编码器再升级,套路上完全一致。
前置知识
SDXL 与多编码器家族:换模型换什么(家族对照表)、采样器与调度器选型指南(调度器)、CFG 与负面引导:引导强度的数学(cfg)。
核心概念
- 三个变体:dev(20 步级,非商用许可)、schnell(4 步,Apache-2.0 可商用)、pro(闭源 API)。
- 三路加载:
UNETLoader(flux1-dev.safetensors → models/unet/) ─MODEL─▶ KSampler
DualCLIPLoader(clip_l + t5xxl_fp8 → models/clip/) ─CLIP─▶ CLIP Text Encode
VAELoader(ae.safetensors → models/vae/) ─VAE─▶ VAE Decode- FluxGuidance 节点:插在条件链上,设置 guidance(推荐 2.5-4,常用 3.5);cfg 固定 1,负面提示词不起作用。
- 精度选择:fp8 权重(约 12GB 主文件)是消费级显卡的常规选择;bf16(约 23GB)质量上限更高;还有更小的 fp4/量化 gguf 生态。
- T5 显存:T5-XXL 编码吃内存,低配机器 ComfyUI 会自动换出;
--lowvram下编码慢是正常现象。
原理与机制
- Rectified Flow 训练:模型学"从噪声到数据的直线速度场",调度器选 simple/beta/sgm_uniform(采样器与调度器选型指南 的实例);schnell 经蒸馏把 20 步压到 4 步。
- 引导蒸馏:dev 把"cfg 放大后的行为"蒸馏进单模型,于是推理不再需要负条件——省一半前向计算,这也是它相对速度优势的一部分。
- T5 长上下文:自然语言整段描述被完整理解,提示词工程的重心从"关键词权重"回到"把话说清楚"(提示词工程:权重、结构与负面写法 的家族差异)。
- Flux Tools 家族:Fill(重绘)、Depth/Canny(控制)、Redux(参考图重混)、Kontext(上下文编辑)——对应工作流换用相应 unet,加载套路不变。
直观类比
SD 系像写电报(关键词+权重+负面三件套),Flux 像写一封完整的信:把场景、光线、情绪、构图用自然语言说清楚即可;而且这位画师"自信心极强"(cfg=1),你要调整的不是监工力度(cfg),而是他出厂设定的"认真程度"(guidance)。
实例与案例
- 标准 dev 工作流(官方模板):三路加载 → 提示词(自然语言)→ FluxGuidance 3.5 → KSampler(euler, simple, 20 步, cfg 1)→ Tiled 解码更稳。
- 低显存方案:fp8 unet + t5xxl_fp8 +
--lowvram;12GB 卡可跑 1024 图,速度换内存。 - 中文用户:Flux 对英文长句最优;要中文优先看 Qwen-Image 家族(原生中文)。
- Flux Fill 修图:重绘工作流换 Fill 模型,蒙版机制同 局部重绘(Inpainting):只改该改的地方。
常见误区
- 把 cfg 调到 7:破坏蒸馏行为,输出劣化;Flux 家族 cfg 恒 1,力度调 FluxGuidance。
- 堆负面提示词:无负向通道,写了也白写;把"不要什么"改写成"要什么"的正向描述。
- 找不到 CheckpointLoader 选项:Flux 多为拆分发布,用三件套加载(模型文件与目录组织);一体化 fp8 checkpoint 也存在但少见。
- karras 惯性:调度器沿 SD 习惯选 karras,不如 simple/beta 贴合其训练分布。
- 显存焦虑症:先 fp8 + lowvram + tiled 解码,再考虑换量化模型;大多数 12GB 卡都能跑。
自测题
- Flux 工作流的三个加载器与对应文件?
- 为什么 Flux 不需要负面提示词?
- schnell 与 dev 的步数与许可差异?
- 提示词写法上 Flux 与 SD1.5 的最大区别?
参考答案
- UNETLoader←flux unet(models/unet/);DualCLIPLoader←clip_l+t5xxl(models/clip/);VAELoader←ae.safetensors(models/vae/)。
- 引导蒸馏把负引导行为并入单模型,cfg=1 无负向通道;调整用 FluxGuidance 的 guidance。
- schnell 4 步、Apache-2.0 可商用;dev 20 步级、非商用许可。
- 用整段自然语言描述场景(靠 T5 长上下文),不依赖关键词权重与负面。
与其他知识点的关系
- SDXL 与多编码器家族:换模型换什么 的对照表在此逐行兑现。
- 模型采样补丁:ModelSampling/RescaleCFG/FreeU 的 ModelSamplingFlux(shift)是 Flux 大分辨率下的常用补丁。
- 模型资源获取与社区 下载 flux 权重时的目录与许可注意。
延伸阅读
- Black Forest Labs 官方页:blackforestlabs.ai
- ComfyUI 官方 Flux 教程:docs.comfy.org(Flux 章节)
前置知识
SDXL 与多编码器家族:换模型换什么采样器与调度器选型指南
关联知识点
模型采样补丁:ModelSampling/RescaleCFG/FreeUCFG 与负面引导:引导强度的数学模型资源获取与社区