⬡ 节点流学园

🚀 04-进阶

性能优化与显存管理

进阶显存lowvram性能fp8tiled

一句话定义

显存不足不等于不能跑:ComfyUI 内置分层换入换出(lowvram 族)、分块处理(tiled)、精度降级(fp8/fp16)、注意力后端切换四层降级手段,加上"生成参数瘦身",让 8GB 甚至更小的卡跑起大模型——代价是速度,而非可行性。

为什么重要

显存是 AI 绘画的第一资源约束;会用降级组合,你能判断"我的卡到底能干什么",不用为每代人+升级硬件,也不用被"24G 显存"的帖子吓退。

前置知识

安装与首次启动:三种途径与硬件对照(启动参数)、潜空间与 VAE:压缩的图像世界(tiled 解码)。

核心概念:四层降级手段

1. 启动参数(全局策略)

参数行为适用
(默认)全模型常驻显存显存充裕
--lowvram模型分层换入换出8GB 级跑大模型
--novram更激进换出4-6GB 级
--cpu全 CPU应急验证
--force-fp16强制半精度Mac/省显存

2. 工作流内手段(按需启用)

  • VAE Decode (Tiled) / VAE Encode (Tiled):大图编解码必配;
  • Ultimate SD Upscale 的小 tile:放大时显存恒定(高清放大(Upscaling):两条路线与取舍);
  • 分段采样(Advanced KSampler):复杂工作流拆两段,中途释放。

3. 精度与格式

4. 注意力后端

  • 默认 PyTorch attention → 可选 xformers / sage-attention(需安装,提速明显);
  • Mac(MPS)注意:部分后端不适用,以官方文档平台页为准。

原理与机制

显存占用 ≈ 模型权重(fp8 减半)+ 激活(随分辨率平方增长)+ 帧数(视频)。优化就是在这三项里做减法:权重换格式、激活降分辨率/分块、时间维减帧。lowvram 的本质是把"装不下的层"放在内存、按需搬运——搬运用 PCIe 带宽,所以速度下降但功能完整。

速度优先级: 常驻显存 >; lowvram > novram > cpu
显存优先级: 反之
调优 = 在这条滑杆上找到你的平衡点

直观类比

显存是操作台面积:模型是工具箱(能搬来搬去,就是慢),生成任务是要摊开的图纸(分辨率越大摊得越开)。lowvram = 用小操作台但工具按需从仓库取;tiled = 图纸太大就分格画;fp8 = 工具轻量化改装。

实例与案例

  • 8GB 卡跑 Flux 1024 图:--lowvram + fp8 权重 + Tiled 解码;首图慢(换层),后续有缓存提速。
  • 视频显存预算:480p×49 帧 8GB 卡起步;爆了先降帧再降分辨率,最后 --novram。
  • 批量生产提速:固定工作流只改 prompt 时,缓存让模型加载只发生一次;batch_size 拉满(显存允许内)比逐张队列快。
  • 速度基线测试:同 seed 同参数,记录 512/768/1024 的单图耗时,建立自己机器的"标尺",升级后再对比。

常见误区

  • 显存不足就 --cpu:速度差 10-50 倍,是最后手段不是默认解。
  • Tiled 一切:小图(1024 以下)tiled 无收益反增接缝风险;大图/爆显存时才用。
  • fp8 当无损:fp8 对某些模型有轻微质量影响,交付级输出可对比 fp16 再定(高清放大(Upscaling):两条路线与取舍 的最终放大用高精度)。
  • 忽视缓存红利:频繁改动"上游无关节点"会触发全链重算;把常改的 prompt/seed 放下游、模型加载放上游,吞吐完全不同。
  • Mac 照抄 N 卡参数:MPS 后端行为不同,sage/xformers 等以平台文档为准。

自测题

  1. lowvram 的代价与收益机制?
  2. 显存爆掉的排查顺序(参数→工作流→精度)?
  3. 为什么"常改 prompt 放下游"能提速?
  4. 视频工作流的显存公式三项是什么?优先砍哪项?
参考答案
  1. 收益:小显存跑大模型不崩;代价:模型分层经 PCIe 换入换出,速度显著下降。
  2. 先降分辨率/帧数,再 tiled 化,再降精度(fp8),最后才 lowvram→novram→cpu。
  3. 节点级缓存:下游参数变化不触发上游模型加载/编码重算;改动越靠近输出端,复用越多。
  4. 模型权重+激活(分辨率²)+帧数;先砍帧数,再降分辨率,最后动权重格式。

与其他知识点的关系

延伸阅读

  • ComfyUI README 的显存与参数章节:github.com/comfyanonymous/ComfyUI
  • sageattention 项目页(后端提速)

前置知识

安装与首次启动:三种途径与硬件对照潜空间与 VAE:压缩的图像世界

关联知识点

高清放大(Upscaling):两条路线与取舍视频与动画:AnimateDiff 到开源视频模型故障排查手册:症状→原因→修法