一句话定义
ComfyUI 的视频能力有两条技术路线:给图像模型插入运动模块(AnimateDiff,SD1.5 时代方案)与原生视频模型(SVD、Wan、HunyuanVideo、LTX-Video 等,当前主流)——工作流在图像管线外包一层"时间维"。
为什么重要
图生视频是新模型发布最密集的战场;懂视频工作流与图像工作流的"同构关系",你就能低成本跟进每一代新视频模型,也为电商短视频素材(案例研究:电商商品图生产管线)打开生产口。
前置知识
SDXL 与多编码器家族:换模型换什么(家族概念)、KSampler 全参数解剖:seed/steps/cfg/denoise(采样)。
核心概念
- AnimateDiff(历史主力):在 SD1.5 的 UNet 中插入可插拔"运动模块"(motion module),让原本逐帧独立的生成具备帧间连贯性;生态:AnimateDiff-Evolved + Video Helper Suite(custom nodes);支持 LoRA、ControlNet(逐帧控制)与无限长度(上下文窗口滑窗)。
- SVD(Stable Video Diffusion):图生视频,输入一张图 + 运动强度,出 14/25 帧、576×1024 类短片。
- 原生视频 DiT 家族(当前主流):
- Wan 2.x(阿里):文/图生视频,多规格开源,社区生态活跃; - HunyuanVideo(腾讯):高质量开源视频 DiT; - LTX-Video(Lightricks):极快,适合实时/草稿。 - 加载形态与 Flux 类似:unet + text encoder(T5 系)+ vae 三件套,分辨率与帧数是新的参数维度。
- 合成环节:节点输出的是帧序列(LATENT/IMAGE 批量),用 Video Helper Suite 的 VHS Video Combine 合成 mp4/webm,可选帧率、循环。
原理与机制
时间维的三种注入方式:
1. 运动模块:在 UNet 各层插入 3D 注意力(帧间 attention),图像模型"学会"连贯
2. 原生时空 DiT:模型从训练起就同时建模 空间×时间(patch 化的 3D token)
3. 图生视频条件:首帧作为条件帧(SVD/Wan-I2V),后续帧在此基础上运动显存压力 = 分辨率 × 帧数 × 通道,是图像的数倍到数十倍;分段采样、低分辨率生成 + 放大、帧插值(RIFE/滤波)是常见降本组合(性能优化与显存管理)。
直观类比
AnimateDiff 是给逐张作画的画师戴上"节奏器",让他每张画之间互相看一眼;原生视频模型则是天生拍电影的画师,一开始就在"胶卷"上作画;SVD 则是"看剧照拍短片"。
实例与案例
- 老显卡玩视频:AnimateDiff(1.5 家族)+ 512×512×16 帧,8GB 卡可跑;配 ControlNet 逐帧控制动作。
- Wan 图生视频:官方模板 → 商品主图作为首帧 → 运动提示词 → 出 5 秒素材,再进剪辑工具加文案(案例研究:电商商品图生产管线)。
- 快速预览:LTX-Video 低分辨率出草稿,选定方案再上 Wan/Hunyuan 精修。
常见误区
- 帧数当分辨率调:帧数×分辨率联合决定显存,一上来 720p×81 帧必爆;从 480p×49 帧起步逐步加。
- AnimateDiff 套在新模型上:运动模块只适配 SD1.5 系;新家族用原生模型,别混装。
- 忽视帧率与时长关系:16 帧@8fps=2 秒;想要 5 秒素材要 40 帧级产出,显存预算先算。
- 忘了 VHS 合成节点:帧序列图堆满 output 文件夹才发现没合成;Video Combine 是视频工作流的"SaveImage"。
- 一致性焦虑:视频模型的角色一致性仍弱于图像;配合 LoRA/首帧锚定/插帧降低抖动。
自测题
- AnimateDiff 的运动模块插在哪?解决什么问题?
- 原生视频 DiT 与"图像模型+运动模块"的本质差异?
- SVD 的输入输出形态?
- 5 秒 8fps 素材需要多少帧?显存超了先降哪个参数?
参考答案
- 插入 SD1.5 UNet 各层,提供帧间 3D 注意力;解决逐帧独立生成不连贯的问题。
- 前者训练时即建模时空联合分布(原生 3D token);后者是事后给 2D 模型补时间维度。
- 输入单图(可选运动强度),输出 14/25 帧、576×1024 类短视频。
- 40 帧;先降分辨率,再降帧数,最后换低精度/分段采样。
与其他知识点的关系
- 性能优化与显存管理 的显存策略在视频场景是刚需。
- ControlNet:把构图权从模型手里拿回来 逐帧 ControlNet 让动画可控。
- 案例研究:电商商品图生产管线 的短视频素材生产是视频能力最直接的商用场景。
延伸阅读
- Video Helper Suite:Kosinkadink/ComfyUI-VideoHelperSuite
- AnimateDiff-Evolved:Kosinkadink/ComfyUI-AnimateDiff-Evolved
- 各视频模型官方模板:docs.comfy.org 模板库
前置知识
SDXL 与多编码器家族:换模型换什么LoRA:轻量插件的加载与叠加