⬡ 节点流学园

⚙️ 02-核心机制

提示词工程:权重、结构与负面写法

核心prompt权重负面提示词结构化

一句话定义

ComfyUI 的提示词 = 送进 CLIP Text Encode 的一段文本,支持 (词:权重) 的加权语法与嵌套括号;写好提示词的诀窍不是堆词,而是结构化表达 + 让编码机制为你工作(前置重点、控制 token、负面克制)。

为什么重要

同一模型、同一参数,提示词写法不同可以差出两个模型的观感。这是零成本、立刻见效的杠杆,也是迁移到任何新模型都带得走的能力。

前置知识

CLIP 与条件编码:文字如何变成方向(编码机制与 77 token 切块)。

核心概念

加权语法(SD 系 CLIP 编码器支持):

(word)            → 默认放大 1.1 倍
(word:1.3)        → 精确权重 1.3(有效区间约 0.5-1.5,过高崩图)
((word:1.2))      → 嵌套叠加(不推荐,难追溯)
[word]            → 减弱 0.9 倍

结构化写法模板(SD 系逗号短语风格):

[质量/风格前缀], [主体+动作], [环境], [构图], [光影], [细节补充]
例: masterpiece, best quality, a young woman reading a book,
    cozy cafe interior, upper body shot, soft window light, shallow depth of field

负面提示词基线(少而准):

lowres, bad anatomy, bad hands, watermark, signature, text, jpeg artifacts

原理与机制

  • 权重的作用层:权重调整该 token 的注意力强度(CLIP 与条件编码:文字如何变成方向 的"音量旋钮");>1.5 常出现颜色溢出/撕裂,因为引导向量离开模型训练分布。
  • 前置效应:77 token 切块后跨段注意力不互通,且 CLIP 对前段 token 注意力天然更高——主体永远放最前。
  • 自然语言 vs 短语列表:T5 编码器家族(Flux/SD3)吃长句,描述完整场景的段落效果优于关键词堆;CLIP 家族(SD1.5/SDXL)相反,短语+逗号更对味(见 Flux 架构与工作流:cfg=1 的新物种)。
  • 负面机制的边界:负面只能"拉开距离"而非"精准擦除";把 50 个词塞负面会互相稀释,8-15 个高相关词足够。

直观类比

提示词像给画师的口头需求单:画师按顺序听(前重后轻),你喊得越响(权重)他越用力——但全篇都在喊就等于没喊(全部 1.4 = 没有重点);负面需求单是"不要这些",写满一页他反而抓不住主次。

实例与案例

  • 修手三段法:先结构化描述姿势(hands holding a cup, fingers visible)→ 不行再加负面 bad hands, extra fingers → 还不行上局部重绘(局部重绘(Inpainting):只改该改的地方)或修复类后处理,别无限加权重。
  • 风格迁移词包:从 Civitai 模型页抄作者推荐的触发词与负面基线(模型资源获取与社区),先复现再改造。
  • 长场景(Flux):"A wide cinematic shot of an old bookstore at dusk, warm light spilling from the windows, a cat sleeping on the counter…" 整段自然语言,一次说清。

常见误区

  • 权重当音量无限推:1.8 以上大概率崩;调构图用 ControlNet/重绘比堆权重可靠。
  • 负面堆"违约清单":几十个 negative 词互相稀释;保持克制,按需增删。
  • 中文直填 SD 系模型:编码对齐差(CLIP 与条件编码:文字如何变成方向),先译英文;想用中文选中文友好家族。
  • 关键词堆砌无视结构:1girl, masterpiece, sunset, 8k, beautiful, cafe, detailed 顺序混乱 → 主体权重被稀释;按模板分层写。
  • 把画质词当万能药:8k, masterpiece 在弱模型上无效,模型能力上限才是天花板(模型资源获取与社区 选模型)。

自测题

  1. (word:1.4) 与 ((word)) 的效果差异与可维护性?
  2. 为什么主体要放在提示词最前?
  3. 写负面提示词的"克制原则"是什么?为什么?
  4. Flux 上写提示词,风格与 SD1.5 有何不同?
参考答案
  1. 前者精确指定 1.4 倍、可读可调;后者嵌套约 1.1×1.1≈1.21 倍且层级难追溯,推荐前者。
  2. CLIP 前段 token 注意力更高,且 77 切块后跨段不互通,前置保证主体被完整编码且权重足。
  3. 8-15 个高相关词;负面靠差值拉开距离,堆太多相互稀释、还会牵连无关维度。
  4. 用完整自然语言长句描述场景(T5 长上下文),而非 SD 系的逗号短语风格。

与其他知识点的关系

延伸阅读

  • ComfyUI 文档 Prompting:docs.comfy.org
  • Civitai 各模型页的"Recommended settings"区块(作者实测参数)

前置知识

CLIP 与条件编码:文字如何变成方向

关联知识点

CFG 与负面引导:引导强度的数学IPAdapter 与参考图控制:让图像自己当提示词模型资源获取与社区