先把判断顺序定下来:人脸崩坏,通常是提示词里人物描述和风格词挤在同一句,以及画幅比例跟镜头类型不匹配,两件事叠加造成的。不要同时动提示词和画幅去试,那样改完一轮还是不知道是谁的锅。做法是分开验证——先固定画幅,只改人物描述的句子长度;再固定长度,把脸相关描述从风格词里拆出来单独成句;最后换画幅重跑同一段提示词,看人物在画面里占多大。每轮只动一处,编号留存,三五轮下来就能得到一组可复现的写法。
判断路径建议按「句子长度 → 描述拆分 → 画幅占比」三步走。固定画幅只改句子长短,能判断信息过载是否影响脸部;把脸、五官、表情从风格词里单独成句,能判断两类词是否互相干扰;换画幅跑同一段提示词,能判断崩坏是描述问题还是构图本身不给脸留位置。每轮只动一处变量并编号留档,输出要记录人脸占画面比例、五官是否可辨认、有无多手多眼这类可观察项。边界:本文给的是排查方法和记录模板,不保证某组参数在所有模型版本和分辨率下都稳定,具体效果需结合你本地的出图环境和模型版本确认。
固定画幅,只改人物描述的句子长度
这一步只回答一个问题:画面问题是不是跟提示词太长太挤有关。操作上,画幅、镜头、风格词、采样参数全部不动,只准备两版人物描述——一版把人物信息压进一句长句,一版拆成几组短句,其他部分逐字相同。这样跑出来的差异,才基本能归到句子长度上。
长短两版可以这样写,注意除人物描述外的部分保持一致,方便对照:
# A 版:人物描述全部挤在一句里
portrait of a young woman with long black hair, wearing a beige knitted sweater, standing in a soft-lit room, gentle smile, looking at the camera, warm color grading, cinematic lighting, 85mm lens, shallow depth of field
# B 版:把同一批信息拆成几组短句,其余词不变
a young woman
long black hair, beige knitted sweater
gentle smile, looking at the camera
soft-lit room, warm color grading, cinematic lighting
85mm lens, shallow depth of field
同一画幅下,两版各跑几轮,记录项固定成几列:版本(A/B)、画幅、人脸是否可辨认、五官是否变形、有没有多手多眼、构图是否被裁掉半个头。通常句子越挤,模型越容易把风格词当成主体描述的一部分,脸和背景一起被拉扯;拆成短句后,人物信息更靠前更独立,脸部稳定性往往更容易观察。这只是排查方向,不是绝对结论,要看你用的模型版本和分辨率。
把人脸描述从风格词里拆出来单独成句
这一步回答第二个问题:人物描述和风格词混在一起,是不是互相干扰。做法是在上一轮选出的相对稳定的句长基础上,只做一次拆分——把脸、五官、表情这类词从风格词串里移出去,单独放一行,其余词原样保留。
拆句前后可以这样对照,被移走的词在注释里标出来:
# 拆句前:脸和风格混在一句
a young woman with clear facial features, calm expression, warm color grading, cinematic lighting, film grain
# 拆句后:把脸相关描述移出去单独成句
# 被移走的词:clear facial features, calm expression
a young woman
clear facial features, calm expression
warm color grading, cinematic lighting, film grain
重跑时同样只改这一处,画幅和其他词都不动。观察重点是人脸细节有没有变清楚、表情是否更可控、风格词带来的色调或质感是否还保留。通常脸相关描述独立后,模型对五官的注意力更集中,风格词也不容易被误读成脸部特征;但这也会让某些镜头感变弱,需要你看是想先保人还是先保氛围,再决定是否分两句保留。
换画幅重跑同一段提示词,对比人物占比
到这一步,提示词文本已经固定,只换画幅。目的是区分:之前的崩坏到底是描述问题,还是画幅本身没给脸留够空间。比如方形、竖版、宽幅三种比例,对人物在画面中的占比影响很直接,尤其是半身或特写类构图。
同一段提示词在两个画幅下的对照可以这样记:
# 提示词保持一致,只改画幅参数
画幅 1:1:1 -> 人物约占画面高度 60%,头部留白较多
画幅 2:9:16 -> 人物约占画面高度 80%,头部接近上边缘
记录项:人脸占画面比例、是否被裁切、背景是否抢主体、五官是否可辨认
如果同一段提示词在竖版里脸正常、在方版里脸崩,问题更偏向画幅和构图的匹配,而不是描述本身;如果两个画幅下都崩,那大概率要回到前两步检查句子长度和描述拆分。换画幅时不要再顺手改风格词,否则又变成多变量混在一起,无法归因。
把每轮结果按改动点编号留存
最后一件事是把上面三轮整理成可复现的对照记录,避免凭印象来回改。编号规则建议用「轮次-改动类型」:R1 改句长,R2 改描述拆分,R3 改画幅;同一轮内再分 A/B 两个版本。每轮只保留一个变量,其他字段一律照抄上一轮。
记录模板可以直接照这个结构写:
轮次:R1-A
改动点:人物描述压成一句长句
画幅:1:1
提示词:见 R1-A 文本
输出观察:人脸是否可辨认 / 五官是否变形 / 有无多手多眼 / 人物占画面比例
轮次:R1-B
改动点:人物描述拆成短句(其余与 R1-A 相同)
画幅:1:1
输出观察:同上
轮次:R2-A
改动点:把脸相关描述从风格词中移出,单独成句
画幅:1:1(与 R1 相同)
输出观察:同上
轮次:R3-A
改动点:画幅从 1:1 改为 9:16(提示词与 R2-A 相同)
输出观察:同上
这样留档后,回看时能直接看出哪一轮开始人脸稳定、哪一处改动引入了新问题。如果某轮结果明显更好,就把它作为下一轮的基准,继续只动一个变量往上叠;如果越改越乱,退回上一轮基准重来,而不是继续在混乱的提示词上加词。具体画幅参数、模型版本和分辨率差异,仍需结合你自己的出图环境确认。