Muse Image 出人像糊、手指多指或者脸型漂移时,先别继续往提示词里加 quality、8k、best quality 这类词,它们并不指定任何可画出来的东西。更有效的顺序是把原始描述拆成主体、动作、环境三行,逐行看权重被哪一类信息占掉,再按行改写。下面五个小节就是一套完整的排查顺序:切分归属、替换抽象词、主体独立成段、用两次生成定位问题层、固化成可复用模板。
适用场景:单人出图时脸和手细节糊、多人出图时人物互相融合、同一段描述两次生成差异明显。操作动作:把原始长描述按主体、动作、环境切三行,逐句标注归属,把情绪和风格词换成可见元素,再让主体单独成段。验证方式:同一段描述连续生成两次,按主体、光线、背景三层记录差异落在哪一层。边界:如果拆完后画面仍随输入参考图变化而变糊,问题更可能来自输入图本身,提示词改写覆盖不到。
把原始描述按主体、动作、环境切成三行
先拿一段典型的原始描述,不要修改内容,直接逐句标注归属。例如:
一个很酷的赛博朋克风格的忧郁女孩站在下雨的霓虹街头回头看着我,
氛围感很强,电影感,高级质感,8k
把它拆开,每一小段标上它到底在说谁:
| 原文片段 | 归属 | 词性 |
|---|---|---|
| 一个很酷的 | 主体 | 形容词 |
| 赛博朋克风格的 | 环境 | 形容词 |
| 忧郁女孩 | 主体 | 形容词 + 名词 |
| 站在下雨的霓虹街头 | 环境 | 名词 + 形容词 |
| 回头看着我 | 动作 + 视角 | 动词 |
| 氛围感很强 / 电影感 / 高级质感 / 8k | 无归属 | 抽象词 |
同一句里形容词和名词混在一起时,模型很难判断“很酷”修饰的是人还是街景,人脸分到的绘制权重会被风格词分走。上面这段里数量最多的类别是形容词:很酷、忧郁、赛博朋克、高级,除忧郁外基本没有对应的可见元素,这通常是先要处理的部分。
删掉不可拍摄的抽象词,换成具体可见元素
抽象词不是说不能用,而是它必须翻译成能落在画布上的东西。替换时保留原意,不要顺手加进风格完全相反的元素:
| 抽象词 | 保留的原意 | 可拍摄的替换写法 |
|---|---|---|
| 很酷 | 冷感、不笑 | 面无表情,视线直视镜头,下颌线收紧 |
| 忧郁 | 情绪低落 | 眉毛微垂,视线略微向下,嘴角平直 |
| 赛博朋克风格 | 霓虹加夜间 | 紫红与青色霓虹灯管,湿滑沥青路面有反光 |
| 氛围感很强 | 有雾、有光边 | 空气中有薄雾,人物背后有逆光轮廓 |
| 电影感 | 布光与画幅 | 浅景深,侧逆光,背景虚化 |
| 高级质感 | 材质细节 | 皮肤保留毛孔纹理,服装是哑光羊毛 |
替换完再读一遍:如果某个词删掉后画面不会少任何东西,它大概率就是干扰项。面部和手部这类高频糊掉的区域,优先用可数的具体描述,比如“五指自然分开”而不是“手势优雅”。
把主体单独成段,减少与场景描述的互相干扰
主体段单独占一行,里面至少写清面部、姿态、视角三类要素。这三类写全了,人脸和手才有明确的落点。
主体:
面部:亚洲女性,25 岁左右,单眼皮,唇部自然闭合,保留皮肤纹理
姿态:半身,肩膀放松,右手抬到脸侧,五指自然分开
视角:平视,正面偏 15 度,人物占画面约一半
动作:
回头看向镜头,动作停在回头的中途
环境:
雨夜街道,紫红与青色霓虹灯管,湿滑路面有反光,空气中有薄雾
面部写五官特征和皮肤处理,而不是写“漂亮”;姿态写身体朝向和手的具体位置,手部位置写不清就是多指和粘连的常见来源;视角写机位高度、人物角度和构图占比。主体段比环境段还短时,通常就是糊的主因,先把主体段补到与环境段同等长度再看结果。
同一段描述生成两次,记录差异落在画面哪一层
两次生成保持其他条件不变:同一段描述、同一张输入图(如果有)、同一组可见参数。只记录变化,不改描述。表格可以按下面的字段填:
| 轮次 | 种子是否固定 | 主体层(脸 / 手) | 光线层 | 背景层 | 变化最大的一层 | 初步判断 |
|---|---|---|---|---|---|---|
| 1 | 未固定 | 脸型稳定,手指数量不对 | 侧逆光方向一致 | 霓虹颜色一致 | 手 | 动作描述对手部约束不足 |
| 2 | 未固定 | 脸型稳定,手仍然多指 | 光向一致 | 背景细节位置漂移 | 手 + 背景 | 手改姿态写法,背景删掉多余元素 |
判断规则可以按层归因:两次差异集中在脸和手,说明主体段信息不足,继续补面部与手部描述;差异集中在光线方向和明暗,说明环境段里的光描述太抽象或自相矛盾,改成单一光源方向;差异集中在背景细节,说明背景描述过载,删到只留两三项。如果两次都用了同一张输入图、且脸部每次都糊,就要先检查输入图的分辨率与人物脸部占比,再回头怀疑提示词。
把改好的描述写回模板供下次复用
把这次调好的结构固定下来,下次只替换场景部分,避免每次重新引入不一致的脸部描述。
主体:
面部:{年龄/性别/脸型/五官特征/皮肤处理}
姿态:{半身或全身} + {身体朝向} + {手部动作与位置}
视角:{平视或俯视} + {人物角度} + {构图占比}
动作:
{一个明确动作,并写清停在哪个瞬间}
环境:
场景:{地点} + {时间}
光线:{光源方向} + {色温} + {是否逆光}
背景:{需要保留的元素,不超过三项}
花括号里的内容都是可替换部分,其中视角里的构图占比、环境里的场景和背景优先替换;面部与姿态建议沿用同一套写法,只在确实需要换人时改动。这个模板的作用是让每次调试只改一个变量,改完仍糊就先看输入图,再考虑模型对多人或大幅动作的固有限制,提示词层面到这一步就够了。