配图总偏题的常见原因不是模型能力,而是约束给得不够:提示词只写了主题,没写主体在做什么、镜头在哪、画面里不该有什么,画幅又没固定。判断顺序建议先用控制变量法——提示词原文不动,只切换画幅连续出几张,看主体是否被裁切、偏移或缩小;如果画幅固定后偏题依旧,再回到提示词补动作和镜头。反过来一上来就改一大段描述,等于同时动了两个变量,出图变好了也说不清是哪一步改对了。
适用场景:同一段提示词在不同批次出图里主体位置、裁切范围不一致的配图任务。操作动作:先固定提示词只改画幅,再单独增加动作词、镜头词和排除词,每次只动一类。验证方式:每次出图记录画幅、改动项和结果描述,观察偏题是否随画幅变化而消失。风险边界:排除词在部分模型上对否定语义处理不稳定,画幅比例也不是所有平台都开放同一组选项,需要结合当前工具确认可用范围。
排查顺序建议按下表执行,一步只改一个变量,改完立刻出图对比,不要连着改两三项再回头猜原因。
| 顺序 | 动作 | 观察点 | 判断 |
|---|---|---|---|
| 1 | 固定提示词,横版、竖版、方形各出一张 | 主体是否被裁切、是否挤到边缘 | 构图随画幅明显变化,先把画幅定下来 |
| 2 | 选定一个画幅,只补主体动作 | 主角在做什么是否画出来了 | 动作仍然抽象,继续补场景物件 |
| 3 | 只补镜头词(景别、机位) | 主体大小和画面占比 | 位置仍不可控,调整描述顺序或换画幅 |
| 4 | 追加排除词 | 背景杂物、错误主体是否减少 | 两次出图对比,减少才保留 |
| 5 | 记录版本并复用 | 能否按同结构换主题 | 结构可复用即视为稳定 |
固定提示词只改画幅看构图变化
这一轮的目的不是挑出最好看的那张,而是确认画幅是不是偏题的来源。做法是把提示词逐字冻结,只切换横向、竖向、方形三种画幅,其他一概不动,然后按下面这张表逐条记录。记录时用相对位置描述,比如主体在画面中间偏左、头部接近上边缘,比写“构图不好”更容易复现。
| 画幅 | 主体占位 | 是否被裁切 | 背景与留白 | 是否可用 |
|---|---|---|---|---|
| 横版(宽大于高) | 偏左 / 居中 / 偏右 | 头顶、脚部、手部是否缺失 | 两侧留白多还是少 | 可 / 需调整 |
| 竖版(高大于宽) | 偏上 / 居中 / 偏下 | 左右手臂是否出框 | 上下留白多还是少 | 可 / 需调整 |
| 方形(宽高接近) | 居中 / 偏移 | 四边是否有元素被切 | 整体是否拥挤 | 可 / 需调整 |
如果三种画幅下主体都跑偏,说明问题更可能在提示词;如果只有某一种画幅频繁裁切主体,先固定能用平的那一种,再去改描述。不同平台控制画幅的字段名不一致,常见的是尺寸类参数或界面里的比例预设,具体名称以你当前使用的工具为准,不要照搬其他平台的写法。
在提示词里补主体动作与镜头位置
抽象主题直接交给模型,模型只能自己猜画面,猜出来的东西自然每张都不一样。把主题翻译成一个可以被画出来的动作,再补上镜头在哪、拍多近,偏题会明显收窄。动作词写的是身体部位和时间点,镜头词写的是景别和观察角度,两者分开补,方便判断是哪一类词起了作用。
主题式写法(偏抽象,容易跑偏):
一个关于专注的封面图
补动作后的写法:
一名学生坐在木质书桌前,右手握笔在纸上写字,身体微微前倾,
左手压住纸边,桌面上只有一盏台灯和一本摊开的笔记本
再补镜头词:
中景,相机与桌面大致同高,从主体侧前方约三十度拍摄,
背景是虚化的书架,主体位于画面中间偏左
场景补充词清单可以按这几类准备,换主题时逐类替换,不要整段重写:
- 主体动作词:握笔写字、双手托起、侧身抬头、回头转身、迈步走下台阶。
- 镜头与景别词:特写、中景、全景;俯拍、平拍、仰拍;侧前方、正后方。
- 光线与时间词:清晨斜射光、室内台灯照明、阴天漫射光。
- 场景物件词:木质书桌、摊开的笔记本、玻璃水杯、墙角绿植。
- 主体位置词:位于画面左侧、居中、靠近下三分之一处。
这里的词都是描述性语言,不是模型参数,不要把它们当成必填字段;作用是把主题收窄成一个具体画面,数量以能描述清楚为止,堆太多同类修饰反而会互相干扰。
用排除词去掉不想要的元素
背景杂物和多余主体,通常靠排除词压下去,但排除词不是万能的,需要出两次图对比才知道有没有效。写法上一般放在提示词末尾,用简短的否定短语,不要写成完整句子;中文提示词平台可以直说不要出现什么。不同模型对否定语义的处理差别较大,是否生效只能靠对比确认。
英文排除词示例(追加在提示词末尾):
no text, no watermark, no logo, no extra people,
no duplicate subject, no clutter background
中文排除词示例:
画面中不要出现文字、水印、标识、多余人物和重复主体,
背景保持简洁,不要堆放无关物品
验证方法是两次出图:第一次带排除词,第二次把排除词整段删掉,其他字句、画幅、参数完全不动。两次结果放在一起看三件事——背景杂物数量、是否出现重复主体、原主体有没有被排除词影响而变样。如果两次差别看不出,说明这段排除词在当前模型上作用有限,就不要再加长它,把篇幅还给主体动作描述更划算。
记录每次改动与出图差异
做到这一步,偏题基本已经能定位。剩下的工作是把每次调整记下来,形成一条可以照抄的路径,下次换主题时只替换主体和场景词,结构不动。记录粒度不用太细,抓住提示词版本、改动项、画幅、结果描述四列就够用。
| 版本 | 本次只改了什么 | 画幅 | 结果描述 | 是否保留 |
|---|---|---|---|---|
| v1 | 原始主题句,无动作词 | 横版 | 主体偏小、背景出现文字 | 否 |
| v2 | 补主体动作与桌面物件 | 横版 | 动作对了,主体挤在右下角 | 部分保留 |
| v3 | 补中景与机位角度 | 竖版 | 主体居中,两侧留白过多 | 否 |
| v4 | v2 加排除词 | 横版 | 文字消失,仍有多余人物 | 保留动作与镜头,弃用该排除词 |
纯文本记录模板(写在配图目录的说明文件里即可):
日期 | 版本 | 改动项 | 画幅 | 主体位置 | 误元素 | 结论
示例:
— | v4 | v2基础上加排除词 | 横版 | 中间偏左 | 无文字,仍有人影 | 保留动作词,换排除词再试
表格里没被保留的版本不要删掉,它们是你判断“哪类词有用”的证据。下次遇到新的偏题,先翻这张表,确认旧结构里已经验证过的动作词和画幅能否直接套用;只有套不上的部分才需要重新做一轮画幅对照。