改词后画面几乎没变化,通常不代表 Craiyon 不认识那条提示词,更常见的情况是:这一轮改动没有真正落在画面主体上,或者同一提示词本身的随机性掩盖了改动。Craiyon 这类文生图工具在网页端每次生成都会重新采样起点,所以“改了一个词、画面还是很像”既可能是词没被识别,也可能只是随机波动。判断顺序建议是:先把改动限制在主体词这一类上,换成更常见的同义说法;再用短句结构重试一轮;最后把两轮结果并排记录下来,看主体是否出现、位置是否相近,再决定是继续换词还是同词多跑几轮。
先别急着判定“这个词无效”。把一轮的改动限制在一类词上,只替换主体名词,句长和其他修饰尽量保持原样,然后连续生成两轮。如果两轮里主体仍然缺席、背景也几乎一样,多半是主体表达没被识别,值得换说法;如果主体出现了、只是位置和背景在变,那就是随机波动,同词多跑几轮更划算。这个判断只在提示词和参数一致时成立,换了模型或调了参数要重新对照。
先确认改的是主体词、动作词还是风格词,一次只动一类
提示词里混着主体、动作、场景、风格几类信息时,一轮改两个以上,画面变化就无法归因。建议先在本地把提示词拆成带标签的几行,把每一类当作一个独立的抽屉。
主体词|a robot
动作词|reading a book
场景词|in a library
风格词|watercolor, soft light标记方法是看这个词删掉之后画面会不会“少一个东西”:
- 主体词:画面里那个“它是谁、它是什么”的名词短语,比如 a robot、a small girl、an airship。删掉后画面通常没有确定对象。
- 动作词:动词或动名词,比如 reading a book、holding an umbrella。删掉后主体还在,只是姿态变了。
- 风格词:画风、材质、年代、光线、构图一类修饰,比如 watercolor、film grain、evening light。删掉后主体和动作都不受影响,主要是色调和笔触变化。
改词时一轮只拉开一个抽屉换内容,其他行逐字复制上一轮。验证方式是把两轮提示词存成文件逐字对比:
printf '%s\n' "a robot reading a book in a library, watercolor" > r1.txt
printf '%s\n' "a machine reading a book in a library, watercolor" > r2.txt
diff r1.txt r2.txt如果 diff 出来只差主体词那一处,画面变化就可以归到主体词上。反过来,如果你只改了风格词、主体却整个变了,那更可能是随机波动,不是词的问题。
把主体词换成更常见的同义说法,再生成一轮
生僻词、学名、行业专有名词是最容易被忽略的一类表达。Craiyon 这类工具对常见英文名词的响应通常更稳定,所以第一轮替换可以先往“更通俗、更接近日常描述”的方向走,而不是继续加修饰。下面三组只是替换方向,不保证一定命中,需要你自己跑一轮看主体是否出现。
| 原主体说法 | 可替换的常见说法 | 替换思路 |
|---|---|---|
| axolotl | a small salamander / a pink water lizard | 冷门学名换成外形描述 |
| barista | a person making coffee / a coffee shop worker | 生僻职业词换成动作加场所 |
| zeppelin | an airship / a big flying balloon | 专有名词换成通用名词 |
操作上建议保留其他行不动,只换主体这一行,连续生成两轮。如果换说法后主体出现了,说明原先那个说法基本没进入画面;如果换说法后主体仍然缺席,问题更可能在句子结构或整体提示词太散,接着做下一节的短句测试。判断“词有没有被识别”不要只看一轮,单轮结果可以是随机失败。
把长句改成“主体+动作+场景”的短句结构
长句里的修饰堆多了,主体信号会被稀释:模型要同时满足多个修饰条件,最后可能把力气花在背景和色调上。可以先压到最简骨架,再用骨架跑两轮。
长句写法(主体夹在中间,前后各一串修饰):
a small girl with red boots holding a yellow umbrella,
standing near a busy street in the rain,
cinematic, film grain, evening light短句写法(主体、动作、场景各一段,风格另起):
a small girl holding a yellow umbrella in the rain,
cinematic light拆解骨架时可以按这个顺序对齐:
主体|a small girl
动作|holding a yellow umbrella
场景|in the rain
风格|cinematic light先用短句连跑两轮,如果主体稳定出现,再把长句里的修饰一段一段加回去,一次只加一类,看加到哪一类之后主体开始消失、变形或者被背景吞掉。这个加回去的过程就是定位“哪部分稀释了主体信号”。如果短句阶段主体就不出现,那就回到上一节继续换主体说法,而不是继续加修饰词。
记录两轮中主体是否出现、位置是否相近、背景是否变化
两轮对照的目的不是给模型打分,而是把“词无效”和“随机波动”分开。建议在跑之前先建一张表,每生成一轮就填一行,别等跑完凭记忆判断。
| 轮次 | 提示词版本 | 主体是否出现 | 主体位置(左/中/右) | 主体占比 | 背景/色调是否变化 |
|---|---|---|---|---|---|
| 第 1 轮 | 原主体说法 | ||||
| 第 2 轮 | 原主体说法 | ||||
| 第 3 轮 | 替换后的主体说法 | ||||
| 第 4 轮 | 替换后的主体说法 |
填写时只记肉眼能看到的东西:有没有那个物体、大致在画面哪个位置、占多大、背景和整体的色调是不是明显不同。判断上可以按下面几条走:同一说法两轮都缺主体、背景也几乎一致,倾向认为主体表达没被识别,换说法;两轮主体都出现、只是位置和背景不同,倾向认为这是随机波动,同词多跑几轮比换词更划算;换说法后主体立刻出现,说明原来的说法基本没起作用;主体每轮都出现、但每次是不同的东西,说明主体词太泛,需要补一个更具体的外形或场景限定。
这套判断只看页面输出,不涉及模型内部参数,所以结论是“目测倾向”,不是概率结论。建议至少跑两轮,条件允许就跑到三轮,成本只是多点几次生成。记录表留在本地,下一次改动作词或风格词时可以直接和这一轮对比,避免每次都从零开始猜。