GenEvolve 的“自我演进”只有在能指出它改了哪一处输入时才算成立。把固定初始描述连跑三次,先看每一轮的输入文本有没有被改过:改过,画面差异就归输入;没改过而画面仍在变,差异通常来自采样随机性、参数或模型版本,不属于可复现的演进。判断顺序建议固定为——先锁输入,再锁随机源,最后才把剩下的差异放进待确认清单,而不是直接写成“模型自己进化了”。
先用输入记录把人力改动与自动变化分开:输入被改过的轮次,画面差异归输入;输入一致而画面不同,先归随机性。三项对照只用于归因分类,不做审美评价。在输入和随机性都没排除之前,不要把差异写成“自我演进”,更不要拿单张图下结论。
固定初始描述后连续跑三次,逐轮记录输入是否被手工改过
这一步的目的是切断“看起来在演进”的错觉,把变量收敛到可校验的最小集合。每轮开始前先记下输入全文,跑完立刻记下输出图标识,中间不要顺手改词。字段建议固定成一张表,缺哪一项就在备注里写“未记录”,不要留空当默认值。
| 记录字段 | 记录方式 | 为什么必须有 |
|---|---|---|
| 轮次序号 | run-01 / run-02 / run-03 | 后面所有对照都按轮次对齐 |
| 输入描述全文 | 原样粘贴,不改标点 | 判断是否被手工改过的唯一依据 |
| 输入指纹 | 对输入文本取哈希前若干位 | 快速确认两轮输入是否逐字一致 |
| 是否手工编辑 | yes / no | 把人力改动与自动变化分开 |
| 编辑内容与时间 | 改了哪个词、什么时候改的 | 回溯差异来源时能对上画面变化 |
| 模型与版本标识 | 页面或日志里显示的名称 | 版本切换也会改变画面,需单独排除 |
| 采样参数 | temperature、top_p、seed 等,界面不暴露就写“不可控” | 决定随机性是否可被固定 |
| 输出图标识 | 文件名或页面 ID | 三张图能一一对应到轮次 |
| 备注 | 报错、重试、中途取消 | 避免把中断重跑算成一轮演进 |
输入指纹可以用本地命令核对,执行位置在存放输入文本的目录:
sha256sum run-01.txt run-02.txt run-03.txt
# macOS 可用:shasum -a 256 run-01.txt三段哈希完全一致,说明这三轮输入没被手工动过;只要有一段不同,就要在对照表里把那一轮单独标出来,不能继续和另外两轮混着比较。
把三张图按构图、色调、主体轮廓三项并排对照
三项拆开看,是为了避免“整体感觉不一样”这种无法归因的描述。每项都写成可复述的短句,同一项由两个人分别描述,如果两人说法接近,说明这项的变化是客观的;如果两人说法差得远,就先记为“无法判断”。
| 对照项 | run-01 | run-02 | run-03 | 明显变化的判断依据 |
|---|---|---|---|---|
| 构图 | 主体位置、画面占比、留白、视角 | 同左 | 同左 | 三张中至少两张在“主体处于画面哪个区域、占多少”上说法不同,且变化方向可复述 |
| 色调 | 主色相、冷暖倾向、明暗对比、光源方向 | 同左 | 同左 | 主色相或光源方向出现可指认的偏移,而不是“感觉更暖” |
| 主体轮廓 | 轮廓边界、比例、姿态、细节密度 | 同左 | 同左 | 轮廓能被一句话概括成不同形状,或姿态发生结构性改变 |
“基本不变”也有依据:三项里有两项以上可以用同一句话涵盖,例如“主体居中、暖色、轮廓同形”。这类情况下,画面差异通常落在纹理、噪点、光影细节上,不足以支撑“演进”的判断。对照时把三张图按相同尺寸并排,不要一张放大一张缩小,否则构图结论会失真。
用同一轮输入重复跑两次,观察输出是否出现差异
挑一轮输入完全没改过的记录,用同一份输入、同一组参数再跑两次,标记为 A1、A2。这一步只回答一个问题:在同一输入下,画面本身稳不稳。
| 对照组 | 输入是否手工改过 | 参数是否一致 | 输出差异描述 |
|---|---|---|---|
| 原轮 run-02 | no | 按记录 | 基准 |
| A1 | no | 与原轮一致 | 记录三项对照结果 |
| A2 | no | 与原轮一致 | 记录三项对照结果 |
表述边界要克制:如果 A1 与 A2 出现差异,只能说明“在该输入与参数下存在随机性影响”,不能据此推出任何比例或概率;如果 A1 与 A2 完全一致,也只能说明“本次未观察到差异”,不能反证随机性不存在。随机性只能解释同一输入内部的差异,解释不了跨轮出现的规律性变化——跨轮一直朝同一方向变,通常另有来源,需要回到输入记录和版本记录里找。
把无法用输入改动或随机性解释的差异单独列出
排除了输入改动,也排除了同一输入下的随机波动之后,剩下的差异不要直接归到“自我演进”。先列清单,再补信息。
| 待确认差异 | 已排除的解释 | 需要补充哪一轮的什么信息 |
|---|---|---|
| 色调整体偏移且跨轮保持 | 输入未改、A1/A2 未出现同类偏移 | run-02 的完整参数与模型版本标识 |
| 轮廓比例变化 | 输入未改 | 该轮是否有自动改写提示词的中间记录 |
| 构图整体挪位 | 随机性未复现 | 该轮的轮次日志、状态文件或版本快照 |
补充信息的动作很具体:翻 GenEvolve 每一轮的状态文件或日志,看有没有“自动改写输入”“继承上一轮提示词”的动作记录;没有这类记录,就不能说它演进的是提示词。日志里如果只记了输出图,建议在下一次运行时把输入文本和参数一起写进去,否则这条差异会一直悬着。到这里仍无法解释时,把它标为“来源未知”即可,这比强行归因更接近事实。
按已确认的变化来源,决定下一轮是改输入还是沿用原输入
判断条件只有一条:三项对照里出现的具体变化,能不能对应到输入文本中的某个词或某句描述。能对应上,说明是输入在起作用;对应不上,说明这一轮不应改动输入。
- 分支一,差异可追溯到输入改动:以改后的输入为新基线,下一轮只动一个变量,比如只加“侧光”不改姿势,保持其余文本逐字不变,然后重复第 1 节和第 2 节的记录动作,确认这个变量是否稳定复现。
- 分支二,输入未改、差异来自随机性:沿用原输入继续跑,先把 seed 固定(界面或配置允许时),把同一输入多跑几次看分布,而不是因为某一张图好看就回头改词;如果参数不可控,就在记录里注明“不可控”,并把“好看”当作选图,不当作演进证据。
- 分支三,差异来源未知:暂停修改输入,先补齐该轮的参数、版本和日志信息,再决定下一轮动作。
这两类处理分支都要落回同一份记录表,否则下一轮又会回到“看起来变了但说不清为什么”的状态。需要结合本机环境和 GenEvolve 实际暴露的配置项确认哪些参数可固定,能固定的就先固定,不能固定的写清楚,别用推测填空。