FluxPic 生成的场景图和实物差太多——是提示词描述还是参考图给得不够?

文章导读
先分清两件事:参考图决定模型“看到多少实物信息”,提示词决定模型“按什么景别、什么光位、什么比例去排布”。生成场景图和实物差太多时,不要一次把参考图和描述都改掉,那样无法归因。稳妥做法是拿同一批输入,先只动参考图数量,再只动场景描述颗粒度,把两次输出并排比对,看光线、比例、环境道具分别在哪一轮里收敛。
📋 目录
  1. Ⅰ 从已有输出里挑出与实拍差距最大的几张场景图
  2. Ⅱ 对照实拍与生成图,标出光线、比例、环境道具的差异点
  3. Ⅲ 保持描述不变,只增加参考图数量再生成一次
  4. Ⅳ 保持参考图不变,只细化场景描述再生成一次
  5. Ⅴ 把两次结果并列,确定该补素材还是该改描述
A A

先分清两件事:参考图决定模型“看到多少实物信息”,提示词决定模型“按什么景别、什么光位、什么比例去排布”。生成场景图和实物差太多时,不要一次把参考图和描述都改掉,那样无法归因。稳妥做法是拿同一批输入,先只动参考图数量,再只动场景描述颗粒度,把两次输出并排比对,看光线、比例、环境道具分别在哪一轮里收敛。

先别急着补拍或改描述:把同一批场景图按“参考图数量”和“描述颗粒度”各做一次单变量对照,通常能看出主因。若只加参考图后光线方向、道具位置明显收敛,说明是素材信息不足;若只有细化描述后比例才回到预期,说明是描述颗粒度问题。两项都改仍不收敛,再查画幅比例、机位高度与生成参数是否和实拍不一致。判断依据是逐张对照记录,不是单次观感。

从已有输出里挑出与实拍差距最大的几张场景图

不要把所有生成图拉进分析,先锁定问题样本。挑选标准建议用三条:一是必须是有环境背景的“场景图”,不是白底或纯色底产品图;二是同一批任务、同一组参数下反复出现同类偏差的图,排除偶发;三是实拍原图可查、拍摄参数(机位高度、画幅、光源方向)大致可还原的图。挑 3 到 5 张就够,多了反而难对照。

样本清单要落到可复现的字段,方便下一轮改一个变量后对照。输出编号建议在调用端就写进文件名,例如 scene_001_ref2_descA.png,后缀带参考图数量和描述版本,后面并排看图不用再翻记录。

输出编号画幅/尺寸生成参数(seed、步数、强度等)输入参考图与实拍最大的差距
scene_001_ref2_descA按实际调用值填按调用端日志填2 张(正面 + 侧面)光线方向相反
scene_002_ref2_descA同上同上2 张主体占比偏小
scene_003_ref2_descA同上同上2 张前景道具缺失

参数从调用端日志或任务配置文件里抄,不要凭记忆填。如果调用端没有日志,先补一条“入参 + 输出文件名”的落盘记录,再开始做对照,否则后面两轮没法归因。

对照实拍与生成图,标出光线、比例、环境道具的差异点

把“差太多”拆成逐个可改的项,每项写清实际表现和期望表现。标注时把实拍图和生成图放在同一画布并排看,只记录肉眼可核对的现象,不要写“质感不对”这类无法行动的判断。

差异项实际表现期望表现核对方式
光线方向高光落在左侧,阴影朝右主光来自右侧窗,阴影朝左看主体高光面与地面投影方向
明暗对比整体平光,暗部抬得偏高侧逆光,暗部保留但对比明确对比实拍暗部与生成图暗部细节
色温偏冷白偏暖,接近实拍室内光看墙面与中性灰区域
主体比例主体占画面约一半主体约占画面三分之一量主体边界像素占比
机位透视俯视感明显平视,接近人眼高度看地平线与垂直线收敛
环境道具数量只有主体和背景左前景有茶几,右后有书架逐一点数并标位置
道具位置道具贴在主体正后方道具在画面边缘形成层次看道具与主体的相对位置

这张表是后面两轮对照的基线。哪一项在两轮里先回到期望,就说明那一项主要由该轮改动的变量控制。

保持描述不变,只增加参考图数量再生成一次

描述文本、seed、步数、画幅全部锁死,只增加参考图数量。做法可以是一次只加一张,优先补实拍中信息缺失最大的角度:光线方向不清就补一张能看出主光位置的照片,道具缺失就补一张带环境全景的照片。新增图放进同一个输入目录,重新生成后按同一命名规则输出。

FluxPic 生成的场景图和实物差太多——是提示词描述还是参考图给得不够?
轮次参考图数量其他参数变化点未变化点
第一轮2 张描述 A,其余不变基线基线
第二轮3 张(补侧面/全景)描述 A,其余不变光线方向、道具位置主体比例、机位高度
第三轮4 张描述 A,其余不变按实际输出记录按实际输出记录

记录“未变化点”同样重要。如果加到多张参考图,比例和机位仍旧不对,通常说明这两项不是素材信息量的问题,而是描述或参数问题。验证方式是直接打开输出目录按编号并排看图,别只看缩略图。

保持参考图不变,只细化场景描述再生成一次

把参考图锁在第一轮的 2 张,seed、步数、画幅不变,只改描述文本。细化的方向是补光位、机位、比例和道具位置,而不是堆形容词。可以把描述写成结构化字段,便于下一轮逐项改。

{
  "scene": "室内客厅,主体靠右",
  "light": "主光来自画面右侧窗,侧逆光,阴影向画面左侧延伸",
  "camera": "平视,接近人眼高度,等效约 50mm,无俯视",
  "framing": "主体约占画面宽度三分之一,上方留出墙面",
  "props": ["左前景茶几", "右后书架", "主体正后方无遮挡"]
}

对照时先记细化前的描述原文,再记细化后的字段,最后看输出差异。常见情况是:只细化描述后,光线方向比参考图轮次更容易收敛,但环境道具数量仍可能缺,因为描述里提了而素材里没有对应角度。

描述版本新增/修改的字段对应输出表现是否回到期望
描述 A无,仅一句概览平光、俯视、道具缺失否
描述 Blight、camera、framing光线方向与机位改善按实际输出填写
描述 C在 B 基础上加 props道具数量与位置改善按实际输出填写

把两次结果并列,确定该补素材还是该改描述

判断依据是“哪一轮先让某一项回到期望”,而不是整体观感。同一项在两轮都改善,说明它对两个变量都敏感,优先用成本低的一方,通常先改描述;只有补素材才改善的项,再安排补拍。

差异项对应变量建议动作
光线方向、阴影落点参考图与描述都会影响先细化 light 字段,仍不对再补一张能看清单侧光的照片
色温、整体冷暖多为描述与生成参数细化描述中的光色,必要时调整参数
主体占画面比例多为描述与画幅设置细化 framing,并确认输出画幅和实拍一致
机位透视、俯视感多为描述中的 camera补写机位高度与等效焦距,不改参考图
环境道具数量多为参考图补拍带全景或侧面的参考图
道具相对位置参考图为主,描述为辅先补素材,再在描述中标注左右前后
材质与反射细节多为参考图补近景参考图,描述里只写材质名称

这套判断可以复用:每换一批实拍素材,先挑三张问题图,做一次“只加参考图”和一次“只改描述”的对照,把结果填回差异标注表。两轮都不收敛时,再回头核对画幅、机位高度和生成参数是否与实拍对齐,避免把参数问题误判成素材或描述问题。