人物越往后越不像,通常不是「参考图」和「提示词」二选一的问题:参考图决定起始长相有多确定,提示词决定后面几帧模型被允许往哪个方向飘。多数情况下两者同时起作用,只是权重不同。判断顺序建议是先把提示词、比例、时长固定,只换参考图跑一遍;再固定参考图,只把提示词中的人物描述删减跑一遍。两轮对照下来,走形出现的位置和表现如果几乎一样,问题更可能在参考图;如果换图后立刻稳定,就该回头收敛提示词。
先分离变量,再决定改素材还是改文案。固定提示词、比例、时长,只换参考图跑两段短镜头:走形位置不变,优先重做参考图的取景、朝向、背景与光线;换图后明显变稳,再把提示词里的人物描述压到最少可辨识字段。若同一镜头反复在同一处崩,且换图也压不住,说明这类动作图生视频本来就不适合,改用首尾帧或分段短镜头更可控。
用同一张参考图跑两段短镜头做对照
这一步的目的是把变量压到只剩参考图一个。固定项包括:完全相同的提示词文本、相同的画面比例、相同的时长(建议先取 2–4 秒,短镜头更容易看清漂移发生在哪一段)、相同的随机种子或至少在记录里记下种子、以及相同的模型与版本参数。变量只留参考图,或者只留提示词,一次只动一个。
结果记录不要只看「像不像」这种主观结论,按帧留存更可靠。每段镜头导出三张图:首帧、约中段一帧、末帧,并把参数快照一起存下来,第二次对照时才能确认自己没顺手改到别的参数。
镜头编号: A1
参考图: ref_A.png(半身 / 正面 / 均匀光)
提示词: (与 A2 逐字一致)
比例: 9:16 时长: 4s 种子: 固定或记录
导出帧: first.png / mid.png / last.png
走形位置: 首帧 / 中段 / 尾帧
走形表现: 脸型 / 发际线 / 服装主色 / 其他
注意一个容易被忽略的前提:确认当前配置里首帧参考图确实被用上了。有些工作流把参考图放在图像输入位,有些放在首帧位,放错位置时表现就是「提示词拼命描述也不像」,此时换多少张图都没用,需要结合环境确认输入位置后再做对照。
检查参考图里人物的取景与光线是否一致
参考图本身带进来的人物漂移,靠提示词是压不住的。可以按下面几个判断点逐项看:
- 主体占比:人物在画面里过小时,模型能用的面部像素有限,后续越走越糊。半身或近景构图通常更稳,全身远景适合做环境镜头,不适合做需要保持长相的镜头。
- 朝向:参考图是侧脸或大角度低头,而目标镜头需要正脸,模型只能自己「补」一份正面五官,补出来的东西和原角色是两回事。参考图朝向应尽量贴近目标镜头的机位。
- 背景干扰:背景里出现第二个人脸、海报、镜子反光、AI 生成图常见的杂乱纹理时,这些特征有可能被混进角色。换一张背景干净、或背景与角色明暗分离明显的图,往往比改提示词有效。
- 明暗差异:参考图是强逆光、低照度或面部大面积阴影时,五官解析本身就不充分。同一角色尽量用同一组灯光条件下的图,前后镜头不要一张棚拍一张夜景。
如果对照实验里走形位置在两轮中保持不变,说明参考图这条线没有排除掉,先解决取景和光线,再谈提示词。
把提示词里的人物描述压到最少可辨识字段
描述越多,互相打架的机会越大。建议只保留三类可辨识字段:发型(长度+颜色+是否刘海这类结构信息)、服装主色(主色加单件类型,例如「酒红针织上衣」)、体型与年龄段。其余修饰词可以先删。
- 保留:短发的长度与颜色、上衣主色、体型、必要的机位与光线。
- 删掉:情绪形容词堆叠(「忧郁又坚定」这类)、多套服装描述、多个配饰、互相矛盾的发型描述(同时写短发和长发及腰)、把镜头运动与人脸描述混写在同一句。
短发深棕、酒红色针织上衣、中等偏瘦体型,正面半身,室内均匀光,镜头固定。
删减时一次只删一类,跑完再看走形是否变化。全删一次跑,很难判断是哪一类描述在拖后腿。
在生成记录里比对走形出现的位置
把首帧、中段、末帧三张图并排放,只看三个最稳的锚点:脸型轮廓、发际线与发色分界、服装主色块。不要拿眼睫毛、手指这类细节当判断依据,它们在任何图生视频里都容易崩。
- 首帧就不像:问题在起始条件,先检查参考图是否真的被使用、输入位置对不对,再检查提示词里是否出现了和参考图矛盾的人物描述。
- 中段开始不像:通常是动作跨度大、人物被遮挡、或镜头方向发生变化,属于过程性漂移,优先缩短单镜头时长。
- 末帧才不像,且逐帧渐变:典型的累积漂移,先尝试把镜头拆短、或在提示词中保留字段再收敛一轮,看看能否把漂移起点往后推。
如果三段镜头在同一位置、同一表现上重复崩,基本可以判定这条路径对当前素材不适用。
什么时候该放弃图生视频改做首尾帧
出现下列场景时,继续调参考图和提示词的收益通常有限:动作幅度大(转身、跑动、大幅度手势)、遮挡多(手挡脸、道具从面部前穿过)、需要换角度(参考图是正面,镜头要侧面或背面)。判断依据可以用最小成本试:同参数连跑两三次,每次都在同一处崩,且换一张更干净的参考图也没改善,就不要再加描述词了。
替代路径建议改成首尾帧——给出同一角色的首帧与尾帧两张图,让中间过渡由模型补;或者拆成两到三段短镜头分别生成再拼接,每段只做一个小动作,让角色在同一朝向、同一光线下完成有限位移。需要注意的是,首尾帧方案把一致性压力转移到了两张起止图上:如果首帧和尾帧本身就不像同一个人,问题会原样出现在结尾,所以这两张图仍然要按前面几节的取景、光线标准来做。