做数字人播报短片,口型漂移和画风前后不一致,通常不是生成能力的问题,而是制作顺序的问题。稳妥的顺序是:文本切句 → 配音对齐 → 口型确认 → 画风定型。判断依据只有一条——把返工代价最大的步骤放到最后。改画风往往牵连整段重新生成,会把已经对好的口型一起回退;切句和配音的返工只影响局部,所以先做便宜的部分。
如果在灵绘AI里生成的口播视频口型对不上、画风中途变化,先别调画风,也别反复重试生成。先把文案按停顿切成单句,单独录一条配音并逐句记下起止时间,再把同一份文本和同一份配音放进一次生成里跑,确认唇形起止点无误后,最后才调画风与参考图。适用场景是单人播报类短片;只要配音语速、音色或句子内容有改动,口型就必须回到配音环节重新确认,这一步没有省法。
把播报文案按停顿切成单句文本
切句的目的只有一个:让每一句文本能一一对应到一段语音。整段文案直接生成,一旦某处口型偏移,你没有可定位的锚点,只能整体重来。
切句规则:在自然停顿处断开,逗号、句号、问号、感叹号、换行都算断点。长句内部没有标点时,建议在语义完整处补一个逗号再切;语气词和连词不要单独成句。
单句字数上限:中文播报单句建议控制在 20–30 字以内,超过 40 字的口播句听感已经在赶,口型也更容易在句中段跟不上。这个范围需要结合语速和配音音色确认,快语速下应再收短。切分后的文本片段示例:
句 01:大家好,这里是产品更新速览。
句 02:今天讲三件事。
句 03:第一件,素材库支持按项目分组。
句 04:第二件,导出可以选清晰度。
句 05:第三件,评论区的问题我们单独回。
切完后保留编号,编号会一直用到配音和口型核对环节。
先出配音并逐句记录起止时间
配音一定要先出,而且要单独出。它提供的是时间基准,后面所有关于“唇形有没有对上”的判断都要对着这份时间表做。
句 01 00:00.0 - 00:03.2
句 02 00:03.2 - 00:04.6
句 03 00:04.6 - 00:09.1
...
查看方法:在播放器里逐句试听、读当前时间戳;或者把音轨放进带波形显示的音频编辑器或剪辑软件,按波形上的静音段找句与句的边界,读出的数值就是该句起止点。没有波形图时,用播放器逐句暂停记时间戳也能得到可用数值,但改口型前建议用波形再核一次。
时长与字数的粗略对应:中文播报常见在每秒 4–6 个字,20–30 字的句子大致是 4–6 秒。如果某句实测时长明显偏离这个范围,先怀疑切句粒度不对,而不是先怀疑口型驱动。
在灵绘AI里把同一套文本与配音放进一次生成
这一步的核心约束是:唇形驱动使用的语音和文本必须来自同一份素材。不要改完文本又上传另一条配音,也不要拿 A 版配音配 B 版文本。
上传顺序建议:先上传配音音轨,再贴入对应的分句文本,最后确认人物形象与画风;具体顺序以页面逻辑为准,但“配音和文本成对”的对应关系不能变。页面上与语音、口型相关的设置项名称以你当前界面的实际名称为准,不同版本差异较大,常见叫法有:音频/配音上传、文本或台词输入、口型或唇形同步、对齐方式、生成时长。改动这些项之前,先把当前配置截图或记录,方便回退。
生成后检查唇形起止点的方法:按第 2 步的时间表逐句定位到视频对应位置,看句首第一个字发音时嘴是否已张开、句尾最后一个字收音时嘴是否已闭合。偏移常出现在句首和句中换气处,句尾反而最容易对上。如果整段偏移均匀,多半是音轨与视频起点没对齐;如果只有某几句偏,多半是这几句的分句或时长记录有误。
口型确认无误后再调画风与参考图
画风在灵绘AI这类工具里通常参与生成过程,所以改画风往往等于重新生成一遍,已经对好的口型会被一起回退,这就是把画风放到最后的原因。
改画风后必须重跑的步骤:重新生成画面 → 按时间表再核一遍唇形起止点 → 确认无误后再定稿。如果画风只是后期色调或滤镜、不参与生成,口型一般不受影响,但仍建议用同一份时间表再看一遍关键句。前后两版结果的对照方式:保留上一版输出文件和它的时间表,按相同时间点逐句对照唇形起止点是否一致,不要凭整体观感判断。
需要回到配音环节的情况有三种:配音的语速、音色或停顿被改过;某句文本被增删或改写;分句边界被重新切过。这三种都会让原来的时间基准失效,必须先重导配音、重新记录起止时间,再走一次生成与口型确认。