一期播客里有口误、口水词和需要补录的段落,想一次交给 Aunio 跑完粗剪加配音,真正要先定的不是提示词写多细,而是两件事:原始录音按可自动化程度分段,音色、语速、停顿三项口径提前固定。分好段,能直接跑的段落才批量交付,抢话和需要重录的段落留人工;口径固定,同一期节目里才不会出现音色和节奏跳变。
把粗剪与配音一次交给 Aunio 并非不可行,前提是把“可自动化”和“需人工确认”提前分开:单人、无交叠、语义完整的段落可以直接跑;抢话、需要补录、语气敏感的段落必须留人工。音色、语速、停顿三项建议先固定,用一段三分钟样音跑通再铺到全篇,导出前逐段核对补录位置与首尾留白。边界在于:涉及重录音频和语气取舍的地方,最终仍要人工听感确认。
按可自动化程度把原始录音切成三段
切段安排在把素材交给 Aunio 之前,用听感和时间码判断,不用先跑模型。判断依据通常看三条:有没有明显口误和反复起句;有没有多人交叠说话;有没有语义断裂、必须重录才能接上的地方。按这三条,原始录音可以落进三类:
- A 段,可直接自动化:单人说话、无交叠、句子完整,只有可删的口水词和短停顿。
- B 段,可跑但必须回听:单人,但停顿长、情绪起伏大、专有名词密集。
- C 段,人工接管:抢话叠音、录制有空响、需要补录、语气带玩笑或反讽。
一段带时间码的切分示例,可以直接照着这四列整理素材:
00:00:08-00:03:52 A 单人开场,无交叠
00:03:52-00:04:10 C 两人同时说话,出现叠音
00:04:10-00:11:30 A 单人主体段落
00:11:30-00:11:48 C 口误后停录,需要补录一句
00:11:48-00:19:05 B 带笑声与长停顿,需回听
00:19:05-00:21:00 A 结尾单人收束
切完建议把 A、B、C 各存成独立文件,文件名带上起止时间码,回退时只重跑某一段,不必整期重来。
在音色与语速设置里固定一套可复用口径
同一期节目音色和节奏跳变,多半是分段跑的时候顺手改了设置。做法是先固定三项,整期复用,并把取值记进当期项目文件:
voice:
timbre: host_a # 选定后整期不改
speed: 1.0 # 相对原速
pause:
sentence_ms: 300
paragraph_ms: 700
验证方式是一次只改一项,其余保持不动,A/B 两版对着听同一句话。如果听不出差别,说明这一项在当前素材上不敏感,就不必动它;如果差别明显,把改动前后的取值和改动时间一并记下,方便以后回退。音色和语速的调整建议放在三分钟样音阶段做,不要在全篇跑完之后再改。
用三分钟片段跑一遍完整流程
三分钟片段的目的不是看效果上限,而是确认流程能跑通、出了问题知道回退哪一项。选一段 A 段加一段 B 段拼接,输入输出对照按下面结构留档:
输入:seg_A_0008_0352.wav 原始单人段落,含若干口误
输入:text_seg_A.txt 对应文本,口误处已标注删除
输出:seg_A.cut.wav 粗剪结果
输出:seg_A.tts.wav 配音结果
输出:run.log 记录本次音色/语速/停顿取值
回退映射可以先按这个方向排查:听感变硬、不像本人,改音色项;整体偏快或偏慢,改语速项;句子之间太挤或拖沓,改停顿项。每次只回退一项,用同一份输入再跑一遍,确认改动确实对应到问题。
逐段核对补录位置与语气
机器产出之后,逐段核对是必须的动作,重点看补录句的插入位置和语气衔接。可以用一张表把结论固定下来:
| 段落编号 | 问题类型 | 是否采纳 | 回退动作 |
|---|---|---|---|
| A-01 | 口水词删除 | 采纳 | 无 |
| A-02 | 补录位置偏移 | 不采纳 | 回退本段,重新标记插入点 |
| B-01 | 笑声被削平 | 不采纳 | 回退停顿取值,保留原音 |
| C-01 | 叠音未处理 | 人工处理 | 不进自动队列 |
核对顺序建议从 C 段开始,再 B 段,最后 A 段。先确认需要人工处理的地方没有被误跑,再看语气敏感段落,最后过一遍可直接自动化的内容。补录句的接入点建议对着文本再听一遍上下文,只有上下文顺了才算采纳。
导出前检查响度与首尾留白
导出母版建议用 WAV,44.1kHz、16bit 或 24bit,平台上传再转 MP3,具体参数按平台要求确认。导出前先跑响度检查,不要只靠耳朵:
ffmpeg -i final.wav -af loudnorm=I=-16:TP=-1.5:LRA=11 -f null -
ffprobe -v error -show_entries format=duration -of default=nw=1 final.wav
首尾留白同样要单独看,用静音检测确认开头没有突然起声、结尾没有被切干净:
ffmpeg -i final.wav -af silencedetect=noise=-50dB:d=0.3 -f null -
留白不足时,只对首尾做补齐,不动中间内容,例如:
ffmpeg -i in.wav -af 'adelay=300|300,apad=pad_dur=0.5' out.wav
返工路径按异常类型拆开:响度不对,先检查是不是对同一段做了两次响度处理,从粗剪源文件重跑一次;首尾异常,只补首尾;某一段语气不对,只回退该段对应的音色或停顿取值,其余段落保持不动。全部通过之后再导出最终交付文件。