手机录音、录音笔和录屏提取出来的音频,能不能直接丢进 SoundWise 转写,取决于两件事:上传入口当前接受的文件格式,以及单文件的时长上限。这两条一般就写在页面上,所以每次转写前先花一分钟核对,比传完一半失败再重来划算得多。下面按上传前核对、切分、校对、导出四步拆开讲,每一步都能在原地验证。
手上有多段来源不同的采访录音时,建议先在上传入口确认格式范围与时长提示,再用 ffprobe 或播放器读出每段的容器、编码、声道和时长,把可能超限的文件单独列出来。超长录音按静音段或话题切换点切开,按固定规则命名后再排队上传;转写完成后逐段校对,并按原音抽检,最后选能回溯的导出格式。具体支持的格式与时长范围以页面实际提示为准,不同账号或版本可能不一样。
在 SoundWise 上传入口核对当前接受的格式
上传页通常会列出允许的扩展名或容器,例如 mp3、m4a、wav、aac 这类常见音频,部分入口也接受 mp4、mov 里的音轨。以页面上实际列出的为准,不要按上一次的经验套用。
- 格式范围:看上传区域下方或右侧的说明文字,把允许的扩展名整行记下来,包括有没有对容器和编码分别提要求。
- 文件选择框:点「选择文件」后,看系统文件管理器默认让哪些文件可选。被置灰或选不中的后缀,基本就是不接受的。
- 被拒提示:如果上传后立刻报错,把提示原文整句复制下来,含错误码或关键字。这是判断「格式不对」还是「时长超限」的唯一依据,凭印象猜容易白折腾。
如果提示指向格式不支持,先用通用工具确认实际容器,再决定转不转。转码示例,把任意输入统一成便于核对和上传的 wav:
ffmpeg -i 采访01.mov -vn -ac 1 -ar 16000 采访01.wav
其中 -vn 表示丢掉视频轨,-ac 1 是单声道,-ar 16000 是采样率。改采样率只影响识别效果,不改变内容;如果页面没有要求具体参数,可以先保留原采样率传一次做对比,再决定是否统一转码。
用播放器或文件信息读出每段素材的时长与编码
时长看两个地方就够:音频播放器进度条显示的总时长,或者命令行里读到的 format duration。两者对不上时,以命令行读数为准。素材多的时候批量读一遍,比逐个点开快。
ffprobe -v error -show_entries format=duration,format_name -show_entries stream=codec_name,codec_type,sample_rate,channels -of default=noprint_wrappers=1 采访01.m4a
关键字段是 duration(秒)、format_name(容器)、codec_name(编码)、channels(声道)。录屏提取的文件常是双声道 48kHz 的 aac,录音笔常见单声道 wav 或 mp3,手机录音多为 m4a。这些差异本身不影响上传,但会影响是否需要先转码。
把读取结果整理成一张待处理清单,字段建议固定为:文件名、来源设备、容器、编码、声道、时长、是否超过页面提示的上限、是否需切分。这一步的产出不是好看的表格,而是明确回答「哪几个文件必须切开」。通常时长明显超限的、体积偏大的、录屏提取出来的长文件,都放进待切分一列,其余的直接排队上传。
把长录音按静音段或话题切换点切成小段
整段上传的代价是:中途失败要全部重来。切成几分钟一段,失败只损失一段,重传成本可控。
切分点的第一依据是静音检测结果,再人工确认一次。示例:
ffmpeg -i 采访全长.m4a -af silencedetect=noise=-35dB:d=1.2 -f null -
输出里的 silence_start / silence_end 就是候选切点。noise 阈值和 d(静音持续秒数)需要按实际底噪调整:安静室内可以收紧,嘈杂环境要放宽,不然会切出大量碎段。没有明显静音的对话式采访,就按话题切换点切:听一遍标记提问轮次切换、受访人换人的位置,或者参考已生成的部分转写里的段落边界,把切点落在句与句之间而不是句子中间。
命名规则建议固定成「日期_受访人_段号_起止时间」,例如 0512_张三_03_002310-003050.m4a。段号两位补零,保证按文件名排序就是播放顺序,上传到页面后顺序不会乱。
切完复查:对每个片段跑一次 ffprobe 看时长,把所有片段时长相加,和原文件时长做一次对比。允许毫秒级误差,差出好几秒通常说明有片段没切出来或者切重了,需要回到切点列表核对一遍。
转录结果按段落逐句校对
机器转写的错,改的顺序比改的数量重要。优先级建议:人名、机构名、专业术语排第一,数字、时间、金额排第二,口语词和语气词排最后。前两类改错会直接影响引用和后续检索,后两类多数可以保留原样。
时间戳对照方法:在转写结果里点某个句子的时间戳,跳回原音那几秒听一遍。判断不了的词,把前后各一句一起听,通常能定下来。人名第一次出现时,建议在方括号里补一个标准写法,例如「[李振国]」,后文统一替换,避免同一人出现多种写法。
修订记录方式:不要只在正文里改。用批注、修订模式,或者单独一张表记「段落号 / 原转写 / 改为 / 依据(时间戳)」。这样第二个人复核时不用重听全部录音,只看改动清单就能确认。
导出文本前确认段落与原音一一对应
交付出去的文本要能回溯到原音,否则对方问「这句是在哪说的」就没法回答。
- 段落编号方式:按上传顺序给每个音频文件编号,段内再按句编号,例如 03-12 表示第 3 个音频文件的第 12 句。编号写进导出文本的段首或行首,导出后核对一次编号是否连续、有没有跳号或重复。
- 抽检段落的选择办法:优先抽三类——含人名或数字的段落、时长特别短的片段(容易在切分时丢内容)、切分点前后紧邻的段落。每类抽一到两段回听即可,不必全听,但抽到的段落要听完整。
- 导出格式的选择依据:给人阅读选带段落结构的纯文本或带时间戳的版本;要给后续检索、对齐字幕,选带时间戳的结构化格式,比如 srt、vtt 或逐行 JSON。选之前先确认接收方能打开哪种,避免导出后再转一次格式。
导出后把文件打开,确认段落编号、时间戳、人名替换都已生效,再发出。到这一步,从上传前核对格式与时长,到导出后抽检,整条链路才算闭合。