转写后语气变正式,通常不是识别层把字听错了,而是转写之后的“后处理/改写”层在替你换词、合并句子;其次是输出格式模板或提示词模板在起作用。判断顺序建议:先看有没有专门的润色、改写、正式化开关,再看输出模板和 prompt,最后才动识别层的语言、标点和分段选项。调整前先固定一段口述样本,否则每次换文本就无法归因,也就没法判断是哪一层改的。
适用于 SayIt 或同类转写工具把口述改得过书面、删掉口头禅的场景。操作上先定位“改写强度 / 风格 / 提示词”相关设置,用同一段带口头禅的口述做前后对照,一次只改一个选项并重载配置。验证看语气词是否保留、句式是否被压缩、是否出现正式词替换,而不是只换了同义词。若项目未暴露改写强度选项,先按原样转写再人工整理;识别语言、采样率、降噪这类设置不要为了“更口语”而随意改动。
录一段语气随意、带口头禅的口述作为固定样本
固定样本的目的,是让“设置有没有生效”变成可比较的问题。建议在同一设备、同一麦克风距离、同一安静的房间里录,语速按你平时说话的速度,不要刻意放慢;句间停顿保持在自然聊天的节奏,大约半秒到一秒即可。刻意一字一顿会让识别层多做补全,反而干扰判断。
可用下面这段作为固定口述文本,重点是保留“嗯、那个、就是”这类口头禅和临时改口:
嗯,那个,我跟你说一下,就是昨天那个事吧,我本来是想着先跟他对一下,
结果他直接就把那个方案发出去了,我说实话当时有点懵。
每次调整设置后,重新口述同一段,不要换词,不要照着书面语念。样本在整轮排查期间保持不变,这样前后输出才有对照基础。
在设置界面或配置文件中定位与书面化/改写相关的选项
先找层级,再改值。多数转写工具的正式程度不由识别层决定,而是由后处理那一层决定。图形界面里可以按页面名称找:设置 → 转写/语音 → 后处理;设置 → 输出/格式化;设置 → AI 润色/改写/风格;或者单独的提示词、Prompt 页面。关注这些关键词:润色、改写、正式、书面、风格、语气、模板、摘要、system prompt。
如果项目用配置文件,下面只是通用骨架,键名以实际项目为准,不要直接照抄就当生效:
# 占位示例,键名以实际项目为准
postprocess:
enabled: true
rewrite_strength: medium # 常见取值如 none/low/medium/high
style: casual # 也可能是 tone 或 formality
remove_fillers: false # 是否删除“嗯、那个”等口头禅
prompt: |
保留说话人的原意和口语语气,不要改写成书面表达。
output:
format: plain # 而不是带模板的 markdown 或报告式输出
若配置是 JSON 结构,思路相同:找到控制改写强度、风格语气、是否去口头禅的键,把占位名替换成项目里实际存在的键。定位不到就先记录当前值,再决定改哪一项,不要全局搜一个词就批量替换。
用最小改动原则逐项调整并重新口述同一段话
一次只改一个设置。候选顺序建议按影响力排:改写强度 → 风格/语气 → 是否删除口头禅 → 输出格式模板 → 提示词模板。改完保存,重载配置或重启进程,再录同一段话。
- 记录当前值和改动后的值,其他选项保持不动。
- 按实际启动方式重载或重启,例如下面这类占位命令,具体以项目的启动方式为准:
sayit `--config` ./config.yaml `--reload`
# 或
systemctl `--user` restart sayit.service
- 重新口述固定样本,把输出贴到同一个记录文件里,和上一版并排存。
- 只在这个设置确认有影响之后,再去改下一个。
记录格式可以很简单:设置项、旧值、新值、输出差异一句话。比如“改写强度 high 改 low:口头禅回来了,长句变短”。不要一次把风格、标点、模型全换掉,那样输出变了也无法归因到具体哪一项。
对比调整前后的删词、改词和句式变化
判断设置是否真的放开了口语,不要只看同义词替换。下面三类变化要分别观察和记录:
| 变化类型 | 调整前常见表现 | 调整后应观察 |
|---|---|---|
| 语气词保留 | “嗯、那个、就是”被整体删掉 | 原样保留,或只删明显重复冗余 |
| 句式缩短 | 两个短句被合并成一个完整长句 | 保持原来的断句和临时改口 |
| 正式词替换 | “发出去”被换成“提交发布” | 仍用原词,必要时只做明显纠错 |
把调整前后的输出并排贴出来,在句子级别标记上面三类变化。如果只是“懵”变成“困惑”这种同义替换,说明改写层仍在生效,正式程度没有真正放开。若语气词保住了但句子仍被拉长,问题更可能在输出格式模板或提示词模板,而不是改写强度本身。
记录找不到相关设置时的替代做法
如果翻遍设置界面和配置文件,都没有改写强度、风格、去口头禅这类选项,可以按“先保口语、再整理”的分段流程处理,不要用识别层的设置硬凑。
- 口述时保持自然语速,转写先按原样导出,不开摘要或润色。
- 导出后只做三件事:删除重复词、保留连接词和语气词、修正明显识别错误。
- 需要书面稿时,另存一份再人工改,不要覆盖原样转写的文本。
- 每条改动留下痕迹,方便回看哪些是工具改的、哪些是自己改的。
不要为了“更口语”去乱动的设置:识别语言、音频采样率、降噪与增益、麦克风选择。这些影响的是“听没听对”,不是“改没改写”。标点开关可以试,但关闭后长句断句通常会变差,一般不太划算。只有确认后处理确实存在且可配置时,才值得继续调风格相关的选项。