SayIt 在采访场景下保留语气词的配置选项

文章导读
SayIt 默认转写链路里,“语气词被删”通常发生在文本整理阶段,而不是语音识别阶段。采访场景要保留“嗯、啊、那个、就是”这些词,处理方向是两个:关闭智能处理,或者改写智能处理的提示词。下面按判断、配置、验证三步拆开。
📋 目录
  1. 先判断语气词丢在哪一层
  2. 方案一:关闭智能处理,保留原始口语
  3. 方案二:修改智能处理提示词,保留语气词并保留标点整理
  4. 辅助配置与验证清单
  5. 常见问题
A A

SayIt 默认转写链路里,“语气词被删”通常发生在文本整理阶段,而不是语音识别阶段。采访场景要保留“嗯、啊、那个、就是”这些词,处理方向是两个:关闭智能处理,或者改写智能处理的提示词。下面按判断、配置、验证三步拆开。

判断:保留语气词的关键在 SayIt 的智能处理环节。默认提示词会要求模型输出通顺书面语,从而删掉填充词。采访场景建议关闭智能处理,或把“不得删除语气词”显式写进自定义提示词。具体设置项名称需要以当前打开的 SayIt 版本为准。

先判断语气词丢在哪一层

SayIt 的转写大致分两段:第一段由 Whisper 类服务产出带语气词的原始文本,第二段由智能处理用大模型整理成通顺句子。判断方法很简单:暂时关掉智能处理,再录一句带“嗯”的短话。如果原始转写里有“嗯”,说明问题出在整理阶段,改提示词或保持关闭即可;如果原始转写里没有,那是识别提示词或热词配置问题,和智能处理无关。

方案一:关闭智能处理,保留原始口语

在设置面板找到“智能处理”开关并关闭。之后转写结果不再经过大模型整理,语气词、重复、半截话都会原样保留。适合后期人工整理素材的采访用途。

  • 适用场景:访谈逐字稿要求忠实原话,标点和分段可以后期补。
  • 操作动作:设置 → 智能处理 → 关闭。
  • 验证方式:说一句“嗯,我觉得这个方案可以”,确认输出包含“嗯”。
  • 风险边界:口语误听不会被纠正,错别字和不通顺句会变多。

方案二:修改智能处理提示词,保留语气词并保留标点整理

如果仍希望 SayIt 帮忙加标点、分段,就不要直接关闭智能处理,而是把“保留语气词”写进自定义提示词。以下提示词可以复制到智能处理对应的提示词输入框,按需要替换“采访”相关表述:

SayIt 在采访场景下保留语气词的配置选项
你是一名中文采访速记整理员。请把语音识别文本整理成带标点的句子。
要求:
1. 保留“嗯、啊、呃、那个、这个、就是”等语气词和口头禅,不要删除或替换。
2. 不改写原话,只补标点和分段。
3. 若同一个语气词连续重复(如“那个那个”),保留一次即可。

输入文本:
{text}

说明:{text} 是占位符,实际填写时按提示词输入框的规则来,多数版本不需要手动写这一行。若当前版本提示词框长度受限,可以缩短为一句:“保留所有语气词,不要删除口头禅,只加标点。”

  • 适用场景:需要保留语气词,又想省去手工整理标点的采访素材。
  • 操作动作:把提示词贴进智能处理的自定义提示词输入框,保存后生效。
  • 验证方式:用同一段二十秒录音对比,确认语气词仍在,且标点和分段正常。
  • 风险边界:不同模型对提示词的服从程度不同;提示词过长或措辞含糊时,仍可能被部分删除。

辅助配置与验证清单

两个辅助手段值得一起做。第一,Whisper 识别提示词(通常在语音识别相关设置里)可以写:“这是一段中文采访录音,说话口语化,会出现‘嗯’‘啊’‘那个’等语气词,请原样转写。”它能在识别阶段降低语气词被吞掉的概率。第二,把采访对象常说的语气词和口头禅加进自定义词库或热词,能提高这些词的识别准确率。需要提醒的是,词库只影响识别层,拦不住智能处理的删除动作;两处要配合使用。

SayIt 在采访场景下保留语气词的配置选项

配置完成后,按下面清单过一遍:

  1. 准备一段十到二十秒、包含至少两处语气词的录音。
  2. 分别用“关闭智能处理”和“修改提示词”两种配置各转写一次。
  3. 检查“嗯、那个、就是”是否出现,是否被替换成“对、好的”等书面词。
  4. 检查句子是否仍自然分段,是否出现整句改写。
  5. 结果稳定后,再把这套配置用于正式采访素材。

常见问题

关闭智能处理后还是没有语气词,怎么办?

说明丢失发生在识别层,不在整理层。检查两处:识别提示词是否明确要求“口语化、保留语气词”;自定义词库是否收录“嗯、那个”这些词。都没效果就换一个模型或接口再试,不同模型的转写习惯不同。

又要保留语气词,又要句子通顺,能兼顾吗?

可以折中:在提示词里写“保留语气词,但连续重复的相同语气词只保留一次”,让整理模型只删重复、不删口头禅。可读性会比纯逐字稿好,但也不会像书面语那样干净,按采访稿用途自己取舍。