如果一句话里塞进三四个动作,Chatterfly 通常只会稳稳处理其中最靠前、表述最明确的那一个,剩下的部分要么被当成背景描述,要么被理解成另一个动作的对象。用户常见的困惑是“我明明说全了,它只做了一半”,这多半不是设备坏了,而是长句里的动作顺序、连接词和指代关系在语音转写与意图判断这两个环节被打散了。把说话方式改成一次只说一件事,是先能自己控制、也最容易验证的一步。
判断方向:把 Chatterfly 当成“一次执行一件事”的执行器,而不是能自己拆解复合句的助手。适用场景是唤醒后连续下达的日常操作;操作动作是把长句按“动作词+对象”拆成 5 字以内的短指令,逐条说出;验证方式是核对转写文本与实际动作是否一致;边界是麦克风环境、唤醒灵敏度和模型版本都会影响结果,拆句只能减少歧义,不能修复“本来就没听清”的问题。
准备一组短指令(5字以内)和一组长句指令(20字以上)
先固定一组对照指令,目标是同一件事,只是说法长短不同。这样后面记录时才能判断差异来自句子长度,而不是来自任务本身难度。建议在安静环境下先读一遍,确认自己吐字清楚。
| 短指令(≤5 字) | 长句指令(≥20 字) | 两者共同的目标 |
|---|---|---|
| 打开设置 | 帮我打开设置然后找到蓝牙并连接我的耳机 | 进入设置并连上蓝牙耳机 |
| 打开蓝牙 | 你帮我看一下现在蓝牙是不是开着的没开就打开 | 打开蓝牙开关 |
| 连接耳机 | 我耳机没连上你帮我连一下之前配对过的那个 | 连接已配对耳机 |
| 调低音量 | 帮我把声音调小一点因为现在有点吵 | 降低音量 |
| 设个闹钟 | 我明天早上七点要起床你帮我定个闹钟吧 | 新建 7:00 闹钟 |
这组指令不用一次全试完,先挑两三条自己最常用的即可。长句里刻意保留“然后、帮我、因为”这类口语成分,是因为它们最容易暴露识别问题。
分别对 Chatterfly 说出两组指令,记录转写文本和实际动作
每说一条,先看屏幕上或日志里显示的转写文本,再看设备实际做了什么。转写文本是判断“听错”还是“理解错”的分界线:转写正确但动作错了,属于意图理解问题;转写本身就缺字漏词,属于拾音或识别问题,这时换短句往往也救不回来。
| 序号 | 指令类型 | 原始说法 | 转写文本 | 转写是否与原文一致 | 实际动作 | 动作是否执行完整 | 响应时间(秒) |
|---|---|---|---|---|---|---|---|
| 1 | 短指令 | 打开蓝牙 | (填写) | 是 / 否 | (填写) | 是 / 否 | (填写) |
| 2 | 长句 | 帮我打开设置然后找到蓝牙并连接我的耳机 | (填写) | 是 / 否 | (填写) | 是 / 否 | (填写) |
| 3 | 分步 | 见下一节逐条记录 | — | — | — | — | — |
响应时间可以用秒表或手表粗略记,不需要精确到毫秒,只要能对比出“长句明显更慢或干脆没反应”就够了。同一组指令建议至少说两三遍,排除一次偶然的拾音失败。记录时注意只写你真正看到的结果,不要凭印象补全。
将长句拆分为多个短指令依次说出,观察执行结果
拆分原则很简单:一条指令只包含一个动作词和一个对象,每步只留一个目标,说完一步、确认一步,再进入下一步。不要用“然后”“顺便”“等一下再”把两件事串在一句里。
以“帮我打开设置然后找到蓝牙并连接我的耳机”为例,可以拆成:
- 打开设置
- 打开蓝牙
- 连接耳机
如果设备里配对过多副耳机,“连接耳机”可能不够具体,这时把它换成“连接 XX 耳机”这样的“动作词+具体对象”,仍然控制在一条指令内。每步说出口后停一下,听到提示音或看到状态变化再继续。
| 步骤 | 说出的短指令 | 转写文本 | 是否执行成功 | 是否需要重说 |
|---|---|---|---|---|
| 1 | 打开设置 | (填写) | 是 / 否 | 是 / 否 |
| 2 | 打开蓝牙 | (填写) | 是 / 否 | 是 / 否 |
| 3 | 连接耳机 | (填写) | 是 / 否 | 是 / 否 |
如果某一步失败,只重说这一步,不要把整段长句再说一遍。重复整段长句通常会得到同样的结果,还会把已经成功的前置动作打乱。
对比长句和分步说的失败模式
长句失败通常不是单一原因,而是几种模式叠加。下面的现象可以直接对着自己的记录勾选,右侧给出对应的分步改写。
| 失败模式 | 常见现象 | 长句原文 | 分步改写 |
|---|---|---|---|
| 只执行前半段 | 设置打开了,但没有继续找蓝牙 | 帮我打开设置然后找到蓝牙并连接我的耳机 | 打开设置 → 打开蓝牙 → 连接耳机 |
| 只执行最后一步 | 直接跳到连耳机,前面的入口动作没做 | 先开蓝牙再帮我连上耳机 | 打开蓝牙 → 连接耳机 |
| 动作错序 | 先做了后面的动作,前面的被跳过 | 先把音量调小再播歌 | 调低音量 → 播放音乐 |
| 连接词被当成内容 | “然后”“顺便”出现在转写文本里,被当成搜索或说明 | 然后顺便帮我把闹钟定到七点 | 设个闹钟 → 七点 |
| 对象丢失或指代不清 | “我的耳机”“那个”被当成泛指,连错设备或找不到 | 帮我连一下之前配过的那个 | 连接 XX 耳机 |
判断属于哪种模式,看转写文本最直接:转写里保留了被跳过的动作词,多半是指代或顺序问题;转写里根本没出现某个动作词,那就是拾音或长度截断问题,环境安静一些或靠近设备再试一次。
形成日常使用的话术模板
把上面验证过的做法固化成三步:先唤醒,再短指令,最后看反馈。模板不用记,照着说就行。
第一步 先唤醒
说出唤醒词,等提示音或指示灯变化后再开口
第二步 短指令
一句话 = 动作词 + 对象,控制在 5 字以内
例:打开蓝牙 / 调低音量 / 设个闹钟
第三步 确认反馈
看到状态变化或听到回应后,再下达下一步短指令
没成功就只重说这一条,不重复整段长句
场景一,连接蓝牙耳机:唤醒后说“打开蓝牙”,等确认;再说“连接耳机”;如果有多副耳机,改成“连接 XX 耳机”。
场景二,早上设闹钟:唤醒后说“设个闹钟”,等设备进入设置状态;再说“七点”;听到确认后再离开。如果设备要求单独保存,就补一句“保存”。
这套话术的边界也要清楚:环境噪声大、设备离得远、唤醒词没听准时,短指令同样会失败,这时先解决拾音问题,而不是继续换措辞。至于哪些短指令在自己设备上被接受,需要用前面那张记录表逐条确认,不同设备支持的指令集和唤醒行为会有差别。