先锁定输出格式再追问——Grok 4.7 处理多轮任务的边界

文章导读
连续追问 Grok 4.7 时,最容易踩的坑不是答错,而是回答结构在轮次之间漂移:第一轮给表格,第二轮换成段落,第三轮又悄悄加了列,于是前后结果无法逐列对比。把输出格式当成第一轮就锁定的约束,再让后续每轮只改一个变量,才能看出是哪一条补充信息真正改变了判断。需要先明确一点:锁定格式只保证你有可比的观察面,不保证结论本身可靠。
📋 目录
  1. A 第一轮就指定表格列名和字段含义
  2. B 每轮追问只改一个变量
  3. C 对比同一列在前后轮的变化
  4. D 要求模型显式标注不确定项
  5. E 在格式不变的前提下导出任务清单
A A

连续追问 Grok 4.7 时,最容易踩的坑不是答错,而是回答结构在轮次之间漂移:第一轮给表格,第二轮换成段落,第三轮又悄悄加了列,于是前后结果无法逐列对比。把输出格式当成第一轮就锁定的约束,再让后续每轮只改一个变量,才能看出是哪一条补充信息真正改变了判断。需要先明确一点:锁定格式只保证你有可比的观察面,不保证结论本身可靠。

处理多轮任务时,先在首轮用固定列名把输出结构钉住,再逐轮追问,通常比每轮重写提示词更容易暴露信息缺口。适用场景是需要前后对比结论的任务;操作动作是首轮定义列名与空值规则,之后每轮只改一个变量;验证方式是逐列对比同一单元格并标记新增、删除、改判;风险边界是模型改口不等于事实变化,格式一致也不代表结论可靠,仍要回到依据列核对。

第一轮就指定表格列名和字段含义

让后续轮次可逐列对比的前提,是第一轮就把列名固定下来,并写清每列的含义和空值规则。建议固定四列:结论、依据、不确定项、下一步。结论放一句话判断;依据只允许写当前轮次实际给出的信息,最好带上原句或字段名;不确定项写缺口;下一步写一个可执行动作。

空值要显式区分三种情况:模型没给出的写“未提供”,当前问题不适用的写“不适用”,需要你补充信息的写“待补充:缺什么”。不要留空白,也不要统一填“无”,否则后面无法判断是模型没答,还是确实没有这一项。

从第一轮开始,固定使用下面这张表回答,不要改成段落、编号列表,也不要增加或删除列:
| 结论 | 依据 | 不确定项 | 下一步 |

填写规则:
- 结论:一句话判断,不超过一行。
- 依据:只写本轮实际提供的信息,尽量引用原句或字段名,不要补充未给出的内容。
- 不确定项:没有证据写“未提供”;不适用写“不适用”;需要我补充写“待补充:缺什么”。
- 下一步:一个可执行动作,没有写“未提供”。
- 表格外不要追加解释,除非我明确要求。

验证方式:第一轮返回后,检查表头是否逐字出现这四列;后续每轮返回后,再检查表头是否与上一轮完全一致。如果模型加了新列或把表格换成段落,这一轮建议重跑,而不是在下一轮里补救。风险边界是列名固定只约束表达形式,依据列里仍可能混入推断,所以还需要后面的标注规则。

每轮追问只改一个变量

如果一轮里同时新增反例、扩大数据范围、又换受众,结论变化时你无法知道是哪一个因素导致的。更稳的做法是每轮只改一个变量,其余条件照抄上一轮。常用的变量有三类:只新增一个反例,只新增数据范围或时间窗口,只要求换目标受众。每次追问前,先写下这一轮改动的是哪一项。

轮次 | 改动变量        | 其余条件
R1   | 初始问题        | -
R2   | 只新增一个反例  | 受众、数据范围、输出格式与 R1 相同
R3   | 只新增数据范围  | 反例、受众、输出格式与 R2 相同
R4   | 只要求换受众    | 反例、数据范围、输出格式与 R3 相同

操作动作是在提示词里显式写出“其余条件与上一轮相同”,并把上一轮的关键条件原样贴回,而不是让模型自己回忆。如果使用多轮消息接口,把上一轮的表格原样放在 assistant 消息里,再发出新的 user 消息,格式锚点才不会丢。验证方式是每轮结束后对照上表,确认只动了一项;如果有两项以上变化,这轮结果只能当参考,不能和前轮并列比较。风险边界是模型可能对“相同”做宽松理解,所以条件要逐条写回,别只写一句“其他不变”。

对比同一列在前后轮的变化

格式锁定之后,比较的是同一列在前后轮里的内容,而不是整段回答是否顺眼。建议先记录变化前后的原句,再做标记:新增是上一轮没有、这一轮出现的信息;删除是上一轮有、这一轮消失的信息;改判是同一列从一种判断变成另一种判断。三者分开记,避免混成一句“模型改主意了”。

先锁定输出格式再追问——Grok 4.7 处理多轮任务的边界
  • 结论列:前后轮判断是否不同?若是,记录两轮的完整原句,标记“改判”。
  • 依据列:有没有出现上一轮没给的依据?有则标记“新增”,并注明它来自哪句追问。
  • 依据列:上一轮有的依据是否在本轮消失?消失则标记“删除”,先确认是自己没带上下文,还是模型漏写。
  • 不确定项列:从“未提供”变成具体缺口属于信息增加;从具体缺口变回“未提供”要警惕,多半是上下文丢失。
  • 下一步列:动作是否与前轮冲突?冲突时先看依据列,不要直接采信更新的一轮。

关键判断是:模型改口不等于事实变化。改判只说明在当前上下文里模型的表达变了;要判断事实是否变化,得看新增依据是不是可核验的信息。适用场景是结论需要对外复用或写进任务清单时;验证方式是把改判单元格单独列出来,回查依据列;风险边界是上下文里混入不完整信息时,删除和改判会同时增多,这时应先修正输入,而不是继续追问。

要求模型显式标注不确定项

推断和事实混在同一列里,是前后轮对比最容易失真之处。可以在提示词里要求模型给依据打来源标签,缺证据直接写“未提供”。常见分法是三类:原文,指用户在本轮或前轮真正给出的内容;常识,指不依赖本次输入的一般性经验;推断,指模型根据已有信息推导出的判断。三类都不等于已验证事实,但混在一起会让不确定项列失去作用。

依据列请按来源标注前缀:
- [原文] 只在用户消息中出现过的内容
- [常识] 不依赖本次输入的一般经验
- [推断] 由已有信息推导,但用户没有直接给出
没有对应内容时写“未提供”,不要用“无”“暂无”等模糊写法。
不确定项列必须与依据列对得上:某条依据是 [推断],就要在不确定项里写明推断所依赖的假设。

验证方式:抽查几轮,看不确定项列是否随依据列变化,而不是一直空着或一直写“未提供”。如果每一轮都写“未提供”,可能说明模型没有暴露真实缺口,这时可以把问题拆小,或直接问“这一轮你缺哪条信息才能确认”。风险边界是标签由模型自己打,可能打错,所以它只是帮助区分来源的辅助手段,不能替代人工核对原文。

在格式不变的前提下导出任务清单

多轮对比稳定之后,再把结果整理成可执行步骤,而不是把对话原文直接贴给别人。清单仍沿用固定格式的思路,按负责人、输入、输出、验收条件列步骤;模型没有给出的信息留空,不要替它补全,否则后面无法区分哪些是确认过的内容。

步骤 | 负责人 | 输入 | 输出 | 验收条件
1    |        |      |      |
2    |        |      |      |
3    |        |      |      |

操作动作是先把结论列和下一步列里的动作合并去重,逐条落到步骤行;依据列中标注 [原文] 的内容才填进输入或输出,[推断] 和 [常识] 只留在备注里,不要写进验收条件。验收条件要能被检查,例如“表头四列与 R1 一致”“依据列出现来源标签”这类可以当场判断的条件;如果写不出来,就先留空。验证方式是让另一个人只看这张清单就能判断每一步是否完成,不需要回看对话。风险边界是负责人、时间点等信息留空后,清单只是一份待补全的草稿,不能当成已确认的分工。