先固定输入再比输出——Space Bunny 做对比测试时该控住哪些变量

文章导读
同一个问题换几种问法,Space Bunny 的回答会差得很远,这种时候很难判断是模型本身不稳定,还是每次输入其实并不一样。更稳的做法是先把输入固定下来:提示词原文、会话状态、发起时间三个条件不对齐,输出差异就没有可比性。可以先用同一段文本、同一会话条件、同一轮次各问一次,再去比对回答里的结论、步骤和示例,而不是凭印象判断“这次好像更聪明”。
📋 目录
  1. A 把提示词原文固定成一份可复用文本
  2. B 区分新会话与延续会话两种条件
  3. C 记录原始输出而不是只记印象
  4. D 用文本对比找出差异类型
  5. E 多轮之后决定哪个结果可用
A A

同一个问题换几种问法,Space Bunny 的回答会差得很远,这种时候很难判断是模型本身不稳定,还是每次输入其实并不一样。更稳的做法是先把输入固定下来:提示词原文、会话状态、发起时间三个条件不对齐,输出差异就没有可比性。可以先用同一段文本、同一会话条件、同一轮次各问一次,再去比对回答里的结论、步骤和示例,而不是凭印象判断“这次好像更聪明”。

做 Space Bunny 对比测试时,先把提示词原文、是否延续会话、提问时间三件事固定,才有资格比较输出。适用场景是同一问题反复问结果不一致、怀疑模型波动;操作上把提示词存成一份文本,同一问题分别在新会话和同一会话追问各取一次,完整保存回答和时间;验证方式是拿两份回答做文本对比,看结论、步骤数、是否给示例三项差异;边界是这只能说明输入条件不一致或上下文有影响,不能据此得出模型稳定性结论。

把提示词原文固定成一份可复用文本

每次重述问题,措辞、语序、附加条件都会变,这些变化本身就是变量。先把问题写成一段固定文本并保存下来,例如放进一个 prompt.txt,之后每次都从这份文件复制,而不是临时重打。

# prompt.txt
请说明:在本地开发环境里,如何判断一个 HTTP 接口是否返回了缓存命中。
要求:给出判断步骤;如果无法直接观察,请明确说明需要补充哪些信息。
不要展开无关背景。

哪些词属于不该随手改的变量:任务动词(判断、解释、列出)、约束条件(只讲步骤、不要背景)、输出格式要求(分点还是段落)、以及问题里的范围词(本地、开发环境)。这些一旦改动,输出差异就不能归因于模型本身。可以先固定一个版本,需要测试变体时再单独另存一份,并在文件名里标注改了哪一处。

区分新会话与延续会话两种条件

上下文是否影响结果,要靠两种条件分开测。同一问题在新会话里问一次,再在同一会话里追问一次,尽量保持提问文本相同。

先固定输入再比输出——Space Bunny 做对比测试时该控住哪些变量
  • 新会话:清空对话或新开一个会话窗口,只贴固定的提示词原文。
  • 延续会话:在当前已有多轮对话的会话里,直接追问同一段文本,不作额外解释。

记录两次回答在结论和细节上的差别。重点看:结论是否一致、步骤数量是否变化、是否额外引入前文出现过的例子。如果两次回答的差异只出现在细节展开上,通常说明延续会话在补充上下文,而不是结论变了;如果结论本身冲突,就需要把两段回答都留下,进入后面的复测。

记录原始输出而不是只记印象

只凭印象记“这次更完整”,过几轮就复查不了。建议每次至少记录三项:提问时间、提问原文、完整回答。提问原文直接引用保存的那份文本,不要事后复述。

时间:
条件:新会话 / 延续会话
提问原文:
回答原文:

保存方式上,截图适合保留页面当时的排版和上下文位置,但不变检索和文本对比;复制文本便于逐字比对和搜索,却可能丢掉换行或特殊格式。可以两者都留:截图作为现场凭证,复制的纯文本作为可比对版本,复制后随手确认换行是否完整。

用文本对比找出差异类型

把两份回答并排放进任意文本对比工具,或直接在编辑器里用差异高亮功能看。不要只看“谁更好”,先分类差异。

先固定输入再比输出——Space Bunny 做对比测试时该控住哪些变量
  1. 结论:两份回答给出的判断是否一致,是否互相矛盾。
  2. 步骤数:给出的步骤是几条,是否多出或漏掉关键环节。
  3. 是否给示例:有没有举出具体命令、配置或小例子,示例是否可执行。

如果两次完全一致,也不必急着认为模型稳定。一致可能来自提示词足够明确、问题本身没有歧义,也可能来自两次提问条件本来就相同。可以把提示词换一个问法再测,或换一个时间点再测一次,看一致是否可重复。若换问法后仍一致,说明这个问题对表述不敏感;若换问法后不一致,说明前面的“一致”只是巧合。

多轮之后决定哪个结果可用

差异列出来之后,最终要落到选用哪一个。取舍规则可以先定两条:

  • 结论一致时,看细节完整度。选步骤清晰、示例可验证的那份,但不要因为文字更长就默认更好。
  • 结论冲突时,用一个可验证的小任务复测。把两份回答里各自建议的做法,分别放到一个最小场景里跑一遍,看哪份说法能得到可观察的结果。

复测仍然以固定输入为前提:同一个任务、同一份数据、同一时间窗口内完成,避免把环境变化误当成回答质量差异。需要结合环境确认的部分,例如接口行为、缓存策略、日志开关的默认值,以当下环境的实际表现为准,不要直接沿用回答里的假设。