智能体回答全是客套话,先别急着换模型。把原因分开看无非两条:提示词只给了“专业、详细、友好”这类形容词,模型没有可执行的判别标准,只能拿通用语料凑句子;或者知识库里原本就没有这段内容,或者有但切片散、检索没命中,模型拿不到依据,只能兜底。判断的关键是用同一批有标准答案的问题做对照,看回答能不能落到具体条件、步骤或数值,再看回答是否带着来源片段。有依据却仍空泛,先改提示词;没依据又空泛,先查知识库覆盖和切片质量。
适用场景是自助问答、客服类智能体。操作上先准备知识库里明确有答案的问题做对照组,观察回答是否具体到条件、步骤、数值,并检查是否带引用或召回片段。有引用但空泛,多为提示词缺可检验规则;无引用且空泛,优先排查知识库覆盖与切片切分。风险边界:两类成因常同时存在,需分开改动,靠同一批问题复测来区分是哪一侧起效。
先问几个知识库里明确有答案的问题
挑问题时不要挑“怎么使用某功能”这种开放题,要挑答案里天然带条件、步骤或数值的题,标准答案是什么样你自己能先写出来。可以先用这三类:
- 「签收后多少天内可以申请无理由退货?哪些品类除外?」——标准答案里应出现具体天数和不适用品类。
- 「开票信息填错需要重开,要提交哪些材料、走什么流程?」——标准答案里应出现材料清单和办理顺序。
- 「接口返回某个业务错误码时,按顺序做哪几步排查?」——标准答案里应出现步骤序号和前置条件。
逐条记录回答是否点到了这些要素:有没有天数、有没有例外品类、有没有材料项、有没有步骤顺序。如果三题全部退化成“建议您联系客服”“具体以官方为准”,说明是全局性空洞,优先怀疑提示词约束和整体检索链路;如果其中两题答得具体、一题空泛,那基本是那一个主题的知识缺失或切片问题,属于局部缺口,改提示词救不回来。
看回答有没有落到具体片段上
要确认内容是不是真从知识库来的,最直接的办法是把来源引用或召回结果打出来。多数问答产品在回答下方会挂片段标题或文档名,管理端一般也能看到本次召回了哪些片段。判断方式很简单:回答里的结论能否和某个片段的文字对上,对得上说明是检索在起作用,对不上说明模型在自行生成。
如果暂时没有引用展示,可以先在提示词里做一次临时验证,要求“只依据检索片段回答,并在句末标注片段编号,没有片段就直接说明”。观察输出里有没有编号:出现编号且编号内容与结论一致,是命中;完全不出现编号、句式又像通用建议,比如“通常情况下”“具体请咨询工作人员”,基本就是没召回到可用片段,模型在兜底。这一步只看行为,不用纠结分数。
把提示词里的形容词改成可检验的规则
“专业”“详细”对模型来说没有可执行的动作,改成能逐条对照的规则,回答才有形状。改写不需要复杂框架,把要求拆成必含要素和禁止项即可:
改前:你是专业客服,回答要专业、详细、友好。
改后:
1. 每条回答必须包含四部分:适用条件 / 操作步骤(编号,不超过5步)/ 例外情况 / 信息不足时缺哪一条信息。
2. 只使用检索到的片段内容,不得补充片段外的时限、金额、政策。
3. 片段不足以回答时,输出固定话术:知识库暂无此条,已转人工。
4. 不得以“通常情况下”“建议联系客服”作为回答主体。试改后拿同一批问题重跑。原先空泛的那几条如果开始出现条件、步骤和例外,说明此前确实是提示词约束不够;如果照着新规则反而频繁触发“暂无此条”,那问题就落回知识库,检索里确实没有可用的依据。
检查切分是否把答案切散了
有些内容库里明明有,回答照样空泛,原因是完整答案被切到多个片段里,一次只召回半截,模型不敢拼也拼不出。到知识库的切片预览里找一条结构完整的答案,比如某流程的适用条件和办理步骤,看它落在几个片段上。几个信号值得留意:单个片段没有主语或只有结论没有前提;片段以“②”“(续)”之类标记开头;同一标题下多个片段必须合起来才能读懂。
遇到这种切分,建议按语义边界重切:文档标题和小节标题跟正文放在同一片,表格的表头和行不要分到不同片段,步骤列表尽量整段保留。切片本身带着“这条属于哪个流程”的信息,召回后才容易把条件、步骤、例外一起带出来,而不是只捞到一句半句。
补两类内容后复测同一批问题
确认是知识缺失后,优先补两类内容。一类是边界说明:什么情况不适用、有哪些例外、例外之外还有没有排除项,这类内容往往是“答得像模板”的根源,因为模型知道大方向,却不知道分界线在哪。另一类是示例问答:把一个真实问题配上标准答案,答案里写清条件、步骤和不确定时的处理方式,格式与线上回答期望的形态保持一致。
补完不要另起一批新题验证,用原来那三个问题、原来的提示词和参数跑一遍,逐条对比:回答是否落到具体条件、是否带片段来源、通用兜底话术是否减少。改动前后各留一份回答记录,才能分清是提示词规则在起作用,还是知识库补齐在起作用。若只改了一侧就复测,结论容易混淆;两侧先后各测一次,判断会清楚很多。