Qwen 答得流畅但事实对不上 / 先把可核对的资料范围圈出来

文章导读
Qwen 答得流畅,说明语句通顺,不说明句中的数字、日期、人名在材料里真有依据。想让回答落在可核对的范围里,通常按顺序做三件事:提问时写清允许使用的材料,要求每条结论标出原文出处,收到答案后逐条回原文比对。第一步没做,后两步基本落空——范围没圈,就没有可回的“原文”。
📋 目录
  1. 在提问里把允许使用的材料列清楚
  2. 要求每条结论标出原文出处
  3. 逐条回原文核对数字、时间与人物
  4. 把核对不过的问题改成可回答的问法
  5. 记录哪些问题确实答不了
A A

Qwen 答得流畅,说明语句通顺,不说明句中的数字、日期、人名在材料里真有依据。想让回答落在可核对的范围里,通常按顺序做三件事:提问时写清允许使用的材料,要求每条结论标出原文出处,收到答案后逐条回原文比对。第一步没做,后两步基本落空——范围没圈,就没有可回的“原文”。

适用场景:内部资料问答、报告摘要等需要落到原文的任务。操作动作:提问时列出材料清单与材料外处理规则,要求每条结论附原文片段,再按数值、日期、人名、因果关系逐条核对。验证方式:某条结论能否在给定材料里找到对应句子,找不到就判为无出处。风险边界:这套做法只压缩编造空间,不代表材料本身正确;材料冲突或缺失时,仍需换检索或人工确认。

在提问里把允许使用的材料列清楚

回答跑出范围,多数时候不是模型坏,而是提问没说“可用的只有这些”。把材料随问题一起交出去,并写清材料之外怎么处理,作答空间会收窄。下面这段可以直接改用,替换材料编号和问题即可。

你只能依据下方【材料】回答问题。
规则:
1. 每条结论后附上材料原文片段,并标明来源编号(如 M03)。
2. 材料没写到的内容,直接回答“材料未覆盖”,不要用其他知识补充。
3. 材料之间冲突时,列出冲突的两处原文,不要自行选一条当结论。
4. 不要把不同材料里的数字、日期合并计算。

【材料】
M01:(一段事实,含主体、时间、数值与单位)
M02:……
问题:……

材料粒度决定核对难度。建议一段只放一个事实点,编号 M01、M02;主体写全称,时间写清口径(发布日还是生效日),数值带单位和区间;表格拆成逐行文字,避免模型自己读表。若同一事项有多份材料,把最终版单独标为权威口径,其余标为过程稿。材料越混,越容易出现把两份材料的半数拼成第三个数的情况。

要求每条结论标出原文出处

标出处不只是格式,作用是让没有依据的结论当场暴露。提问时把引用格式写死,模型要么给出原文,要么承认没有。

Qwen 答得流畅但事实对不上 / 先把可核对的资料范围圈出来
每条结论后用括号给出原文,格式:结论(M02:“原句”)。
一条结论由多条材料支撑时,逐条列出编号,不要合并成一句。
给不出原文片段的结论,不要写进答案。

检查方式很直接:通读一遍,看有没有连续几条不带括号引用的结论。这种段落通常是自由发挥的高发区,尤其是背景介绍、影响分析这类收尾部分。发现某条结论没有出处时,不必重新问一遍原问题,直接把那一条拎出来追问:

你上面第 3 条没有给出原文出处。请二选一:
a) 补充对应材料编号和原文片段;
b) 撤回该条,改写成“材料未覆盖”。

追问后仍然给不出原文,就把这条结论按无依据处理,不要因为它读起来合理而留下。

逐条回原文核对数字、时间与人物

核对按出错代价排序,通常是:数值、日期时间、人名机构名、因果关系。数值最容易错,重点看单位、量级、区间、同比还是环比;日期时间要看时区、口径以及是发布日还是生效日;人名机构名注意全称简称混用和同名;因果关系最隐蔽,材料里“同时出现”常被写成“导致”。

每条结论给一个固定标记,方便统计和回看:

Qwen 答得流畅但事实对不上 / 先把可核对的资料范围圈出来
  • [已核对] —— 原文能逐字对上
  • [不符] —— 原文数值或表述不同,写出原文是哪个
  • [无出处] —— 答案里有,材料里没有
  • [材料外] —— 属于通用常识或外部信息,不在本次范围内
结论编号结论摘要标注出处核对结果处理
1某指标为 XM02[已核对]保留
2生效时间为某年某月M03[不符:原文为另一时间]按原文改回
3该变化由某政策导致[无出处]删除或换问法

核对时以材料原文为准,不要拿模型的第二次回答当依据。第二次回答同样可能平滑地补全,只是补得更像。

把核对不过的问题改成可回答的问法

反复核对不过,多半是问题本身超出了材料能支撑的范围。收窄的思路:把“最好、最新、最合适”换成“材料里列出了哪些选项、各自条件”,把“为什么”换成“材料给出的原因有哪几条”,涉及数值时加上单位和时间口径,一次只问一个可对照的维度。

改写前后对照:

Qwen 答得流畅但事实对不上 / 先把可核对的资料范围圈出来
改前:Qwen 最新版本是什么,比上一代强多少?
改后:仅依据我提供的这份版本说明,列出其中出现的版本名称
      及对应的能力描述;说明里没有出现的内容写“材料未提及”。

改前:这个指标为什么下降?
改后:材料中对指标下降给出了哪几种解释?逐条列出原文。

改前:这套方案适合我们吗?
改后:材料里列出了这套方案的哪些适用条件和不适用条件?
      逐条列出原文。

改写后仍然答不好,说明不是问法问题,而是材料不够,这时应回到资料准备环节补材料,而不是继续换措辞追问。

记录哪些问题确实答不了

答不了的问题值得留档,因为下一次要么补材料,要么换检索方式,要么直接转人工。用一个简单表记录即可,字段固定四列:问题、失败类型、需要的材料、后续处理方式。失败类型建议统一成几种,避免每次写法不同。

  • 材料缺失:手头确实没有对应资料
  • 材料冲突:两份材料口径不一致,需要确认以哪份为准
  • 超出材料:问题需要外部或实时信息
  • 需人工判断:涉及责任划分、策略取舍,模型不宜给结论
问题失败类型需要的材料后续处理方式
某条款的生效时间是什么材料缺失正式签署版本找业务方补文件后再问
两个版本哪个指标更高材料冲突两版统计口径说明先确认口径,再统一比对
当前最新报价是多少超出材料实时数据源不走材料问答,改查业务系统

记录到一定数量后,会看出哪些问题反复出现在材料缺失和超出材料两栏,这通常就是该补资料或该换流程的部分。