先把长文档拆成可核对的小段——Longcat-2.5-preview 逐段问、逐段回查

文章导读
长文档一次性丢给模型,输出和原文对不上,通常不是模型“没读”,而是读者自己也没法定位哪一段被处理、哪一段被跳过。把文档按小标题拆成可独立核对的小段,逐段提问并回原文对照,最后只合并已核对的部分,可以把“说不清”变成“逐条能查”。
📋 目录
  1. 壹 按小标题把长材料切成能独立核对的小段
  2. 贰 每段只问一件事,并要求复述原文关键句
  3. 叁 在原文里逐条对照输出中的数字和专有名词
  4. 肆 把没有被覆盖的段落记成遗漏清单
  5. 伍 合并分段结论时只写已核对的内容
A A

长文档一次性丢给模型,输出和原文对不上,通常不是模型“没读”,而是读者自己也没法定位哪一段被处理、哪一段被跳过。把文档按小标题拆成可独立核对的小段,逐段提问并回原文对照,最后只合并已核对的部分,可以把“说不清”变成“逐条能查”。

处理长文档时,建议先把原文切成带编号的小段,每段只问一个明确问题,并要求模型复述原文关键句。拿到输出后,用数字、日期、专有名词和否定表述逐条回查原文,对不上的标成待查。没被覆盖的段落单独记入遗漏清单。汇总时只写已核对的结论,未核对的段落标注待定。这个流程适用于需要可追溯结果的问答或整理任务,不承诺消除所有错误,但能让错误位置显式暴露。

按小标题把长材料切成能独立核对的小段

切分长文档时,最直接的依据是原文自带的小标题或章节编号。比如文档里有「2.1 部署要求」「2.2 配置项」,就把每个编号下的内容切成一段。如果没有小标题,可以按自然段或语义块切,每段控制在 300 到 800 字左右,或者对应一个能独立回答的小问题。一段太长,模型容易揉在一起;太短,上下文又不够。如果某个结论跨了前后两段,可以在提问时把关联前后段一起附上,并在段号里标注「含上下文 2.1-2.2」。

切分后给每段一个稳定编号,例如「段 2.1」「段 2.2」,后面所有提问、核对和遗漏都引用这个编号。这样即使之后重新组织问题,也能对回具体原文。

每段只问一件事,并要求复述原文关键句

一段提问里塞多个要求,模型容易顾此失彼。建议每段只问一件事,并要求它先复述原文关键句再作答。提问模板可以写成三段:

先把长文档拆成可核对的小段——Longcat-2.5-preview 逐段问、逐段回查
以下是原文第 [段号] 段:
[粘贴该段原文]

请只完成一个任务:[具体问题,例如“列出所有日期”]。

回答时先逐条引用原文中对应关键句,再给出你的归纳。不要引用其他段落的内容。

前后对照:如果一次问“总结这段并列出所有数字和注意事项”,模型可能只挑容易的答。改成先问“列出这段出现的所有日期”,再单独问“列出这段的注意事项”,每个回答都要求带上原句。这样输出和原文的对应关系更清楚,也更容易发现漏项。

在原文里逐条对照输出中的数字和专有名词

核对时优先看那些最容易出错也最容易验证的内容。可以准备一个固定核对清单,每段输出后逐行过一遍:

先把长文档拆成可核对的小段——Longcat-2.5-preview 逐段问、逐段回查
  • 数字:原文写「3 个节点」,输出是否写成「2 个节点」或「几个节点」。
  • 日期:原文写「2024-05-01」,输出是否变成「2024-05-07」或省掉年份。
  • 人名机构名:原文写「A 公司」,输出是否写成「B 公司」或替换成别的实体。
  • 否定表述:原文写「不支持」,输出是否写成「支持」或漏掉「不」字。

发现对不上时,在该段号后直接标注,例如「段 3.1 [数字不符]」「段 2.2 [否定反转]」。标注不要只写在心里,要写进记录文件或对话笔记里,方便汇总时过滤。

把没有被覆盖的段落记成遗漏清单

有些段落可能因为提问时跳过了,或者模型输出为空、只复述标题,导致没有被覆盖。这些要显式记成遗漏清单,而不是靠感觉。记录格式可以按段落编号排列,每条注明原因:

遗漏清单:
- 段 2.3:问题没覆盖到,提问时只问了 2.1 和 2.2。
- 段 4.1:模型输出为空,可能被跳过。
- 段 5.2:输出只重复了标题,未回答具体问题。
- 段 6.4:原文图片说明未提取,暂时无法核对。

每轮提问后更新这个清单。遗漏原因写清楚是「问题没覆盖到」「段落被跳过」还是「输出不完整」,后续补问时可以直接按编号定位。

先把长文档拆成可核对的小段——Longcat-2.5-preview 逐段问、逐段回查

合并分段结论时只写已核对的内容

合并分段结论时,只把已经通过核对的段落写进汇总。操作上可以分成两块:

已核对结论:
- 段 1.1:……(数字和日期已对照原文)
- 段 2.2:……(专有名词已对照原文)

待定结论(未核对或核对不通过):
- 段 3.1:……
- 段 4.3:……

取舍规则很简单:没有回原文逐条对照过的内容,不放进「已核对结论」;标注了数字不符、否定反转的段落,要么补问重核,要么放在待定区。这样最后交付的汇总里,每个结论都能指回一段具体原文,也不会把没核过的段落悄悄混进去。