书生·浦语这类模型在长文改写里前后跑偏,通常不是单次推理“忘了前面”,而是分段之后每段拿到的上下文不一样:术语、人称、语气各段各写。分段改写能压住大部分不一致,但有两个动作不能省——先建一张术语与人称统一表,再在每段开头接上一段的结尾摘要。只切段不建表,段数越多,同一术语出现两套译法的机会越大。
分段改写本身不是解药,真正的控制点是“每段共享同一份基准”。适用场景:同一篇长文切成多段,分别提交给模型改写。操作动作:先从原文抽出术语与人称口径做成统一表,再把上一段结尾压成一句衔接说明,一并放进该段的任务说明。验证方式:改完前三段就逐项对照术语、指代、语气三个检查点,判断跑偏来自提示写法还是分段方式。边界:分段长度上限、模型对长上下文的实际保留能力,需要结合你所在的环境先做小样确认,不要直接按一整篇推断。
把原文里反复出现的术语与人称先列成一张表
这一步决定后面每段写出来像不像同一篇。做法是先通读原文,把出现两次以上的专名、关键名词、固定说法挑出来,再给每一个定下统一写法。抽取可以手动,也可以用编辑器正则或 grep -o 配合排序统计大致摸一遍高频词,不追求精确计数,只求不漏掉主要术语。
三类内容必须进表:一是术语与专名,含固定译法,例如同一概念原文里出现了“检索增强”和“RAG”两种写法,就要指定全篇统一用哪一个;二是人称口径,明确全篇用第三人称、第一人称,还是允许“我们”出现,出现在哪类句子;三是语气与句式,例如是否允许感叹句、是否允许口语化短句。表建好之后,它不只是给人看的,每次提交改写任务都要把这张表一起贴进提示里。
统一表的表头可以这样定,字段少一点更好填:
| 原文写法 | 统一写法 | 类别 | 禁用写法 | 首次出现段落 |
|---------|---------|------|---------|------------|
| RAG、检索增强 | 检索增强 | 术语 | RAG(正文中不再单独出现) | 第1段 |
| 我们、笔者 | 本文(或统一第三人称) | 人称 | 我们、你、大家 | 第1段 |
| 大模型、LLM、模型 | 大模型 | 术语 | LLM(标题与代码外不混用) | 第2段 |
“禁用写法”一列是这张表真正起作用的地方,它把“不要写什么”变成可检查项,回读时直接按这一列搜索即可。
用同一段任务说明改写前三段并对照检查
先只改前三段,不要一次铺开到全文。目的是用小样本区分:跑偏到底是提示写法没交代清楚,还是分段方式本身有问题。这三段共用同一段任务说明,把统一表、人称口径、语气要求全部写死在提示里。
你是长文改写助手。以下三条是全文强制基准,任何一段都不得违背:
1. 术语统一表:{在此粘贴统一表}
2. 人称口径:全篇第三人称,不使用“我们”“你”
3. 语气:陈述、克制,不使用感叹句
本段任务:改写第 1 至第 3 段,保持原意,不新增事实。
上一段结尾摘要:{第1段填“无”}
改完逐段对照三个检查点:术语是否统一,逐个数改写文中出现的每个术语,看它是否落在统一表的“统一写法”列;指代是否清楚,看段内出现的“它、该方案、这个方法”是否有唯一指向,指向不明就改成具体名词;语气是否一致,看句末标点和句式有没有突然变得口语或夸张。
记录方式建议用一张逐段对照表,改一段填一行:
| 段号 | 术语检查 | 指代检查 | 语气检查 | 结论 |
|-----|---------|---------|---------|------|
| 第1段 | 通过 | 通过 | 通过 | — |
| 第2段 | 出现“LLM” | 通过 | 通过 | 术语跑偏 |
| 第3段 | 通过 | “该方案”指向不明 | 通过 | 指代跑偏 |
判断口径可以这样用:如果前三段就已经出现术语不统一或人称跳变,多半是提示写法问题——统一表没进提示,或者进了但没写成强制约束;如果前三段干净,问题集中在后半段才冒出来,那更像分段方式问题,需要补第 3 节的衔接说明,或把每段切得更短。
在每段开头接上前一段的结尾摘要
分段之后各段互不衔接,是因为每一段独立提交时,模型看不到上一段是怎么收尾的。解决办法是手工把上一段结尾压缩成一句话,作为本段的起始上下文,放进任务说明,也写进改写正文的开头。
压缩写法固定成一个句式即可:“上文讲到 X,已经确定 Y,本段继续处理 Z。”X 是上一段主题,Y 是上一段得出的口径或结论,Z 是本段要接着讲的内容。一句话,不展开,不带评价。
带衔接说明的开头可以写成这样:
上文讲到训练数据清洗流程已确定采用三级过滤,本段继续说明每一级过滤的判定口径。
在实际执行时,第一级过滤先处理明显残缺的记录……
注意衔接说明是给上下文用的,不是正文的一部分;如果成稿里不需要它出现,就在合并时删掉这一句,但要保留它参与改写过程。若同一术语在衔接句和正文里写法不同,以统一表为准。
改完全文后做一次从前到后的回读核对
回读按固定顺序走,不要跳读:先扫人称,再扫术语,再扫语气,最后处理指代。顺序的原因是人称和术语的修改会牵动后面句子的措辞,先改这两项能减少返工。
人称跳变的具体处理:按段号从上到下逐段读,遇到与统一表不符的人称词就当场改,并把该段标记出来,改完再从头确认一遍没有被漏掉的复数表述。若全篇统一第三人称,出现“我们”的句子通常是原文引述,需要判断是保留引号内原样还是转述,转述就改成第三人称。
术语出现两套译法的处理:用禁用写法列去搜索成稿,逐处确认上下文再改,不要直接全局替换。同一个词在不同语境下可能确实指两个东西,全替换会改错。可以先定位再改:
grep -n "RAG\|LLM" draft.md
把命中行逐条看完,确认是同一个概念再统一成“检索增强”“大模型”;如果确认是两个不同对象,就在统一表里补一行区分说明,避免下次再混。回读结束后,再对照逐段对照表检查一遍前三段,确认最终稿和当初的检查结论没有出入。