先给判断:润色后句子更别扭,学科语域没选对是可能原因之一,但它通常只解释「术语被换成日常词、口语词变多」这一层。如果句子同时被拆短、被动改主动、信息顺序也被重排,那已经不是换语域能修正的范围,属于改写幅度过大。所以不要一上来就换学科语域,先把别扭感落到具体句子上,标出它在用词层还是句子结构层,再决定是改设置还是回退重写。
语域选择影响的是词表与正式度,不负责句子结构。判断顺序建议是:先固定三句问题样本,再和原始稿逐句对照,确认差异集中在用词层还是结构层;用词层可以先查润色工具里的语域、学科方向、术语表配置,结构层则要回退到原句重新改。后面的禁用清单和 diff 步骤,用于在提交前确认上一轮残留改写是否清干净。
从改后版本里挑出口语化痕迹最重的三句
不要笼统地说「读起来别扭」。从改后稿件里挑三句口语痕迹最重的,逐句标出触发点,样本固定下来之后,后面的判断才有落点。常见的触发点有四类:口语副词与程度词、短语动词、第一人称视角、模糊量词。
- 样本 A。原文「实验结果表明,该方法能有效降低标注成本。」改后「我们做了实验,结果发现这个方法还挺能省打标签的钱的。」标记点:第一人称「我们」+ 口语程度词「挺」+ 术语「标注」被换成「打标签」、「成本」被换成「钱」。
- 样本 B。原文「本文提出的框架由三个模块组成。」改后「我们提出的框架基本上就是由三个部分拼起来的。」标记点:模糊限定「基本上」+ 短语动词「拼起来」+ 术语「模块」被换成「部分」。
- 样本 C。原文「在低资源条件下,模型仍保持较好的鲁棒性。」改后「数据不多的时候,模型还是蛮扛得住的。」标记点:口语程度词「蛮」+ 口语化表达「扛得住」+ 「低资源条件」被换成「数据不多」。
把这三句连同标记点抄到一处,不要边挑边改。挑完之后再进下一步。
对照原文确认是语域设置问题还是改写幅度过大
把每一组原文与改文并列,只回答一个问题:这条差异属于用词层,还是句子结构层。用词层的差异,语域和术语表配置有机会修;结构层的差异,配置管不了。
- 样本 A 差异:「标注成本→打标签的钱」是用词层,术语替换;「我们做了实验,结果发现」是把陈述句改成叙事句,句数由一句变两句,属结构层。
- 样本 B 差异:「模块→部分」「组成→拼起来」是用词层;加「基本上」是用词层的模糊限定,但插在谓语前,改变了断言强度。
- 样本 C 差异:「低资源条件→数据不多」是用词层;「鲁棒性→扛得住」是术语退化为口语表达;主语从句末条件状语的语序变化,属结构层。
判定方法可以这样做:把同一段分别用两个语域设置各跑一次(例如「学术正式」与「通用口语」各一次),对比两次输出。如果差异只出现在词表映射上,说明是语域或术语表没配对,改配置即可;如果句子数量、主语、语序都变了,说明是改写幅度过大,调语域也压不住,需要回退到原句重写。需要结合你所用工具的实际配置项确认,不同工具对「学科语域」的定义并不一致。
从本领域已发表段落里抽三句做语域标尺
凭感觉说「太口语」很难收敛,需要一个可比较的参照物。做法是从同方向、同类型文献里抽三句当标尺:方法段取两句、结论段取一句,共三句。不要从摘要取,摘要为了压缩篇幅常做省略和改写,正式度不代表正文。
抽取时挑纯陈述句,不含数字、不含图表引用、不含公式符号,这样才好和你的改文逐项比。抽到之后列出与改文的差别,建议按下面几个维度对照:
- 主语类型:标尺句用「本文」「该方法」还是「我们」;改文是否换成了口语视角。
- 句子长度:标尺句一句承载几件事;改文是否被切成多个短句。
- 连接方式:标尺句用「因此」「在此基础上」,改文是否换成「然后」「结果发现」。
- 术语密度:标尺句里每个关键概念是否都用领域术语;改文是否混入了日常词。
- 限定词:标尺句用「在一定程度上」「通常」,改文是否换成「基本上」「挺」。
把这三句标尺放在手边,作为「本领域正式度大概长这样」的锚点。它是参照物,不是让你照抄措辞。参照物的价值在于:当你不确定某个词算不算口语时,看标尺句里同类位置用的是什么。
把不接受的口语化改法写进禁用清单
同一个问题反复出现,通常是因为只改句子、不沉淀规则。建议把前面标记出来的口语词和退化术语整理成一个清单文件,放在项目目录里,投稿前用关键词检索逐一确认。示例:
# banned_style.txt,每行一个不允许出现在正式段落里的写法
挺
蛮
其实
基本上
差不多
搞定
扛得住
拼起来
打标签
花销
检索命令(ripgrep 与 grep 任选其一):
rg -n -f banned_style.txt draft.md
# 没有 rg 时
grep -n -F -f banned_style.txt draft.md
使用方式:命中的行回到上下文判断。如果这个词在两版改文之外、本来就在原始稿里,保留;如果是上一轮润色加进去的,回退到原句;如果确实想保留该语义,就换成领域术语,例如「扛得住」换成「鲁棒性」,「花销」换成「成本」。清单不必一次写全,每次发现新的反复问题就补一行,这比每次重新凭记忆检查要稳。
二次润色前先清掉上一轮残留改写
在已经改过一遍的文本上再改,误差会叠加:你无法分清哪句是原文、哪句是上一轮加的。所以二次润色前,先把上一轮的残留改写清掉,操作顺序建议固定下来:
- 保留一份原始稿,命名为 draft.v0.md,此后不再改动。
- 把当前稿与 v0 逐词对照,生成差异文件。
- 在差异里标出上一轮引入、且本轮不打算保留的改写。
- 把这些句子回退到 v0 的原文表述。
- 从回退后的文本开始本轮改写,而不是从上一轮结果继续改。
生成逐词对照的命令示例:
git diff `--word-diff`=plain -- draft.v0.md draft.v2.md > diff.v0-v2.txt
# 没有纳入 git 时
diff -u draft.v0.md draft.v2.md > diff.v0-v2.txt
验证方式:提交前再看一次 diff 输出,里面只应包含你本轮明确要改的句子。出现其他行,说明是上一轮残留,按第 4 步回退。风险边界要清楚:回退以 v0 为基准,不要以「上一轮改完的版本」为基准,否则每轮都在前一轮误差上叠加。如果 v0 本身就有术语用错或事实错误,单独记一条待办,不要混在润色流程里顺手改掉,否则回退时会分不清哪些改动是必要的。