模式选择的关键不是哪条路径更高级,而是这次输出要保住哪些特征。同一段英文在偏流畅、偏正式、偏简单这几类路径里跑,句长、连接词密度和主被动语态通常朝不同方向偏移:偏流畅的路径倾向拆开长句、补上衔接词,偏正式的路径倾向保留名词化和被动结构,偏简单的路径会压低从句层级。论文和邮件共用一套设置,常见结果是要简洁的地方出现绕口长句,要正式的地方冒出口语词。可以先固定原文和语言设置,只切换模式跑一轮,逐份保存后再按文体定默认项。
改写模式的选择标准来自文体和术语约束,而不是模式的排序。操作上先固定同一段原文和语言设置,只切换模式,逐份保存输出;再对比句数、平均句长、连接词增删和主被动语态的偏移方向,并回看术语清单是否被同义替换。学术写作优先保证术语与逻辑连接词稳定,商务邮件优先保证语气直接、句长可控,日常表达可以接受更大的句式和词汇变动。模式的具体表现需要结合当前页面版本和语言设置确认,不要跨文体套用同一套设置。
用同一段原文跑一遍不同改写模式
样本选 80 到 150 词的一段英文,里面最好包含一个长句、一个被动句和两三个专业术语。样本太短,句长和语态的偏移看不出来,也容易把一次偶然替换误判成模式特征。语言设置先固定:English (US) 或 English (UK) 选定后不改,同义词滑杆位置、句子结构类选项也保持不动,真正切换的只有 Modes 里的模式。常见可见的路径包括 Standard、Fluency、Formal、Simple、Creative 等,部分账号还会看到 Expand、Shorten 或自定义模式,具体以当前页面 Modes 列表为准。
逐份保存,不要在同一份输出上反复覆盖。命名用原文名加模式名,放在同一个目录里:
outputs/
sample_standard.txt
sample_fluency.txt
sample_formal.txt
sample_simple.txt
保存后在文件名旁记一行:这版用了哪个模式、语言设置是什么、同义词滑杆在哪一档。后面回看差异时,这条记录比凭印象回忆可靠。页面上的模式列表和可见选项会随账号与版本变化,需要以自己在页面上实际看到的名称为准,不要直接照搬别人截图里的模式名。
对比输出在句长与连接方式上的变化
对比不要只看读起来顺不顺,那太主观。建议落到四个可数的观察点:句数、平均句长、连接词出现次数、被动结构数量。把各模式输出放进同一目录,先用脚本粗筛一遍,再人工回看被标记的句子。
import re, pathlib
LINKERS = ['however', 'therefore', 'moreover', 'furthermore', 'in addition', 'but', 'and', 'so']
def sentences(text):
return [s.strip() for s in re.split(r'(?<=[.!?])\s+', text.strip()) if s.strip()]
def summary(text):
sents = sentences(text)
words = re.findall(r'[A-Za-z]+', text)
passive = len(re.findall(r'\b(?:is|are|was|were|be|been|being)\s+\w+ed\b', text, re.I))
linkers = {k: len(re.findall(r'\b' + re.escape(k) + r'\b', text, re.I)) for k in LINKERS}
avg = round(len(words) / len(sents), 1) if sents else 0
return {'sentences': len(sents), 'words': len(words), 'avg_len': avg, 'passive_like': passive, 'linkers': linkers}
for p in sorted(pathlib.Path('outputs').glob('*.txt')):
print(p.name, summary(p.read_text(encoding='utf-8')))
脚本输出只是粗筛。正则识别被动结构会漏掉不规则动词,也可能把系动词加形容词误判进来;连接词计数也不区分逻辑关系是否用对。人工回看重点看三类:长句是否被拆成两句、是否新增或删掉 however 与 therefore 一类衔接词、主动句是否被改成 be 加过去分词结构。语态的切换要单独记,因为改主动为被动后,动作主体容易从句子主语位置上消失。
每份输出里记下一处最明显的差异,写成具体句子,例如“第 2 句由 34 词拆成 16 词和 21 词两句,新增 therefore”。这种记录能帮你判断模式是否适合当前文体,比笼统写“太口语”或“太生硬”可操作。同一段原文跑完几种模式后,把这几条记录并排放在一起,选择标准就出来了。
按文本类型匹配改写模式
不同文体看重的输出特征不一样,判断表比模式排行榜更好用:
| 文本类型 | 优先看的输出特征 | 建议的模式方向 | 理由与风险边界 |
|---|---|---|---|
| 学术写作 | 术语原样保留、逻辑连接词稳定、被动语态可按需保留、句长平稳 | 偏正式或标准类模式 | 读者关注论证结构和术语一致性,口语化会削弱限定条件。风险是部分模式把 however 换成 but,或把被动改主动导致主语指向变化,改完必须回看。 |
| 商务邮件 | 语气直接、句长偏短、少用被动、动作项和时限清楚 | 标准或偏流畅类模式 | 邮件看重对方能否快速抓到要办的事。风险是过度正式的模式会堆名词化结构,读起来生硬;过度简单的模式可能把礼貌措辞压掉。 |
| 日常表达 | 句式自然、可用缩略、词汇替换空间大 | 偏简单或创意类模式 | 这类文本对术语和被动结构没有硬约束,可以放宽。风险是涉及金额、日期、承诺时不要沿用同一设置,需换回正式模式重跑并逐项核对事实。 |
同一篇稿件里混用文体时,建议按段落定模式,不要按整篇定。摘要和方法段用学术写作的设置,给合作者写的说明段用邮件的设置,中间不要来回切换同一段。
切换模式后回看术语是否被改动
模式切换最容易出问题的地方不是句子结构,而是术语被悄悄替换。准备一份清单,放在稿件或项目目录里,每次切换模式后逐项比对。
term,type,allowed_variant
latency,术语,不得替换
throughput,术语,不得替换
OAuth 2.0,产品名,不得改写大小写与空格
cross-validation,方法名,不得拆成 cross validation
p < 0.05,统计符号,保持符号与空格
比对用 diff 最快,在终端里跑:
diff -u outputs/sample_standard.txt outputs/sample_formal.txt
改动形式通常落在几类:同义替换、缩写展开或反向缩合、单复数变化、大小写变化、连字符增删、主动改被动。发现被改动的词,先判断是模式导致的统一行为,还是只在这一句发生的偶发替换。统一行为可以写进清单的 allowed_variant 列;偶发替换就地改回,并在保存的文件里标注改了哪一处。术语被反复替换的稿子,越往后越难回退。
把选定设置固化成固定改写流程
把选定的模式固化成流程,减少每次重新试模式的时间。顺序建议是:
- 先定模式:按当前文体选一个默认模式,写进稿件头或模板里,例如在标题下方留一行 mode: Formal,同时记下语言设置。
- 再逐句改:每次只处理一段,改完立刻对照术语清单和事实项,确认术语、数字、日期没被换掉,再进入下一段。
- 最后统一回读:不再看模式设置,只按文体标准通读一遍,检查语气、句长和逻辑连接词是否前后一致。
中途不再切模式,主要有三个原因。切换后前面段落与后面段落的语气会分叉,整篇读起来像两个人写的;同一批术语可能在每次切换时被不同方式替换,回看成本会叠加;最后也很难说清哪一版才是基线。确实需要换模式时,建议从切换处往后重跑,并把切换点写进文件名或记录里,而不是整篇来回换。