降重后重复率反而升高,先别急着判定工具失效。通常有两类原因:一是改写引入了新的相似来源,替换后的用词恰好与另一篇文献的表达一致,或者调整后的句式与比对库中某段更接近;二是改写过程中删掉或改动了引用标注,原本被识别为引用的内容变成了无出处的正文,被计入重复。建议的判断顺序是:先做降重前后报告的相似来源对比,确认新增重复落在哪些片段,再决定是回退改写还是补回引用,而不是整篇推倒重写。
重复率升高的排查顺序:先用同一入口导出的降重前后报告并列对比,定位新增重复片段及其相似来源;再判断该片段属于同义替换、语序调整还是固定搭配造成的句式重合;同时逐句核对引用标记、脚注与参考文献条目是否被删改。原因确认后,只对新增重复段做信息重组式回退,其余段落保持不动,并用同一入口复测留档。适用边界:可比报告须来自同一检测范围与同一字数口径,缺少改前报告时,结论只能作参考。
对比降重前后报告的相似来源变化
把两次报告放在一起看,重点不是总重复率数字,而是相似片段清单的变化。逐条列出改前出现的片段,再看改后哪些片段是新出现的、哪些片段的相似来源换成了别的文献。如果某段在改前没有标红、改后标红,说明这次改写引入了新的相似来源,问题出在改写动作,而不在原稿。
| 片段位置 | 改前相似来源 | 改前重复比例 | 改后相似来源 | 改后重复比例 | 变化判断 |
|---|---|---|---|---|---|
| 第 2 章第 3 段 | (填入改前命中的文献/网页) | (填入) | (填入改后命中的文献/网页) | (填入) | 新增来源 / 来源替换 / 无变化 |
| 第 4 章第 1 段 | — | (填入) | (填入) | (填入) | 改后新增重复 |
| 结论部分 | (填入) | (填入) | — | (填入) | 已消除 |
可比性要先确认:两次报告是否来自同一检测范围,是否包含摘要、致谢、参考文献、附录。范围不同时,数字变化不能直接归因于改写。可以先在报告的相似来源列表里按重复比例从高到低排序,从最高的片段开始逐条核对。
标出新增重复来自同义词替换还是句式重合
定位到新增片段后,把改后句子和原句并排,标出连续相同的部分。常见诱因有三类:
- 同义替换:只把词换成近义词,句子骨架没动。比对通常看连续字串和相近表达,换掉两三个词不足以拉开距离。
- 语序调整:把主谓宾前后调换、把状语提到句首,但核心搭配仍然保留,等于把同一串词重新排队。
- 固定搭配:专业术语、标准编号、法规条号、机构全称、公式名称本来就不该换,重复往往来自这些不可改写的部分,需要改写周边叙述把它包起来。
判断方法是用文本比对找最长连续相同片段,连续重合越长,越说明改动停留在词面:
# 找出两段文本中最长的连续相同片段
python - <<'PY'
import difflib
a = open('原稿段.txt', encoding='utf-8').read()
b = open('改后段.txt', encoding='utf-8').read()
sm = difflib.SequenceMatcher(None, a, b)
for blk in sm.get_matching_blocks():
if blk.size >= 6:
print(blk.size, repr(a[blk.a:blk.a + blk.size]))
PY
输出里连续重合集中在术语和编号上属于正常,集中在叙述句上就需要回退改写。判断完再决定回退范围,不要整段重写。
检查改写后引用标注是否被删改
引用标注被删改是容易被忽略的一类原因。改写时如果把带引号的原文改成无引号的转述,检测既会识别出与原文的重合,又不会把它算作引用,重复比例被双重计入。
逐句核对下面几项:
- 直接引用是否保留引号,页码是否还在。
- 脚注、尾注编号是否连续,删除段落时有没有留下空号或错位。
- 参考文献条目是否与正文引用一一对应,是否多出正文已删的条目。
- 被合并的句子中,原来的引用标记是否迁移到正确的句子末尾。
- 表格、图注中的来源说明是否被一起删掉。
核对方式是把改后正文里的每个引用标记在参考文献列表里反查一遍,再从列表反向查回正文。任何一边落空,先补齐或删除,再谈降重。
对新增重复段回退到信息重组
确认新增重复来自句式而非引用缺失后,回退这部分,用信息重组替代词语替换。重组的目标是让句子的主次关系和论证落点发生变化,而不是同一句话换一种说法。
- 原句:早晚高峰的短时客流波动会显著影响城市轨道交通客流预测的精度。
- 换词版:早高峰与晚高峰的短时客流起伏,会明显作用于城市轨道客流预测的准确度。——词换了,骨架没变,容易被判定为结构重合。
- 重组版:城市轨道交通客流预测精度较低的时段集中在早晚高峰,此时短时波动幅度较大;平峰时段客流相对平稳,预测结果通常更稳定。——主语从「波动」换成「时段」,论证落点从「波动影响精度」变成「不同时段的差异」,与原句的连续重合明显减少。
常用三个动作:把两个短句合并成一个带转折或因果的长句,打断原句的连续字串;调整主次,把原句的宾语或状语提为主语;改变论证落点,把「A 影响 B」改写成「B 在什么条件下表现不同」。同一段里只做一处通常不够,建议整段重排一遍语义顺序。
对每个新增重复段执行的回退清单:
- 复制改后段落,标记与原句连续重合的部分。
- 区分重合部分是术语、数据还是叙述句,术语和数据保留,叙述句重写。
- 按上面三个动作中至少两个重写该段。
- 保留原段的引用标记,迁移到新的句子位置。
- 把回退版与改前版本、原文并排检查一遍。
用同一入口复测并记录变化
回退后不要凭感觉判断有效,要用同一入口复测。同一检测平台、同一范围设置、同一字数口径,导出的报告才具备可比性。每次复测保存报告原件,并附一份改动说明,记录这一版改了什么、为什么改,避免下次又在一个已经试过的方向上反复。
| 版本 | 改动说明 | 复测重复率 | 新增重复段数 | 处置 |
|---|---|---|---|---|
| v1(降重后初版) | 全文同义词替换 | (填入) | (填入) | 定位新增来源 |
| v2(回退第 2 章) | 合并句子、调整主次信息 | (填入) | (填入) | 对比 v1 |
| v3(补回引用标注) | 恢复脚注与参考文献对应 | (填入) | (填入) | 定稿或继续回退 |
报告和说明用固定命名放在同一目录,例如「报告_日期_版本号」。如果某一版复测后新增重复段没有减少,说明这次重组方向不对,回到相似来源对比那一步重新判断诱因,而不是继续在同一段上换词。保留所有版本,不要只留最后一次;一旦中途改过检测范围,前后的数字就不再可比。