文献多的综述选题交给 Write For You、文献少的先自己读一遍

文章导读
要不要把综述选题交给工具,判断依据通常不是题目热不热门,而是这个题目下核心文献的数量,以及这些文献能不能靠摘要判断。核心文献在几十篇量级、且摘要信息足够时,自己一篇篇读完往往比配置工具、校对输出更快;核心文献上百篇、跨多个子方向时,先让工具做一轮筛选和聚类,再回到原文精读,通常更省时间。可以先按下面的顺序做一次判断,再决定是否投入工具流程。
📋 目录
  1. A 先数清题目下的核心文献有多少篇
  2. B 按可读性判断哪一批必须自己读
  3. C 把工具输出当成索引而不是结论
  4. D 用报告里的关键词回到检索式补漏
  5. E 记录本轮哪些判断由人做出
A A

要不要把综述选题交给工具,判断依据通常不是题目热不热门,而是这个题目下核心文献的数量,以及这些文献能不能靠摘要判断。核心文献在几十篇量级、且摘要信息足够时,自己一篇篇读完往往比配置工具、校对输出更快;核心文献上百篇、跨多个子方向时,先让工具做一轮筛选和聚类,再回到原文精读,通常更省时间。可以先按下面的顺序做一次判断,再决定是否投入工具流程。

先把题目下的核心文献数成一个可比较的数字:限定数据库、年份和文献类型,把检索式和命中数记在一个文件里,再人工区分核心与边缘。核心文献少、摘要可判的,自己精读一遍更划算;核心文献多、跨方向的,交给工具做初筛、聚类和线索索引,但工具输出只当索引,不当结论。工具报告里的高频词用来补检索漏项,凡是进入草稿的判断都要留下人做判断的记录。

先数清题目下的核心文献有多少篇

“文献很多”是个模糊感受,先把它变成一个数字。计数范围需要界定清楚:用哪几个数据库(例如 Web of Science、Scopus、CNKI、PubMed 中的哪几个)、年份区间、语言限制、文献类型(只算期刊论文,还是包含会议论文、预印本、学位论文)。范围不同,数字会差很多,同一篇综述里不要混用两套口径。

检索式要原样记录下来,建议单独建一个 search-log 文本文件,每条记录包含编号、数据库、检索式、执行时间、命中数。示例格式如下,字段可以按自己习惯增删,但检索式不要事后修改而不留痕:

# search-log.txt
S1  | Scopus | TITLE-ABS-KEY(("topic a" OR "topic b") AND (review OR survey)) AND PUBYEAR > 2018 | hits=412
S2  | CNKI   | SU=('主题A' + '主题B') AND YE BETWEEN 2019-2024                  | hits=87

命中的条目导出为 BibTeX 或 RIS 后先去重,再统计实际条数。用一行命令核对导出文件里的条目数,避免把重复导出当成新增文献:

grep -c "^@" search-2024.bib
# Python 版本,便于按类型分别统计
python - <<'PY'
import re, collections
text = open('search-2024.bib', encoding='utf-8').read()
types = re.findall(r'^@(\w+)\{', text, flags=re.M)
print(len(types), collections.Counter(types))
PY

去重后的条目要人工分成核心与边缘。核心的判断标准通常包括:研究问题与你的综述题目直接对应、方法或数据被后续文献反复引用、发表在本领域主要期刊或会议上、初筛后仍保留在候选清单里。边缘文献指主题相邻、只提供背景或案例的条目。真正影响分流决策的是核心文献数,不是总命中数。

按可读性判断哪一批必须自己读

核心文献数只是第一层判断,第二层是这批核心文献能不能靠摘要判断。有些文献摘要写完结论,你读完摘要就知道能不能用;有些文献摘要只写“本文研究了某问题”,方法细节、样本条件、结论边界全在正文里,这类必须自己读。

建议把满足以下任一条件的文献列进“必须精读”清单:

  • 摘要没有交代数据来源、样本规模或实验条件,而这些直接影响结论能否迁移到你的综述范围。
  • 同一子方向内结论互相矛盾,需要核对原文的方法差异,摘要看不出分歧来源。
  • 该文献提出的方法或分类框架会被你直接沿用,需要确认定义、边界和适用条件。
  • 属于本领域的奠基性或高被引文献,引用时不能只转述二手概括。
  • 工具初筛给出的相关性判断与你的直觉不一致,需要原文核对。

核心文献只有十几篇、且大多不满足上述条件时,直接自己读完再写,通常比搭一套工具流程更省事。核心文献上百篇、分成几个子方向时,可以只对其中少部分做精读,其余交给工具初筛,把精读预算集中在真正影响结论的那一批上。

文献多的综述选题交给 Write For You、文献少的先自己读一遍

把工具输出当成索引而不是结论

工具对文献的概括、主题聚类、相关性排序都属于中间产物,可以作为查找线索,不能直接引用。区分方式很简单:能在原文里找到对应句子的内容,才可能进入草稿;只能在工具报告里找到的内容,先只当线索。

  • 可以当线索:主题聚类给出的方向划分、高频术语、被反复提到的作者或文献、可能相关但你还没读过的条目。
  • 可以进入草稿:文献的元数据(作者、年份、期刊、DOI)、你自己记录的检索式、基于人工阅读归纳的分类框架草稿。
  • 不能直接进入草稿:工具对某篇文献结论的概括、对方法优劣的评价、对“研究空白”的判断、以及任何没有回到原文核对的数字。

衔接方式是给每条线索标注状态,例如“待核对”“已核对(附原文位置)”“已排除(原因)”。工具输出里被标为相关的条目,逐条打开原文确认后再改状态,没有确认的条目不要写进正文。

用报告里的关键词回到检索式补漏

初轮检索一般会漏掉同义词、缩写和相邻领域的术语,工具报告正好可以拿来补。补漏的关键词通常来自几处:报告里的高频术语、你精读时在原文中看到但检索式没写的表达、数据库的主题词或关键词字段、以及被反复引用的相邻方向术语。

拿到候选关键词后不要直接替换原检索式,而是新增一条编号检索,保留原检索式和新增检索式,方便对比命中差异。记录方式可以沿用前面的 search-log,增加“parent”和“新增纳入”两列:

S3 | Scopus | TITLE-ABS-KEY(("term c" OR "term d")) AND PUBYEAR > 2018 | parent=S1 | hits=63 | 新增纳入=9

新增纳入的条目同样要去重、同样要人工判断核心与边缘。补漏轮次建议控制在两三回,之后新增关键词带来的边际收益会明显下降,继续扩检索式不如回到已纳入文献里做引用追踪。

记录本轮哪些判断由人做出

后续写作要能说清每个结论的来源,靠的是过程留痕。留痕方式不用复杂,一个 decisions 文件加正文里的注释标记就够。decisions 文件按时间顺序记下:谁做的判断、依据是什么、影响范围是什么。

# decisions.txt
- 2024-xx-xx | 剔除 S1 中 2019 年前的条目 | 依据:综述范围限定近五年 | 影响:候选清单减少
- 2024-xx-xx | 将文献 X 列为必须精读 | 依据:摘要未交代样本条件,与主题高度相关

需要标注的段落类型主要有三类:事实性陈述(有原文出处,标注文献编号和页码或章节)、判断性陈述(人做出的归纳或取舍,标注判断依据)、工具生成内容(只作为线索,标注“待核对”,核对完成前不进入正文)。在草稿里用行内标记区分,例如 [F1] 表示事实来自文献 1,[J] 表示人做的判断,[T] 表示工具线索。这样在后续修改时,能一眼看出哪句话需要回到原文确认,哪句话是自己的判断、需要重新审视是否站得住。