先把研究问题写成清单——再交给 Academic Research Skills

文章导读
课题刚开始就打开工具乱试,通常是因为主研究问题还没固定:工具能返回一堆材料,但你没法判断哪一份该留、哪一份该扔,回头一看问题和文献都没对齐。可行的前置动作是——把主研究问题拆成 3~5 个能分别回答的子问题,给每个子问题写上证据类型和检索范围,再决定哪些子问题交给 Agent 检索、哪些自己精读。适用场景是需要多来源证据的课题;风险边界是拆解质量取决于你对领域的熟悉程度,Agent 只按你给的口径
📋 目录
  1. Ⅰ 把主研究问题拆成 3~5 个能分别回答的子问题
  2. Ⅱ 给每个子问题标注证据来源与检索范围
  3. Ⅲ 把子问题映射成 Agent 任务并写清输出格式
  4. Ⅳ 规定每份交付物的验收标准
  5. Ⅴ 按子问题回收结果并记录哪些需要重做
A A

课题刚开始就打开工具乱试,通常是因为主研究问题还没固定:工具能返回一堆材料,但你没法判断哪一份该留、哪一份该扔,回头一看问题和文献都没对齐。可行的前置动作是——把主研究问题拆成 3~5 个能分别回答的子问题,给每个子问题写上证据类型和检索范围,再决定哪些子问题交给 Agent 检索、哪些自己精读。适用场景是需要多来源证据的课题;风险边界是拆解质量取决于你对领域的熟悉程度,Agent 只按你给的口径取回零件,不能替你判断问题本身值不值得问。

先把主研究问题写成子问题清单,再决定哪些交给 Agent:每个子问题写明证据类型、来源与检索范围,映射成带输出格式和停止条件的任务,最后按子问题回收并记录重做项。判断方式是看每份交付物是否给出出处、是否区分事实与推测、是否覆盖全部子问题。拆解和验收仍需人工确认,工具只负责按口径取回可拼接的零件。

把主研究问题拆成 3~5 个能分别回答的子问题

拆解的目标不是把问题写细,而是让每个子问题可以被单独检索、单独验收。建议每个子问题写成三行:一句话问句、它需要的证据类型、可接受的答案形式。证据类型必须写具体,否则 Agent 会把观点、案例、统计数字混在一起返回。

以“某类模型在中文长文档问答上的可用性如何”这个主研究问题为例,可以先拆成四个子问题:

  • 子问题 A:现有公开评测在中文长文档场景覆盖到什么程度。证据类型:数据集说明与统计口径。可接受答案:数据集名称、文档长度分布、语言构成。
  • 子问题 B:已有方法处理长上下文的方式有哪些。证据类型:方法对比。可接受答案:按“是否训练、是否检索、是否压缩”归类的对照表。
  • 子问题 C:是否有落地案例或工程报告。证据类型:案例与工程描述。可接受答案:场景、部署约束、明确写出的失败点。
  • 子问题 D:评测口径不一致时结论会怎么变。证据类型:方法比较与口径说明。可接受答案:同一指标在不同口径下的解释差异。

子问题数量控制在 3~5 个,超过之后每个问题的证据类型容易重复,回收阶段会分不清哪份材料该归到哪一条。

给每个子问题标注证据来源与检索范围

检索口径不同,结果就没法合并。给每个子问题单独写清四项:来源类型、关键词组合、时间跨度、语言限定。来源类型建议写“期刊库 / 预印本 / 标准或官方文档 / 代码仓库 / 企业技术博客”这类可定位的类别,不要只写“网上资料”。

子问题编号:B
来源类型:预印本、会议论文、官方文档
关键词组合:(long context OR long document) AND (question answering OR QA) AND Chinese
时间跨度:近五年,更早的仅在方法被反复引用时纳入
语言限定:中英文,其他语种仅在无替代时纳入并标注
排除项:无出处转载、纯产品宣传页

时间跨度和语言限定需要结合课题确认:口径放宽会显著增加筛选量,收窄又可能漏掉奠基性工作。可以先按一个较紧的口径跑一轮,看返回材料是否足够支撑子问题,再决定是否放宽。

把子问题映射成 Agent 任务并写清输出格式

任务是子问题的执行切片,一个子问题可以对应一个或多个任务。任务描述建议固定四段:目标、输入范围、输出格式、停止条件。输出格式写死,是为了让结果能直接拼进后续对比表,而不是返回一篇散文。

先把研究问题写成清单——再交给 Academic Research Skills
目标:整理“长上下文模型在中文长文档问答上的公开方法对比”
输入范围:仅限子问题 B 定义的来源类型与关键词,不扩展其他主题
输出格式:表格,每行 = 方法名 / 适用文档长度 / 是否需要额外训练 / 出处(标题 + 链接或编号)
停止条件:连续两轮检索无新增可归入表格的方法,或表格已达约定行数时停止,并说明未覆盖范围

映射关系可以先记成一张小表,避免同一个子问题被重复下单,也避免某个子问题始终没人处理:

子问题证据类型交给谁任务编号
A数据集与统计口径Agent 检索 + 自己复核T1
B方法对比Agent 检索T2
C案例与工程描述自己精读T3
D口径差异分析自己写,Agent 只供原文T4

判断哪些交给 Agent,通常看两点:材料是否以文本检索为主、结论是否不需要跨来源判断。需要交叉推理和取舍的子问题,建议自己写。

规定每份交付物的验收标准

把“看起来还行”换成可核验的项。每份交付物回收时至少过这三关:

  • 是否给出出处:每条结论能定位到具体文档、章节或链接;只写“有研究表明”一律退回。
  • 是否区分事实与推测:原文写了什么、你推断什么,分列或分段标注;两者混写视为未通过。
  • 是否覆盖全部子问题:对照上表逐条打勾,缺失项写明缺失原因,不允许用“其他内容”含糊带过。

再补两项可选项:是否说明检索范围与时间跨度、是否列出被排除的材料及排除理由。这两项不是每份都要,但对方法对比和口径分析类子问题,通常是必要的。验收标准要在下单时一起给出,事后补标准容易变成按结果倒推。

按子问题回收结果并记录哪些需要重做

回收节奏建议按子问题而不是按时间:某个子问题的任务全部返回后再统一验收,避免材料堆在一起收不了尾。回收时维护一张表,字段可以先用这些:子问题编号、任务编号、交付物路径、出处完整性、事实与推测是否分列、子问题覆盖情况、状态、重做原因。

重做触发条件写明阈值,避免每次靠感觉决定:出处缺失的条目达到约定比例(例如超过一半,具体比例需结合课题容忍度确认)、事实与推测混写、覆盖的子问题少于约定数量,命中任一条即重新下单或补充检索。重做时在任务描述里补上失败原因和新的输出格式要求,不要原样重跑。