超级促销周Claude Skills——20% 折扣
Tips

如何用 AI 撰写文献综述:2026 年工作流

Powerdrill Bloom·
如何用 AI 撰写文献综述:2026 年工作流

阅读 40 篇论文并不难。在脑海中同时理清 40 篇论文,从而说出该领域真正的共识,这才是难点。

这正是 AI 工作空间能够真正提供帮助的任务。但这也是一项有着严格界限的任务。规范文献综述的标准关乎方法和可追溯性,而没有任何工具可以代您提供这两者。

本指南将介绍哪些地方的帮助是切实的、哪些责任仍由您承担,并提供一个能够产出站得住脚的草稿的工作流。

文献综述的真正目的

文献综述不是一堆摘要的堆砌。它是对一系列研究工作的论证。它阐明了哪些观点已成定论、哪些研究结果存在冲突,以及还有哪些领域尚未有人涉足。

读者想从中了解 3 件事:该领域研究了什么?是如何研究的?这些研究共同说明了什么?

以下的每一个步骤都是为了回答其中一个问题。而逐篇总结论文无法回答其中的任何一个。这就是为什么逐篇罗列的文献综述读起来像是一个清单,而不是一个论证。

报告标准的要求

在动笔之前,非常值得去阅读一下这里最广泛使用的标准,因为它明确了评审文献综述的依据。

The PRISMA statement — Preferred Reporting Items for Systematic reviews and Meta-Analyses — describes itself as "a guideline designed to improve the reporting of systematic reviews."

注意“报告”(reporting)这个词。该声明自身的总结对其范围有着明确的界定。PRISMA“为作者提供了如何完整报告为何进行系统评价的指导和示例。”同一句话继续写道:“使用了什么方法,以及发现了什么结果。”

这句话正是此处使用 AI 的全部边界条件。工具可以帮助您了解论文说了什么。而您的方法之所以具有可报告性,是因为您做出并记录了决策,这部分工作完全属于作者。

PRISMA 2020 是主要指南。它“由各种 PRISMA 扩展版进行补充”,声明指出这些扩展版“为不同类型或不同方面的系统评价报告提供指导”。例如,范围综述(scoping reviews)就有其专属的扩展版。

并非每篇文献综述都是系统评价,大多数课程作业也不是。但其报告逻辑适用于任何文献综述:说明原因、说明方法、说明发现。

AI 在哪些方面有帮助,哪些方面没有

明确这一点可以免去日后的麻烦,特别是当您所在的机构要求在文献综述旁附带一份声明时。

任务实际帮助谁承担最终责任
寻找论文有限——工作空间只读取您提供的内容您负责构建语料库
提取方法、样本和研究结果强大,可同时跨多个文档进行您负责对照原文进行核实
构建对比矩阵强大您负责决定列属性
发现研究之间的分歧擅长发现,不擅长裁决您负责判断哪个研究结果成立
撰写综合论述可作为初稿参考您负责撰写论证
引用和引文必须逐一检查始终由您负责

第一行是人们最容易出错的地方。AI 工作空间是基于您上传的文档进行工作的。它不会代您检索付费订阅数据库,这意味着您文献综述的覆盖范围完全取决于您收集了什么。

这绝非一个小问题。覆盖范围是评审人员对任何文献综述提出质疑的首要问题。这也是整个流程中毫无疑问需要手动完成的部分。

首先构建语料库

在打开任何工具之前先做这件事。语料库决定了文献综述后续的一切。

将问题定义得足够具体,以便能够回答。“远程工作与生产力”是一个主题;而“自 2020 年以来,完全远程工作对知识型岗位实测生产力的影响”则是一个有明确界限的问题。

直接检索您所在领域的数据库。记录下使用了哪些数据库、哪些检索词以及哪个日期范围——在撰写方法部分时,您会需要这三项内容,而事后重新构建这些信息会非常痛苦。

应用纳入和排除标准,并记录每个阶段的数量。找到了多少条记录,筛选后剩下多少条,完整阅读了多少篇。这正是 PRISMA 要求您报告的轨迹。

然后将 PDF 导出到一个文件夹中。该文件夹就是您的输入源。

关于文件质量的一个实用建议。没有文本层的扫描版 PDF 提取效果很差,混合了清晰文件和扫描文件的语料库会产生参差不齐的结果。在假定整套文件都可读之前,先检查其中几篇,并在有出版商版本的情况下替换掉扫描版。

构建综合矩阵

综合矩阵是将一堆论文转化为文献综述的中间产物。行代表来源,列代表主题或变量,单元格则记录每个来源对每个主题的阐述。

横向阅读一行可以了解一篇论文。纵向阅读一列可以了解该领域对某个问题的立场——而这正是您实际要撰写的内容。

矩阵还能让“缺失”显现出来,而纯文本则做不到这一点。某一列中的空白区域标志着一组从未探讨过该问题的论文。这种空白往往是整个研究中最具发表价值的发现,而当您按顺序阅读时,它几乎是不可见的。

将其构建为电子表格,而不是文档。您需要反复对其进行排序、筛选和重新排序,而表格对这些操作的承载能力是文本文件无法比拟的。

步骤 1:上传语料库并定义列属性

打开 Powerdrill Bloom 并将 PDF 作为集合上传。用自然语言描述您想要的矩阵,并明确命名各列。

常用的默认列包括作者和年份、研究问题、方法、样本和背景、主要发现以及声明的局限性。添加一到两个针对您特定问题的列——例如您关注的变量,或每篇论文所使用的理论框架。

亲自定义列属性是至关重要的一步。它们体现了您对这场辩论核心的理解,而通用的列设置只会产出平庸的文献综述。

上传论文语料库并定义提取列

步骤 2:对照原文核实每一行

将生成的矩阵视为具有已知失效模式的草稿。提取在处理明确表述时是可靠的,但在处理任何含蓄暗示的内容时可靠性较低。

对照论文本身检查样本量、日期和效应方向。相反的符号或误读的样本量会扩散到您的综合论述中,并且以后很难被发现。

特别注意局限性列。作者会在不同的地方阐述局限性——有时在讨论部分,有时在脚注中——而这正是提取最容易遗漏内容的地方。

步骤 3:纵向阅读各列并指出分歧

现在,发挥该矩阵的作用。一次看一列,并思考该领域集体表达了什么。

让工作空间根据在每个主题上的立场对来源进行分组,并标记研究结果冲突的地方。冲突是这里最有价值的产出——共识很容易写,而分歧才是文献综述体现其价值的地方。

然后亲自审视这些冲突。两项研究产生分歧是因为方法、样本、时期还是定义的不同?这个问题是文献综述的思想核心,需要由您来回答。

正在处理大量的 PDF 语料库?立即体验 Powerdrill Bloom

纵向阅读提取列以指出研究之间的分歧

将矩阵转化为文字论述

矩阵是脚手架,而不是文献综述本身。将前者转化为后者遵循一个可靠的模式。

按主题组织,绝不要按论文组织。每个部分针对一个问题,报告现有研究对此的阐述,并为每个论点引用多个来源。

每个段落应以论点开头,而不是以引用开头。“3 项研究发现生产力没有差异”读起来像是一个论证。而“Smith (2023) 发现……”读起来则像是一个清单。

明确处理冲突。当研究存在分歧时,直接指出,然后解释可能的原因。一篇抹平分歧的文献综述,其价值远不如一篇梳理出分歧脉络的综述。

以研究空白收尾。还有什么尚未被研究,为什么这很重要?这正是文献综述值得被引用的原因,它直接源自您矩阵中的空白单元格。

矩阵元素转化为文字论述
一列一个主题章节
纵向列中的共识带有多个引用的论点
纵向列中的冲突解释来源为何存在差异的段落
空白区域结论中的研究空白
局限性列您对证据质量的评估

对于阅读步骤本身,这里有一份关于如何自动将 50 页的 PDF 报告总结为核心见解的演练。对于直接处理文档,这里有一份与 PDF 对话的指南。

保留一份站得住脚的记录

有两份文档与文献综述本身同样重要,而且在进行过程中随时记录要比事后重新构建容易得多。

第一份是检索记录。包括查询的数据库、确切的检索字符串、日期范围以及每个筛选阶段的记录数量。这能让读者判断覆盖范围,也是当结论令人惊讶时,评审人员首先检查的部分。

第二份是关于工具参与情况的记录。哪些步骤使用了 AI 工作空间,以及您做了什么来验证每个步骤的输出。现在许多机构都会直接要求提供此项内容,将其写下来可以将一个尴尬的问题转化为两行字的简单回答。

这两份文档都不需要太复杂。对于大多数项目来说,单页内容就足够涵盖这两者,而且共享文档比私人文档效果更好。

除了合规之外,这还有一个实际的好处。在提取 6 周后,您将不记得某个特定的样本量是来自摘要还是方法部分。而这份记录无需重新打开 40 篇 PDF 就能回答这个问题。

记录内容为什么需要它
数据库和检索字符串方法部分,以及应对任何关于覆盖范围的质疑
每个筛选阶段的数量重建筛选过程
纳入和排除标准解释为什么某篇已知的论文没有被纳入
哪些步骤使用了工具信息披露要求
验证了什么以及如何验证应对对特定数字的质疑

什么时候该工作流不适用

值得指出的是,在某些情况下,上述方法反而会增加工作量,而不是减轻负担。

对 5 或 6 篇论文进行综述不需要矩阵。您完全可以在脑海中理清 6 篇论文,为它们搭建脚手架的成本远超其带来的收益。

如果综述的论证真正关乎某一个理论传统,而不是累积的研究结果,那么从制表中获益较少。提取在处理可衡量的论点时效果很好,但在处理解释性立场时效果较差。

元分析的要求比这里描述的任何内容都要严格。效应量、异质性和偏倚风险评估都遵循既定的方案,提取步骤需要满足这些方案,而不是使用通用的列设置。

如果您所在的领域需要注册方案,请在提取开始前进行注册。事后注册会违背其初衷。

常见错误

逐篇总结论文。这是最常见的结构性失败。它产出的是一份冠以错误标题的有注释的书目。

让工具来设定主题。通用的列会产生通用的章节。这些列其实就是您论证的大纲形式。

因为输出看起来很笃定就跳过验证。流畅的提取和正确的提取是两码事,两者的差异会在您的方法部分中显现出来。

未能记录检索过程。您未纳入的论文也是方法的一部分,事后重新构建检索很少能产生完全相同的列表。

未经检查就直接采用引用。每条参考文献都必须追溯到源头。这是不可妥协的,而且比起出错的后果,这花不了多少时间。

将分歧视为噪音。在大多数文献中,冲突的研究结果才是提供最多信息的部分。

先写引言。文献综述的框架应该源自矩阵所展示的内容,而不是先于它。在阅读之前撰写的引言往往会宣告一个证据并不支持的结论。

过度收集。40 篇精选的论文胜过通过广泛检索收集的 100 篇。每增加一个来源都会消耗验证时间,而边缘性的来源很少能改变论点。

把研究空白部分留到最后并草草了事。研究空白通常是综述中被引用最多的部分,它值得您花心思撰写,而不是在半夜草草写下一个段落。

快速参考

阶段产出AI 节省的时间
定义问题一个有界限、可回答的问题无——这完全取决于您
检索与筛选一个 PDF 文件夹及检索记录无——直接检索数据库
提取填充完整的综合矩阵大幅节省
验证经核对的矩阵无——这是为上一行付出的代价
综合分组的立场和指出的冲突大幅节省
撰写综述本身适度,作为初稿
引用经核实的参考文献

从最后一列可以明显看出规律。帮助主要集中在中间环节,即工作量巨大的部分。而开头和结尾仍需手动完成,因为那是需要发挥判断力的地方。

针对该领域的专用工具,这里有学术 AI 工具以及用于 PDF 数据提取和分析的 AI 工具的汇总。

常见问题解答

AI 能帮我写文献综述吗?

一旦您收集并验证了材料,它就可以帮您起草各个章节,而且它在跨多篇论文的提取和对比方面确实非常强大。但有 3 件事仍由您决定:设定研究问题、保证覆盖范围以及对准确性承担责任。评审人员会在这 3 个方面对您进行严格考量。

什么是综合矩阵?

一种行代表来源、列代表主题或变量的表格。横向阅读一行可以总结一篇论文;纵向阅读一列可以展示该领域对某个问题的看法。它是从阅读过渡到写作的标准中间步骤。

撰写文献综述允许使用 AI 吗?

政策因机构和期刊而异,现在许多机构和期刊都要求披露如何使用 AI。请检查适用于您的指南,并记录哪些步骤涉及使用工具。无论如何,对准确性承担的责任始终由作者承担。

PRISMA 有什么要求?

PRISMA 是系统评价的报告指南。它要求作者完整报告进行综述的原因、使用的方法以及发现的结果。其扩展版涵盖了其他综述类型,例如范围综述。

文献综述应该包含多少个来源?

这没有固定的数量,取决于研究范围和领域。更重要的是您的检索和筛选过程是有记录且站得住脚的。读者应该能够清楚地知道哪些内容被纳入了,哪些内容被排除了。

来源:PRISMA 声明,prisma-statement.org,包括 PRISMA 2020 及其扩展版。