做医学文献综述时,AI 检索工具靠谱吗?我更看重它会不会在证据不足时停下来

AI 摘要 / TL;DR

AI正在改变科研信息收集方式,但医学综述、证据盘点和引文管理不能只追求“快速生成结论”。一次围绕SGLT2抑制剂与成人心力衰竭结局的检索显示,三库并行检索得到12条候选记录,去重后剩11条独立记录,但可核验直接证据不足,Q1门禁评分0.42未通过。更适合科研场景的AI工作流,应把查询规划、去重、证据分级、门禁判断、纠偏补查和人工审批串成可复查链路。

先说结论

如果用 AI 做医学文献综述,我不会只看它能不能“搜到很多文献”,也不会只看它能不能快速写出一段结论。我更看重三件事:

  • 检索过程能不能复查;
  • 证据和书目记录能不能区分;
  • 证据不足时,系统会不会明确停下来。

一次围绕 SGLT2 抑制剂对成人心力衰竭结局影响 的检索运行,很典型地说明了这一点:OpenAlex、Europe PMC、Crossref 三路并行检索后,初筛得到 12 条候选记录,去重后剩 11 条独立记录;但由于可核验直接证据不足,Q1 门禁评分只有 0.42,未通过。最终输出的不是一个确定性医学结论,而是缺失清单、纠偏方案、审计记录和 Zotero 交接包。

这反而是我认为比较可靠的地方:它没有把“检索到了”偷换成“已经证实了”。

一、真实问题:医学综述到底能不能交给 AI 跑?

很多人现在做开题、综述、指南更新或证据盘点时,都会遇到一个问题:

文献太多,数据库太分散,检索式、去重、引文整理、证据判断都很耗时间。能不能用 AI 工作流先跑一遍?

我的经验是,可以用,但不要把它当成“自动写结论机器”。

在医学研究里,最危险的不是漏掉几篇文献,而是把不完整的证据包装成确定判断。尤其是涉及心衰住院、心血管死亡、亚组差异这类临床结局时,只看标题、摘要或指南条目,很容易产生过度推断。

所以,一个更合理的选型标准不是“它能不能给答案”,而是:

  • 能不能先固定研究问题;
  • 能不能按数据库差异规划查询;
  • 能不能保留失败和异常;
  • 能不能区分 metadata、摘要证据和直接证据;
  • 能不能设置证据门槛;
  • 门槛没过时,能不能主动停止并给出补查方向。

下面这个案例,就是按这个思路跑下来的。

二、先把研究问题固定下来,而不是先搜关键词

这次研究问题被限定为:SGLT2 抑制剂对成人心力衰竭患者结局的影响。

具体问题也比较明确:截至 2025 年 12 月 31 日,SGLT2 抑制剂是否降低心衰住院和心血管死亡?在 HFrEF、HFmrEF、HFpEF 三类人群中,效果是否一致?

同时,纳入和排除标准先写清楚:

  • 纳入:RCT、系统综述、荟萃分析和正式指南;
  • 排除:动物实验、细胞实验、单纯糖尿病研究、评论和新闻稿。

这一步很关键。很多综述质量不稳定,不是因为后面写得不好,而是研究问题一开始就太散。问题没有收窄,后面的检索边界就会漂移,结果里会混进大量看似相关、实则无法回答问题的记录。

截图 1 | 研究方案输入:主题、时间范围与纳入/排除标准

为了避免术语混淆,先把几个关键概念放在这里:

术语含义
SGLT2 抑制剂钠-葡萄糖协同转运蛋白 2 抑制剂,常用于糖尿病和心衰相关研究。
HFrEF射血分数降低型心力衰竭。
HFmrEF射血分数轻度降低型心力衰竭。
HFpEF射血分数保留型心力衰竭。
RCT随机对照试验。
RIS / CSL-JSON常见引文交换格式,用于文献管理工具导入。
Q1 门禁结论放行前的证据门槛,需先满足可核验证据数量要求。

三、核心痛点:搜到文献,不等于拿到证据

医学综述里最容易被低估的一个问题是:书目记录和直接证据不是一回事。

一条记录有 DOI、PMID,或者出现在指南参考文献里,只能说明它是一个可追踪的文献条目;但它是否回答了当前问题,还要看它有没有提供对应结局、效应量、研究人群和亚组数据。

例如这次要回答的是:

  • SGLT2 抑制剂是否降低心衰住院?
  • 是否降低心血管死亡?
  • 在 HFrEF、HFmrEF、HFpEF 中效果是否一致?

如果只找到指南、综述或试验设计论文,但没有拿到可核验的主要结果和效应量,就不能直接推出确定结论。

这也是为什么我认为,一个严谨的 AI 文献工作流,必须内置“证据门禁”。否则它很容易变成一个把相关文献拼接成流畅文字的工具,看起来专业,实际证据链并不完整。

四、不同方案对比:手工检索、普通 AI 问答、工作流式检索

做这类资料工作,常见有三种方式。

方案优点主要问题
手工检索研究者掌控感强,适合精读和最终判断数据库切换、去重、引文整理耗时;过程容易散落在个人笔记里
普通 AI 问答上手快,适合快速了解背景容易跳过检索审计;可能把不完整证据组织成确定结论
工作流式检索能保留查询、命中、异常、去重、证据矩阵和门禁记录仍需要人工确认;证据不足时不会直接给“漂亮答案”

如果只是临时查几篇论文,手工搜索可能最快。

但如果场景是医学综述、课题组协作、指南更新、证据盘点、投研资料核验,单靠手工流程会有两个问题:一是重复劳动多,二是过程很难完整交接。

这类场景里,我更倾向于使用工作流式检索:让系统承担查询规划、并行检索、去重、格式整理、缺失项提示等机械工作,把关键判断留给人。

五、这次运行是怎么做查询规划的?

比较好的做法不是把同一串关键词直接丢给多个数据库,而是先把研究问题拆成不同系统能理解的检索条件。

这次分别面向 OpenAlex、Europe PMC、Crossref 生成查询:

  • OpenAlex 使用对应的过滤语法;
  • Europe PMC 加上 FIRST_PDATE 限定;
  • Crossref 使用对应查询参数。

这样做的意义不只是自动化,而是把检索规则留下来。之后复查时,可以看到当时到底查了什么、为什么某些结果被纳入或排除。

截图 2 | 查询规划:为三个数据库分别生成检索式

六、三库并行检索:成功、失败和异常都要记录

查询规划完成后,三路检索同时发起。实际结果如下:

来源原始命中状态
OpenAlex766 条成功;日期范围仍需人工确认
Europe PMC11,882 条成功;日期限定合规
Crossref失败;参数校验未通过,已写入审计日志

这里有两个细节值得注意。

第一,Crossref 失败没有被悄悄跳过,而是明确写入审计记录。失败本身也是信息,因为它会影响后续证据完整性判断。

第二,OpenAlex 虽然返回了 766 条结果,但日期范围仍需人工确认,所以不能简单标成“完全合规”。

在科研信息收集里,异常记录和成功记录一样重要。否则最后拿到一份报告时,很难判断它到底漏了什么、哪里需要补查。

截图 3 | 三库检索结果:命中数、状态与异常记录

七、从 12 条候选到 11 条独立记录:去重只是第一步

三个来源返回的数据经过初步筛选后,得到 12 条候选记录。去重后剩下 11 条独立记录,其中 1 条被识别为重复位置。

随后按研究类型和标识符继续整理:

  • 正式指南:2 条,包括 2021 ESC 心衰指南和 2023 ESC 指南更新;
  • 系统综述 / 荟萃分析:4 条;
  • RCT 主要结果:0 条,只有 1 条试验设计论文;
  • 直接匹配研究问题:2 条;
  • 可核验的直接结局记录:0 条。

这一步暴露了一个很现实的问题:初筛后看起来有文献,但真正能直接回答问题的证据并不够。

尤其是这次要判断心衰住院、心血管死亡以及三类心衰人群的效果一致性,只靠指南和综述条目远远不够。还需要回到关键 RCT 主要结果,提取 HR/RR 与 95% CI,并核验亚组交互作用。

截图 4 | 检索审计与证据包:命中结果、时间范围与研究类型核验

八、为什么我认可这次结果:Q1 门禁没过,系统停了下来

这次工作流预先设置了 Q1 门禁:至少要有 3 条可核验的直接证据,才允许继续生成确定性结论。

实际评分是 0.42,未通过。

未通过原因也列得很清楚:

  • 直接匹配且可核验的记录不足 3 条;
  • 缺少心衰住院和心血管死亡的效应量;
  • 缺少 HFrEF、HFmrEF、HFpEF 分层数据;
  • 缺少第三来源复核。

这一步在我看来非常重要。

如果是纯手工流程,做到这里很容易凭经验继续写,比如“指南里应该有”“大方向应该没问题”。但门禁机制把这个动作拦住了:不是没有检索结果,而是现有结果还不足以支撑这几个具体问题。

截图 5 | Q1 门禁判定:score 0.42,未通过;直接证据、关键效应量与第三来源复核均有缺口

需要说明的是,Q1 门禁 0.42 的具体计算公式、阈值来源和版本信息仍需要在正式方法学说明中补充。作为研究交付物使用时,这部分不应被省略。

九、证据不够时,正确动作不是硬写,而是纠偏补查

门禁未通过后,工作流没有直接结束,也没有自行放行结论,而是规划了一轮定向补查。

补查重点包括 DAPA-HF、EMPEROR、DELIVER 等关键试验,并把“是否合并纠偏结果继续”交给人工审批。

这点符合我对科研工具的基本要求:

  • 系统可以提示缺什么;
  • 系统可以规划下一轮怎么查;
  • 但是否接受补查方案、是否合并新结果、是否继续生成综述,必须由人确认。

截图 6 | 纠偏过程中的人工确认:是否继续生成综述,由人决定

十、最终结论不是“有效”或“无效”,而是“证据不足 / 待验证”

这次证据矩阵最终标注如下:

结论项状态
C1:心衰住院是否降低unsupported(证据不足)
C2:心血管死亡是否降低unsupported
C3:三型心衰的效果是否一致unsupported
C5:指南与试验设计的书目身份partial(仅元数据确认)

所以,这次运行不能用于形成临床决策结论。

这不是“没有价值”。恰恰相反,它把当前证据包的边界讲清楚了:哪些只是元数据确认,哪些缺少直接结局,哪些效应量还没提取,哪些关键试验需要补齐。

下一步也很明确:补齐四大 RCT 的主要结果,提取 HR/RR 与 95% CI,并核验亚组交互作用。

对医学综述来说,一个诚实的“证据不足 / 待验证”,往往比一个顺滑但证据链不完整的肯定结论更有价值。

十一、交付物不只是报告,还有可交接的证据包

运行结束后,工作流输出了一份完整结果 JSON,包含:

  • 搜索审计;
  • 证据矩阵;
  • 共识与争议;
  • 更新日志;
  • 监测计划。

同时生成 7 条 RIS / CSL-JSON 引文草稿,作为 Zotero 的模拟交接包。

这里的“交接包”不会越权直接写入 Zotero 库。它只是把需要导入的内容整理好,后续是否导入、如何核对,仍由使用者决定。

截图 7 | 交付物:搜索审计、报告结果与 Zotero 交接包

十二、拆开看,它其实是一条科研信息生产 SOP

这不是一个黑盒按钮直接吐答案的过程。它背后是一条比较清楚的 SOP:

  • 输入研究主题、时间范围、纳入 / 排除标准;
  • 查询规划 Agent 把问题转成数据库可执行的检索式;
  • OpenAlex、Europe PMC、Crossref 三个分支并行检索;
  • 合并结果并去重;
  • 核验标识符并整理研究类型;
  • 打包证据;
  • 执行 Q1 门禁;
  • 门禁不过则生成纠偏重检方案;
  • 人工审批是否继续;
  • 输出报告和 Zotero 交接包。

图 1 | 科研信息收集工作流架构:从研究问题到报告交付

这套工作流运行在 AstraFlow 的原生模拟环境中。平台提供 Agent 编排和 API 调用所需的运行环境,具体模型和数据源按任务接入。正式评估产品能力时,还需要进一步核验其官方文档、产品边界和可用的数据源接入方式。

十三、和手工流程相比,省下来的不只是复制粘贴

这次运行和常见手工流程的差异,主要不在“快”,而在“过程有没有留下来”和“结论有没有门槛”。

对比项手动流程工作流方式(本次运行)
数据库覆盖逐个登录、逐个写语法三库并行发起,异常也记录
原始命中处理766 + 11,882 条结果靠人翻Agent 筛出 12 条候选,再自动去重
去重肉眼比对标题和 DOI自动识别重复位置(12 → 11)
证据分级依赖个人判断和记忆按研究类型分类,并核验标识符
结论门禁主要靠自觉自动判定,并列出缺失清单
纠偏手动重查一遍自动规划,关键合并动作需人工审批
引文整理手动录入 Zotero生成 RIS / CSL-JSON 草稿
结论可信度容易凭印象判断用证据矩阵分级,unsupported 就直说
首轮审计耗时通常以天计约 10 分钟(06:31 → 06:40)

本次首轮审计从 06:31 开始,到 06:40 完成。

时间节省是一方面,更重要的是,它留下了查询式、命中数、失败原因、排除记录、证据矩阵和更新日志。换人接手,或者过一段时间重新更新,不必完全依赖个人记忆。

十四、这类工作流真正解决的三个问题

1. 减少机械整理

数据库切换、查询语法适配、初步去重和引文格式整理,不应该占用研究者太多精力。人更应该把时间花在研究问题、原文核验和结果解释上。

2. 把严谨性写进流程

至少几条直接证据才允许下结论,哪些字段必须核验,证据不足时如何补查,这些要求不能只存在于个人经验里。它们应该变成可检查的节点。

3. 让后续更新有迹可循

Living review、指南更新、持续证据监测都不是一次性任务。检索式、命中数、失败原因和更新日志被保留下来,后续更新才有基础。

这也是这类工作流适合放在统一开发平台上的原因:模型、Agent、外部 API 和结果文件可以组合在同一条链路里,换任务时调整其中一环即可,不必每次从零搭环境。

十五、适合哪些场景?不适合哪些场景?

适合

这类工作流更适合:

  • 医学生做开题综述;
  • 临床研究者做证据综述;
  • 高校课题组统一文献筛选流程;
  • 需要持续更新的 living evidence review;
  • 投研、产品团队做资料收集和交叉核验;
  • 多人协作且需要保留审计记录的项目。

不适合

以下情况未必需要上工作流:

  • 只是偶尔查几篇论文;
  • 不需要完整审计链路;
  • 研究者已经明确知道目标文献;
  • 只是做非常早期的背景了解。

如果目标只是快速了解一个概念,普通搜索或手工检索可能更快。

十六、实际使用建议

如果要把这类工作流用于严肃研究,我建议至少注意三点。

1. 门禁没过不等于白跑

门禁未通过时,报告里的缺失清单和纠偏计划反而很有价值。它告诉你接下来应该补什么,而不是让你凭感觉重新开始。

2. 人工审批不要跳过

纠偏结果是否合并、最终报告是否发布,这两道闸不能完全交给系统。科研判断仍然要由人负责。

3. 元数据不是事实

metadata_only 只能说明记录存在,不能证明结局、效应量或亚组结论已经被核验。正式引用前,必须回到原文。

总结:我会选择能“停下来”的工具,而不是只会“写下去”的工具

医学文献综述里,真正有价值的不是把文献“搜出来”,而是把检索、筛选、证据门禁和人工确认串成一条可审计链路。

这次运行没有给出 SGLT2 抑制剂与成人心衰结局的确定性结论,因为直接证据不足,Q1 门禁没有通过。它给出的结果是:证据不足 / 待验证,不能据此作临床决策;下一步需要补齐关键 RCT 主要结果、提取 HR/RR 与 95% CI,并核验亚组交互作用。

在我看来,这种结果比“强行生成一篇完整综述”更可信。

真正需要人决定的地方,工作流没有藏起来:证据够不够,结论能不能下,纠偏结果要不要合并,最后是否用于临床或研究决策,都由人把关。

下一次有人问“这个结论有证据支持吗”,理想状态不是凭印象回答,而是把检索记录、证据矩阵、缺失项和纠偏计划一起摆出来。

工作流:Academic Research — Living Evidence Review & Citation SOP(AstraFlow 原生模拟版)

FAQ

1. 这套流程为什么没有直接给出 SGLT2 抑制剂有效的肯定结论?

因为可核验的直接证据不足,Q1 门禁评分只有 0.42,未达到继续生成确定性结论的要求。现有材料不足以支撑心衰住院、心血管死亡和三类心衰人群一致性这几个具体判断。

2. metadata_only 可以直接当作事实引用吗?

不可以。元数据只能说明记录存在,不能证明结局、效应量或亚组结论已经被核验。正式引用前仍要回到原文。

3. 为什么 Crossref 检索失败也要保留?

因为失败本身就是审计信息。保留失败记录,才能复查参数、判断异常是否影响最终证据包,也能指导下一轮纠偏。

4. 这套流程最适合哪些任务?

最适合需要持续更新、多人协作、保留检索审计和引文交接的任务,比如医学综述、证据盘点、投研资料核验和课题组统一筛选。

5. 什么时候手工搜索更合适?

如果只是偶尔查几篇论文,且不需要完整审计链路,手工搜索通常更快。工作流更适合反复更新、多人协作和对证据链要求较高的场景。

6. 这类工具能替代研究者判断吗?

不能。它能减少机械整理、保留审计链路、提示缺失项,但不能替代原文核验、方法学评价和临床或研究决策。