# 做医学文献综述时，AI 检索工具靠谱吗？我更看重它会不会在证据不足时停下来

> 作者/来源: UCloud 运营管理员
> 发布时间: 2026-08-27T07:37:19.833Z
> 分类: AI专区
> 原文链接: http://117.50.162.249:3000/yun/articles/2754

---

## 先说结论

如果用 AI 做医学文献综述，我不会只看它能不能“搜到很多文献”，也不会只看它能不能快速写出一段结论。我更看重三件事：

- 检索过程能不能复查；
- 证据和书目记录能不能区分；
- 证据不足时，系统会不会明确停下来。

一次围绕 SGLT2 抑制剂对成人心力衰竭结局影响 的检索运行，很典型地说明了这一点：OpenAlex、Europe PMC、Crossref 三路并行检索后，初筛得到 12 条候选记录，去重后剩 11 条独立记录；但由于可核验直接证据不足，Q1 门禁评分只有 0.42，未通过。最终输出的不是一个确定性医学结论，而是缺失清单、纠偏方案、审计记录和 Zotero 交接包。

这反而是我认为比较可靠的地方：它没有把“检索到了”偷换成“已经证实了”。

## 一、真实问题：医学综述到底能不能交给 AI 跑？

很多人现在做开题、综述、指南更新或证据盘点时，都会遇到一个问题：

> 文献太多，数据库太分散，检索式、去重、引文整理、证据判断都很耗时间。能不能用 AI 工作流先跑一遍？

我的经验是，可以用，但不要把它当成“自动写结论机器”。

在医学研究里，最危险的不是漏掉几篇文献，而是把不完整的证据包装成确定判断。尤其是涉及心衰住院、心血管死亡、亚组差异这类临床结局时，只看标题、摘要或指南条目，很容易产生过度推断。

所以，一个更合理的选型标准不是“它能不能给答案”，而是：

- 能不能先固定研究问题；
- 能不能按数据库差异规划查询；
- 能不能保留失败和异常；
- 能不能区分 metadata、摘要证据和直接证据；
- 能不能设置证据门槛；
- 门槛没过时，能不能主动停止并给出补查方向。

下面这个案例，就是按这个思路跑下来的。

## 二、先把研究问题固定下来，而不是先搜关键词

这次研究问题被限定为：SGLT2 抑制剂对成人心力衰竭患者结局的影响。

具体问题也比较明确：截至 2025 年 12 月 31 日，SGLT2 抑制剂是否降低心衰住院和心血管死亡？在 HFrEF、HFmrEF、HFpEF 三类人群中，效果是否一致？

同时，纳入和排除标准先写清楚：

- 纳入：RCT、系统综述、荟萃分析和正式指南；
- 排除：动物实验、细胞实验、单纯糖尿病研究、评论和新闻稿。

这一步很关键。很多综述质量不稳定，不是因为后面写得不好，而是研究问题一开始就太散。问题没有收窄，后面的检索边界就会漂移，结果里会混进大量看似相关、实则无法回答问题的记录。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941294-0b526565be2e66de9d4090bc28a69265.jpg)

截图 1 ｜ 研究方案输入：主题、时间范围与纳入/排除标准

为了避免术语混淆，先把几个关键概念放在这里：

| 术语 | 含义 |
|---|---|
| SGLT2 抑制剂 | 钠-葡萄糖协同转运蛋白 2 抑制剂，常用于糖尿病和心衰相关研究。 |
| HFrEF | 射血分数降低型心力衰竭。 |
| HFmrEF | 射血分数轻度降低型心力衰竭。 |
| HFpEF | 射血分数保留型心力衰竭。 |
| RCT | 随机对照试验。 |
| RIS / CSL-JSON | 常见引文交换格式，用于文献管理工具导入。 |
| Q1 门禁 | 结论放行前的证据门槛，需先满足可核验证据数量要求。 |

## 三、核心痛点：搜到文献，不等于拿到证据

医学综述里最容易被低估的一个问题是：书目记录和直接证据不是一回事。

一条记录有 DOI、PMID，或者出现在指南参考文献里，只能说明它是一个可追踪的文献条目；但它是否回答了当前问题，还要看它有没有提供对应结局、效应量、研究人群和亚组数据。

例如这次要回答的是：

- SGLT2 抑制剂是否降低心衰住院？
- 是否降低心血管死亡？
- 在 HFrEF、HFmrEF、HFpEF 中效果是否一致？

如果只找到指南、综述或试验设计论文，但没有拿到可核验的主要结果和效应量，就不能直接推出确定结论。

这也是为什么我认为，一个严谨的 AI 文献工作流，必须内置“证据门禁”。否则它很容易变成一个把相关文献拼接成流畅文字的工具，看起来专业，实际证据链并不完整。

## 四、不同方案对比：手工检索、普通 AI 问答、工作流式检索

做这类资料工作，常见有三种方式。

| 方案 | 优点 | 主要问题 |
|---|---|---|
| 手工检索 | 研究者掌控感强，适合精读和最终判断 | 数据库切换、去重、引文整理耗时；过程容易散落在个人笔记里 |
| 普通 AI 问答 | 上手快，适合快速了解背景 | 容易跳过检索审计；可能把不完整证据组织成确定结论 |
| 工作流式检索 | 能保留查询、命中、异常、去重、证据矩阵和门禁记录 | 仍需要人工确认；证据不足时不会直接给“漂亮答案” |

如果只是临时查几篇论文，手工搜索可能最快。

但如果场景是医学综述、课题组协作、指南更新、证据盘点、投研资料核验，单靠手工流程会有两个问题：一是重复劳动多，二是过程很难完整交接。

这类场景里，我更倾向于使用工作流式检索：让系统承担查询规划、并行检索、去重、格式整理、缺失项提示等机械工作，把关键判断留给人。

## 五、这次运行是怎么做查询规划的？

比较好的做法不是把同一串关键词直接丢给多个数据库，而是先把研究问题拆成不同系统能理解的检索条件。

这次分别面向 OpenAlex、Europe PMC、Crossref 生成查询：

- OpenAlex 使用对应的过滤语法；
- Europe PMC 加上 FIRST_PDATE 限定；
- Crossref 使用对应查询参数。

这样做的意义不只是自动化，而是把检索规则留下来。之后复查时，可以看到当时到底查了什么、为什么某些结果被纳入或排除。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941224-06c11483e1f1623af5f3aef2c644a276.jpg)

截图 2 ｜ 查询规划：为三个数据库分别生成检索式

## 六、三库并行检索：成功、失败和异常都要记录

查询规划完成后，三路检索同时发起。实际结果如下：

| 来源 | 原始命中 | 状态 |
|---|---:|---|
| OpenAlex | 766 条 | 成功；日期范围仍需人工确认 |
| Europe PMC | 11,882 条 | 成功；日期限定合规 |
| Crossref | — | 失败；参数校验未通过，已写入审计日志 |

这里有两个细节值得注意。

第一，Crossref 失败没有被悄悄跳过，而是明确写入审计记录。失败本身也是信息，因为它会影响后续证据完整性判断。

第二，OpenAlex 虽然返回了 766 条结果，但日期范围仍需人工确认，所以不能简单标成“完全合规”。

在科研信息收集里，异常记录和成功记录一样重要。否则最后拿到一份报告时，很难判断它到底漏了什么、哪里需要补查。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941176-e57d3f8e0b39e05851a65e6e0ebeceff.jpg)

截图 3 ｜ 三库检索结果：命中数、状态与异常记录

## 七、从 12 条候选到 11 条独立记录：去重只是第一步

三个来源返回的数据经过初步筛选后，得到 12 条候选记录。去重后剩下 11 条独立记录，其中 1 条被识别为重复位置。

随后按研究类型和标识符继续整理：

- 正式指南：2 条，包括 2021 ESC 心衰指南和 2023 ESC 指南更新；
- 系统综述 / 荟萃分析：4 条；
- RCT 主要结果：0 条，只有 1 条试验设计论文；
- 直接匹配研究问题：2 条；
- 可核验的直接结局记录：0 条。

这一步暴露了一个很现实的问题：初筛后看起来有文献，但真正能直接回答问题的证据并不够。

尤其是这次要判断心衰住院、心血管死亡以及三类心衰人群的效果一致性，只靠指南和综述条目远远不够。还需要回到关键 RCT 主要结果，提取 HR/RR 与 95% CI，并核验亚组交互作用。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941158-7f37abca5aa997e5ac95f829a6422fc0.jpg)

截图 4 ｜ 检索审计与证据包：命中结果、时间范围与研究类型核验

## 八、为什么我认可这次结果：Q1 门禁没过，系统停了下来

这次工作流预先设置了 Q1 门禁：至少要有 3 条可核验的直接证据，才允许继续生成确定性结论。

实际评分是 0.42，未通过。

未通过原因也列得很清楚：

- 直接匹配且可核验的记录不足 3 条；
- 缺少心衰住院和心血管死亡的效应量；
- 缺少 HFrEF、HFmrEF、HFpEF 分层数据；
- 缺少第三来源复核。

这一步在我看来非常重要。

如果是纯手工流程，做到这里很容易凭经验继续写，比如“指南里应该有”“大方向应该没问题”。但门禁机制把这个动作拦住了：不是没有检索结果，而是现有结果还不足以支撑这几个具体问题。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941133-8e638b9172205819498e9ce1ea2a2204.jpg)

截图 5 ｜ Q1 门禁判定：score 0.42，未通过；直接证据、关键效应量与第三来源复核均有缺口

需要说明的是，Q1 门禁 0.42 的具体计算公式、阈值来源和版本信息仍需要在正式方法学说明中补充。作为研究交付物使用时，这部分不应被省略。

## 九、证据不够时，正确动作不是硬写，而是纠偏补查

门禁未通过后，工作流没有直接结束，也没有自行放行结论，而是规划了一轮定向补查。

补查重点包括 DAPA-HF、EMPEROR、DELIVER 等关键试验，并把“是否合并纠偏结果继续”交给人工审批。

这点符合我对科研工具的基本要求：

- 系统可以提示缺什么；
- 系统可以规划下一轮怎么查；
- 但是否接受补查方案、是否合并新结果、是否继续生成综述，必须由人确认。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941118-2dcf5248e9222d1a7a9eb8e95d6af71b.jpg)

截图 6 ｜ 纠偏过程中的人工确认：是否继续生成综述，由人决定

## 十、最终结论不是“有效”或“无效”，而是“证据不足 / 待验证”

这次证据矩阵最终标注如下：

| 结论项 | 状态 |
|---|---|
| C1：心衰住院是否降低 | unsupported（证据不足） |
| C2：心血管死亡是否降低 | unsupported |
| C3：三型心衰的效果是否一致 | unsupported |
| C5：指南与试验设计的书目身份 | partial（仅元数据确认） |

所以，这次运行不能用于形成临床决策结论。

这不是“没有价值”。恰恰相反，它把当前证据包的边界讲清楚了：哪些只是元数据确认，哪些缺少直接结局，哪些效应量还没提取，哪些关键试验需要补齐。

下一步也很明确：补齐四大 RCT 的主要结果，提取 HR/RR 与 95% CI，并核验亚组交互作用。

对医学综述来说，一个诚实的“证据不足 / 待验证”，往往比一个顺滑但证据链不完整的肯定结论更有价值。

## 十一、交付物不只是报告，还有可交接的证据包

运行结束后，工作流输出了一份完整结果 JSON，包含：

- 搜索审计；
- 证据矩阵；
- 共识与争议；
- 更新日志；
- 监测计划。

同时生成 7 条 RIS / CSL-JSON 引文草稿，作为 Zotero 的模拟交接包。

这里的“交接包”不会越权直接写入 Zotero 库。它只是把需要导入的内容整理好，后续是否导入、如何核对，仍由使用者决定。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941100-3dc1949efc86a3c9931b62be744020ff.jpg)

截图 7 ｜ 交付物：搜索审计、报告结果与 Zotero 交接包

## 十二、拆开看，它其实是一条科研信息生产 SOP

这不是一个黑盒按钮直接吐答案的过程。它背后是一条比较清楚的 SOP：

- 输入研究主题、时间范围、纳入 / 排除标准；
- 查询规划 Agent 把问题转成数据库可执行的检索式；
- OpenAlex、Europe PMC、Crossref 三个分支并行检索；
- 合并结果并去重；
- 核验标识符并整理研究类型；
- 打包证据；
- 执行 Q1 门禁；
- 门禁不过则生成纠偏重检方案；
- 人工审批是否继续；
- 输出报告和 Zotero 交接包。

![](https://ucloud-blog.cn-bj.ufileos.com/imagebed/0998212183941086-3bd2a9c7d1c5a9e22a3a2c78cf498e87.jpg)

图 1 ｜ 科研信息收集工作流架构：从研究问题到报告交付

这套工作流运行在 AstraFlow 的原生模拟环境中。平台提供 Agent 编排和 API 调用所需的运行环境，具体模型和数据源按任务接入。正式评估产品能力时，还需要进一步核验其官方文档、产品边界和可用的数据源接入方式。

## 十三、和手工流程相比，省下来的不只是复制粘贴

这次运行和常见手工流程的差异，主要不在“快”，而在“过程有没有留下来”和“结论有没有门槛”。


| 对比项 | 手动流程 | 工作流方式（本次运行） |
|---|---|---|
| 数据库覆盖 | 逐个登录、逐个写语法 | 三库并行发起，异常也记录 |
| 原始命中处理 | 766 + 11,882 条结果靠人翻 | Agent 筛出 12 条候选，再自动去重 |
| 去重 | 肉眼比对标题和 DOI | 自动识别重复位置（12 → 11） |
| 证据分级 | 依赖个人判断和记忆 | 按研究类型分类，并核验标识符 |
| 结论门禁 | 主要靠自觉 | 自动判定，并列出缺失清单 |
| 纠偏 | 手动重查一遍 | 自动规划，关键合并动作需人工审批 |
| 引文整理 | 手动录入 Zotero | 生成 RIS / CSL-JSON 草稿 |
| 结论可信度 | 容易凭印象判断 | 用证据矩阵分级，unsupported 就直说 |
| 首轮审计耗时 | 通常以天计 | 约 10 分钟（06:31 → 06:40） |

本次首轮审计从 06:31 开始，到 06:40 完成。

时间节省是一方面，更重要的是，它留下了查询式、命中数、失败原因、排除记录、证据矩阵和更新日志。换人接手，或者过一段时间重新更新，不必完全依赖个人记忆。

## 十四、这类工作流真正解决的三个问题

### 1. 减少机械整理

数据库切换、查询语法适配、初步去重和引文格式整理，不应该占用研究者太多精力。人更应该把时间花在研究问题、原文核验和结果解释上。

### 2. 把严谨性写进流程

至少几条直接证据才允许下结论，哪些字段必须核验，证据不足时如何补查，这些要求不能只存在于个人经验里。它们应该变成可检查的节点。

### 3. 让后续更新有迹可循

Living review、指南更新、持续证据监测都不是一次性任务。检索式、命中数、失败原因和更新日志被保留下来，后续更新才有基础。

这也是这类工作流适合放在统一开发平台上的原因：模型、Agent、外部 API 和结果文件可以组合在同一条链路里，换任务时调整其中一环即可，不必每次从零搭环境。

## 十五、适合哪些场景？不适合哪些场景？

### 适合

这类工作流更适合：

- 医学生做开题综述；
- 临床研究者做证据综述；
- 高校课题组统一文献筛选流程；
- 需要持续更新的 living evidence review；
- 投研、产品团队做资料收集和交叉核验；
- 多人协作且需要保留审计记录的项目。

### 不适合

以下情况未必需要上工作流：

- 只是偶尔查几篇论文；
- 不需要完整审计链路；
- 研究者已经明确知道目标文献；
- 只是做非常早期的背景了解。

如果目标只是快速了解一个概念，普通搜索或手工检索可能更快。

## 十六、实际使用建议

如果要把这类工作流用于严肃研究，我建议至少注意三点。

### 1. 门禁没过不等于白跑

门禁未通过时，报告里的缺失清单和纠偏计划反而很有价值。它告诉你接下来应该补什么，而不是让你凭感觉重新开始。

### 2. 人工审批不要跳过

纠偏结果是否合并、最终报告是否发布，这两道闸不能完全交给系统。科研判断仍然要由人负责。

### 3. 元数据不是事实

metadata_only 只能说明记录存在，不能证明结局、效应量或亚组结论已经被核验。正式引用前，必须回到原文。

## 总结：我会选择能“停下来”的工具，而不是只会“写下去”的工具

医学文献综述里，真正有价值的不是把文献“搜出来”，而是把检索、筛选、证据门禁和人工确认串成一条可审计链路。

这次运行没有给出 SGLT2 抑制剂与成人心衰结局的确定性结论，因为直接证据不足，Q1 门禁没有通过。它给出的结果是：证据不足 / 待验证，不能据此作临床决策；下一步需要补齐关键 RCT 主要结果、提取 HR/RR 与 95% CI，并核验亚组交互作用。

在我看来，这种结果比“强行生成一篇完整综述”更可信。

真正需要人决定的地方，工作流没有藏起来：证据够不够，结论能不能下，纠偏结果要不要合并，最后是否用于临床或研究决策，都由人把关。

下一次有人问“这个结论有证据支持吗”，理想状态不是凭印象回答，而是把检索记录、证据矩阵、缺失项和纠偏计划一起摆出来。

工作流：Academic Research — Living Evidence Review & Citation SOP（AstraFlow 原生模拟版）

## FAQ

### 1. 这套流程为什么没有直接给出 SGLT2 抑制剂有效的肯定结论？

因为可核验的直接证据不足，Q1 门禁评分只有 0.42，未达到继续生成确定性结论的要求。现有材料不足以支撑心衰住院、心血管死亡和三类心衰人群一致性这几个具体判断。

### 2. metadata_only 可以直接当作事实引用吗？

不可以。元数据只能说明记录存在，不能证明结局、效应量或亚组结论已经被核验。正式引用前仍要回到原文。

### 3. 为什么 Crossref 检索失败也要保留？

因为失败本身就是审计信息。保留失败记录，才能复查参数、判断异常是否影响最终证据包，也能指导下一轮纠偏。

### 4. 这套流程最适合哪些任务？

最适合需要持续更新、多人协作、保留检索审计和引文交接的任务，比如医学综述、证据盘点、投研资料核验和课题组统一筛选。

### 5. 什么时候手工搜索更合适？

如果只是偶尔查几篇论文，且不需要完整审计链路，手工搜索通常更快。工作流更适合反复更新、多人协作和对证据链要求较高的场景。

### 6. 这类工具能替代研究者判断吗？

不能。它能减少机械整理、保留审计链路、提示缺失项，但不能替代原文核验、方法学评价和临床或研究决策。