做医学文献综述时,AI 检索工具靠谱吗?我更看重它会不会在证据不足时停下来

AI正在改变科研信息收集方式,但医学综述、证据盘点和引文管理不能只追求“快速生成结论”。一次围绕SGLT2抑制剂与成人心力衰竭结局的检索显示,三库并行检索得到12条候选记录,去重后剩11条独立记录,但可核验直接证据不足,Q1门禁评分0.42未通过。更适合科研场景的AI工作流,应把查询规划、去重、证据分级、门禁判断、纠偏补查和人工审批串成可复查链路。
先说结论
如果用 AI 做医学文献综述,我不会只看它能不能“搜到很多文献”,也不会只看它能不能快速写出一段结论。我更看重三件事:
- 检索过程能不能复查;
- 证据和书目记录能不能区分;
- 证据不足时,系统会不会明确停下来。
一次围绕 SGLT2 抑制剂对成人心力衰竭结局影响 的检索运行,很典型地说明了这一点:OpenAlex、Europe PMC、Crossref 三路并行检索后,初筛得到 12 条候选记录,去重后剩 11 条独立记录;但由于可核验直接证据不足,Q1 门禁评分只有 0.42,未通过。最终输出的不是一个确定性医学结论,而是缺失清单、纠偏方案、审计记录和 Zotero 交接包。
这反而是我认为比较可靠的地方:它没有把“检索到了”偷换成“已经证实了”。
一、真实问题:医学综述到底能不能交给 AI 跑?
很多人现在做开题、综述、指南更新或证据盘点时,都会遇到一个问题:
文献太多,数据库太分散,检索式、去重、引文整理、证据判断都很耗时间。能不能用 AI 工作流先跑一遍?
我的经验是,可以用,但不要把它当成“自动写结论机器”。
在医学研究里,最危险的不是漏掉几篇文献,而是把不完整的证据包装成确定判断。尤其是涉及心衰住院、心血管死亡、亚组差异这类临床结局时,只看标题、摘要或指南条目,很容易产生过度推断。
所以,一个更合理的选型标准不是“它能不能给答案”,而是:
- 能不能先固定研究问题;
- 能不能按数据库差异规划查询;
- 能不能保留失败和异常;
- 能不能区分 metadata、摘要证据和直接证据;
- 能不能设置证据门槛;
- 门槛没过时,能不能主动停止并给出补查方向。
下面这个案例,就是按这个思路跑下来的。
二、先把研究问题固定下来,而不是先搜关键词
这次研究问题被限定为:SGLT2 抑制剂对成人心力衰竭患者结局的影响。
具体问题也比较明确:截至 2025 年 12 月 31 日,SGLT2 抑制剂是否降低心衰住院和心血管死亡?在 HFrEF、HFmrEF、HFpEF 三类人群中,效果是否一致?
同时,纳入和排除标准先写清楚:
- 纳入:RCT、系统综述、荟萃分析和正式指南;
- 排除:动物实验、细胞实验、单纯糖尿病研究、评论和新闻稿。
这一步很关键。很多综述质量不稳定,不是因为后面写得不好,而是研究问题一开始就太散。问题没有收窄,后面的检索边界就会漂移,结果里会混进大量看似相关、实则无法回答问题的记录。

截图 1 | 研究方案输入:主题、时间范围与纳入/排除标准
为了避免术语混淆,先把几个关键概念放在这里:
| 术语 | 含义 |
|---|---|
| SGLT2 抑制剂 | 钠-葡萄糖协同转运蛋白 2 抑制剂,常用于糖尿病和心衰相关研究。 |
| HFrEF | 射血分数降低型心力衰竭。 |
| HFmrEF | 射血分数轻度降低型心力衰竭。 |
| HFpEF | 射血分数保留型心力衰竭。 |
| RCT | 随机对照试验。 |
| RIS / CSL-JSON | 常见引文交换格式,用于文献管理工具导入。 |
| Q1 门禁 | 结论放行前的证据门槛,需先满足可核验证据数量要求。 |
三、核心痛点:搜到文献,不等于拿到证据
医学综述里最容易被低估的一个问题是:书目记录和直接证据不是一回事。
一条记录有 DOI、PMID,或者出现在指南参考文献里,只能说明它是一个可追踪的文献条目;但它是否回答了当前问题,还要看它有没有提供对应结局、效应量、研究人群和亚组数据。
例如这次要回答的是:
- SGLT2 抑制剂是否降低心衰住院?
- 是否降低心血管死亡?
- 在 HFrEF、HFmrEF、HFpEF 中效果是否一致?
如果只找到指南、综述或试验设计论文,但没有拿到可核验的主要结果和效应量,就不能直接推出确定结论。
这也是为什么我认为,一个严谨的 AI 文献工作流,必须内置“证据门禁”。否则它很容易变成一个把相关文献拼接成流畅文字的工具,看起来专业,实际证据链并不完整。
四、不同方案对比:手工检索、普通 AI 问答、工作流式检索
做这类资料工作,常见有三种方式。
| 方案 | 优点 | 主要问题 |
|---|---|---|
| 手工检索 | 研究者掌控感强,适合精读和最终判断 | 数据库切换、去重、引文整理耗时;过程容易散落在个人笔记里 |
| 普通 AI 问答 | 上手快,适合快速了解背景 | 容易跳过检索审计;可能把不完整证据组织成确定结论 |
| 工作流式检索 | 能保留查询、命中、异常、去重、证据矩阵和门禁记录 | 仍需要人工确认;证据不足时不会直接给“漂亮答案” |
如果只是临时查几篇论文,手工搜索可能最快。
但如果场景是医学综述、课题组协作、指南更新、证据盘点、投研资料核验,单靠手工流程会有两个问题:一是重复劳动多,二是过程很难完整交接。
这类场景里,我更倾向于使用工作流式检索:让系统承担查询规划、并行检索、去重、格式整理、缺失项提示等机械工作,把关键判断留给人。
五、这次运行是怎么做查询规划的?
比较好的做法不是把同一串关键词直接丢给多个数据库,而是先把研究问题拆成不同系统能理解的检索条件。
这次分别面向 OpenAlex、Europe PMC、Crossref 生成查询:
- OpenAlex 使用对应的过滤语法;
- Europe PMC 加上 FIRST_PDATE 限定;
- Crossref 使用对应查询参数。
这样做的意义不只是自动化,而是把检索规则留下来。之后复查时,可以看到当时到底查了什么、为什么某些结果被纳入或排除。

截图 2 | 查询规划:为三个数据库分别生成检索式
六、三库并行检索:成功、失败和异常都要记录
查询规划完成后,三路检索同时发起。实际结果如下:
| 来源 | 原始命中 | 状态 |
|---|---|---|
| OpenAlex | 766 条 | 成功;日期范围仍需人工确认 |
| Europe PMC | 11,882 条 | 成功;日期限定合规 |
| Crossref | — | 失败;参数校验未通过,已写入审计日志 |
这里有两个细节值得注意。
第一,Crossref 失败没有被悄悄跳过,而是明确写入审计记录。失败本身也是信息,因为它会影响后续证据完整性判断。
第二,OpenAlex 虽然返回了 766 条结果,但日期范围仍需人工确认,所以不能简单标成“完全合规”。
在科研信息收集里,异常记录和成功记录一样重要。否则最后拿到一份报告时,很难判断它到底漏了什么、哪里需要补查。

截图 3 | 三库检索结果:命中数、状态与异常记录
七、从 12 条候选到 11 条独立记录:去重只是第一步
三个来源返回的数据经过初步筛选后,得到 12 条候选记录。去重后剩下 11 条独立记录,其中 1 条被识别为重复位置。
随后按研究类型和标识符继续整理:
- 正式指南:2 条,包括 2021 ESC 心衰指南和 2023 ESC 指南更新;
- 系统综述 / 荟萃分析:4 条;
- RCT 主要结果:0 条,只有 1 条试验设计论文;
- 直接匹配研究问题:2 条;
- 可核验的直接结局记录:0 条。
这一步暴露了一个很现实的问题:初筛后看起来有文献,但真正能直接回答问题的证据并不够。
尤其是这次要判断心衰住院、心血管死亡以及三类心衰人群的效果一致性,只靠指南和综述条目远远不够。还需要回到关键 RCT 主要结果,提取 HR/RR 与 95% CI,并核验亚组交互作用。

截图 4 | 检索审计与证据包:命中结果、时间范围与研究类型核验
八、为什么我认可这次结果:Q1 门禁没过,系统停了下来
这次工作流预先设置了 Q1 门禁:至少要有 3 条可核验的直接证据,才允许继续生成确定性结论。
实际评分是 0.42,未通过。
未通过原因也列得很清楚:
- 直接匹配且可核验的记录不足 3 条;
- 缺少心衰住院和心血管死亡的效应量;
- 缺少 HFrEF、HFmrEF、HFpEF 分层数据;
- 缺少第三来源复核。
这一步在我看来非常重要。
如果是纯手工流程,做到这里很容易凭经验继续写,比如“指南里应该有”“大方向应该没问题”。但门禁机制把这个动作拦住了:不是没有检索结果,而是现有结果还不足以支撑这几个具体问题。

截图 5 | Q1 门禁判定:score 0.42,未通过;直接证据、关键效应量与第三来源复核均有缺口
需要说明的是,Q1 门禁 0.42 的具体计算公式、阈值来源和版本信息仍需要在正式方法学说明中补充。作为研究交付物使用时,这部分不应被省略。
九、证据不够时,正确动作不是硬写,而是纠偏补查
门禁未通过后,工作流没有直接结束,也没有自行放行结论,而是规划了一轮定向补查。
补查重点包括 DAPA-HF、EMPEROR、DELIVER 等关键试验,并把“是否合并纠偏结果继续”交给人工审批。
这点符合我对科研工具的基本要求:
- 系统可以提示缺什么;
- 系统可以规划下一轮怎么查;
- 但是否接受补查方案、是否合并新结果、是否继续生成综述,必须由人确认。

截图 6 | 纠偏过程中的人工确认:是否继续生成综述,由人决定
十、最终结论不是“有效”或“无效”,而是“证据不足 / 待验证”
这次证据矩阵最终标注如下:
| 结论项 | 状态 |
|---|---|
| C1:心衰住院是否降低 | unsupported(证据不足) |
| C2:心血管死亡是否降低 | unsupported |
| C3:三型心衰的效果是否一致 | unsupported |
| C5:指南与试验设计的书目身份 | partial(仅元数据确认) |
所以,这次运行不能用于形成临床决策结论。
这不是“没有价值”。恰恰相反,它把当前证据包的边界讲清楚了:哪些只是元数据确认,哪些缺少直接结局,哪些效应量还没提取,哪些关键试验需要补齐。
下一步也很明确:补齐四大 RCT 的主要结果,提取 HR/RR 与 95% CI,并核验亚组交互作用。
对医学综述来说,一个诚实的“证据不足 / 待验证”,往往比一个顺滑但证据链不完整的肯定结论更有价值。
十一、交付物不只是报告,还有可交接的证据包
运行结束后,工作流输出了一份完整结果 JSON,包含:
- 搜索审计;
- 证据矩阵;
- 共识与争议;
- 更新日志;
- 监测计划。
同时生成 7 条 RIS / CSL-JSON 引文草稿,作为 Zotero 的模拟交接包。
这里的“交接包”不会越权直接写入 Zotero 库。它只是把需要导入的内容整理好,后续是否导入、如何核对,仍由使用者决定。

截图 7 | 交付物:搜索审计、报告结果与 Zotero 交接包
十二、拆开看,它其实是一条科研信息生产 SOP
这不是一个黑盒按钮直接吐答案的过程。它背后是一条比较清楚的 SOP:
- 输入研究主题、时间范围、纳入 / 排除标准;
- 查询规划 Agent 把问题转成数据库可执行的检索式;
- OpenAlex、Europe PMC、Crossref 三个分支并行检索;
- 合并结果并去重;
- 核验标识符并整理研究类型;
- 打包证据;
- 执行 Q1 门禁;
- 门禁不过则生成纠偏重检方案;
- 人工审批是否继续;
- 输出报告和 Zotero 交接包。

图 1 | 科研信息收集工作流架构:从研究问题到报告交付
这套工作流运行在 AstraFlow 的原生模拟环境中。平台提供 Agent 编排和 API 调用所需的运行环境,具体模型和数据源按任务接入。正式评估产品能力时,还需要进一步核验其官方文档、产品边界和可用的数据源接入方式。
十三、和手工流程相比,省下来的不只是复制粘贴
这次运行和常见手工流程的差异,主要不在“快”,而在“过程有没有留下来”和“结论有没有门槛”。
| 对比项 | 手动流程 | 工作流方式(本次运行) |
|---|---|---|
| 数据库覆盖 | 逐个登录、逐个写语法 | 三库并行发起,异常也记录 |
| 原始命中处理 | 766 + 11,882 条结果靠人翻 | Agent 筛出 12 条候选,再自动去重 |
| 去重 | 肉眼比对标题和 DOI | 自动识别重复位置(12 → 11) |
| 证据分级 | 依赖个人判断和记忆 | 按研究类型分类,并核验标识符 |
| 结论门禁 | 主要靠自觉 | 自动判定,并列出缺失清单 |
| 纠偏 | 手动重查一遍 | 自动规划,关键合并动作需人工审批 |
| 引文整理 | 手动录入 Zotero | 生成 RIS / CSL-JSON 草稿 |
| 结论可信度 | 容易凭印象判断 | 用证据矩阵分级,unsupported 就直说 |
| 首轮审计耗时 | 通常以天计 | 约 10 分钟(06:31 → 06:40) |
本次首轮审计从 06:31 开始,到 06:40 完成。
时间节省是一方面,更重要的是,它留下了查询式、命中数、失败原因、排除记录、证据矩阵和更新日志。换人接手,或者过一段时间重新更新,不必完全依赖个人记忆。
十四、这类工作流真正解决的三个问题
1. 减少机械整理
数据库切换、查询语法适配、初步去重和引文格式整理,不应该占用研究者太多精力。人更应该把时间花在研究问题、原文核验和结果解释上。
2. 把严谨性写进流程
至少几条直接证据才允许下结论,哪些字段必须核验,证据不足时如何补查,这些要求不能只存在于个人经验里。它们应该变成可检查的节点。
3. 让后续更新有迹可循
Living review、指南更新、持续证据监测都不是一次性任务。检索式、命中数、失败原因和更新日志被保留下来,后续更新才有基础。
这也是这类工作流适合放在统一开发平台上的原因:模型、Agent、外部 API 和结果文件可以组合在同一条链路里,换任务时调整其中一环即可,不必每次从零搭环境。
十五、适合哪些场景?不适合哪些场景?
适合
这类工作流更适合:
- 医学生做开题综述;
- 临床研究者做证据综述;
- 高校课题组统一文献筛选流程;
- 需要持续更新的 living evidence review;
- 投研、产品团队做资料收集和交叉核验;
- 多人协作且需要保留审计记录的项目。
不适合
以下情况未必需要上工作流:
- 只是偶尔查几篇论文;
- 不需要完整审计链路;
- 研究者已经明确知道目标文献;
- 只是做非常早期的背景了解。
如果目标只是快速了解一个概念,普通搜索或手工检索可能更快。
十六、实际使用建议
如果要把这类工作流用于严肃研究,我建议至少注意三点。
1. 门禁没过不等于白跑
门禁未通过时,报告里的缺失清单和纠偏计划反而很有价值。它告诉你接下来应该补什么,而不是让你凭感觉重新开始。
2. 人工审批不要跳过
纠偏结果是否合并、最终报告是否发布,这两道闸不能完全交给系统。科研判断仍然要由人负责。
3. 元数据不是事实
metadata_only 只能说明记录存在,不能证明结局、效应量或亚组结论已经被核验。正式引用前,必须回到原文。
总结:我会选择能“停下来”的工具,而不是只会“写下去”的工具
医学文献综述里,真正有价值的不是把文献“搜出来”,而是把检索、筛选、证据门禁和人工确认串成一条可审计链路。
这次运行没有给出 SGLT2 抑制剂与成人心衰结局的确定性结论,因为直接证据不足,Q1 门禁没有通过。它给出的结果是:证据不足 / 待验证,不能据此作临床决策;下一步需要补齐关键 RCT 主要结果、提取 HR/RR 与 95% CI,并核验亚组交互作用。
在我看来,这种结果比“强行生成一篇完整综述”更可信。
真正需要人决定的地方,工作流没有藏起来:证据够不够,结论能不能下,纠偏结果要不要合并,最后是否用于临床或研究决策,都由人把关。
下一次有人问“这个结论有证据支持吗”,理想状态不是凭印象回答,而是把检索记录、证据矩阵、缺失项和纠偏计划一起摆出来。
工作流:Academic Research — Living Evidence Review & Citation SOP(AstraFlow 原生模拟版)
FAQ
1. 这套流程为什么没有直接给出 SGLT2 抑制剂有效的肯定结论?
因为可核验的直接证据不足,Q1 门禁评分只有 0.42,未达到继续生成确定性结论的要求。现有材料不足以支撑心衰住院、心血管死亡和三类心衰人群一致性这几个具体判断。
2. metadata_only 可以直接当作事实引用吗?
不可以。元数据只能说明记录存在,不能证明结局、效应量或亚组结论已经被核验。正式引用前仍要回到原文。
3. 为什么 Crossref 检索失败也要保留?
因为失败本身就是审计信息。保留失败记录,才能复查参数、判断异常是否影响最终证据包,也能指导下一轮纠偏。
4. 这套流程最适合哪些任务?
最适合需要持续更新、多人协作、保留检索审计和引文交接的任务,比如医学综述、证据盘点、投研资料核验和课题组统一筛选。
5. 什么时候手工搜索更合适?
如果只是偶尔查几篇论文,且不需要完整审计链路,手工搜索通常更快。工作流更适合反复更新、多人协作和对证据链要求较高的场景。
6. 这类工具能替代研究者判断吗?
不能。它能减少机械整理、保留审计链路、提示缺失项,但不能替代原文核验、方法学评价和临床或研究决策。