文献自动入库流水线
OWNER · 2025.10 – 至今 · 国家生物信息中心面向国家级基因组数据库(GSA / GSA Human / OMIX)。把散在邮件、PMC、期刊页里的文献, 变成可审计、可入库的结构化数据。人工审核是流水线里的正式节点,不是失败兜底。
1三条路线汇进一条流水线
每日跑邮件订阅、PMC、期刊页三条采集路线,统一成同一种记录形状,抽出文章与数据编号。
其中 PMC 那条做过一次方向反转,见下面第二张图。
2缺的元信息逐级补齐
来源自带 → 落地页 → PubMed/PMC → Crossref 四级降级,按「成本从低到高、可信度从高到低」排,任一级失败不中断后续。
抓取只对 6% 的行发生(332 / 5539)—— 92.8% 的编号直接来自 PMC 全文。这 332 次里成功 125 次、撞付费墙 155 次;付费墙转人工上传 PDF,原地重写原记录,不新增行。
3用 LLM 判断引用类型
一篇论文与一个数据集的关系有三种:提交、复用、只是引用。原本是规则,改成 LLM —— 这个判断需要全文级语义,往往要交叉方法、数据可用性声明与致谢多处才能定。
同集同口径下,规则版误判率 35.8%,LLM 降到 9.2%。
4三路一致才自动落库
所有记录先进审核队列,不直接写发布库。确定性规则判一次、LLM 用两个不同 prompt 各判一次,三路完全一致才自动采信;任意不一致即置空转人工。
500 条标注集上逐档实测:仅 LLM 一次覆盖 71.4%(9 条误判),三路一致覆盖 44.8%、该区间零误判。剩下的 55.2% 不是没兜住的错误,是设计内的分流。
一次具体改造 · PMC 反查
原来是拿本地库里的数据编号逐个问 PMC「谁引用了它」,一次约 6 万次检索、跑 14.3 小时,只能一个月一次。把问题反过来问「谁提到了这个仓库」,一次检索就够。
真正的目标不是性能。一个月一次意味着一次积压几百篇,没人愿意开始;每天一次是十几篇,分给四个人当天就消化掉了。性能是手段,让审核量落回人的日常承受范围才是目的。
- 日常流量46 天内日均入链 24 篇文献 / 39 个数据集,该口径下自动入库率 71%
- 累计3154 篇文献 / 5539 个数据集,综合自动入库率 80.3%(含一次全量历史回填)
- 调度153 次运行 3 次失败,成功率 98.0%;失败当晚的邮件由次日回溯窗口覆盖,零数据丢失