← 工作项目

文献自动入库流水线

2025.10 – 至今 · 中国科学院北京基因组研究所(国家生物信息中心)

面向国家级基因组数据库(GSA / GSA Human / OMIX)。将散在邮件、PMC、期刊页里的文献, 变成可审计、可入库的结构化数据。展示平台数据集价值,提升平台数据集申请和使用量

PythonFastAPIMySQL DockerLLM语义分类AI WorkflowEvaluation

1三条路线汇进一条流水线

每日跑邮件订阅、PMC、期刊页三条采集路线,统一成同一种记录形状,抽出文章与数据编号。

2缺的元信息逐级补齐

来源自带 → 落地页 → PubMed/PMC → Crossref 四级降级,按「成本从低到高、可信度从高到低」排,任一级失败不中断后续。

抓取只对 6% 的行发生(332 / 5539)—— 92.8% 的编号直接来自 PMC 全文。这 332 次里成功 125 次、撞付费墙 155 次;付费墙转人工上传 PDF,原地重写原记录,不新增行。

3用 LLM 判断引用类型

一篇论文与一个数据集的关系有三种:提交、复用、只是引用。原本是规则,改成 LLM —— 这个判断需要全文级语义,往往要交叉方法、数据可用性声明与致谢多处才能定。

同集同口径下,规则版误判率 35.8%,LLM 降到 9.2%

4三路一致才自动落库

所有记录先进审核队列,不直接写发布库。确定性规则判一次、LLM 用两个不同 prompt 各判一次,三路完全一致才自动采信;任意不一致即置空转人工。

500 条标注集上逐档实测:仅 LLM 一次覆盖 71.4%(9 条误判),三路一致覆盖 44.8%、该区间零误判。剩下的 55.2% 不是没兜住的错误,是设计内的分流。

定时采集邮件 · PMC · 期刊清洗 + 解析富化类型判定(LLM)审核队列自动入库综合入库率 80.3%审核系统 · 网页端公开发布库 校验通过校验不通过复核后入库手动补录
系统主干 · 点左侧任一段,对应模块高亮系统主干 · 图两侧还有,点上方任一段高亮