AI Engineer & AI Agent Developer

AI 是新时代的
电力
AI is the new
electricity.

— Andrew Ng, 2016

嗨,我是 David我专注于 AI 应用落地,将业务流程、知识与决策逐步 Agent 化,让 AI 从回答问题的工具,变成能够理解任务、调用工具并完成交付的执行系统 Hi, I'm David. I work on getting AI into production: turning workflows, knowledge and decisions into agents step by step, so that AI stops being a tool that answers questions and becomes a system that understands a task, calls the tools it needs, and delivers.

我相信,AI 的价值不在参数、Demo 或简单替代人工,而在于真正改变生产方式、释放生产力,并放大人的判断力、创造力与行动力。因此,我选择保持 Builder 的本能:贴近问题,快速交付,并将每一个工作流、每一次交互和每一处细节,打磨成真正值得使用的体验。 I believe the value of AI lies not in parameters, demos or simply replacing people, but in genuinely changing how work gets done, unlocking productivity, and amplifying human judgement, creativity and initiative. So I keep a builder's instincts: stay close to the problem, ship fast, and polish every workflow, every interaction and every detail into something genuinely worth using.

SCROLL
01

能力地图Skill map

后端Backend

JavaSpring Boot Spring AIPython FastAPITypeScript

AI & 大模型AI & LLMs

RAGAgent Evaluation

数据库Databases

MySQLPostgreSQL Redis

其他Other

Claude CodePi Agent 产品设计Product design 需求调研Requirements research
02

项目

文献自动入库流水线

OWNER · 2025.10 – 至今 · 国家生物信息中心

面向国家级基因组数据库(GSA / GSA Human / OMIX)。把散在邮件、PMC、期刊页里的文献, 变成可审计、可入库的结构化数据。人工审核是流水线里的正式节点,不是失败兜底

PythonFastAPIMySQL Docker自部署 LLMVue SPA

1三条路线汇进一条流水线

每日跑邮件订阅、PMC、期刊页三条采集路线,统一成同一种记录形状,抽出文章与数据编号。

其中 PMC 那条做过一次方向反转,见下面第二张图。

2缺的元信息逐级补齐

来源自带 → 落地页 → PubMed/PMC → Crossref 四级降级,按「成本从低到高、可信度从高到低」排,任一级失败不中断后续。

抓取只对 6% 的行发生(332 / 5539)—— 92.8% 的编号直接来自 PMC 全文。这 332 次里成功 125 次、撞付费墙 155 次;付费墙转人工上传 PDF,原地重写原记录,不新增行。

3用 LLM 判断引用类型

一篇论文与一个数据集的关系有三种:提交、复用、只是引用。原本是规则,改成 LLM —— 这个判断需要全文级语义,往往要交叉方法、数据可用性声明与致谢多处才能定。

同集同口径下,规则版误判率 35.8%,LLM 降到 9.2%

4三路一致才自动落库

所有记录先进审核队列,不直接写发布库。确定性规则判一次、LLM 用两个不同 prompt 各判一次,三路完全一致才自动采信;任意不一致即置空转人工。

500 条标注集上逐档实测:仅 LLM 一次覆盖 71.4%(9 条误判),三路一致覆盖 44.8%、该区间零误判。剩下的 55.2% 不是没兜住的错误,是设计内的分流。

定时采集邮件 · PMC · 期刊清洗 + 解析富化类型判定(LLM)审核队列自动入库综合入库率 80.3%审核系统 · 网页端公开发布库 校验通过校验不通过复核后入库手动补录
图 1 · 系统主干(滚动左侧,图上对应位置会亮起)

一次具体改造 · PMC 反查

原来是拿本地库里的数据编号逐个问 PMC「谁引用了它」,一次约 6 万次检索、跑 14.3 小时,只能一个月一次。把问题反过来问「谁提到了这个仓库」,一次检索就够。

原方案反转后VS逐个编号问 PMC:谁引用了它提问方式一次检索问 PMC:谁提到了仓库约 6 万次检索外部请求1 次检索14.3 小时单次耗时分钟级一个月一次运行频率每天一次
图 2 · PMC 反查改造前后

真正的目标不是性能。一个月一次意味着一次积压几百篇,没人愿意开始;每天一次是十几篇,分给四个人当天就消化掉了。性能是手段,让审核量落回人的日常承受范围才是目的。

生物大数据平台智能审编系统

2025 – 至今 · 国家生物信息中心

面向国家生物大数据平台的独立审编后台,承接日均 500 TB 数据吞吐与数百条元数据提交的审核。

JavaSpring BootVue.js RAGAgent

这一段还在整理,先占个位。

0302

经历Background

2025.10 — 至今Oct 2025 — present

生信工程师Bioinformatics Engineer

中国科学院北京基因组研究所(国家生物信息中心)· 北京,中国Beijing Institute of Genomics, CAS (China National Center for Bioinformation) · Beijing, China

  • 从 0 搭建文献自动化入库流水线,见上方项目Built the literature ingestion pipeline from scratch — see above
  • 独立完成智能审编系统的需求调研与产品设计,拆开原系统里耦合的提交端与审核端Ran requirements research and product design for the curation system solo, splitting the coupled submission and review sides of the old system
2023.10 — 2025.10Oct 2023 — Oct 2025

帝国理工学院 · 理学硕士Imperial College London · MSc

计算机科学与技术(健康数据分析与机器学习)· 伦敦,英国Computing (Health Data Analytics & Machine Learning) · London, UK

2019.09 — 2023.07Sep 2019 — Jul 2023

利物浦大学 · 理学学士University of Liverpool · BSc

数学与统计 · 利物浦,英国Mathematics & Statistics · Liverpool, UK