AI Engineer & AI Agent Developer

AI 是新时代的
电力
AI is the new
electricity.

— Andrew Ng, 2016

嗨,我是 David我专注于 AI 应用落地,将业务流程、知识与决策逐步 Agent 化,让 AI 从回答问题的工具,变成能够理解任务、调用工具并完成交付的执行系统 Hi, I'm David. I work on getting AI into production: turning workflows, knowledge and decisions into agents step by step, so that AI stops being a tool that answers questions and becomes a system that understands a task, calls the tools it needs, and delivers.

我相信,AI 的价值不在参数、Demo 或简单替代人工,而在于真正改变生产方式、释放生产力,并放大人的判断力、创造力与行动力。因此,我选择保持 Builder 的本能:贴近问题,快速交付,并将每一个工作流、每一次交互和每一处细节,打磨成真正值得使用的体验。 I believe the value of AI lies not in parameters, demos or simply replacing people, but in genuinely changing how work gets done, unlocking productivity, and amplifying human judgement, creativity and initiative. So I keep a builder's instincts: stay close to the problem, ship fast, and polish every workflow, every interaction and every detail into something genuinely worth using.

SCROLL
01

经历Background

2025.10 — 至今Oct 2025 — present

生信工程师Bioinformatics Engineer

中国科学院北京基因组研究所(国家生物信息中心)Beijing Institute of Genomics, CAS
(China National Center for Bioinformation)

北京,中国Beijing, China

  • 重构文献自动化入库流水线,设计并开发人工审核系统,总入库 1 万+ 文献Rebuilt the literature ingestion pipeline and built the human review system on top of it — 10,000+ papers ingested to date
  • 从 0 设计智能审编系统,完成审编系统与审编 Agent 的开发,日均自动审编 100+ 数据集Designed and built the curation system from scratch, curation agent included — 100+ datasets auto-curated daily
2023.10 — 2025.10Oct 2023 — Oct 2025

帝国理工学院Imperial College London

理学硕士 · 计算机科学与技术MSc · Computing

伦敦,英国London, UK

健康数据分析与机器学习Master's Degree in Health Data Analytics & Machine Learning

2019.09 — 2023.07Sep 2019 — Jul 2023

利物浦大学University of Liverpool

理学学士 · 数学与统计BSc · Mathematics & Statistics

利物浦,英国Liverpool, UK

02

能力地图Skill map

后端Backend

JavaSpring Boot Spring AIPython FastAPITypeScript

AI & 大模型AI & LLMs

RAGAgent Evaluation

数据库Databases

MySQLPostgreSQL Redis

其他Other

Claude CodePi Agent 产品设计Product design 需求调研Requirements research
03

工作项目

文献自动入库流水线

OWNER · 2025.10 – 至今 · 国家生物信息中心

面向国家级基因组数据库(GSA / GSA Human / OMIX)。把散在邮件、PMC、期刊页里的文献, 变成可审计、可入库的结构化数据。人工审核是流水线里的正式节点,不是失败兜底

PythonFastAPIMySQL Docker自部署 LLMVue SPA

1三条路线汇进一条流水线

每日跑邮件订阅、PMC、期刊页三条采集路线,统一成同一种记录形状,抽出文章与数据编号。

2缺的元信息逐级补齐

来源自带 → 落地页 → PubMed/PMC → Crossref 四级降级,按「成本从低到高、可信度从高到低」排,任一级失败不中断后续。

抓取只对 6% 的行发生(332 / 5539)—— 92.8% 的编号直接来自 PMC 全文。这 332 次里成功 125 次、撞付费墙 155 次;付费墙转人工上传 PDF,原地重写原记录,不新增行。

3用 LLM 判断引用类型

一篇论文与一个数据集的关系有三种:提交、复用、只是引用。原本是规则,改成 LLM —— 这个判断需要全文级语义,往往要交叉方法、数据可用性声明与致谢多处才能定。

同集同口径下,规则版误判率 35.8%,LLM 降到 9.2%

4三路一致才自动落库

所有记录先进审核队列,不直接写发布库。确定性规则判一次、LLM 用两个不同 prompt 各判一次,三路完全一致才自动采信;任意不一致即置空转人工。

500 条标注集上逐档实测:仅 LLM 一次覆盖 71.4%(9 条误判),三路一致覆盖 44.8%、该区间零误判。剩下的 55.2% 不是没兜住的错误,是设计内的分流。

定时采集邮件 · PMC · 期刊清洗 + 解析富化类型判定(LLM)审核队列自动入库综合入库率 80.3%审核系统 · 网页端公开发布库 校验通过校验不通过复核后入库手动补录
系统主干 · 滚动左侧,图上对应位置会亮起

生物大数据平台智能审编系统

2025 – 至今 · 国家生物信息中心

面向国家生物大数据平台的独立审编后台,承接日均 500 TB 数据吞吐与数百条元数据提交的审核。

JavaSpring BootVue.js RAGAgent

这一段还在整理,先占个位。