登上Cell主刊的AI虚拟细胞,解的是药物研发那「另外半道题」

上周《Cell》主刊上线了一篇来自中国的 AI 论文《UniPert–G2CP》,团队是腾讯生命科学实验室和中南大学。国内在 Cell 主刊发 AI 虚拟细胞相关研究的,据公开信息这是第一篇。

「国产AI登顶刊」这个标签之外,更值得说的是它瞄准的那个问题确实太大了。做药的人都知道一句话:分子好不一定药好用。过去二十年,AI drug discovery 把化学分子那端摸得越来越透——AlphaFold 解了蛋白结构,对接 AI 算得准结合能,QSAR 筛得掉类药性差的分子。但所有这些加起来,回答的只是半道题:这个分子本身好不好。至于它对哪个病人、哪个细胞、哪种突变背景有效,一直没有可用的计算模型给过答案。临床二期高达 70% 以上的失败率,平均 26 亿美元的沉没成本,根子是脱离细胞背景的分子建模——做得再精也猜不准真实疗效。

这篇论文要解的就是这另外半道题。核心思路是用基因扰动数据做预训练,再用化合物数据做迁移微调。选择这条路是因为数据层面有一个严重的不对等——可能成药的化学分子空间超过 10^60,而目前全球最大的化学扰动图谱 LINCS L1000 只覆盖了约 2 万个化合物;反观 CRISPR 基因筛选,一次实验就能平行测几千个基因,单位成本低得多。数据稀疏、搜索空间巨大、又极度依赖细胞背景——三重困境叠在一起,纯用化学数据硬推基本走不通。

团队设计了两层结构。UniPert 模块把基因扰动和化合物扰动拉进同一个语义空间,让模型用同一套语言去理解两种完全不同的扰动信号;G2CP 模块负责在给定细胞背景下,从「基因型」推导出「细胞表型」。这是一个迁移学习策略——用密集、便宜的遗传数据做预训练,再拿稀疏、昂贵的化学数据做精调。

论文拿 ESR1 内分泌耐药这个真实的临床问题做了闭环验证,从算法预测到机制解释串起来了,这也是编辑和审稿人最认可的部分。数据方面,他们公开了 4994 个基因 × 7860 个化合物 × 5 个癌症细胞系,外加 53963 对化合物-蛋白相互作用,按论文的说法是当前该方向公开建模中规模最大、模态最全的工作之一。

这套成果不是平地起楼。从 2022 年 scBERT(Nature Machine Intelligence)把单细胞转录组语言化,到 2024 年 scPROTEIN(Nature Methods)、2025 年 scTranslator(Nature Biomedical Engineering),团队基本以每年一篇顶刊的节奏推进,主线始终是一个:用统一语言描述生命系统。

第一作者是中南大学博士生、腾讯实习生李一鸣,研究工作在实习期间完成。通讯作者包括腾讯的杨帆、姚建华和中南大学的李敏。这个配置本身说明了当下做 AI 生命科学的一个现实:学术机构出问题定义和生物学验证,工业界出数据基建和工程能力,哪边缺了都不好办。

至于远景,论文结尾提到了数字孪生诊室——未来医生面对患者时,在云端构建该患者的数字孪生细胞群,对多种候选方案做虚拟试验,然后给出最优组合方案。大方向没有问题,但 UniPert–G2CP 目前覆盖 5 个癌症细胞系、不到一万个化合物,真实人体的细胞类型和药物组合远比这个复杂。数据稀疏问题在论文里被策略性地缓解了,但远远没有被解决。

团队自己也清楚这一点。下一步是把这套能力集成到 AI 生命科学 Agent 平台里,以 Skill 的形式嵌入实验科学家的工作流——靶点发现、候选化合物评估、耐药机制解析,先从工具化做起。这个节奏比数字孪生诊室的远景更实在。

论文全文在 Cell 官网可以读到:https://www.cell.com/cell/fulltext/S0092-8674(26)00654-9