Nature | 郭天南团队开发具备临床应用潜力的虚拟细胞垂类模型
发布时间:2026-09-10 08:21 浏览量:1
生命现象看似复杂、随机,背后却隐藏着严密而深刻的秩序。这种生命的内在秩序究竟是什么?长久以来,无数探索者以非凡的智慧、卓绝的努力和极大的耐心孜孜求索,推动生命科学取得了一系列伟大发现。今天,在人工智能时代,新一代科学家正在探索生命奥秘的新路径。
继在蛋白质结构预测等单类生物分子研究领域取得一系列突破后,人工智能正逐步拓展至细胞这一生命活动基本单元的研究。近两年来,虚拟细胞研究逐渐成为全球“AI+生物医药”领域研究与转化的前沿方向,并有望对生物医药、生物制造、农业生产等领域产生颠覆性影响。
然而,如何构建具有实际应用价值的虚拟细胞?什么样的数据才能支撑有效虚拟细胞模型的构建?又应如何科学评估虚拟细胞模型的性能?
2026年9月9日,西湖大学医学院、生命科学学院、西湖实验室郭天南团队联合北京大学、北京科学智能研究院、哈尔滨医科大学等科研机构,在Nature发表题为“An operational perturbation proteomics-based virtual cell model”的研究论文。他们开发了一款具有临床应用潜力的虚拟细胞模型ProteinTalks,用于三阴性乳腺癌的药物疗效预测、肿瘤耐药靶点挖掘并个性化精准治疗指引。该研究展示了一条不同于单纯扩大数据和模型规模的新路径:以真实、连续的蛋白质动态为基础,构建了一个具有一定临床应用潜力的虚拟细胞垂类模型。
近年来,基于转录组数据训练的基础模型被用于探索AI虚拟细胞。通过学习基因表达的规律,这些模型能够表征细胞状态,并尝试预测细胞在药物等干预下的变化,为理解细胞行为提供了新的工具。
但蛋白质才是细胞功能的主要执行者。如果让AI学习药物作用后蛋白质的动态变化,能否更准确地预测细胞反应?这一方向具有潜力,但受限于时间分辨扰动蛋白质组数据的不足,相关探索仍处于起步阶段。
围绕这一问题,团队将目光投向三阴性乳腺癌。作为一种缺乏雌激素受体、孕激素受体和HER2表达的乳腺癌亚型,三阴性乳腺癌可选择的靶向治疗方案相对有限。面对庞大的候选药物和联合用药空间,如何更有效地预测药物反应,也为检验新方法提出了严峻挑战。
要让模型理解药物如何影响细胞,仅记录某一时刻的分子状态并不够。面对蛋白质组实验通量的限制,研究团队没有单纯扩大样本规模,而是先通过密集时间点采样,识别药物作用的早期、中期和晚期响应;随后选取具有代表性的时间点(6,24,48小时),系统测量不同乳腺癌细胞在单药和联合用药后的蛋白质组变化。这样的纵向采样将静态分子快照串联为动态轨迹,在有限的实验规模内捕捉药物作用随时间演化的特征,为模型训练提供了关键的动态信息。
1.构建大规模时间分辨扰动蛋白质组数据集
研究团队对16株三阴性乳腺癌细胞系和2株非三阴性乳腺癌细胞系进行了系统研究,使用63种临床应用的小分子药物及59种药物组合进行扰动。
经过数据质控分析后,ProteinTalks数据集包括:16,311个扰动蛋白质组DIA-MS数据文件包含5585个定量蛋白质组和超过3800万项蛋白质丰度测量值;23,482项细胞毒性测量值。
生物学分析表明,这些时间序列数据能够反映药物作用机制。不同阶段的蛋白质变化呈现出明确的时间特征:药物作用机制相关通路主要在6小时富集;随后,调控网络、代谢过程和细胞周期逐渐重塑;而与细胞死亡相关的通路在48小时更加突出。
图1 ProteinTalks的工作流程概述
2.ProteinTalks模型构建
ProteinTalks 是一个学习扰动条件下的蛋白质组动态和药物表型的联合模型。模型首先将细胞的基线蛋白质组与以蛋白质为维度表征的药物扰动信息(包含药物靶点信息)共同编码为潜在表示,并在潜在表示空间中利用神经常微分方程学习其随时间的连续演化过程,再将对应于 6、24 和 48 小时的状态解码为蛋白质组预测。
在此基础上,模型的表型预测头对基线蛋白质组、预测的蛋白质变化轨迹,以及单药或药物组合中各药物的分子指纹和理化性质特征进行编码融合,并通过卷积层和全连接层(多层感知器)预测单药疗效或双药组合的协同作用概率。蛋白质组重建与药物表型预测两个任务采用固定权重的联合损失函数进行协同训练,因此,表型预测误差也可通过反向传播参与动态表征的学习。
不同于一些预先在预定义表征空间中进行轨迹插值的方法,ProteinTalks 在训练过程中同步学习蛋白质组表征及其在扰动条件下的时间演化,从而使动态预测任务参与模型内部表征的塑造。换言之,模型不仅拟合细胞在给定时间点的蛋白质状态,还刻画这些状态在给定扰动条件下随时间变化的规律。
论文中的比较结果显示,与所比较的静态转录组基础模型相比,ProteinTalks 的模型参数量和训练数据点数量均约少三个数量级。
3.从药效预测到跨系统迁移
在针对17种可评估细胞系进行的“留一细胞系”验证中,模型的平均准确率、AUROC和AUPRC分别达到0.90和0.95。在论文所报告的评估条件下,ProteinTalks 的整体性能优于 3 种转录组基础模型和 4 种传统机器学习模型。
研究团队还考察了模型对训练阶段未见药物的泛化能力。在一个包含4种三阴性乳腺癌细胞系、81种抗癌化合物的独立数据集中,ProteinTalks在未经微调的情况下取得了0.90的AUROC和0.88的准确率。
在少样本迁移实验中,模型进一步应用于来自黑色素瘤、结直肠癌、肺癌和胰腺癌的扰动蛋白质组数据,获得0.77的平均AUROC,显示出向乳腺癌之外的其他肿瘤细胞迁移的潜力。
4.动态蛋白质网络重塑与药物响应相关蛋白
对于药物反应预测模型,准确率并不是唯一需要评估的维度。为此,研究团队引入动态SHAP分析,分别计算6、24和48小时各蛋白质对药效预测结果的贡献。
传统的特征重要性分析通常只提供一个静态排序。动态SHAP则能够形成随时间变化的蛋白质贡献图谱:有些蛋白质可能在给药早期具有较高权重,随后逐渐减弱;另一些蛋白质则可能在细胞进入死亡或耐药阶段后,才成为影响模型判断的重要因素。通过这种方式,ProteinTalks可以将药效预测追溯到具体蛋白质及其时间依赖性变化,为研究药物敏感性和耐药机制提供候选线索。
不过,模型归因并不等同于生物学因果关系。某个蛋白质对预测结果具有较高贡献,并不能直接证明它决定了药物反应,仍需通过进一步的功能实验加以验证。在抗有丝分裂药物的分析中,AKR1C3被模型识别为重要的药效相关蛋白。研究团队随后在三阴性乳腺癌细胞系BT20中利用siRNA敲低AKR1C3,发现细胞对多西他赛的敏感性显著提高。这一结果从侧面验证了模型提出的生物学假设,也表明ProteinTalks不仅能够预测药物反应,还可以从动态蛋白质网络中筛选值得进一步研究的候选机制。
5.从肿瘤细胞系走向患者来源的模型
完成细胞系层面的验证后,研究团队进一步评估了ProteinTalks的临床应用潜力。
在患者来源异种移植模型中,研究人员先使用乳腺癌样本进行适配,随后在140个非乳腺癌样本中开展零样本测试。与三种转录组基础模型实现相比,ProteinTalks的平均AUROC提高了24%。
研究还分析了501名未经治疗的三阴性乳腺癌患者的基线石蜡包埋肿瘤样本。基于基线蛋白质组和计划采用的治疗方案计算模型评分后,患者可被划分为总生存期和无复发生存期等不同的亚组。该结果初步支持利用蛋白质组进行辅助预后分层的可行性。然而,由于该分析属于回顾性研究,模型的临床效用仍需通过前瞻性研究进一步验证。
在个体化药物筛选方面,研究团队还基于三个三阴性乳腺癌患者来源类器官的基线蛋白质组,对约3000种已上市或处于临床开发阶段的化合物进行了虚拟筛选。除顺铂外,模型还筛选出citarinostat、THZ-1和CAY10603等候选药物。这些化合物在论文报道的类器官实验中表现出比临床标准化疗的顺铂更低的半数抑制浓度。
这是不是一个完整的虚拟细胞?
目前还不是。
ProteinTalks并不是对真实细胞全部结构和功能的数字化复制。它首先聚焦于一项明确任务:从细胞的基线蛋白质组出发,预测药物作用后的蛋白质动态变化,在这个特定场景构建了蛋白质组的虚拟细胞模型,并应用于药物筛选和机制分析。
这项研究为蛋白质组虚拟细胞的技术放大奠定了基础,但从当前的概念验证走向更完整、更普适的虚拟细胞,仍面临若干关键挑战。首先,需要进一步整合能够表征转录与翻译状态的多层组学数据,建立不同分子层之间动态变化的对应关系。其次,现有训练数据的规模、癌种覆盖范围和生物学情境仍需扩展,以支持模型在更复杂扰动条件下的泛化。当前模型主要基于群体细胞水平的蛋白质组数据,尚不能充分解析单细胞异质性及其与群体平均信号之间的差异。更重要的是,如何跨越细胞系、类器官和患者来源模型之间的生物学差异,将模型稳定迁移至真实人体样本和临床场景,仍是下一阶段需要解决的核心问题。随着更大规模、时间分辨且跨层次的数据不断积累,ProteinTalks所验证的技术路线有望进一步拓展为更接近真实生命过程的虚拟细胞体系。
这项工作的标志性意义在于提出并验证了一条新的研究路径:以时间分辨的扰动蛋白质组作为动态监督信号,构建能够捕捉细胞动态流形的预训练模型,从而提升AI对细胞状态与复杂表型的表征能力,并将其应用于药物研发。蛋白质组与功能表型更为接近,而对时间演化规律的显式建模,则有助于推动人工智能的学习从静态相关性建模走向动态机制刻画。二者结合,使 ProteinTalks 在训练数据规模和模型参数量均比所比较的转录组模型少约 2~3 个数量级的情况下,仍取得了更优的整体性能。这将为未来虚拟细胞模型的发展提供重要的方法论参考。
目前来看,虚拟细胞模型所能做的还很有限,我们对细胞体系运作的科学规律理解仍极其碎片化,离我们期盼构建的细胞的“数字孪生”还有很大距离。
“描绘和预测细胞的所有的行为,目前是做不到的,但是我们可以先走一小步,迈出一小步,再思考,再讨论,总是可以越走越远。”郭天南说。
虚拟细胞研究并非要取代生命研究。郭天南认为,虚拟细胞研究代表了生命科学研究的一个新的阶段,人类尝试更全面的采集生命活动的数据,用更复杂的算法分析这些数据,以获得前所未有的洞见,为疾病的诊治提供更高维度的解决方案。
本研究由西湖大学医学院助理研究员孙瑞博士、西湖大学医学院助理研究员钱鎏佳博士、北大研究院(现深势科技)算法工程师李永歌博士和哈尔滨医科大学刘通教授担任共同第一作者,西湖大学医学院郭天南教授、西湖实验室朱怡研究员、北京科学智能研究院温翰研究员、北京大学周沛劼研究员为文章共同通讯作者。
文章链接:
学术合作组织
战略合作伙伴
(*排名不分先后)
转载须知
【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
- 上一篇:轮毂数控铣床改造升级,重载夹爪替换原有进口抓手
- 下一篇:“卖书人”选好书