分享自:

虚拟细胞世界模型:迈向AI驱动的数字生物体

期刊:CellDOI:10.1016/j.cell.2026.08.042

本文作者为Eric P. Xing(穆罕默德·本·扎耶德人工智能大学及卡内基梅隆大学教授、GenBio AI联合创始人兼首席科学家)和Le Song(穆罕默德·本·扎耶德人工智能大学教授、GenBio AI联合创始人兼首席技术官)。文章以“perspective”(前瞻性观点)形式发表于Cell期刊第189卷,出版日期为2026年9月17日,文章DOI为https://doi.org/10.1016/j.cell.2026.08.042。

本文并非单一原创实验研究,而是一篇关于“虚拟细胞世界模型”(virtual cell world model, VCWM)的学术观点与框架性论文。其核心主张是:生物学研究应当从基于试错实验的湿实验室范式,转向基于可计算的“数字实验室”范式,通过构建能够模拟活细胞行为的多模态、多尺度、动态且有状态的计算系统,实现生物学的可预测、可设计与可编程。作者提出,VCWM本质上是一种“世界模型”(world model),它不只是预测特定生物学终点,而是学习并模拟细胞作为一个动态系统的内在演化规律,从而支持干预条件下的反事实推理、长时程推演和理性设计。

文章首先从学术背景出发,指出尽管单细胞、空间转录组及多模态技术带来了生物学数据的爆炸式增长,但现有计算框架大多局限于单一模态或特定预测任务。近年来兴起的AI驱动数字生物体(AI-driven digital organism, AIDO)理念,以及Chan Zuckerberg Initiative提出的预测性细胞系统路线图、Arc Institute的大规模扰动基础模型等,均表明领域正朝着可模拟细胞行为的方向发展。然而,作者认为,现有模型多为“预测器”,例如RNA-seq扰动预测模型(如X-Cell)、基于大语言模型的生物学推理系统(如CellHermes)、以及机制性全细胞模型(如JCVI-syn3a的4D模拟)等,虽各有优势,但彼此割裂,无法形成一个统一的、可被持续干预并演化出连贯多模态输出的细胞模拟器。

文章的主体部分围绕VCWM的可操作定义与体系架构展开。作者明确定义VCWM为一个包含三个关键组件的动态系统:第一,结构化编码器(structured encoder),将基因组、表观组、转录组、蛋白质组、结构信息、互作网络、形态学图像及微环境等异质观测数据映射到一个共享的细胞潜空间(cellular manifold, M),该潜空间不仅具有语义性,还具有“状态性”与“可操作性”;第二,动作条件化转移算子(action-conditioned transition operator, f),以干预操作a作为输入,推动潜状态z在M上演化,其形式为z_{t+1} = f(z_t, a_t),支持任意时长的轨迹滚动(rollout);第三,结构化解码器(structured decoder),将潜状态还原为多种可观测模态,并在共享几何结构与生物网络拓扑的约束下,强制跨模态一致性。作者特别强调,VCWM与现有预测模型的关键区别不在于基准任务上的增量性能提升,而在于输出性质与用户体验的彻底重构:VCWM生成的是由同一个潜状态投射出的分子、结构、功能与形态的连贯轨迹,而非孤立的预测终点。

在架构层面,作者提出了一个将符号推理与连续动力学相耦合的混合系统。生物网络G=(V,E)中的节点代表基因、蛋白质、复合物、通路与过程,边代表调控、物理或功能关系。编码器可以基于图神经网络实现,并可与Transformer架构结合形成残差网络结构,以平衡生物先验与数据驱动的表达能力。转移算子f则包含两个互补模块:符号推理模块利用大语言模型或知识图谱在G上推演调控逻辑变化,连续动力学模块则基于扩散模型或流匹配模型(flow matching)在M上传播平滑的分子与形态变化。解码器则通过共享M的几何与G的拓扑,对基因表达、蛋白质定位、互作概率、结构构象及形态学描述等多模态输出施加一致性约束。这一设计使VCWM能够同时捕捉外部干预驱动的状态转移与内在的细胞周期、调控振荡等内源性时间动力学。

文章进一步系统阐述了VCWM的数据需求。学习细胞流形M需要大规模多模态数据,其中单细胞配对数据(如CITE-seq、单细胞多组学ATAC+RNA)提供最严格的跨模态对齐监督,但数量稀少;部分配对数据和大量未配对的单模态数据则提供条件级对齐与表征学习基础。学习一步动作条件转移需要扰动-响应数据集,包括CRISPR敲除/干扰/激活筛选、RNAi与过表达实验、小分子处理、遗传变异及环境扰动,并且干预强度、剂量、时间及组合信息都应编码进动作a中。组合扰动筛选尤其重要,因为它们揭示了遗传与药理互作,为学习非加性效应提供监督。学习长时程轨迹结构则需要纵向活细胞成像、非破坏性转录组记录技术(如Live-seq)以及RNA velocity等快照推断方法,后者虽弱于直接时序测量,但可作为对转移算子f和细胞流形几何的约束。作者将这三类数据分别对应三个学习目标:多模态测量塑造流形,扰动定义局部转移,时序信号约束长程流动。

在计算与技术挑战方面,作者指出VCWM面临表示学习、规模化训练与时间动态建模三大障碍。统一表示需在稀疏配对数据与海量未配对数据之间取得平衡,可能需结合跨模态重建与对比学习策略。模型参数量可达数十亿,输入上下文极长,需要张量并行、流水线并行与上下文并行等分布式训练技术。时间轨迹推断本身也存在技术脆弱性,单细胞RNA-seq噪声大,高维状态空间中的轨迹重建困难,因此学习到的世界模型质量可能高度依赖推断信号的保真度。

在评估框架上,作者主张不能沿用RNA-seq扰动基准或现有排行榜,而应建立“虚拟细胞竞技场”(virtual cell arena),从连贯性、动力学保真度与实验效用三个维度进行评价。计算验证包括跨模态一致性与多步轨迹稳定性;生物学验证将受控扰动作为探针,比较预测状态转移与实验观测;生成效用验证则通过逆向设计任务,如给定目标表型区域M*,要求模型提出干预序列a以将当前状态驱动至目标状态,并通过实验检验其成功率是否显著高于基线筛选。作者还在Box 1中给出了一个具体范例:针对衰老原代祖细胞分化能力下降问题,设计三至五个干预的组合方案并在虚拟细胞中搜索剂量、顺序与时间,最终在真实原代细胞中前瞻性验证是否能恢复分化能力,同时避免过度增殖、衰老或炎症等不良状态。

文章最后提出了VCWM演化的两个轴向。垂直轴是构建“虚拟细胞银行”(virtual cell bank),积累覆盖细胞类型、发育阶段、遗传背景、疾病状态与环境暴露的多样化细胞状态库;水平轴是层级化组合,从虚拟细胞到虚拟组织、虚拟器官乃至虚拟生物体,每级引入额外空间、生理与功能约束。两者共同指向AIDO的长期图景。作者同时提醒,当前训练数据多来自癌细胞系或永生化细胞系,在体外标准化条件下培养,可能引入系统偏差;因此需将培养条件与微环境显式纳入细胞上下文,并逐步纳入原代细胞、患者来源细胞、类器官与组织测量。此外,个性化虚拟细胞还涉及隐私、同意、所有权与治理等伦理问题。作者以工程类比总结全文:正如计算机辅助设计(CAD)重塑了建筑与机械设计、电子设计自动化(EDA)革命了半导体工程、大规模模拟支撑了现代天气预报,VCWM有望成为生物设计的计算基座,推动生物学从湿实验室的穷举搜索转向在可学习细胞世界中的结构化导航,最终实现“虚拟生物学”的工业时代。

上述解读依据用户上传的学术文献,如有不准确或可能侵权之处请联系本站站长:admin@fmread.com