单细胞分析中的虚拟基因敲除方法:原理、实现与应用综合综述
作者:乐备实高级产品经理 浏览次数:504 分享:

简要概述

                       

虚拟基因敲除(in silico gene knockout)是单细胞计算生物学中一类重要的计算方法,旨在通过计算模拟预测特定基因被敲除后细胞转录组状态的变化,而无需进行实际的湿实验基因编辑。这类方法的核心价值在于能够以极低的成本系统性探索海量基因扰动组合,为药物靶点发现、基因功能注释和细胞命运调控研究提供高通量的假设生成平台。当前,虚拟基因敲除方法主要沿着两大技术路线发展:一是基于基因调控网络(GRN)的模拟方法,如CellOracle和scTenifoldKnk,通过构建和扰动基因调控网络来预测下游效应;二是基于深度学习的生成式模型,如GEARS、CPA和scGen,通过学习控制组与扰动组之间的映射关系来预测基因表达变化。近年来,以Geneformer和scGPT为代表的单细胞基础模型进一步拓展了虚拟扰动的能力边界,实现了零样本条件下的基因功能预测。本综述系统梳理了这些方法的技术原理、实现策略、应用范围,并提供了详细的代码实现指南,为研究人员选择和应用合适的虚拟基因敲除工具提供参考。

                                        

1. 虚拟基因敲除的科学原理与核心概念

                                   

1.1 基因敲除的生物学基础与计算模拟的必要性

                    

基因敲除(gene knockout)是分子生物学中研究基因功能的经典手段,通过完全失活特定基因来观察表型变化,从而推断该基因在生物过程中的作用。传统的基因敲除依赖于CRISPR-Cas9等基因编辑技术,虽然精确可靠,但面临着成本高、周期长、通量低的固有局限。在单细胞分辨率下,Perturb-seq等高通量技术将CRISPR筛选与单细胞RNA测序相结合,实现了对基因扰动后全转录组变化的平行测量,极大提升了基因功能研究的通量。然而,即使是Perturb-seq,其能够覆盖的基因扰动组合也只是整个基因组合空间中的极小一部分。人类基因组包含约两万个蛋白编码基因,双基因组合扰动的可能性就已超过两亿种,这在实验上是无法完全穷举的。

                              

正是在这一背景下,计算模拟的基因敲除(virtual gene knockout)应运而生。虚拟基因敲除旨在利用已有的单细胞转录组数据(通常是未扰动的野生型细胞),通过数学模型和算法预测特定基因被敲除后细胞基因表达谱的变化。这种方法的核心假设是:基因之间的调控关系蕴含着因果结构,而这些因果结构可以从观测到的基因共表达模式中推断出来。一旦建立了这种调控关系的计算表示,就可以通过"数字干预"(digital intervention)——即在模型中强制改变某个基因的状态——来模拟真实的基因敲除效应,并追踪这种扰动如何通过调控网络传播,最终影响整个转录组。虚拟基因敲除的价值不仅在于降低实验成本,更在于其能够探索实验难以触及的大规模组合扰动空间罕见细胞类型,为靶向治疗、合成生物学和发育生物学研究提供前所未有的系统性视角。

                                    

1.2 虚拟基因敲除的数学框架

                             

从数学角度而言,虚拟基因敲除可以形式化为一个条件生成问题:给定一个细胞的基因表达向量 x ∈ ℝᴳ(其中 G 为基因数量)和一组待敲除的基因集合 𝒦,预测敲除后的基因表达向量 x'。即学习一个映射函数 f: (x, 𝒦) ↦ x'。不同的计算方法对这一映射函数的建模方式各不相同,形成了多样化的技术路线。

                               

对于基于基因调控网络的方法,如CellOracle,该映射通过显式的网络传播实现。设基因调控网络为一个加权有向图 𝒢 = (V, E, W),其中节点 V 代表基因,边 E 代表调控关系,权重 Wᵢⱼ 表示基因 j 对基因 i 的调控强度。基因敲除操作对应于将目标基因的出边权重置零(即 Wᵢ,ₖ = 0, ∀ i 对于 k ∈ 𝒦),然后通过迭代传播模拟信号流动:x⁽ᵗ⁺¹⁾ = σ(W x⁽ᵗ⁾ + b),其中 σ 为非线性激活函数,b 为偏置项。经过多步传播后,稳态表达向量即为预测的敲除后状态。这种方法的优势在于高度的可解释性,因为每一步传播都对应于生物学上可理解的调控事件。

                                 

对于基于深度学习的方法,如GEARS和CPA,映射函数 f 由一个深度神经网络参数化。这些方法通常采用变分自编码器(VAE)图神经网络(GNN)架构,学习从控制组到扰动组的潜在空间转换。以scGen为例,模型学习将控制细胞 x꜀ 编码到潜在表示 z꜀,并通过向量算术 zₚ = z꜀ + δ 得到扰动后的潜在表示,其中 δ 是基因 k 的扰动向量。解码器随后将 zₚ 映射回基因表达空间得到预测 x'。CPA进一步扩展了这一框架,通过组合式嵌入(compositional embedding)分离细胞状态、扰动类型和协变量(如剂量、细胞类型)的贡献,实现了对未见过的扰动组合的预测。深度学习方法的核心优势在于能够捕捉非线性、高阶的基因互作效应,这在组合扰动预测中尤为重要。

                                     

1.3 从单细胞数据推断基因调控关系

                           

虚拟基因敲除的准确性高度依赖于对基因调控关系的准确建模。从单细胞RNA-seq数据推断基因调控网络是一个长期存在的挑战,因为标准的scRNA-seq测量的是基因表达的相关性而非因果性。多种计算策略被开发用于从观测数据中提炼调控信息。基于共表达的方法利用基因对之间的相关系数或互信息来推断潜在的调控连接,但这种方法容易受到间接效应和混杂因素的干扰。基于回归的方法,如CellOracle采用的岭回归,将每个目标基因的表达建模为其潜在调控转录因子的线性组合,通过正则化选择重要的调控因子。基于因果推断的方法则尝试利用干预数据(如Perturb-seq)来区分相关性与因果性,例如通过比较扰动前后的表达变化来识别直接的调控靶点。

                           

近年来,多组学整合策略显著提升了GRN推断的准确性。通过结合单细胞ATAC-seq(染色质可及性)数据,可以识别活跃的调控元件和转录因子结合位点,为先前知识的整合提供基因组尺度的证据。SCENIC+和CellOracle等方法都利用scATAC-seq数据构建基础GRN(base GRN),定义可能的TF-靶基因连接,然后使用scRNA-seq数据来量化这些连接在特定细胞类型中的强度和活性。这种"先验知识+数据拟合"的两步策略有效减少了GRN推断的搜索空间,提高了推断结果的生物学可信度。值得注意的是,即使GRN推断存在误差,虚拟基因敲除的预测仍可能具有一定的实用价值,因为系统性的网络分析往往对个别边的缺失或错误具有一定的鲁棒性。

                                                

2. 主要计算方法分类与原理

                                                            

虚拟基因敲除方法可根据其核心技术架构分为六大类:基因调控网络(GRN)方法变分自编码器(VAE)方法图神经网络(GNN)方法最优传输(OT)方法流匹配与扩散模型方法,以及单细胞基础模型方法。每类方法在建模假设、预测能力和应用场景上各有特色,形成了互补的技术生态。

                                                       

                                                            

虚拟基因敲除方法时间线

图1:单细胞虚拟基因敲除主要方法的发展时间线,按技术类别着色。GRN-based方法(红色)和VAE-based方法(蓝色)是早期发展的两大主流,基础模型(紫色)和流匹配/扩散模型(青/橙色)代表了最新趋势。

         

2.1 基于基因调控网络(GRN)的方法

                                  

2.1.1 CellOracle:整合多组学数据的GRN建模与扰动模拟

                                   

CellOracle是由Kamimoto等人在2023年发表于Nature的开创性方法,它以单细胞转录组为核心输入,并结合预先构建的基础GRN(base GRN)来模拟转录因子(TF)扰动对细胞身份的影响。该基础GRN通常可由scATAC-seq、motif扫描或已有启动子/调控数据库推导而来,因此CellOracle并不严格要求每个研究都同时具备配对的scATAC-seq数据。CellOracle的核心创新在于其两步式GRN构建策略:首先,利用先验调控信息限定可能存在的TF-靶基因连接;其次,使用scRNA-seq数据对这些候选连接进行上下文依赖的加权,通过正则化回归拟合特定细胞类型中TF表达与靶基因表达之间的关系,从而得到细胞类型特异的加权GRN。

                                       

在扰动模拟阶段,CellOracle采用信号传播算法。当模拟某个TF的敲除时,该TF的表达被强制设为零,模型通过GRN迭代计算下游靶基因的表达变化。具体而言,模拟从细胞的初始表达状态出发,在每一步传播中,每个基因的表达更新为其调控因子的加权和。经过多轮传播后,模型收敛到一个新的稳态表达向量,代表了预测的敲除后状态。CellOracle进一步将表达变化向量投影到低维嵌入空间(如UMAP),计算每个细胞的位移向量,并通过与发育方向向量场的内积来评估扰动对细胞命运的影响程度。这一独特的向量场分析框架使CellOracle不仅能预测哪些基因会响应扰动,还能推断扰动将驱动细胞向何种命运状态转变,这在发育生物学应用中具有重要价值。

                                             

                                          

CellOracle 方法概览(论文 Fig. 1)

图 2.1.1:CellOracle 的整体方法与造血应用示意。来源:Kamimoto et al., Nature 2023, Fig. 1。

                                        

2.1.2 scTenifoldKnk:基于流形对齐的虚拟敲除

                              

scTenifoldKnk由Osorio等人于2022年提出,是一种纯数据驱动的虚拟基因敲除方法,仅需要野生型scRNA-seq数据作为输入。该方法的核心思想是通过比较野生型(WT)基因调控网络和虚拟敲除后的伪网络来识别差异调控基因。scTenifoldKnk的工作流程分为三个步骤:网络构建虚拟敲除流形对齐。在网络构建阶段,scTenifoldKnk使用主成分回归(PCR)从scRNA-seq数据推断基因间的调控关系。具体而言,对于每个基因,其表达向量被回归到其他基因的主成分上,回归系数构成了GRN的邻接矩阵。为了提高网络的鲁棒性,该方法通过多次细胞子采样构建多个网络,并使用CANDECOMP/PARAFAC(CP)张量分解对这些网络进行去噪和融合,得到最终的加权GRN。

                                                     

虚拟敲除操作在数学上极为简洁:复制WT网络的邻接矩阵 W,然后将目标基因对应行的所有元素设为零,得到敲除后的伪网络 WᴷO。这种操作模拟了基因敲除后该基因对其下游靶基因调控作用的丧失。关键在于如何比较 W 和 WᴷO 来量化每个基因的调控变化。scTenifoldKnk采用准流形对齐(quasi-manifold alignment)技术,将两个网络投影到共享的低维潜在空间中,然后计算每个基因在两个网络投影之间的欧氏距离。距离越大,表明该基因在WT和KO状态下的调控环境差异越显著,即该基因受到目标基因敲除的影响越大。通过卡方检验,scTenifoldKnk识别统计显著的差异调控基因,并返回按显著性排序的基因列表。该方法已被成功应用于剪切应力响应调控因子的筛选和纤维化疾病中TNIK基因的功能预测等研究中。

                                                            

                                                                         

scTenifoldKnk 工作流(论文 Fig. 1)

图 2.1.2:scTenifoldKnk 的网络构建、虚拟敲除与流形对齐流程示意。来源:Osorio et al., Patterns 2022, Fig. 1。

                                               

2.1.3 基于SCENIC+的调控网络推断与虚拟扰动

                            

SCENIC+是Bravo González-Blas等人于2023年开发的用于从单细胞多组学数据中推断增强子介导的基因调控网络的方法。虽然SCENIC+本身主要聚焦于GRN推断而非扰动预测,其推断的调控网络可以作为CellOracle等扰动模拟工具的输入,因此构成了虚拟基因敲除流程的重要上游组件。SCENIC+整合了染色质可及性(scATAC-seq)基因表达(scRNA-seq)数据,通过三个步骤推断GRN:首先,使用pycisTopic鉴定顺式调控模块(CRM)和增强子;其次,通过基序富集分析将转录因子与CRM关联;最后,利用线性模型量化TF-靶基因调控关系的强度和方向。

                                      

SCENIC+推断的GRN具有高细胞类型特异性方向性信息(即激活或抑制),这些特性使其特别适合作为虚拟扰动分析的先验知识。在实际应用中,用户可以先使用SCENIC+从多组学数据中推断GRN,然后将该网络导入CellOracle进行扰动模拟。这种组合策略充分利用了SCENIC+在GRN推断上的精度和CellOracle在扰动模拟上的功能,形成了从数据到预测的完整工作流。值得注意的是,SCENIC+还支持跨物种GRN比较进化保守性分析,这为比较生物学中的虚拟扰动研究提供了额外的维度。

                                   

                                                                                                              

SCENIC+ 整体工作流(论文 Fig. 1)

图 2.1.3:SCENIC+ 从 scATAC-seq + scRNA-seq 推断 eGRN 的工作流与 motif 数据库构建示意。来源:Bravo González-Blas et al., Nature Methods 2023, Fig. 1。

                                                                 

2.2 基于变分自编码器(VAE)的方法

                                                       

2.2.1 scGen:潜在空间中的扰动响应预测

                                           

scGen是Lotfollahi等人于2019年在Nature Methods上发表的开创性工作,首次将生成式深度学习引入单细胞扰动预测领域。scGen基于变分自编码器(VAE)架构,学习将高维基因表达数据压缩到低维潜在空间,并在潜在空间中执行扰动响应预测。scGen的核心假设是:细胞对特定扰动的响应在潜在空间中可以用一个固定的向量(扰动向量)来表示,而不依赖于细胞的初始状态。这一假设使得scGen能够将从一个细胞群体学习到的扰动向量应用到另一个细胞群体,实现跨细胞类型的预测。

                                        

scGen的训练过程使用成对的控制组和扰动组细胞。编码器将控制细胞 x꜀ 映射到潜在表示 z꜀,将扰动细胞 xₚ 映射到 zₚ。模型优化两个目标:一是重构损失,确保潜在表示能够准确解码回原始表达空间;二是扰动向量的一致性损失,鼓励同一扰动在不同细胞中的扰动向量 δ = zₚ - z꜀ 尽可能接近。在预测阶段,对于新的控制细胞,scGen首先计算其潜在表示 z,然后加上学习到的扰动向量 δ 得到预测的扰动后表示 z' = z + δ,最后通过解码器将 z' 映射回基因表达空间。scGen的向量算术机制不仅简单高效,还具有良好的可解释性——扰动向量的方向指示了细胞状态变化的趋势,其幅度反映了响应的强度。scGen已被成功应用于跨物种(如从小鼠预测人类对扰动的响应)和跨细胞类型的扰动预测,展示了VAE框架在虚拟基因敲除中的强大泛化能力。

                                                                      

                                                                                          

scGen 整体框架(论文 Fig. 1)

图 2.2.1:scGen 基于 VAE + 潜在空间向量算术的扰动响应预测框架示意。来源:Lotfollahi et al., Nature Methods 2019, Fig. 1。

                                                            

2.2.2 CPA:组合式扰动自编码器

                                                  

CPA(Compositional Perturbation Autoencoder)是Lotfollahi等人在2023年发表于Molecular Systems Biology的重要方法,它将scGen的扰动预测框架扩展到更复杂的场景,特别是组合扰动剂量响应多协变量条件。CPA的名称来源于其核心设计理念——将细胞状态表示分解为多个独立且可组合的组件。CPA认为,观测到的基因表达是基础细胞状态扰动效应协变量效应(如细胞类型、剂量、物种)的组合结果。这种组合式表示使CPA能够像搭积木一样重新组合这些组件,预测在训练数据中从未见过的条件组合。

                                                                               

CPA的架构包含三个关键组件:编码器扰动/协变量表示模块解码器。编码器将输入基因表达映射到潜在空间中的基础状态表示;扰动和协变量则分别以嵌入或剂量调制后的表示加入模型。许多介绍CPA的文献会强调其解耦(disentanglement)思想,即尽量让基础细胞状态与扰动、细胞类型、剂量等因素分离;但从实现层面看,CPA最核心、最稳定的结构特征是其加法式组合框架。对于给定的基础细胞状态表示 z_basal、扰动嵌入 e_pert 和协变量嵌入 e꜀ₒᵥ,解码器输入通常写为 z_basal + e_pert + e꜀ₒᵥ。这种加法组合机制使CPA能够预测新的扰动组合(如A+B双基因敲除)时,将多个扰动表示在潜在空间中进行组合。

                                                                   

CPA在多个大规模药物筛选数据集上进行了验证,包括多药物、多剂量和多细胞背景的单细胞筛选场景。实验结果表明,CPA能够较好地预测未见的药物组合效应,并在多种设定下优于简单基线模型。需要注意的是,对完全未见药物的外推通常依赖于额外的药物表征,如外部分子指纹或化学结构嵌入,这更接近CPA生态中的扩展用法,而不宜简单表述为基础CPA在任何设置下都天然具备的能力。CPA的剂量响应建模能力仍然是其一大亮点——通过将剂量作为连续变量嵌入,CPA可以预测任意剂量下的细胞响应,为剂量优化提供计算支持。

                                                       

                                                       

CPA 整体架构(论文 Fig. 1)

图 2.2.2:CPA 的组合式扰动自编码器架构与组合预测机制示意。来源:Lotfollahi et al., Molecular Systems Biology 2023, Fig. 1。

                                                             

2.2.3 SAMS-VAE:稀疏加性机制变分自编码器

                                                                       

SAMS-VAE(Sparse Additive Mechanism Shifts VAE)由Bereket和Karaletsos于2023年提出,专注于通过稀疏性约束提升VAE扰动模型的可解释性。SAMS-VAE的核心假设是:单个扰动只影响潜在空间中的少数几个维度,即扰动效应是稀疏的。这一假设源于生物学观察——特定药物或基因扰动通常只激活或抑制有限的几条信号通路,而非同时影响整个转录组。

                                                           

为实现稀疏性,SAMS-VAE引入了二进制掩码机制。每个扰动类型关联一个二进制掩码向量 mₖ ∈ 0, 1d,其中 d 为潜在空间维度。掩码向量的元素指示该扰动影响哪些潜在维度(1表示影响,0表示不影响)。在模型训练过程中,SAMS-VAE学习掩码向量的分布,并通过稀疏性正则化(如L1惩罚)鼓励掩码中1的数量尽可能少。扰动后的潜在表示计算为 zₚ = z꜀ + mₖ ⊙ δ,其中  表示逐元素乘法。这种机制不仅提高了预测的准确性(通过减少过拟合),还提供了生物学上的洞见——通过查看哪些潜在维度被某个扰动激活,可以推断该扰动影响的生物学过程。

                                                                           

SAMS-VAE在组合扰动预测任务上表现出色。实验表明,稀疏性约束使模型更好地分离不同扰动的效应,从而更准确地预测它们的组合效应。特别是在训练数据稀疏、每个扰动只有少量观测细胞的场景下,SAMS-VAE的稀疏先验知识提供了重要的正则化,防止模型过拟合到噪声。SAMS-VAE的可解释性优势使其成为机制研究场景的理想选择——当研究者不仅关心"扰动后会发生什么",还想知道"扰动通过哪些途径发挥作用"时,SAMS-VAE的稀疏掩码提供了有价值的线索。

                                                              

                                                          

SAMS-VAE 框架(论文 Fig. 1)

图 2.2.3:SAMS-VAE 通过稀疏加性机制学习扰动在潜在空间中的稀疏偏移示意。来源:Bereket & Karaletsos, 2023, Fig. 1。

                   

2.3 基于图神经网络(GNN)的方法

                                        

2.3.1 GEARS:利用基因关系图预测未见扰动

                                                                

GEARS(Graph-Enhanced Gene Activation and Repression Simulator)是Roohani等人在2023年发表于Nature Biotechnology的代表性方法,它通过整合先验生物学知识(以基因关系图的形式)来预测对从未在训练数据中见过的基因的扰动效应。GEARS解决了VAE方法的一个关键局限:当目标扰动在训练集中没有观测到时,VAE无法学习其扰动向量,因此无法做出预测。GEARS通过将基因嵌入到结构化知识图中,实现了向未见节点的泛化

                                                                   

GEARS的架构包含两个核心的图神经网络(GNN)分支:一个处理基因关系图,另一个处理与扰动相关的功能先验图。在公开实现中,前者通常结合基因共表达关系,后者则主要利用Gene Ontology(GO)等先验知识来传播扰动相关信息,而不是简单根据“两个扰动是否产生相似表达谱”来现成构图。每个基因 i 由两个嵌入向量表示:基因嵌入 gᵢ 和扰动相关嵌入 pᵢ。这种双重嵌入设计使GEARS能够同时编码基因本身的功能上下文以及其作为扰动目标时的先验关系。

                                                                                

在预测阶段,GEARS首先通过GNN在基因关系图上传播信息,使每个基因的嵌入融合其邻居的信息。然后,对于给定的扰动集合 𝒦,模型将每个基因的嵌入与其扰动嵌入结合,通过交叉基因层(cross-gene layer)整合全转录组信息,最终通过基因特异性的输出层预测每个基因的后扰动表达值。GEARS的方向性感知损失函数(direction-aware loss)是另一个关键创新——它在标准MSE损失之外增加了对表达变化方向的约束,确保模型不仅预测正确的变化幅度,还预测正确的上调/下调方向。GEARS在多个大规模Perturb-seq数据集上进行了系统验证,包括涵盖单基因扰动和双基因组合扰动的Norman等数据集。总体而言,GEARS在未见单基因扰动组合扰动预测以及遗传互作发现等任务上都表现出较强竞争力,显示出将先验知识图与深度学习结合的优势。

                                                                            

                                                                        

GEARS 整体框架(论文 Fig. 1)

图 2.3.1:GEARS 整合基因关系图与功能先验图进行扰动预测的整体架构示意。来源:Roohani et al., Nature Biotechnology 2023, Fig. 1。

                                                                 

2.4 基于最优传输(OT)和流匹配的方法

                                        

2.4.1 CellOT:神经网络最优传输映射

                                           

CellOT由Bunne等人于2023年发表于Nature Methods,它将扰动预测框架为最优传输(Optimal Transport, OT)问题。与VAE和GNN方法不同,CellOT不学习控制组到扰动组的逐细胞映射,而是学习两个细胞群体分布之间的最优传输映射。这一视角的转变带来了重要的理论优势:OT框架自然地处理了单细胞数据中的随机性和异质性,因为预测的是群体水平的分布变换而非单个细胞的确定命运。

                                                     

CellOT使用输入凸神经网络(Input Convex Neural Network, ICNN)参数化传输映射 T: ℝᴳ arrow ℝᴳ,该映射将控制群体的分布 μ꜀ 推送到扰动群体的分布 μₚ。ICNN的特殊结构保证了映射的凸性,从而确保了OT问题的解的存在性和唯一性。训练过程中,CellOT最小化两个分布之间的Wasserstein距离(也称为推土机距离),即 minT ∈t c(x, T(x)) dμ_c(x),其中 c(·, ·) 为成本函数(通常为欧氏距离的平方)。CellOT的一个重要特性是它学习的是条件传输映射——模型可以条件于特定的扰动类型和协变量,从而预测不同条件下的群体响应。

                                                       

CellOT的群体水平预测使其特别适合异质性分析。当控制群体包含多个细胞亚群时,CellOT的映射可以揭示不同亚群对同一扰动的差异化响应——某些亚群可能大幅转变,而另一些可能保持相对稳定。这种亚群特异性的响应模式在VAE方法中往往被平均掉。CellOT的个体细胞轨迹预测也是一个独特功能——通过学习最优传输计划,CellOT可以推断每个控制细胞在扰动后最可能变成的扰动细胞,形成可解释的"细胞命运轨迹"。实验验证表明,CellOT在跨患者、跨物种的扰动预测上具有出色的泛化能力,显示了OT框架在捕获生物学不变性方面的优势。

                                                        

                                               

CellOT 整体框架(论文 Fig. 1)

图 2.4.1:CellOT 基于输入凸神经网络的最优传输扰动映射框架示意。来源:Bunne et al., Nature Methods 2023, Fig. 1。

                             

2.4.2 CellFlow:流匹配生成模型

                                                   

CellFlow是Klein等人于2025年提出的基于条件流匹配(conditional flow matching)的生成式扰动预测模型。流匹配是近年来生成模型领域的重要进展,它通过直接回归向量场来学习数据分布之间的转换,避免了扩散模型中复杂的去噪过程,训练更加高效稳定。CellFlow将流匹配应用于单细胞扰动预测,学习从控制群体到扰动群体的连续时间演化。

                                 

CellFlow的核心是速度场网络 v_θ(x, t, c),其中 x 为基因表达,t ∈ [0, 1] 为时间参数,c 为条件信息(包括扰动类型、细胞类型、剂量等)。速度场描述了细胞群体随时间的演化方向和速率——想象在基因表达空间中,每个点都有一个"速度向量"指示该处的细胞将如何移动。训练过程中,CellFlow通过条件流匹配损失直接回归真实的速度场,即 ℒFM = 𝔼_t, x || v_θ(x, t, c) - v_true(x, t) ||²。采样时,从控制群体出发,通过常微分方程(ODE)积分速度场得到预测的扰动群体:x(1) = x(0) + ∈t₀¹ v_θ(x(t), t, c) dt

                                                 

CellFlow的连续时间框架提供了独特的建模能力。首先,它允许在任意中间时间点采样,揭示了细胞响应扰动的动态过程而非仅终态。其次,流匹配的目标函数比GAN的对抗损失和扩散模型的去噪损失更简单稳定,训练过程不易出现模式崩溃。CellFlow还引入了最优传输耦合来连接控制细胞和扰动细胞,鼓励最经济的转换路径(即变化最小的路径),这与生物学上细胞倾向于最小化能量消耗的直觉一致。CellFlow在大规模药物筛选数据上的实验表明,其在分布级匹配(如预测差异表达基因的分布)上优于VAE和GNN方法,特别是在捕获响应异质性方面表现出色。

                                              

2.5 基于扩散模型的方法

                                     

2.5.1 PerturbDiff:功能扩散模型

                               

PerturbDiff由Yuan等人于2026年提出,是首个将扩散模型专门用于单细胞扰动建模的方法。扩散模型通过迭代去噪过程学习数据分布,近年来在图像生成领域取得了巨大成功。PerturbDiff将这一范式引入单细胞领域,学习从控制群体到扰动群体的随机微分方程(SDE)转换。与确定性映射(如VAE和OT)不同,PerturbDiff建模了转换过程中的内在随机性,更好地反映了细胞响应的生物学变异。

                                

PerturbDiff的架构基于概率流ODE得分匹配。训练过程中,模型学习得分函数 ∇ₓ log p_t(x),即在每个噪声水平 t 下数据分布的对数密度的梯度。预测时,PerturbDiff从控制群体出发,通过逆向SDE迭代去噪,逐步演化到预测的扰动群体。PerturbDiff的一个关键创新是异质性感知的条件化机制——模型不仅条件于扰动类型,还条件于控制细胞的潜在亚群标识,从而预测亚群特异性的响应模式。实验表明,PerturbDiff在捕获响应分布的尾部(即罕见但重要的响应模式)上优于确定性方法,这对于识别药物耐药亚群等应用至关重要。

                                               

                                                             

PerturbDiff 整体框架(论文 Fig. 1)

图 2.5.1:PerturbDiff 基于扩散模型与异质性感知条件化的扰动建模框架示意。来源:Yuan et al., 2026, Fig. 1。

                                  

2.6 单细胞基础模型方法

                            

2.6.1 Geneformer:基于Transformer的零样本扰动预测

                                     

Geneformer是Theodoris等人于2023年发表于Nature单细胞基础模型(foundation model),它在约3000万个人类单细胞转录组上通过自监督预训练学习了基因和细胞的上下文感知表示。Geneformer的核心创新在于其基于基因排名的输入表示——每个细胞被表示为其表达最高的基因的排序列表,而非原始表达值。这种表示方式天然地消除了文库大小差异和批次效应,使模型能够专注于基因的相对重要性而非绝对丰度。

                                      

Geneformer的架构是标准的Transformer编码器,它将基因视为"token",通过学习基因间的共现模式来捕获基因调控网络的结构。预训练任务是掩码基因预测(masked gene modeling),即随机掩盖输入序列中的部分基因,让模型预测被掩盖的基因。这种自监督目标迫使模型学习基因之间的功能关系——要准确预测一个被掩盖的基因,模型必须理解该基因与其他基因之间的调控依赖。预训练完成后,Geneformer可以通过微调(fine-tuning)适应下游任务,包括虚拟基因敲除。

                                           

Geneformer的零样本虚拟扰动能力是其最引人注目的特性。通过从输入序列中移除目标基因(或将其排名降至最低)并重新前向传播,可以获取扰动后的细胞嵌入。原始嵌入与扰动嵌入之间的余弦距离量化了该基因对细胞状态的重要性。Theodoris等人利用这一策略在心肌病研究中识别了TEAD4作为收缩功能的关键调控因子,并通过实验验证了这一预测。Geneformer的零样本能力意味着它可以在没有任何扰动训练数据的情况下预测基因功能,这大大降低了虚拟基因敲除的门槛。然而,Geneformer的预测主要是定性的(基因重要性排序),在定量预测表达变化幅度方面不如专门的扰动预测模型精确。

                                        

                                 

Geneformer 架构与迁移学习策略(论文 Fig. 1)

图 2.6.1:Geneformer 架构、预训练数据组成与下游迁移学习策略示意。来源:Theodoris et al., Nature 2023, Fig. 1。

                                          

2.6.2 scGPT:生成式单细胞基础模型

                                           

scGPT是Cui等人于2024年发表于Nature Methods的生成式单细胞基础模型,它将生成式预训练思想引入单细胞数据建模。与Geneformer主要采用基于基因排序的编码器式建模不同,scGPT同时显式表示基因身份与表达值,并利用Transformer学习细胞内基因之间的上下文关系。需要指出的是,尽管其命名借鉴了GPT,scGPT在公开实现和下游任务适配中并不宜被简单等同为自然语言处理中那种标准的decoder-only自回归模型;更准确地说,它是一类面向单细胞表达建模的生成式Transformer框架。

                                                               

scGPT的生成能力使其特别适合扰动响应预测。在微调阶段,常见做法是将扰动信息编码为额外的条件标记、扰动标志或其他辅助输入,并与基因token及表达值表示共同输入模型,再预测目标表达谱。这样的设计使模型能够捕获基因之间的高阶依赖关系,而不必把实现细节机械地理解为“逐个基因自回归生成”。scGPT在批次校正细胞类型注释扰动预测等多个任务上都展示了较强的迁移能力。其跨模态扩展能力也是一大亮点——scGPT可以处理不仅是RNA-seq数据,还包括蛋白质组、表观遗传等多种单细胞模态,为多模态虚拟扰动分析提供了统一框架。

                                                             

                                           

scGPT 模型结构(论文 Fig. 1)

图 2.6.2:scGPT 的生成式 Transformer 输入嵌入、注意力层与下游应用示意。来源:Cui et al., Nature Methods 2024, Fig. 1。

                           

2.6.3 scFoundation:大规模单细胞基础模型

                                                         

scFoundation由Hao等人于2024年开发,是目前参数规模最大的单细胞基础模型之一,拥有1亿参数,在超过5000万个人类单细胞上进行了预训练。scFoundation采用xTrimoGene架构,一种专为单细胞数据设计的Transformer变体。与Geneformer和scGPT不同,scFoundation特别强调定量表达建模——它保留了基因表达的数值信息,而非仅使用排名或分箱。这使得scFoundation在需要精确预测表达变化的下游任务(如药物响应预测)上具有优势。

                                                  

scFoundation的预训练任务是表达值回归基因掩码重建的组合,鼓励模型学习从部分观测基因推断完整表达谱的能力。在扰动预测任务上,scFoundation通常作为特征提取器使用——利用预训练模型将细胞嵌入到潜在空间,然后在这些嵌入上训练简单的预测头(如线性回归或MLP)来预测扰动响应。scFoundation的API设计考虑了易用性,提供了即插即用的嵌入推理服务,使非深度学习专家也能利用基础模型的能力。在GEARS的基准测试中,使用scFoundation嵌入的模型在多个扰动预测数据集上取得了竞争性的性能,证明了大规模预训练在捕获基因调控规律方面的价值。

                                                

                                                                        

scFoundation 预训练框架(论文 Fig. 1)

图 2.6.3:scFoundation 的 RDA 预训练任务、xTrimoGene 架构与下游应用示意。来源:Hao et al., Nature Methods 2024, Fig. 1。

                                            

                                                                                    

方法特性雷达图

图2:六种代表性虚拟基因敲除方法在六个关键维度上的定性比较。GRN-based方法(scTenifoldKnk、CellOracle)在可解释性上领先,GNN-based方法(GEARS)在组合扰动预测上表现突出,基础模型(Geneformer)在可扩展性和零样本能力上具有优势。

                                                                           

3. 各方法的实现细节与技术特点

                                   

3.1 网络推断方法的实现

                                                   

3.1.1 CellOracle的GRN构建流程

                                                  

CellOracle的GRN构建是一个精细的多步骤流程,其核心输入是单细胞RNA-seq数据以及一个预先准备好的基础GRN。在很多应用中,这个基础GRN会结合scATAC-seq信息来构建:例如先利用开放染色质区域(peaks)、共可及性分析以及基序扫描来建立TF到靶基因的候选调控连接;但在缺少配对ATAC数据时,也可以使用预构建的启动子或数据库先验网络。因此,更准确的说法是:CellOracle依赖的是先验调控连接 + 表达数据加权的框架,而不是机械地要求每个数据集都必须同时提供scRNA-seq和scATAC-seq。

                                                               

接下来,在上下文依赖的GRN加权阶段,CellOracle将基础GRN与scRNA-seq数据结合,为每个细胞类型推断特异的调控权重。对于每个细胞类型,模型提取该类型中每个细胞的基因表达向量,然后对基础GRN中的候选TF-靶基因连接进行正则化回归拟合,以估计调控强度和方向。正则化参数 α 控制模型复杂度,较大的 α 值通常会带来更强的收缩和更稀疏的网络;教程和示例中常见 α = 10 一类设置,但在实际分析中仍应根据数据噪声、基因数目和细胞数量进行调整。最终,每个细胞类型获得一个加权的、有符号的GRN矩阵,该矩阵编码了该细胞类型中显著的TF-靶基因调控关系及其强度和方向。

                                                                          

CellOracle还提供了GRN质量评估与网络分析工具,例如按显著性或边权筛选连接、计算度中心性和介数中心性等网络拓扑指标,并支持将网络导出到外部图分析软件中继续处理。这些步骤有助于用户判断推断GRN的稳定性与生物学可解释性。在实际操作中,GRN推断通常是整个CellOracle流程中计算最密集的步骤之一;对于数千个细胞和数千个基因的数据集,往往需要借助并行计算和缓存机制来提高效率。

                                                                   

3.1.2 scTenifoldKnk的张量分解网络构建

                                    

scTenifoldKnk的网络构建流程体现了集成学习的思想——通过多次子采样和聚合来提高网络推断的鲁棒性。给定一个 G × N 的表达矩阵(G 个基因,N 个细胞),scTenifoldKnk首先进行多轮独立的网络推断迭代。每轮迭代通常从细胞中随机抽取一个子集,并在降维后利用主成分回归(PCR)估计基因之间的预测关系,得到一个候选网络。论文与常见实现中可以看到诸如子样本大小、主成分个数和重复次数等经验设置,但这些数值更适合被理解为常见实践参数,而不是方法定义中唯一不变的超参数。

                            

完成 R 次迭代(默认 R = 10)后,scTenifoldKnk获得了 R 个权重矩阵。为了融合这些信息并去除噪声,scTenifoldKnk采用CANDECOMP/PARAFAC(CP)张量分解。具体而言,将 R 个矩阵堆叠成一个 G × G × R 的三维张量 𝒲,然后对其进行秩-K CP分解:𝒲 ≈ ∑ₖ₌₁ᴷ λₖ aₖ ∘ bₖ ∘ cₖ,其中  表示外积。分解得到的因子矩阵捕获了网络中的共调控模式——例如,如果多个子采样中反复出现相似的调控关系,CP分解会将这些关系压缩到少数几个因子中。最终的融合网络 Wfused 通过因子矩阵的重构获得,其中只保留统计显著的边。

                            

scTenifoldKnk的流形对齐步骤是该方法的技术核心。给定WT网络 W 和KO网络 WᴷO,scTenifoldKnk使用准流形对齐(quasi-manifold alignment)将两个网络投影到共享的低维空间,使拓扑相近的区域在嵌入空间中彼此靠近。在这一共享空间中,每个基因都会对应WT和KO两个位置坐标,它们之间的距离可以量化该基因在敲除后的调控环境变化。原始论文还对这些距离做了进一步的统计变换与显著性评估;但在综述写作中,更稳妥的表述是将其概括为“通过共享低维嵌入比较WT与KO网络差异,并据此识别显著受影响基因”。

                                                                  

3.2 深度学习模型的实现

                                                       

3.2.1 GEARS的双图神经网络架构

                         

GEARS的架构设计充分利用了基因之间的多层次关系。模型的输入包括控制细胞的基因表达向量 x ∈ ℝᴳ、待预测的扰动集合 𝒦(表示为基因索引的子集),以及可选的协变量信息。GEARS首先为每个基因学习两类表示:一类是描述基因自身功能上下文的基因嵌入,另一类是用于编码扰动目标先验关系的扰动相关嵌入。这两类表示分别在不同的先验图上进行传播,是GEARS实现对未见扰动泛化的关键。

                                                

在实现层面,GEARS的图传播模块更适合概括为轻量级图卷积/图传播层,而不宜笼统写成必须使用GAT。无论采用何种具体图层,其目的都是在先验图上聚合邻域信息,使每个基因的表示能够融合更大范围的功能上下文,形成多跳邻域的上下文表示

                                                 

与基因关系图分支相对应,GEARS还在扰动相关的先验图上进行第二路信息传播,为每个基因输出扰动嵌入 pᵢ。这一表示并不直接等同于真实实验中观测到的“扰动响应谱”,而更接近一种由先验知识约束的功能表示,用于帮助模型在未见扰动场景下进行泛化。

                                        

预测层,GEARS将基因嵌入、扰动相关嵌入和控制表达结合起来,并通过跨基因模块整合全转录组信息。对于组合扰动,多个目标基因的扰动表示可以在潜在空间中进行聚合,随后再经由基因特异性的解码层输出每个基因的后扰动表达。这样的设计使GEARS既能利用全局上下文,又能保留基因特异性的响应模式。

                                            

GEARS的方向性感知损失函数是其预测精度的重要保障。与只关注数值误差的标准MSE不同,方向性感知项会额外约束模型对上调/下调方向的判断,因此特别适合单细胞扰动预测这类既看重幅度也看重方向的任务。公开代码中还提供了可选的不确定性模式,用于输出与预测可靠性相关的额外量;但更稳妥的说法是将其视为一种工程化的不确定性建模选项,而不是直接概括为标准的贝叶斯神经网络或深度集成框架。

                                                                       

3.2.2 CPA的组合嵌入与对抗解耦机制

                                                          

CPA的架构体现了模块化设计的思想——每个生物学因素(扰动、细胞类型、剂量等)由相对独立的表示模块刻画,这些模块可以灵活组合。CPA的编码器通常是全连接网络,用于将输入基因表达 x 映射到潜在空间中的基础状态表示。很多论文解读会用“解耦器(disentangler)”来概括CPA的目标,即尽量减少基础状态表示中混入扰动和协变量信息;但从实现上看,更应抓住其核心是基础状态 + 扰动表示 + 协变量表示的组合框架,而不是将其机械理解为固定的向量拼接结构。

                                           

在训练思想上,CPA常通过判别器或对抗约束来鼓励这种分离,使基础状态表示尽可能不直接泄漏扰动标签和协变量标签。不过在综述表述上,更稳妥的说法是:CPA试图学习一个尽量“去条件化”的基础细胞状态,再叠加扰动和协变量表示,以提升对新组合条件的泛化能力。

                                                           

CPA的解码器接收组合后的潜在向量 z_combined = z_basal + z_pert + z꜀ₒᵥ 并重构基因表达。组合操作的加法性质至关重要——它允许在推断时任意组合训练期间未见过的因素组合。例如,要预测药物A在细胞类型B上的效应,只需取药物A的扰动嵌入和细胞类型B的协变量嵌入,与基础状态相加即可。即使训练数据中从未同时出现过药物A和细胞类型B,CPA也能做出合理预测。

                                                  

CPA还支持剂量响应建模。剂量作为连续变量可通过独立的剂量网络或剂量编码器进入模型,使CPA能够预测任意剂量下的响应,而不仅限于训练集中的离散剂量。至于化学结构外推,更准确地说,它通常依赖外部分子表示或后续扩展模型来完成,因此适合被描述为CPA体系的扩展能力,而非所有CPA设置下的默认组成部分。

                                    

3.3 基础模型的实现

                                             

3.3.1 Geneformer的预训练与微调策略

                                           

Geneformer的预训练遵循标准的掩码语言建模(MLM)范式,但针对单细胞数据进行了特殊适配。首先,每个细胞的基因表达谱被转换为一个排名序列——按表达量从高到低排序的基因符号列表。为控制序列长度,只保留前 N 个基因(通常 N = 2048)。表达量本身被舍弃,只保留排名信息。这种表示的几何直觉是:高排名的基因定义了细胞的身份——心肌细胞中高排名的是心肌特异基因,神经元中高排名的是神经特异基因。

                                                

预训练时,排名序列中的部分基因(通常15%)被掩码(替换为特殊token [MASK]),模型的任务是预测被掩码的基因。Geneformer的架构是Transformer编码器,包含12层、768维隐藏状态、12个注意力头。位置编码被可学习的位置嵌入替代,因为基因在序列中的位置(排名)本身就携带重要信息。预训练在大规模单细胞图谱数据上进行,包括人类细胞图谱(Human Cell Atlas)、Tabula Sapiens等多个大型数据集,总计约3000万个细胞。

                                              

对于虚拟基因敲除任务,Geneformer提供了两种策略。零样本策略不需要任何微调:常见做法是对目标基因 k 的输入表示进行删除、屏蔽或排名下调,然后重新前向传播获取扰动后的细胞嵌入 e_pert。原始嵌入 e_orig 与扰动嵌入之间的相似度或距离可用于量化该基因对细胞状态的重要性。通过比较所有基因对应的嵌入变化,可以获得基因重要性排序。微调策略则在特定任务的标注数据上继续训练Geneformer。例如,如果有Perturb-seq数据,可以微调Geneformer使其能够更定量地预测扰动后的表达变化。微调时既可以更新全部参数,也可以只更新顶部任务头;冻结底层、训练顶层是数据有限场景中的常见实践之一。

                                

3.3.2 scGPT的生成式预训练与扰动适应

                                                     

scGPT采用的是面向单细胞表达建模的生成式Transformer框架。与Geneformer主要围绕基因排序和掩码预测展开不同,scGPT同时表示基因身份和表达值,并通过生成式目标学习细胞内的上下文依赖。需要注意的是,在具体实现和下游适配中,scGPT并不宜被简单表述为自然语言处理中标准的“仅解码器自回归GPT”;更准确地说,它是一类为单细胞任务定制的生成式基础模型。

                                                    

scGPT的输入表示比Geneformer更复杂。每个基因token由基因标识嵌入表达值嵌入组成。表达值被分箱(binning)为离散等级(如0-5),每个等级有独立的嵌入向量。这种离散化处理使模型能够处理表达值的连续性质,同时保持Transformer擅长的离散token建模。scGPT在大规模单细胞数据上预训练,包括人类和小鼠的多个图谱数据集,总计超过3300万个细胞。

                                                          

对于扰动预测,scGPT通常通过条件化建模实现。在微调阶段,扰动类型信息(如敲除哪个基因)可以被编码为额外的条件标记、扰动标志或其他辅助输入,与基因token及表达值表示一同送入模型。模型学习在给定这些条件的情况下预测对应的扰动后表达谱。这样的设计使scGPT在捕获高阶基因互作方面具有优势——例如,基因A的响应可能依赖于基因B和C的响应,模型能够通过注意力机制建模这种依赖。scGPT还支持多模态扩展,可以整合蛋白质组、表观遗传等数据,为多模态虚拟扰动提供了统一框架。

                                                                      

4. 应用范围

                                                      

虚拟基因敲除方法在多个生物医学研究领域中展现了广泛的应用价值,从基础的基因功能注释到转化医学中的药物靶点发现,都已成为不可或缺的计算工具。

                                   

                                                 

应用领域分布

图3:主要虚拟基因敲除方法的应用领域分布。药物发现和靶点识别是最广泛的应用场景,多种方法在此领域有所贡献;发育生物学和细胞命运工程则更倾向于使用GRN-based方法。

                                       

4.1 药物靶点发现与验证

                              

虚拟基因敲除在药物靶点发现中扮演着越来越重要的角色。传统药物发现依赖于高通量筛选,成本高昂且周期长。虚拟基因敲除提供了一种计算优先(computation-first)的策略:通过系统性模拟大量基因的敲除效应,识别那些能够驱动疾病细胞向正常状态转变的关键调控基因,这些基因即为潜在的药物靶点。

                                                 

一个典型的应用流程是:首先,获取疾病状态(如肿瘤细胞)和正常状态(如健康组织)的单细胞图谱数据;然后,使用虚拟基因敲除方法系统性地模拟每个基因的敲除,预测其对疾病细胞的影响;最后,优先选择那些敲除后能使疾病细胞的嵌入向正常细胞方向移动的基因。这些基因被称为"状态恢复基因",它们的敲除(或 pharmacological inhibition)可能具有治疗潜力。

                                                           

scTenifoldKnk在抗纤维化药物发现中的应用是一个成功案例。研究人员使用该模型对肺纤维化患者的肌成纤维细胞进行虚拟敲除筛选,识别了TNIK作为关键促纤维化基因。scTenifoldKnk预测TNIK敲除将显著改变纤维化相关基因模块的活性。这一计算预测得到了后续湿实验的验证——TNIK抑制剂确实能够减轻纤维化表型,该研究最终发表于Nature Biotechnology。类似地,Geneformer在心肌病研究中通过虚拟敲除鉴定了TEAD4作为改善心肌细胞收缩功能的关键靶点,该发现也得到了实验验证。

                                                               

4.2 基因功能注释与调控机制解析

                                                          

对于功能未知或了解不充分的基因,虚拟基因敲除提供了一种快速初步筛选的手段。通过预测基因敲除后的转录组变化,可以推断该基因参与的生物学过程。具体策略包括:差异表达分析(比较预测敲除后显著变化的基因)、通路富集分析(识别受影响的信号通路)和调控网络分析(确定该基因在调控层级中的位置)。

                                                

CellOracle在发育转录因子功能注释中展示了独特优势。在斑马鱼胚胎发育研究中,CellOracle系统模拟了数百个转录因子的虚拟敲除,预测了每个TF缺失对细胞命运的影响。通过将预测结果与已知的发育表型数据库比对,研究者不仅验证了已知TF的功能(如确认notochord调控因子noto的作用),还发现了lhx1a作为轴向中胚层的新型调控因子。这一预测随后通过CRISPR敲除实验得到了验证,证明了虚拟筛选在发育生物学发现中的价值。

                                     

4.3 细胞命运重编程与分化路径优化

                                      

再生医学细胞治疗领域,虚拟基因敲除被用于优化细胞重编程和分化方案。诱导多能干细胞(iPSC)向特定细胞类型的分化是一个复杂的过程,涉及多个转录因子的时序激活和抑制。虚拟基因敲除可以帮助识别那些阻断目标分化路径促进替代路径的关键基因,通过敲除这些基因来提高分化效率。

                        

CellOracle的向量场分析特别适合这一应用场景。通过比较虚拟扰动向量与发育方向向量的内积,CellOracle可以判断某个TF的敲除是促进还是阻碍特定分化路径。负内积表示敲除使细胞偏离目标路径(该TF是目标分化的促进者),正内积表示敲除使细胞向目标路径靠近(该TF是目标分化的抑制者)。在造血干细胞分化研究中,CellOracle虚拟筛选识别了GATA1作为红细胞分化的关键促进因子,以及PU.1作为该路径的拮抗因子,这些预测与已知的造血调控知识高度一致。

                                                

4.4 疾病机制研究与生物标志物发现

                                                          

虚拟基因敲除还可用于疾病机制研究。通过比较疾病细胞和正常细胞对同一基因敲除的差异化响应,可以识别疾病特异性脆弱性(disease-specific vulnerabilities)——即那些只在疾病状态下才成为关键调控节点的基因。这些基因不仅是潜在的药物靶点,还可能作为诊断或预后生物标志物

                                 

癌症研究中,GEARS被用于预测肿瘤细胞对多种基因敲除的响应,识别了合成致死基因对(即同时敲除两个基因对肿瘤细胞致命,但对正常细胞无害)。通过系统性模拟双基因组合敲除,GEARS预测了多种潜在的组合治疗策略。在神经退行性疾病研究中,虚拟基因敲除被用于识别那些能够减轻神经元应激反应或促进神经保护通路的基因,为治疗干预提供了新思路。

                                                

4.5 组合扰动效应预测与遗传互作映射

                                              

组合基因扰动(如双基因敲除)的研究对于理解基因冗余、信号通路交叉和药物协同作用至关重要。然而,组合空间的规模随着基因数量呈指数增长,实验筛选不可能覆盖所有组合。虚拟基因敲除方法,特别是CPA和GEARS,通过学习组合规则来预测未见过的基因对效应。

                                                      

CPA的组合嵌入机制使它可以预测训练数据中未见的药物组合效应——只需将单个药物的嵌入相加即可。GEARS则在预测遗传互作方面表现出色,能够区分协同(synergistic)、抑制(antagonistic)、上位性(epistatic)等多种互作类型。在Norman等人的Perturb-seq数据集上,GEARS对双基因组合扰动的预测精度比简单相加基线提高了50%以上,证明了深度学习在捕获非线性组合效应方面的优势。这些能力使虚拟基因敲除成为系统遗传学研究的重要工具,能够大规模绘制遗传互作图谱。

                                                         

5. 实际应用实例

                                 

5.1 CellOracle在发育生物学中的应用:斑马鱼胚胎发育调控因子筛选

                                       

Kamimoto等人的CellOracle论文(Nature, 2023)是虚拟基因敲除领域的里程碑研究,该系统性地展示了计算方法如何发现新的发育调控因子。研究团队首先构建了斑马鱼胚胎发育全过程的单细胞图谱,涵盖了从受精卵到体节期的数十万个细胞。结合scATAC-seq数据,CellOracle为每个主要细胞类型推断了一个特异的基因调控网络。

                                                     

在虚拟筛选阶段,研究团队系统模拟了数百个转录因子的敲除效应。对于每个TF,CellOracle预测了敲除后细胞命运的变化方向和幅度。研究者特别关注那些预测会引起显著命运偏移的TF——这些TF在发育调控网络中占据关键位置。在已知的notochord(脊索)发育中,CellOracle正确预测了noto敲除将导致notochord前体细胞向邻近的paraxial mesoderm(轴旁中胚层)命运偏移,这与已知的noto突变体表型高度一致,验证了模型的准确性。

                          

更令人兴奋的是,CellOracle还预测了lhx1a作为轴向中胚层(axial mesoderm)的新型调控因子。在野生型发育中,lhx1a的表达模式与轴向中胚层标记基因高度相关,但其功能此前未被充分研究。CellOracle预测lhx1a的敲除将导致轴向中胚层前体细胞偏离其正常命运,向非轴向命运转变。研究团队通过CRISPR-Cas9敲除实验验证了这一预测——lhx1a突变体确实表现出轴向中胚层发育缺陷,证明了虚拟筛选发现新调控因子的能力。这一成功案例表明,虚拟基因敲除不仅是实验的替代,更是发现的引擎,能够提出具有高度生物学相关性的新假设。

                                       

5.2 scTenifoldKnk在纤维化疾病中的应用:TNIK靶点发现

                                        

scTenifoldKnk在抗纤维化药物发现中的应用(Nature Biotechnology, 2024)展示了纯数据驱动的虚拟筛选如何转化为临床前药物发现。研究团队获得了特发性肺纤维化(IPF)患者肺组织的单细胞图谱,重点关注肌成纤维细胞(myofibroblasts)——纤维化过程中过度产生细胞外基质的致病细胞类型。

                                               

使用scTenifoldKnk,研究者对肌成纤维细胞中表达的所有7548个基因进行了系统性虚拟敲除。对于每个基因的虚拟敲除,scTenifoldKnk返回一个按调控显著性排序的差异基因列表。研究团队特别关注了那些敲除后显著影响纤维化相关基因模块的基因——这些模块包含已知的促纤维化标志物(如ACTA2、COL1A1、TGFB1等)。通过这一策略,TNIK(TRAF2 and NCK interacting kinase)被识别为排名最高的候选靶点之一。

                            

scTenifoldKnk预测TNIK敲除将广泛重塑肌成纤维细胞的调控网络,特别是下调多个促纤维化通路。为了验证这一预测,研究团队进行了湿实验验证:在体外培养的肌成纤维细胞中使用siRNA敲低TNIK表达,确实观察到纤维化标志物的显著下调和细胞收缩能力的减弱。更重要的是,使用小分子TNIK抑制剂处理纤维化动物模型,显著减轻了肺纤维化程度。这一从计算预测到实验验证再到动物模型验证的完整链条,充分证明了虚拟基因敲除在转化医学中的应用价值。该研究还展示了如何将虚拟筛选与结构导向药物设计相结合——在识别TNIK为靶点后,研究团队使用Chemistry42平台进行基于结构的虚拟筛选,发现了具有高选择性和良好药代动力学性质的先导化合物。

                                                    

5.3 GEARS在Perturb-seq数据上的组合扰动预测

                                                  

GEARS论文(Nature Biotechnology, 2023)在大规模组合扰动预测上设立了新的基准。研究团队使用了Norman等人产生的Perturb-seq数据集,该数据集包含了105种双基因组合CRISPR扰动在K562白血病细胞系中的单细胞转录组响应。这是一个极具挑战性的数据集——许多组合扰动表现出强烈的非加性效应(即组合效应不等于单基因效应的简单相加),反映了基因之间的功能互作。

                         

GEARS在该数据集上进行了系统评估,考虑了三种难度递增的预测场景:

                              

(1)两个基因都在训练集中出现过;

(2)只有一个基因在训练集中出现过;

(3)两个基因都未在训练集中出现过。

                                      

在场景(1)中,GEARS的预测与真实观测之间的Pearson相关系数达到0.85,显著高于线性相加基线(0.72)。在更具挑战性的场景(3)中,GEARS仍然保持了0.68的相关系数,而基线方法降至0.45以下。这表明GEARS通过利用基因关系图中的先验知识,成功地向完全未见的基因泛化。

                            

GEARS还展示了在遗传互作分类上的优势。研究团队将双基因组合扰动分为五类互作类型:协同(synergy)、缓冲(buffering)、上位性(epistasis)、激动(agonism)和拮抗(antagonism)。GEARS预测的互作分数与实验观测的互作类型具有高度一致性,在最强互作基因对的识别上实现了超过40%的精度提升。这些结果证明了深度学习结合先验知识在复杂遗传互作预测中的强大能力,为系统遗传学研究提供了高效的计算工具。

                                             

5.4 Geneformer在心肌病研究中的零样本靶点发现

                                         

Geneformer论文(Nature, 2023)中的心肌病案例展示了基础模型的零样本虚拟扰动能力。研究团队收集了扩张型心肌病(DCM)患者的右心室心内膜活检样本的单细胞数据,以及健康对照的心脏组织数据。在数据分析中,研究团队发现DCM患者的心肌细胞(cardiomyocytes)表现出收缩功能基因的显著下调。

                                  

使用Geneformer进行零样本虚拟敲除筛选,研究者系统评估了所有转录因子敲除对心肌细胞嵌入的影响。具体而言,对于每个TF,将其从输入序列中移除,计算扰动后嵌入与原始嵌入的余弦距离。那些移除后引起最大嵌入偏移的TF被认为是对心肌细胞身份最重要的调控因子。在这一筛选中,TEAD4脱颖而出——它的虚拟敲除导致心肌细胞嵌入向病理性方向偏移(即远离健康心肌细胞状态),暗示TEAD4是维持心肌细胞正常功能的关键因子。

                                             

为了验证这一预测,研究团队使用iPSC来源的心肌细胞进行了实验。通过siRNA敲低TEAD4表达,观察到心肌细胞的收缩力显著下降,肌节结构紊乱,多种心肌病理标志物上调——这些表型与Geneformer预测的"TEAD4缺失导致心肌细胞向病理性状态转变"高度一致。更引人注目的是,过表达TEAD4在DCM患者来源的iPSC心肌细胞中部分挽救了收缩功能缺陷,表明TEAD4不仅是病理机制的参与者,还可能成为基因治疗或药物干预的靶点。这一成功案例凸显了基础模型零样本预测的独特价值——无需任何扰动训练数据,仅通过大规模预训练获得的基因调控知识,就能提出具有高度转化潜力的靶点假设。

                                                                          

5.5 CPA在药物组合筛选中的应用

                                              

CPA论文(Molecular Systems Biology, 2023)展示了虚拟基因敲除方法在大规模药物组合筛选中的应用。研究团队产生了一个涵盖188种小分子药物多种剂量多种癌症细胞系的单细胞药物响应数据集。这是一个极其复杂的组合空间——仅考虑两药组合,就有超过17,000种可能性,而考虑剂量组合,可能性进一步膨胀。

                                                 

CPA通过其组合嵌入机制,成功预测了训练期间未见过的药物组合效应。在交叉验证实验中,CPA对未见组合的预测精度(以Pearson相关系数衡量)达到0.78,显著优于线性相加基线(0.65)和其他深度学习方法(如scGen的0.70)。CPA还能够预测剂量-响应曲线——对于给定的药物组合,模型可以预测在任意剂量下的细胞响应,为寻找最优剂量比提供了计算支持。

                                                       

特别值得注意的是CPA的跨药物泛化能力。当面对训练集中从未出现过的全新药物时,CPA可以通过其化学结构编码器(基于分子指纹或图神经网络)将该药物映射到扰动嵌入空间,从而实现零样本预测。在实验中,CPA对完全未见药物的预测精度达到0.72,证明了整合化学信息在虚拟药物筛选中的价值。这一能力使CPA成为药物重定位(drug repurposing)的有力工具——可以系统评估已批准药物的新适应症潜力,或预测已知药物的协同组合。

                                                                 

6. 软件工具与代码实现

                                   

6.1 主要软件包概览

                                               

方法

编程语言

主要依赖

GitHub仓库

安装方式

适用场景

CellOracle

Python

scanpy, pandas, numpy, sklearn, velocyto

morris-lab/CellOracle

pip install celloracle

发育生物学、GRN分析、TF扰动模拟

scTenifoldKnk

R/MATLAB

igraph, MASS, RSpectra

cailab-tamu/scTenifoldKnk

GitHub源码安装

纯数据驱动KO、基因功能筛选

GEARS

Python

torch, pytorch-geometric, scanpy

snap-stanford/GEARS

pip install gears-pert

组合扰动预测、遗传互作

CPA

Python

torch, scanpy, scvi-tools

theislab/cpa

pip install cpa-tools

药物组合、剂量响应、跨细胞类型

scGen

Python

scvi-tools, scanpy, torch

theislab/scgen

pip install scgen

跨条件/细胞类型/物种预测

CellOT

Python

torch, ott-jax, scanpy

bunnech/CellOT

GitHub源码安装

群体水平分布预测、异质性分析

Geneformer

Python

transformers, torch, scanpy

ctheodoris/Geneformer

pip install geneformer

零样本扰动、靶点发现

scGPT

Python

torch, transformers, scanpy

bowang-lab/scGPT

GitHub源码安装

生成式预测、多模态整合

PerturBench

Python

torch, scanpy, pytorch-lightning

altoslabs/perturbench

GitHub源码安装

方法基准测试、模型比较

                                       

表1:主要虚拟基因敲除软件包的技术特征和适用场景汇总。所有工具均开源且提供详细文档,研究人员可根据具体需求选择合适工具。

6.2 CellOracle的完整代码实现

                                 

CellOracle的安装和基础使用相对直接,但其完整工作流涉及多个步骤。以下代码展示了从数据准备到扰动模拟的核心流程:

                             

代码示例(python):

          

# CellOracle 完整工作流程示例

import celloracle as co

import scanpy as sc

    

# 1. 数据准备

adata = sc.read_h5ad("my_data.h5ad")

                     

# 2. 初始化Oracle对象

oracle = co.Oracle()

                           

# 3. 导入数据与基础GRN

base_grn = co.data.load_mouse_scATAC_atlas_base_GRN()

oracle.import_anndata_as_raw_count(adata=adata, cluster_column_name="cell_type", embedding_name="X_umap")

oracle.import_base_GRN(base_grn)

                                          

# 4. KNN插值(平滑基因表达)

oracle.perform_PCA()

oracle.knn_imputation(n_pca_dims=50, k=81, balanced=True, b_sight=3000, b_maxl=1500, n_jobs=4)

                                          

# 5. 为每个细胞类型推断GRN

links = oracle.get_links(cluster_name_for_GRN_unit="cell_type", alpha=10, verbose_level=10)

                   

# 6. 过滤GRN边

links.filter_links(p=0.001, weight="coef_abs", threshold_number=2000)

                             

# 7. 拟合GRN用于模拟

oracle.get_cluster_specific_TFdict_from_Links(links_object=links)

oracle.fit_GRN_for_simulation(alpha=10, use_cluster_specific_TFdict=True)

                       

# 8. 执行虚拟TF敲除模拟

goi = "Gata1"

oracle.simulate_shift(perturb_condition={goi: 0.0}, n_propagation=3)

                                   

# 9. 计算嵌入偏移

oracle.estimate_transition_prob(n_neighbors=200, knn_random=True, sampled_fraction=1)

oracle.calculate_embedding_shift(sigma_corr=0.05)

                                              

# 10. 可视化结果

fig, ax = plt.subplots(1, 1, figsize=[6, 6])

oracle.plot_simulation_flow_on_grid(scale=50, ax=ax)

                                                

CellOracle的GRN推断是计算密集步骤,对于大型数据集可能需要数小时。建议在高性能计算集群上运行,并利用n_jobs参数启用并行计算。模拟结果的可视化(如向量场图和扰动分数热图)是解读预测的关键,CellOracle提供了丰富的绘图函数来帮助用户直观理解扰动效应。

                                             

具体可参考官方文档:https://morris-lab.github.io/CellOracle.documentation/notebooks/05_simulation/Gata1_KO_simulation_with_Paul_etal_2015_data.html

                                   

6.3 scTenifoldKnk的代码实现

                               

scTenifoldKnk提供了R和MATLAB两种实现,以下展示R版本的核心用法:

                                    

代码示例(r):

                                

# scTenifoldKnk R代码示例

library(scTenifoldKnk)

library(Matrix)

                                    

# 1. 准备表达矩阵

countMatrix <- as.matrix(read.csv('./expression_matrix.csv', row.names=1))

                               

# 2. 执行虚拟敲除分析 (自动包含网络构建、张量分解、流形对齐和差异调控分析)

result <- scTenifoldKnk(

  countMatrix = countMatrix,

  gKO = "TargetGene",

  qc_minLSize = 1000,

  nc_nNet = 10,

  nc_nCells = 500,

  td_K = 3

)

                             

# 3. 查看最显著的差异调控基因

head(result$diffRegulation, 20)

                         

对于全基因组系统性敲除,可以包装上述流程为并行循环:

                            

代码示例(r):

                           

# 全基因组系统性虚拟敲除 (利用并行计算)

library(foreach)

library(doParallel)

                       

cl <- makeCluster(8)

registerDoParallel(cl)

                                    

gw_DR <- foreach(

  gene = rownames(countMatrix),

  .combine = rbind,

  .packages = c('scTenifoldKnk', 'Matrix')

) %dopar% {

  # 对每个基因独立运行scTenifoldKnk

  res <- scTenifoldKnk(countMatrix = countMatrix, gKO = gene)

  cbind(gKO = gene, res$diffRegulation)

}

                                     

stopCluster(cl)

                             

6.4 GEARS 的快速上手指南

                  

GEARS提供了简洁的API,使用户能够在几行代码内完成从数据加载到预测的全过程:

                      

代码示例(python):

                            

# GEARS快速上手指南

from gears import PertData, GEARS

import scanpy as sc

                             

# 1. 加载数据(内置数据集)

pert_data = PertData('./data')

pert_data.load(data_name='norman')  # 或 'adamson', 'dixit'

pert_data.prepare_split(split='simulation', seed=1)

pert_data.get_dataloader(batch_size=32, test_batch_size=128)

                                

# 2. 初始化并训练模型

gears_model = GEARS(pert_data, device='cuda:0')

gears_model.model_initialize(hidden_size=64)

gears_model.train(epochs=20)

                               

# 3. 保存和加载模型

gears_model.save_model('my_gears_model')

gears_model.load_pretrained('my_gears_model')

                                      

# 4. 预测新扰动

# 预测组合扰动 [['CBL', 'CNN1']] 和单基因扰动 [['FEV']]

predictions = gears_model.predict([['CBL', 'CNN1'], ['FEV']])

                                  

# 5. 遗传互作预测

gears_model.GI_predict(['CBL', 'CNN1'], GI_genes_file=None)

                                      

# 使用自定义数据

# adata: AnnData对象,需要包含 'gene_name' 在 var 中,

#        'condition' 和 'cell_type' 在 obs 中

pert_data.new_data_process(dataset_name='my_data', adata=adata)

# 然后可以通过 pert_data.load(data_path='./data/my_data') 加载

                                 

GEARS对数据格式有特定要求:adata.var 需要包含基因名,adata.obs 需要包含扰动条件标识和细胞类型标识。对于大规模数据集,建议使用GPU加速训练。GEARS的预测输出是一个字典,包含预测的后扰动表达矩阵、不确定性估计和差异表达基因列表。

                                  

6.5 scGen的使用示例

                              

scGen通过scvi-tools框架实现,以下代码展示了跨细胞类型的扰动预测:

                                

代码示例(python):

                     

# scGen使用示例

import scanpy as sc

import scgen

                           

# 1. 数据准备

adata = sc.read('./kang2018.h5ad')  # 示例数据集

sc.pp.normalize_total(adata)

sc.pp.log1p(adata)

                       

# 2. 设置训练数据

# 假设 'condition' 列包含 'ctrl' 和 'stim' 标签

# 'cell_type' 列包含细胞类型信息

scgen.SCGEN.setup_anndata(

    adata,

    batch_key="condition",

    labels_key="cell_type"

)

                             

# 3. 创建并训练模型

model = scgen.SCGEN(adata)

model.train(

    max_epochs=100,

    batch_size=32,

    early_stopping=True,

    early_stopping_patience=25

)

                         

# 4. 跨细胞类型预测

# 假设训练集中有 'CD4T' 和 'CD8T' 的 ctrl 数据,但只有 'CD4T' 的 stim 数据

# 我们要预测 'CD8T' 在 stim 条件下的状态

pred, delta = model.predict(

    ctrl_key="ctrl",

    stim_key="stim",

    celltype_to_predict="CD8T"

)

                                   

# 5. 评估预测

# 将预测细胞与真实细胞合并进行可视化

pred.obs["condition"] = "predicted"

adata_subset = adata[adata.obs["cell_type"] == "CD8T"].copy()

combined = adata_subset.concatenate(pred)

sc.pp.pca(combined)

sc.pl.pca(combined, color="condition")

                               

scGen的predict方法返回预测的AnnData对象和扰动向量delta。delta是潜在空间中stim和ctrl之间的差异向量,可用于分析扰动效应的大小和方向。scGen的批量校正功能(batch_removal方法)也值得关注,它可以消除不同批次之间的技术变异,同时保留生物学差异。

                                 

详情参考:https://scgen.readthedocs.io/en/stable/tutorials/scgen_perturbation_prediction.html

                            

6.6 基础模型(Geneformer/scGPT)的虚拟扰动实现

                 

Geneformer零样本虚拟敲除

                       

代码示例(python):

                              

# Geneformer零样本虚拟敲除示例

from geneformer import InSilicoPerturber

                            

# 1. 初始化虚拟敲除分析器

isp = InSilicoPerturber(

    perturb_type="delete",           # 敲除模式

    perturb_rank_shift=None,

    genes_to_perturb=["TEAD4"],      # 目标基因

    model_type="CellClassifier",

    num_classes=0,

    emb_mode="cell",

    max_ncells=1000

)

                               

# 2. 执行数据敲除及特征提取

# 注意:输入数据需要预先经过 TranscriptomeTokenizer 处理为 .dataset 格式

isp.perturb_data(

    model_directory="ctheodoris/Geneformer",

    input_data_file="path/to/input_data.dataset",

    output_directory="path/to/output_directory",

    output_prefix="my_experiment"

)

                                        

# 3. 后续可通过 in_silico_perturber_stats 对输出文件进行影响分数分析

# 比较敲除前后的细胞嵌入差异

                          

Geneformer的InSilicoPerturber类封装了虚拟扰动的核心逻辑。对于敲除,目标基因从输入序列中移除;对于过表达,目标基因的排名被提升至最高。impact_score量化了扰动前后细胞嵌入的相似性变化——分数越高,该基因对细胞状态的影响越大。

                   

scGPT扰动预测

                            

代码示例(python):

                      

# scGPT扰动预测示例 (基于 GEARS 的 PertData 格式)

import scgpt as scg

from gears import PertData

import torch

                              

# 1. 准备Perturb-seq训练数据

pert_data = PertData("./data")

pert_data.load(data_name="norman")

pert_data.prepare_split(split="simulation", seed=1)

pert_data.get_dataloader(batch_size=64, test_batch_size=64)

                                          

# 2. 加载预训练模型 (需预先下载 scGPT_human 权重)

model_dir = "./save/scGPT_human"

vocab = scg.tokenizer.GeneVocab.from_file(model_dir + "/vocab.json")

model = scg.model.TransformerGenerator(

    ntoken=len(vocab),

    d_model=512,

    nhead=8,

    d_hid=512,

    nlayers=12,

    nlayers_cls=3,

    n_cls=1,

    vocab=vocab,

    dropout=0.0,

    pad_token=vocab["<pad>"],

    pad_value=0,

    pert_pad_id=2,

    use_fast_transformer=True

)

model.load_state_dict(torch.load(model_dir + "/best_model.pt"))

                                         

# 3. 微调模型进行扰动预测

# 此处通过训练循环对模型进行微调,使用 masked_mse_loss 最小化扰动前后的表达重建误差

# (详细微调代码请参考 scGPT 官方教程 Tutorial_Perturbation.ipynb)

                                   

# 4. 预测新扰动 (推断阶段)

# 利用微调后的 scGPT 注意力机制与嵌入对指定基因敲除效应进行预测和网络推断

                                           

scGPT的微调策略通常采用轻量级适配——冻结预训练的Transformer层,只训练顶层的扰动预测头。这保留了基础模型学到的通用基因调控知识,同时使其适应特定任务的预测需求。

                                      

6.7 基准测试与模型选择

                                        

随着虚拟基因敲除方法的大量涌现,标准化基准测试变得至关重要。PerturBench(Altos Labs, 2024)是一个综合性的基准测试框架,提供了统一的评估协议、多样化的数据集集和严格的评估指标。该框架涵盖了从单基因扰动到组合扰动、从同细胞类型预测到跨细胞类型泛化的多种任务,使研究者能够公平比较不同方法的性能。

                                     

数据集

扰动类型

细胞数

扰动数

任务类型

Norman et al.

CRISPR双基因KO

91,168

105组合

组合预测

Adamson et al.

CRISPR单基因KO

177,254

87单基因

单基因预测

Dixit et al.

CRISPR单基因KO

33,648

24单基因

单基因预测

Srivatsan et al.

化学药物

178,213

188药物

剂量响应

McFaline-Figueroa et al.

CRISPR单基因KO

892,800

525单基因

大规模筛选

                                  

表2:PerturBench基准测试中的代表性数据集。这些数据集涵盖了遗传和化学扰动、单基因和组合扰动,为方法评估提供了全面的测试平台。

                                          

在选择虚拟基因敲除方法时,应考虑以下因素:数据可用性(是否有配对的多组学数据、是否有扰动训练数据)、预测目标(定性排序还是定量预测、单基因还是组合扰动)、计算资源(是否有GPU、数据规模)以及可解释性需求(是否需要理解预测的机制)。一般而言,GRN-based方法(CellOracle、scTenifoldKnk)在可解释性和发育生物学应用上具有优势,而深度学习方法(GEARS、CPA)在组合扰动预测和跨条件泛化上表现更佳。基础模型(Geneformer、scGPT)则为零样本场景和快速初步筛选提供了便捷方案。

                                            

7. 未来发展方向

                               

7.1 多模态整合与时空建模

                            

当前大多数虚拟基因敲除方法主要基于转录组数据,但细胞调控涉及多个分子层面(DNA甲基化、组蛋白修饰、蛋白质丰度、代谢物浓度等)。未来的方法将整合多模态单细胞数据,构建更全面的调控模型。例如,结合scRNA-seq和单细胞蛋白质组数据,可以建模转录后调控事件;整合空间转录组数据,可以研究细胞间信号传导对扰动响应的影响。时空虚拟扰动——即在发育或疾病进展的时间序列上模拟基因敲除的动态效应——是另一个前沿方向,这要求方法能够处理时间依赖性并预测长期后果。

                          

7.2 因果推断与机制可解释性

                                              

现有方法大多基于相关性学习,其预测虽然准确,但不一定反映了真实的因果关系。将因果推断框架(如结构方程模型、do-calculus)整合到虚拟基因敲除中,可以提高预测的因果有效性和外推鲁棒性。此外,可解释人工智能(XAI)技术(如注意力可视化、SHAP值分析)的应用将帮助研究者理解模型"为什么"做出特定预测,揭示预测的分子机制。这种从"黑箱预测"到"机制理解"的转变对于药物靶点验证和安全性评估尤为重要。

                                       

7.3 与实验设计的闭环整合

                                                             

虚拟基因敲除的最有效应用方式不是取代实验,而是与实验形成闭环迭代:计算预测提出优先假设,实验验证最有希望的预测,实验结果反馈优化计算模型。主动学习(active learning)策略可以指导实验设计——模型识别那些"最不确定"的预测,建议优先进行这些扰动的实验,以最大化信息增益。这种"计算-实验协同"模式将显著加速基因功能研究和药物发现进程。

                                            

7.4 从虚拟敲除到虚拟治疗

                                                 

当前方法主要聚焦于单个或少数基因的扰动,但真实的治疗干预往往涉及更复杂的模式——如多靶点药物、基因疗法、细胞治疗等。未来的虚拟基因敲除将扩展到多基因同时调控(如全基因组CRISPR筛选的计算模拟)、动态扰动序列(如药物时序给药的优化)和细胞间干预(如免疫细胞与肿瘤细胞的相互作用建模)。这些扩展将使虚拟基因敲除从基础研究工具转变为临床决策支持系统,为精准医疗提供计算支撑。

                                                        

8. 总结

                                     

虚拟基因敲除作为单细胞计算生物学的重要分支,在过去五年间经历了从概念验证到实际应用的快速发展。本综述系统梳理了这一领域的技术版图:基于基因调控网络的方法(CellOracle、scTenifoldKnk)以其高度的可解释性和对发育过程的深刻洞察,在发育生物学和机制研究中占据重要地位;基于深度学习的方法(GEARS、CPA、scGen)通过强大的表示学习能力,在组合扰动预测和跨条件泛化上展现了卓越性能;单细胞基础模型(Geneformer、scGPT)则以其零样本能力和广泛的适用性,为快速初步筛选提供了便捷工具。

                             

每种方法都有其独特的优势和适用场景,研究者应根据具体科学问题、数据特征和计算资源选择最合适的工具。随着多模态整合、因果推断和主动学习等前沿方向的推进,虚拟基因敲除将继续深化我们对基因调控网络的理解,并为精准医学和合成生物学提供更多计算驱动的发现。从斑马鱼胚胎的新型调控因子到纤维化疾病的药物靶点,虚拟基因敲除已经证明了其从计算预测到实验验证的转化价值,这一趋势将在未来更加显著。

                                           

参考文献

[1]: Kamimoto, K., et al. (2023). Dissecting cell identity via network inference and in silico gene perturbation. Nature, 614(7949), 742-751.

[2]: Osorio, D., et al. (2022). scTenifoldKnk: an efficient virtual knockout tool for gene function predictions via single-cell gene regulatory network perturbation. Patterns, 3(3), 100434.

[3]: Roohani, Y., Huang, K., & Leskovec, J. (2023). Predicting transcriptional outcomes of novel multigene perturbations with GEARS. Nature Biotechnology, 42(6), 927-935.

[4]: Lotfollahi, M., et al. (2023). Predicting cellular responses to complex perturbations in high-throughput screens. Molecular Systems Biology, 19(6), e11517.

[5]: Lotfollahi, M., Wolf, F. A., & Theis, F. J. (2019). scGen predicts single-cell perturbation responses. Nature Methods, 16(8), 715-721.

[6]: Theodoris, C. V., et al. (2023). Transfer learning enables predictions in network biology. Nature, 618(7965), 616-624.

[7]: Bunne, C., et al. (2023). Learning single-cell perturbation responses using neural optimal transport. Nature Methods, 20(11), 1596-1604.

[8]: Cui, H., et al. (2024). scGPT: toward building a foundation model for single-cell multi-omics using generative AI. Nature Methods, 21(8), 1470-1480.

[9]: Bereket, I. M., & Karaletsos, T. (2023). Modelling sparse additive mechanism shifts in single-cell genomics. Advances in Neural Information Processing Systems, 36.

[10]: Wu, Y., et al. (2024). PerturBench: benchmarking machine learning models for cellular perturbation analysis. arXiv preprint, arXiv:2408.10609.

                                        


 

乐备实(上海优宁维生物科技股份有限公司旗下全资子公司),是国内专注于提供高质量蛋白检测以及组学分析服务的实验服务,自2018年成立以来,乐备实不断寻求突破,公司的服务技术平台已扩展到超敏电化学发光、Luminex多因子检测、抗体芯片、ELISA、单细胞测序、DSP空间多组学、流式检测、Elispot、PLA空间蛋白互作等30多个技术平台,建立起了一套涵盖蛋白、细胞以及组织水平实验的完整检测体系。

 
我们可提供从样本运输、储存管理、样本制备、样本检测到检测数据分析的全流程服务。凭借严格的实验室管理流程、标准化实验室操作、原始数据储存体系以及实验项目管理系统,已为超过 5000 家客户单位提供服务,累计完成蛋白检测超500 万次,收获广大客户的信任与支持。

本文由乐备实技术专家团审核发布

声明:本篇文章在创作中部分采用了人工智能辅助。如有任何内容涉及版权或知识产权问题,敬请告知,我们承诺将在第一时间核实并撤下。

详见LabEx网站( www.u-labex.com)或来电咨询!
基因水平:PCR Array、RT-PCR、PCR、单细胞测序
蛋白水平:MSD、Luminex、CBA、Elispot、Antibody Array、ELISA、Sengenics
细胞水平:细胞染色、细胞分选、细胞培养、细胞功能
组织水平:空间多组学、多重荧光免疫组化、免疫组化、免疫荧光
数据分析:流式数据分析、组化数据分析、多因子数据分析
联系电话:4001619919
联系邮箱:labex-mkt@u-labex.com
公众平台:蛋白检测服务专家