● Feed Monitor · 每天替你盯顶级英文播客

Causal Models Need Causal Data - Xaira’s X-Cell model (Bo Wang & Ci Chu)

Latent Space · 2026-07-22

Causal Models Need Causal Data - Xaira’s X-Cell model (Bo Wang & Ci Chu)
一句话摘要

Zera Therapeutics 用高通量实验系统一次性敲除人类全部 2 万个基因,再测每个基因变化对其他所有基因的影响,生成 2D 因果数据训练 AI 模型,首次让生物学家看到模型能准确预测从未见过的细胞系如何响应基因扰动。

AI制药虚拟细胞高通量实验因果模型
结构化解读

虚拟细胞模型:因果数据才是胜负手

本期嘉宾是 Xaira Therapeutics 的两位高管:Bo Wang 是生物医学 AI 高级副总裁,多伦多大学前副教授,scGPT 的领衔作者;Ci Chu 是 AI 驱动发现高级副总裁,负责高通量生物学,曾在 Recursion 和 Verily(Google X)工作十年,深耕 AI、大数据与生物学的交叉地带。两人联手发布了 Xaira 的虚拟细胞模型 Excel,核心看点:不用观察数据硬学因果关系,而是自建高通量实验工厂生产因果数据,让模型首次在未见过的细胞类型上做出靠谱预测。

这期回答了 8 个问题:

  1. 为什么观察数据不足以训练出能预测药物反应的虚拟细胞模型?
  2. Xaira 如何用高通量实验生成“因果数据”?
  3. Excel 模型在架构上如何超越 scGPT 等早期基础模型?
  4. 扩散语言模型 vs 自回归模型:为什么后者更适合单细胞数据?
  5. Excel 模型如何利用五种生物先验知识提升预测?
  6. 在 T 细胞激活实验中,Excel 如何实现跨上下文泛化?
  7. 线性模型为何在扰动预测任务上屡屡打败复杂基础模型?
  8. 学术界和产业界在虚拟细胞领域应如何分工合作?
1. 观察数据无法学到因果关系

被问到为何不直接使用公开数据库(如 CellxGene)时,Ci Chu 直接泼了盆冷水。CellxGene 数据集包含超 3300 万个细胞,但主要是健康人类供体的描述性数据。scGPT 训练于 CellxGene,在描述性任务(如批次校正)上表现优异,但在因果性扰动预测任务上无法超越线性模型。

问题出在数据的因果结构上。观察数据中基因 A、B、C 共同变化,可以解释为 A 调控 B 和 C,也可以解释为 B 调控 A 和 C,存在无数可能的因果结构。"We believe observational data are underpowered to learn causality truly."(我们相信观察数据从根本上不足以学习因果关系。)

这意味着仅靠公共单细胞图谱数据训练的基础模型,无法可靠预测基因扰动后的细胞状态变化。有些团队仍在尝试用纯观察数据做扰动预测,但效果有限——你没法从相关中挤出现实世界的因果。

2. Perturb-seq 实现了基因组规模的因果数据生成

被问到高通量实验系统如何工作时,Ci Chu 给出了具体方案。利用 CRISPR-Cas9 和单细胞 RNA-seq 技术,每次实验可同时扰动所有 20000 个人类基因。通过条形码技术,每个细胞携带一个唯一的 guide RNA 标识,从而知道哪个基因被沉默。

Xaira 已生成 7 个全基因组 Perturb-seq 数据集,涵盖 16 种细胞类型,经过严格质控后仍有 2500 万个细胞。这意味着 Xaira 将结构生物学中数据驱动模型成功的模式复制到了细胞生物学——就像 PDB 数据库训练了 AlphaFold 一样,大规模因果数据使 AI 模型能够学习基因调控网络。

不过,Perturb-seq 目前主要针对单基因敲除,而生物学中常存在冗余基因和组合效应,需要扩展到多基因扰动。这是下一步的挑战。

3. 扩散语言模型比自回归模型更适合单细胞数据

被问到 Excel 模型架构选择时,Bo Wang 解释了关键区别。早期 scGPT 采用自回归训练,需要人为规定基因顺序,但基因表达数据本质上是无序的集合。Excel 使用扩散语言模型,通过迭代编辑从噪声表示逐步细化到精确预测,无需假设基因顺序。

实验表明,在相同数据上训练时,扩散模型在泛化到未见细胞类型的任务上显著优于自回归模型。这意味着扩散架构更自然地匹配了基因表达数据的集合性质,使得模型能够更好地捕捉基因间的复杂相互作用。

当然,扩散模型需要更多推理步骤,计算成本较高。但为了泛化能力,这笔账划算。

4. 五类生物先验知识使 Excel 实现上下文特异预测

被问到模型如何利用生物学知识时,Bo Wang 列出了 Excel 融合的五种先验:GenePT(LLM 对基因的描述)、蛋白质相互作用网络、DepMap(癌症必需基因)、形态学信息、scGPT 嵌入(细胞类型)。通过交叉注意力机制将先验作为条件输入模型。

消融实验表明,先验知识对某些细胞类型提升显著,但对另一些细胞类型边际收益较小。"By looking at the weights of different priors, we can actually understand which prior knowledge are more important to these particular cell types."(通过观察不同先验的权重,我们实际上可以理解哪些先验知识对特定细胞类型更重要。)

这意味着 Excel 不仅利用先验知识提升预测精度,还提供了模型可解释性,帮助生物学家发现关键调控因子。不过,先验知识的整合方式(交叉注意力)可能限制了元数据的表达范围,仍有改进空间。

5. Excel 在未见细胞类型上成功泛化,超越线性基线

被问到模型能否在未见上下文中预测时,Ci Chu 给出了三个惊艳案例。在 T 细胞实验中,仅用静息 T 细胞数据训练,模型成功预测了激活 T 细胞中所有扰动的效果。线性基线(将静息状态扰动效应线性叠加到激活状态)完全失败。

在多细胞类型 iPSC 分化实验中,模型对训练中未见的细胞类型做出了准确预测。更令人兴奋的是,模型从 T 细胞系泛化到来自多名供体的原代 T 细胞,预测准确。

这意味着虚拟细胞模型有望替代大量昂贵且难以进行的生物学实验,特别是在原代细胞、类器官等复杂系统中。目前泛化能力仅在少数案例中得到验证,还需要更多系统的生物学验证,但方向已经清晰。

6. 线性模型为何屡败?数据规模与质量才是关键

被问到为何早期基础模型打不过线性基线时,Bo Wang 一针见血:那些基准测试用的都是小数据集(如 Replo),指标也选得有问题——单细胞数据极度稀疏,细胞平均表达谱的 MAE 甚至比技术重复还低,所以线性模型靠“猜平均”就能赢。

Excel 不同之处在于,它训练在 7 个全基因组 Perturb-seq 数据集上,涵盖 16 种细胞类型、2500 万个细胞。Ci Chu 补充说,当他把线性基线预测、真实数据和 Excel 预测的基因变化热力图并排放在一起时,视觉上非常清晰:Excel 预测与真实数据更接近。"This is a wow moment I was talking about in the beginning."(这就是我一开始说的“哇”时刻。)

这不是算法魔法,而是数据规模和质量的胜利。线性模型在简单任务上可能表现不错,但面对跨细胞类型泛化这样的复杂任务,它完全失灵。

7. 学术界与产业界:共生而非替代

被问到科学家角色如何变化时,Bo Wang 坦言,连他自己都感到焦虑——AI 论文每天涌现,学生压力更大。他观察到,现在学生加入实验室第一句话就是“你有多少 GPU?”。产业界在资源上优势明显,但学术界仍有不可替代的价值:学术自由、对特定领域的深度理解、以及接触医疗数据的能力(加拿大高校可访问行业难以获取的临床数据集)。

Ci Chu 从湿实验角度补充:CRISPR、单细胞 RNA-seq、Perturb-seq 这些关键技术都诞生于学术界。产业界擅长的是规模化、工业化和数据质量控制。他建议学术界专注于创新原型,产业界负责放大和产品化。

两人的共识:虚拟细胞领域需要开放合作。 蛋白质领域的成功(PDB 数据库 + AlphaFold 开源)证明了这一点。Xaira 已开源所有数据和模型权重,希望推动整个领域加速。

把这 8 条放在一起看

把前两个单元串起来看,核心逻辑很清晰:观察数据无法学到因果关系(单元 1),所以 Xaira 自建高通量实验工厂生成因果数据(单元 2)。这个选择决定了后面的一切——扩散架构更适合无序的基因表达数据(单元 3),五类先验知识让模型更聪明(单元 4),而最终的泛化能力(单元 5)正是靠这些因果数据训练出来的。线性模型打不过 Excel,不是因为算法多高级,而是因为数据规模和质量根本不在一个量级(单元 6)。

学术与产业的分工(单元 7)其实指向同一个问题:虚拟细胞模型的瓶颈不是算法,而是因果数据的规模和多样性。Xaira 通过工业化高通量实验生成大规模因果数据,并配合扩散架构和多先验融合,首次展示了模型在未见细胞类型上的泛化能力。但 Ci Chu 和 Bo Wang 也坦诚,目前泛化仅在少数案例中得到验证,距离真正预测患者药物反应仍有很长的路要走。对于正在读这篇文章的你——无论是做 AI 的、搞生物的、还是投资这个赛道的——关键问题不是“哪个架构更好”,而是“你的数据是因果的吗?”。

↗ 观看原片(YouTube)

→ 看今天的全部更新每天替你盯 14 个顶级英文播客频道,AI 提炼成几分钟读完的中文精华。每日更新,无需登录。
微信扫一扫 / 长按识别

每天早上,这份精华我直接发你微信。加我,长按左边二维码。

微信:xiangcaizi02