Xaira 的 X-Cell:药物发现需要“因果数据”

Latent Space6 天前

核心观点

在用于药物发现的细胞模型中,仅仅扩大参数规模和训练算力并不一定带来更好效果。Xaira Therapeutics 的 X-Cell 相关工作强调:如果目标是预测基因表达变化,模型需要的是更具信息密度、能够支持因果推断的数据。

当模型撞上“信息墙”

文章提到一个关键现象:在单一且相对较小的数据集上训练时,模型规模扩大后出现了明显瓶颈。

具体表现是:

  • 当参数规模扩大到约 15 亿之后,测试损失趋于停滞;
  • 训练损失仍然可以继续下降;
  • 约 31 亿参数模型偏离了原本的缩放趋势。

这通常意味着,模型并不是首先受限于参数量或算力,而是受限于数据本身包含的信息量。换句话说,继续堆参数、堆计算,可能无法跨过这道墙。

对于预测基因表达变化这类任务,模型需要的不只是更多样本,而是更“富信息”的数据。

约 30 倍信息量带来的变化

Xaira 团队的做法是加强数据生成,用更高信息密度的数据来支撑模型训练。文章称,在信息量约提升 30 倍后,模型重新表现出随参数和训练计算量扩展而提升的趋势。

文章没有给出该数据生成工作的确切成本,但作者推测:

  • 数据采集实验和基础设施可能需要数千万美元量级;
  • 计算、人力和研究成本可能在数百万美元量级;
  • 这种预算结构更像强化学习中的 rollout 预算,而不是典型的大规模预训练数据预算。

这些表述是估算,并非官方披露数据。

为什么细胞模型需要更好的数据

如果要反向理解人类细胞如何工作,一个自然切入点是记录不同类型细胞在不同状态下表达了哪些基因。例如,细胞中有哪些 RNA、数量如何、在什么条件下发生变化。

文章提到,CELLxGENE 是一个由 Chan Zuckerberg Institute 建立的细胞数据库,包含约 1.68 亿个细胞。它将每个细胞映射到 2 万至 3 万个基因的检测计数,并附带每个细胞的详细元数据。按文章描述,这相当于一个约 4 万亿条目的矩阵。

这种数据基础类似于结构生物学中的 Protein Data Bank 对蛋白结构模型的推动作用。CELLxGENE 也催生了大量 RNA 表达模型,并推动了所谓“虚拟细胞”模型的发展。

Xaira 的押注:为模型主动生成数据

文章介绍,Ci Chu 和 Bo Wang 是 Xaira 相关方向中的关键人物。Ci Chu 近期被任命为首席发现官,Bo Wang 被任命为首席 AI 科学家。这也显示出 Xaira 将“高信息密度数据驱动药物发现”视为重要战略。

Bo Wang 此前参与构建过 scGPT,这是一类有影响力的 RNA 表达模型。Xaira 的思路则进一步强调:药物发现中的模型不仅要学习相关性,还要能预测干预后的变化,因此需要更接近因果结构的数据。

对 AI 制药的启示

这篇内容的重点不在于宣布某个药物发现结果,而在于提出一个模型建设问题:

当任务需要预测扰动、干预和细胞状态变化时,普通观测数据可能不够;要让模型具备更强预测能力,就必须生成更能揭示因果关系的数据。

这与通用 AI 中“扩大模型规模即可持续提升”的叙事不同。对于细胞和药物发现任务,瓶颈可能更早地出现在数据层面:数据是否覆盖了足够多的干预条件,是否包含足够信息,是否能帮助模型理解细胞系统如何响应外部扰动。

小结

Xaira 的 X-Cell 方向体现了一种新的 AI 制药工程观:模型、算力和数据生成需要共同设计。尤其在细胞扰动预测中,高质量、高信息密度、面向因果关系的数据,可能比单纯扩大模型规模更关键。

目前文章提供的是方法论和战略层面的讨论,而不是临床或药物管线结果。因此,更合理的理解是:这是一次关于 AI 药物发现基础设施与数据策略的案例观察。

评论

请登录后发表观点

暂无数据