← AI4S 总览
AI4S · 生命科学 · CELL

虚拟细胞与生物基础模型

「虚拟细胞」想做的事和世界模型很像:给定细胞当前的状态和一个干预(敲除一个基因、加一种药),预测细胞接下来会变成什么样。如果做成了,大量湿实验可以先在计算机里筛一遍。

底座是在海量生物序列上训练的基础模型:DNA 语言模型读懂基因组,单细胞模型读懂细胞状态。2025 年 Arc 研究所办了第一届虚拟细胞挑战赛,这个方向第一次有了公开的统一评测。

验证器:验证一个结果要多久、多贵

扰动实验(如 Perturb-seq)能批量产生验证数据,但每一轮仍要几周、花费不菲;而且模型在没见过的细胞类型上是否还准,目前是最大的问号。

SOTA 模型在这里扮演什么

目前基本是专用模型的地盘。通用大模型的作用是帮研究者分析这些模型的输出、设计后续实验。

ENTRIES · 2 个条目,按成熟度从高到低

代表工作

L2 设计模型NEW · 2026 年 9 月

Evo 2

Arc 研究所 · 2025-02 · 开放权重

在横跨生命三域、超过 10 万个物种的基因组上训练的 DNA 基础模型,能读也能写基因序列。

生物序列的「大模型」标杆,完全开放;能预测突变影响、生成基因组片段,但生成的长序列是否真能在细胞里工作仍需逐一验证。

事实与来源
  • 规模在约 9 万亿个 DNA 碱基对上训练,单核苷酸分辨率,上下文长度 100 万Nature (2026), s41586-026-10176-5
  • 发表2025 年 2 月以预印本发布并开放权重,2026 年 3 月正式发表于《自然》Arc 研究所官方
论文代码
L1 预测模型NEW · 2026 年 9 月

xTrimoSCPerturb

百图生科 · 2025-12 · 未发布

百图生科在单细胞基础模型 scFoundation 上改进的扰动响应预测模型。

拿下 Arc 首届虚拟细胞挑战赛第一名的中国团队模型;证明了单细胞基础模型的可用性,但比赛本身只覆盖有限的细胞类型。

争议与局限:Arc 2026 年的第二届挑战赛把题目改成「在模型没见过的细胞环境中预测扰动响应」——这恰恰说明首届比赛的设定还不足以回答泛化问题。

事实与来源
  • 比赛成绩2025 年 Arc 虚拟细胞挑战赛第一名(奖金 10 万美元);同届「通才奖」由 Altos Labs 的流匹配模型获得Arc 研究所官方(arcinstitute.org/news/virtual-cell-challenge-2025-wrap-up)
官方
药物发现材料研发
每个条目的等级是本站判断,依据写在「事实与来源」里;有争议的必写争议。关于与方法 →术语表 →最后更新 2026-09