「虚拟细胞」想做的事和世界模型很像:给定细胞当前的状态和一个干预(敲除一个基因、加一种药),预测细胞接下来会变成什么样。如果做成了,大量湿实验可以先在计算机里筛一遍。
底座是在海量生物序列上训练的基础模型:DNA 语言模型读懂基因组,单细胞模型读懂细胞状态。2025 年 Arc 研究所办了第一届虚拟细胞挑战赛,这个方向第一次有了公开的统一评测。
扰动实验(如 Perturb-seq)能批量产生验证数据,但每一轮仍要几周、花费不菲;而且模型在没见过的细胞类型上是否还准,目前是最大的问号。
目前基本是专用模型的地盘。通用大模型的作用是帮研究者分析这些模型的输出、设计后续实验。
在横跨生命三域、超过 10 万个物种的基因组上训练的 DNA 基础模型,能读也能写基因序列。
生物序列的「大模型」标杆,完全开放;能预测突变影响、生成基因组片段,但生成的长序列是否真能在细胞里工作仍需逐一验证。
百图生科在单细胞基础模型 scFoundation 上改进的扰动响应预测模型。
拿下 Arc 首届虚拟细胞挑战赛第一名的中国团队模型;证明了单细胞基础模型的可用性,但比赛本身只覆盖有限的细胞类型。
争议与局限:Arc 2026 年的第二届挑战赛把题目改成「在模型没见过的细胞环境中预测扰动响应」——这恰恰说明首届比赛的设定还不足以回答泛化问题。