AlphaFold的横空出世,曾为AI生物医药划下一道分水岭:人类首次以近乎实验级的AI精度破解了蛋白质结构之谜,也让靶点解析、分子设计正式步入了AI赋能的快车道。而当分子层面工具逐渐从前沿探索变为行业基建,生命科学的探索边界也开始向更复杂的系统层级延伸。
从单一蛋白质到完整的活细胞,是计算生物学正在翻越的下一座高山。
旨在实现细胞状态的完整模拟、可精准预测药物与基因扰动下细胞响应的虚拟细胞技术(AIVC),被冠以圣杯之名,成为先行者眼中撬动下一代药物研发的支点。
在这条挤满顶尖科研机构与生物技术公司的赛道上,诞生于2022年美国加州的Tahoe Therapeutics(下称“Tahoe”),正凭借一系列重磅开源成果,成为该赛道颇具代表性的企业。
1救星也在渡劫
AIVC的兴起,可以看成全球新药研发市场发出的呼救。
据美国生物技术创新组织(BIO)追踪2011—2020年全球9704个药物临床开发项目后的统计,新药从进入I期临床到最终获得FDA批准的综合成功率(LOA)为7.9%;若计入临床前阶段的筛选淘汰,从候选分子到成功上市的整体比例则更低。
药研动辄数十亿美金投入、十余年研发周期,却难逃折戟命运,背后的原因其实老生常谈:一是体外培养模型无法复刻人体真实的肿瘤微环境与组织空间结构;二是标准化均质细胞系,难以还原真实患者群体存在的遗传异质性。这些问题共同推高了研发沉没成本,行业亟待更精准、更高效的系统性模拟工具。
虚拟细胞的核心价值,旨在通过AI模型在数字空间高保真复现细胞的状态运行、信号响应与表型变化,将大量原本需要湿实验室完成的实验,转化为“硅基实验”。它的价值贯穿药物研发全链条:靶点发现阶段快速定位疾病关联核心基因,化合物筛选阶段批量压缩候选分子范围,临床转化阶段辅助患者分层与风险预判。
更长远来看,它有望像AlphaFold打开蛋白质结构黑箱一样,解开细胞调控网络的运行逻辑,推动人类从“观察生命”走向“编程生命”。
单细胞系统生物学领域研究机构Arc Institute首席技术官Dave Burke提出过这样一段比喻:如果说DNA是细胞的读存储器,编码生命基础程序;mRNA是随机存储器,随环境、压力、疾病状态动态调整;那么构建虚拟细胞,就是在逆向求解细胞的“中央处理器”——破译细胞接收信号、整合信息、输出响应的运算逻辑。只有读懂这套逻辑,才能真正回答:让病变细胞回归正常,究竟需要输入怎样的指令。

AI虚拟细胞(AIVC)全技术产业链全景图(Ma et al., npj Digital Medicine, 2025)
但愿景的宏大,无法掩盖当下的现实瓶颈。虚拟细胞的发展,目前仍有难关。
首先是数据短板:细胞级建模对数据的要求远高于蛋白质层面,它不仅需要静态观测数据,更需要大量带因果性的扰动数据。长期以来,公开单细胞数据以观测性为主,系统性扰动数据集普遍规模小、批次效应强、细胞背景单一,成为制约模型上限的核心稀缺资源。
其次是模型局限:早期虚拟细胞方案多走“自底向上模拟单细胞”的路径,先生成AI模拟的细胞基因活动假想数据,再聚合统计。不仅训练与推理成本高,也难以适配药物敏感性等复杂表型预测,更难支撑零样本跨上下文泛化;较弱的可解释性,也与药物研发对机制解释的需求存在错位。
此外,当前多数模型仍停留在学术基准验证阶段,距离嵌入研发全流程、产生临床价值仍有距离。
就在业内共同摸索破局路径时,Tahoe走出了一条“数据先行”的差异化路线——没有从堆砌模型参数出发,而是先沉心攻克最底层的高质量扰动数据规模化生产。团队从成立之初就笃定:虚拟细胞的瓶颈不在模型架构,而在数据的质量与因果性。
2把上百组实验塞进一块培养皿
作为“数据优先”设想的核心载体,Tahoe的自研基础平台Mosaic应运而生——经工程化改造,搭建规模化、高保真单细胞扰动数据的生产链。这套技术脱胎于联合创始人Johnny Yu、Hani Goodarzi和Kevan Shokat在加州大学旧金山分校的实验室研究。
Mosaic平台的思路,是把数十种携带不同突变背景的肿瘤细胞混合培养,组成一体化三维肿瘤球培养体系,分置96孔独立微孔;各微孔分别施加单一药物干预,整块培养板可同步开展多种药物平行筛选。
传统筛选模式下,不同细胞、不同药物需要分板培养,试剂与培养环境差异会产生难以消除的批次干扰,极易掩盖细胞真实响应信号;Mosaic将多种细胞置于同一培养单元,所有样本共享完全一致的给药、测序条件,可从实验源头减少系统偏差,各类细胞的药效数据就拥有了统一的横向对比标准。
Mosaic平台整套实验依托组合条形码测序与基因型分拆技术完成细胞溯源,无需分批次搭建上百组独立实验,就能同步捕捉不同遗传背景细胞对同一药物的转录组响应。同时,这套体系兼容肿瘤细胞系、原代细胞、类器官等多种样本,能够复刻患者群体天然遗传异质性,最大程度贴近体内真实的细胞互作与肿瘤微环境特征。
在实验效率层面,Mosaic则在数量级有所突破:常规筛选一次仅能观测单一细胞对少数药物的反应,而Mosaic在一块培养体系内就能并行完成数十种细胞、多梯度药物的同步扰动,单次实验即可生成数万组药物-细胞交互的单细胞转录数据;搭配Parse GigaLab高通量单细胞建库与超大通量测序管线,可稳定产出亿级规模的单细胞数据集,解决过往扰动数据样本量稀少、干预类型单一的痛点。
除此之外,Mosaic还可适配小分子、基因编辑等多元手段,持续产出带有明确因果关联的多模态时序数据,为后续AI虚拟细胞模型提供充足的训练素材。
3贯通产业链,大模型与轻量化并举
基于Mosaic平台的高通量数据生产能力,Tahoe搭建起一套覆盖底层数据至上层应用工具的产品矩阵:Tahoe-100M筑牢全域数据底座,Tahoe-x1搭建大参数基础生物模型,Rhaister 开辟轻量化落地方案。三者贯穿从原始数据供给、核心模型基座到产业实际落地的虚拟细胞产业链全流程。
作为路径中的基石,Tahoe-100M涵盖50种癌细胞系、1100余种小分子扰动下的超1亿个单细胞转录组,是公开领域首个达到亿级规模的药物扰动单细胞数据集,扰动后单细胞测量规模约为此前所有公开同类数据总和的50倍。
作为一份开源数据集,截至2026年初,Tahoe-100M下载量突破25万次,包括Arc Institute的STATE模型在内的多个业内方案均将其作为核心训练数据来源,一定程度上缓解了虚拟细胞建模领域长期存在的扰动数据稀缺问题。
三大主流单细胞扰动数据集综合维度对比(Tahoe, bioRxiv, 2026)
有了数据集的支撑,Tahoe于2025年10月推出30亿参数的扰动预训练模型Tahoe-x1(Tx1)。团队结合FlashAttention v2、全分片数据并行等大模型工程技术,针对生物数据特性重构了注意力机制,计算效率较以往细胞模型可提升3至30倍。
在DepMap(癌症依赖图谱)基因必需性预测、MSigDB(分子特征数据库)致癌通路推断等核心基准测试中,Tx1的表现优于同期其他开源模型,并展现出了跨细胞类型的零样本泛化能力,即无需同类细胞实验数据,就能预测陌生细胞反应。
遵循一贯的开源策略,Tx1同步开放了权重与训练代码,为行业提供了可复用、可二次开发的大参数细胞模型基准。
而当行业普遍追逐更复杂的模型架构时,今年6月发布的Rhaister模型体现了Tahoe的另一条技术思路——回归基础统计规律,直接在汇总统计层面完成扰动响应预测。该模型无需模拟单个细胞的表达谱,仅通过少量参考上下文学习扰动响应模式,数秒即可完成训练、毫秒级输出预测结果,在多项评测指标上超过结构更复杂的虚拟细胞模型,部分指标接近实验噪声水平。
传统虚拟细胞建模流程(上)与Rhaister轻量化统计预测工作流(下)对比
配套的Emerald Bay药物敏感性数据集,以及仅靠基线表达就能预测的零样本版本 Rhaister-O,进一步拓展了其适用边界。这种轻量化、高可解释性的方案,更适配AI科研智能体的快速迭代节奏,也为虚拟细胞技术的产业落地提供了成本更低的可选路径。
4合作药企推进首创靶点新药
目前,Tahoe已完成种子轮与A轮融资,累计融资额4200万美元。依托其技术成果,Tahoe已识别出数十个全新肿瘤特异性表面抗原,其中多数为传统研究手段数十年未能发现的新靶点,且具备抗体偶联药物(ADC)开发价值。
2026年初,Tahoe与Alloy Therapeutics联合成立合资企业,推进ADC管线的临床前开发。Alloy Therapeutics是深耕生物药全链条开发的企业,依托人源化小鼠抗体平台、自研ADC工程体系及旗下82VS创业孵化工作室,具备从抗体筛选、偶联药物设计到项目孵化落地的完整转化能力,已产出多款进入临床阶段生物制剂。双方形成优势互补,目前正围绕两个经多维度验证的首创靶点共同开展管线转化,探索“AI靶点挖掘+专业生物药工程”协同新药开发模式。
融资历程图
更远期的布局,则指向对干湿实验体系的深层重构,覆盖科研、制药以及生命科学多领域。Tahoe正在研发Tara自主研究智能体,目标是打通“数据生成—模型预测—智能体假设验证”这一闭环,让系统能够自主提出生物学假设、依托已有实测数据完成验证并输出结论。
这一方向延续了其“先建基准真相,再嵌入推理能力”的思路:当大模型沉浸在高质量、规模化的生物实测数据中时,AI便有望从辅助研究的工具,逐步进阶为能够独立完成研究循环的研究型智能。


















