日前,一家名为Databricks的企业完成了50亿美元(约339亿元人民币)的战略融资,投后估值高达1900亿美元(约1.36万亿元人民币)。
坊间传闻,原本企业本轮只想融资10亿美元,但蜂拥而至的投资人累计塞了150亿美元,最后以50亿美元成交。其在资本市场的受欢迎程度可见一斑。
这一估值可在最新的全球独角兽榜单中排名第四。在它前面仅有AI双雄Anthropic(最新一级市场传言估值9650亿美元)及OpenAI(最新一级市场传言估值8520亿美元)、字节跳动(4800-5500亿美元)三大豪强。
有意思的是,医疗领域恰恰是其业务中单客户价值最高的业务板块。这家年化营收破70亿美元、增速超80%的“AI卖铲人”对于我们有何借鉴和参考?会否出现医疗领域的“国产版Databricks”?动脉网对此进行了梳理。
历史证明,在淘金热里,最赚钱的不一定是淘金的人,更有可能是卖铲子的那位。
而Databricks,就是眼下这波AI淘金潮里的“卖铲人”。
这家企业由加州大学伯克利分校AMPLab的7名研究人员于2013年联合创立。创始团队中也包含了知名开源大数据计算引擎Apache Spark的主要开发者。他们将相关技术商业化,并提出融合数据湖与数据仓库能力的“湖仓一体”架构。
其中,Lakehouse是其核心业务,这个存算治一体的数据底座是其“湖仓一体”架构的底座。在这个底座之上则是各个业务板块。
Genie、Agent Bricks和Lakebase构成其AI板块:Genie提供自然语言对话式BI,让不懂SQL数据库的人可以用自然语言查数据;Agent Bricks可以把智能体直接建在数据之上;Lakebase则是无服务器PostgreSQL数据库,专为AI智能体提供事务处理能力。
Unity Catalog和Unity AI Gateway则是管控层,用于管理多模型路由与成本,包括治理、权限、审计等功能。其中,Unity Catalog决定企业敢不敢用AI,Unity AI Gateway则决定企业用AI的成本。这也是Databricks的护城河所在。
其商业模式主要按照计算消耗(DBU)计费,再加上大客户年框和AI/治理增值服务。根据官方信息,其年化收入已超过70亿美元,净收入留存率超140%。
它在全球已有超过2万家客户,70%的财富500强企业都依赖Databricks Data+AI平台来控制数据并与AI结合。超过1000家客户年付费超100万美元,更有100家客户年付费超1000万美元。
凭借这些亮眼数据,Databricks 自 2013 年成立起累计披露融资近252亿美元。其中,2024年底其完成的J轮融资额高达100亿美元,是史上最大额度单轮融资之一。
尤其从去年9月至今,Databricks先后完成了K轮、L轮和两次战略融资,企业估值也从去年9月首次突破1000亿美元快速飙升至如今的1900亿美元。增长速度之快令人咂舌。
不过,Databricks也面临一些质疑。最为明显的则是其估值跑得太快,从上一轮2月1340亿美元到如今1900亿美元,半年估值大涨42%,但营收显然不可能同步大涨42%,后续业绩增长压力也将长期存在。
同时,Databricks也面临激烈竞争,其主要竞争对手Snowflake也正补齐AI训练业务。这家企业于2020年9月在纽交所上市,当年也曾是史上最大软件IPO之一,实力不容小觑。此外,包括微软、谷歌和亚马逊这些巨头在医药云上也从未放松。
按解决方案划分,Databricks的解决方案包括交通、金融服务、医疗、制造业、零售等解决方案。其中,医疗场景虽然收入占比不算最高,但却被认为是其业务线中客户价值最高、客户忠诚度最高的部分。
首先,医药数据的合规要求极高。要知道,药企数据不是普通数据,基因组和临床试验数据无法随意切换到通用云。Unity Catalog的价值正在于此,一旦将申报体系建构在其上,企业切换平台基本等同于重新合规申报。正因此,Databricks的医疗客户对其有天然粘性。
其次,随着AI的逐渐普及,数据已经从单纯的存储演变为了用于AI智能体训练。无论是提出分子假设、挖掘真实世界证据,乃至对药物不良反应信号的监视,都有赖于可追溯私有数据的喂养,Databricks正好提供了这样的数据底座。
最后,无论是纵向还是横向,经过多年积累的Datacricks已经在这一领域形成了自己的优势。Databricks是医药AI数据栈中唯一敢将自己的产品定位为底层操作系统,它的主要竞争对手Snowflake和Palantir Foundry或多或少都在某个节点存在不足。
虽然Databricks并未上市,没有单独披露医药营收,但通过几组证据足以拼出医疗业务的分量和潜力。
在客户覆盖率方面,官方对医疗业务的披露提到已有超350家医药生命科学客户;全球Top10药企覆盖9家,Top15覆盖13家;美国最大的10家医疗集团中覆盖8家;大型IDN医疗网络前25家里已覆盖17家之多。
在标杆案例上,诺和诺德的案例是最为典型的。通过把临床试验数据搭成FounData平台二次利用,诺和诺德的开发团队数据调用率从约1%猛增至20%以上。根据官方测算,这直接带来1.57亿美元净新增价值及1400万美元效率节省的价值。
除了诺和诺德,Regeneron的合作也值得一提。通过将PB(1PB=1024TB)级别的基因组数据与电子病历统一,Regeneron将全量查询时间从30分钟大幅压缩至3秒,实现600倍提速。
在细分场景份额上。Databricks在药企R&D、多组学、临床试验AI细分赛道上是公认的第一梯队,且份额领先。行业普遍认为,Databricks在R&D与AI训练负载上领先。
Databricks在广义份额与间接营收上也有不俗表现。2025年,广义数据科学平台市场规模约为1177亿美元,Databricks整体占比高于竞争对手Palantir和Snowflake。
若将统计口径缩小至“药企R&D+AI数据底座”,Databricks的存在感明显高于全局份额。估算医药生命科学在其营收中占比将接近10%。
从这些数据来看,坊间将医疗板块视为Databricks近1900亿美元估值中里合规溢价最厚、单客户价值最高的垂直切片也就不难理解。
值得一提的是,由于数据主权以及审计合规等因素,Databricks几乎很难落地国内核心药企的研发环节,这就为国内企业留出了空间。
那么,究竟谁有机会成为中国版Databricks呢?
在通用数据湖仓+AI底座方面。星环科技是国产里最类似Databricks的企业,不过,其在医疗板块还需要更多积累。此外,滴普科技曾以FastData实时湖仓和Deepexi企业大模型服务过省属国有医药集团,但这种形式更偏数据中台,在最为重要的数据治理服务稍有欠缺。
在医药垂直数据基座上,国内潜在对标企业在数据端较有特点。比如,医渡科技手握近70亿份医疗记录和1.2亿患者真实世界数据,在真实世界数据和临床知识图谱上有一定优势,但还需要补齐数据湖仓算力和AI训练链路端。
若严格意义而言,国内没有第二家Databricks。各自虽然都有涉足部分业务,但距离“国产版Databricks”仍有距离,机会仍然存在。
总结来看,一个不造大模型的公司,居然值1900亿美元,充分说明了“卖铲人”的价值。
模型在降价、词元(token)在贬值,但随着监管收紧及智能体的逐渐普及,合规、可溯源、能对接智能体的企业私有数据将会越来越有价值。
Databricks就是如此,它用十年时间把医药这个垂直行业变成了自己估值里最有价值的部分之一。
Databricks的高估值对中国市场同样借鉴意义非凡。包括卫健、医保和真实世界数据在内的医药数据湖仓、生物计算数据底座和AI制药中间层都还处于缺位。
各自拿着拼图一角的潜力标的接下来应该往哪条路走,大可以摸着这块“砖头”过河。
谁将成为国产版Databricks,当好AI时代的卖铲人,我们拭目以待。

















