字数 9298,阅读大约需 47 分钟
研究时间:2026年7月22日 | 所属领域:计算生物学/蛋白质设计 | 研究对象类型:研究机构一、一句话定义
Baker 实验室是华盛顿大学蛋白质设计研究所(IPD)旗下的核心研究团队,由 2024 年诺贝尔化学奖得主 David Baker 领导,三十年间从蛋白质结构预测的开拓者转型为蛋白质从头设计的全球引领者,构建了覆盖结构预测(RoseTTAFold)、序列设计(ProteinMPNN)、骨架生成(RFdiffusion)到抗体设计(RFantibody)的完整技术栈,孵化出 21 家衍生公司、累计融资超 30 亿美元,是当今 AI 驱动的蛋白质工程领域最具影响力的学术实验室。
为直观了解Baker 实验室 30 年来的发展脉络,我建立了浏览页面,点击文末链接可跳转到互动页面,包括如下的知识网络和时间线。以后也会更新其他内容。
图 1 Baker实验室 30 年发展全景网络。
图 2 Baker实验室 30 年发展时间线。二、纵向分析:从诞生到当下起源:一个哲学系学生的蛋白质折叠执念
1962 年 10 月 6 日,David Baker 出生在西雅图一个科学家家庭。父亲 Marshall Baker 是物理学家,母亲 Marcia Baker 是地球物理学家——这种成长环境让科学对他来说就像呼吸一样自然。但有意思的是,他在哈佛大学最初主修的是哲学与社会科学,直到最后一年才转向生物学。
这个"半路出家"的背景,后来被 Baker 自己视为一种优势。哲学训练让他习惯于追问"为什么"而非仅仅"怎么做",这种思维模式在他后来从结构预测转向蛋白质设计的战略抉择中起到了关键作用。
Baker 的学术路径经历了三次转向。本科毕业后,他进入 UC Berkeley 的 Randy Schekman 实验室攻读博士——Schekman 后来在 2013 年获得诺贝尔生理学或医学奖。在 Schekman 实验室,Baker 研究的是酵母中的蛋白质运输与转运,属于细胞生物学领域,与蛋白质折叠尚无直接关联。
真正的转折发生在博士后阶段。1989 年,Baker 加入 UCSF 的 David Agard 实验室,本打算短暂学习结构生物学,然后申请细胞生物学教职。但他很快沉迷于一个核心问题:蛋白质的氨基酸序列如何折叠出千奇百怪的三维结构?
Baker 后来回忆了一个颇具画面感的细节:博士后实验室有一间专门用于解析晶体结构的房间,他试着做了 3 分钟将氨基酸链与电子密度图匹配的工作,感到头痛欲裂。这不是他该干的事。他想要用计算机去做更有意义的事情——如果能用计算方式替代手工结构解析,那意味着什么?
这个"3 分钟的头痛",成了 Baker 整个职业生涯的起点。1993-1998:Rosetta 的诞生与 CASP 首秀
1993 年,Baker 回到家乡西雅图,加入华盛顿大学生物化学系,带着一个核心设想:用计算方法预测蛋白质结构。三年后的 1996 年,他与研究生们开始编写一个叫 Rosetta 的程序——取名自古埃及的罗塞塔石碑,寓意是将蛋白质序列"翻译"成三维结构。
最初的 Rosetta 用 FORTRAN 编写,核心方法论是片段组装(fragment assembly):不直接计算整个蛋白质的折叠(计算量太大),而是从蛋白质数据库(PDB)中提取短片段(3-9 个氨基酸残基),用蒙特卡罗搜索在能量函数指导下拼装出整体折叠。这个思路在当时的计算生物学界是开创性的。
Rosetta 的第一个重要舞台是 CASP(蛋白质结构预测关键技术评估),这是一个从 1994 年开始两年一度的盲测竞赛。Baker 团队从 CASP2(1996 年)开始参与,当时"鲜有合理结果"。但两年后的 CASP3(1998 年),Rosetta 正式发布并崭露头角。
真正的一战成名是 CASP4(2000 年)。Baker 团队获得 31 分,第二名仅 8 分。有人比喻说这就像 1927 年贝比·鲁斯击出 60 支本垒打,第二名仅 14 支。此后几届 CASP,Rosetta 持续领先:CASP6(2004 年)首次实现接近原子级精度的 ab initio 预测,CASP11(2014 年)通过整合 GREMLIN 共进化信息实现"历史性突破"——对目标蛋白 T0806 达到 3.6 Å RMSD,被评价为"比 CASP 20 年历史上任何针对超过 100 个氨基酸且缺乏已知结构同源物的蛋白质的预测都要准确"。GREMLIN:从物理到共进化的桥梁
2013 年,Baker 实验室的 Sergey Ovchinnikov 与 Hetunandan Kamisetty、Baker 共同在 PNAS 发表了 GREMLIN 方法。这是一个关键的转折点——GREMLIN 基于伪似然最大化方法,从蛋白质多序列比对(MSA)中学习残基间的统计耦合关系,预测哪些残基在三维空间中会相互接触。
为什么这很重要?因为蛋白质结构的决定性信息不仅藏在单个序列里,还藏在进化过程中不同位置的"共同变异"里。如果第 35 位和第 120 位的氨基酸总是协同变化,那它们很可能在三维结构中靠得很近。GREMLIN 将这种共进化信号转化为结构约束,大幅提升了 Rosetta 的预测精度。
2015 年,Ovchinnikov 利用 GREMLIN + Rosetta 测定了约 614 个此前未知结构的蛋白质家族——其中 206 个是膜蛋白,137 个具有 PDB 中未出现的折叠类型。2017 年这项工作正式发表在 Science 上。
GREMLIN 的历史意义远超其当时的直接贡献。它的 Potts 模型条件概率输出——P(氨基酸 at position i | 其余所有位置)——正是后来蛋白质语言模型(如 ESM)通过掩码语言建模计算的东西。只不过 ESM 从所有家族的原始序列中隐式学习,而 GREMLIN 从单一家族的 MSA 中显式拟合。
更重要的是,GREMLIN → trRosetta(2020 年,引入残基间取向预测)→ RoseTTAFold(2021 年,三轨网络)→ AlphaFold2 的 Evoformer,这条技术演进路线清晰可辨。Baker 实验室在共进化领域的早期投入,为整个蛋白质结构预测的革命埋下了种子。Top7:从"读"到"写"的第一步
在结构预测稳步前进的同时,Baker 做了一个关键的决定:不只是预测自然界已有蛋白质的结构,还要设计自然界不存在的全新蛋白质。
2003 年 11 月,Brian Kuhlman 在 Baker 实验室用 Rosetta 设计出了 Top7——一个 93 个氨基酸的蛋白质,具有自然界中不存在的拓扑结构。X 射线晶体学验证显示,晶体结构与设计模型的骨架 RMSD 仅 1.2 Å。
这个结果在蛋白质科学界引起的震动,用诺贝尔委员会后来的话说:"Top7 was a bolt from the blue for the researchers working on protein design."(对蛋白质设计研究者来说,Top7 是一道晴天霹雳。)此前所有从头设计的蛋白质都只是在模仿已有结构,而 Top7 的结构在自然界中根本不存在。
Top7 证明了蛋白质设计不只是理论概念,而是可以落地的工程实践。Baker 因此与 Kuhlman 共享了 2004 年费曼纳米技术奖。更重要的是,Top7 为 Baker 的整个研究纲领奠定了基调:如果结构预测是"读"——理解自然界已有的蛋白质,那么蛋白质设计就是"写"——创造自然界不存在的蛋白质。后者是更难但更具应用价值的问题。IPD:打造"蛋白质设计的贝尔实验室"
2012 年 4 月,华盛顿大学在 Baker 团队国际领先地位的基础上,成立了蛋白质设计研究所(Institute for Protein Design,IPD)。IPD 的定位是"蛋白质设计的贝尔实验室"——一个将基础研究、技术开发和商业转化融为一体的非营利科研机构。
IPD 的成立是 Baker 实验室从一个传统学术实验室向"研究-开发-创业"综合体转型的关键节点。2014 年 6 月,IPD 设立转化研究中心,推动基础研究走向市场。2017 年筹资 1200 万美元布局深度学习技术。2019 年获 TED"无畏计划"5 年 4500 万美元资助。
截至 2023 年,IPD 的规模已远超一个传统学术实验室:超过 250 人,4 名首席研究员,125 名以上博士后和研究生;2800 平方米科研用房,11 个实验室平台;2023 财年经费 3300 万美元;Science/Nature/Cell 论文 83 篇,h 指数 101;100 余项专利;与全球 125 个以上机构合作。
Baker 培养的研究人员中有 100 多位已到其他机构担任独立教职,分布在 60 多所大学。这个"人才网络"本身就是 Baker 影响力的重要组成部分——从 IPD 走出去的人,正在全球各地复制 Baker 模式。CASP14 的冲击:AlphaFold2 的碾压性胜利
2020 年 11 月,CASP14 的结果像一颗炸弹。
DeepMind 的 AlphaFold2 以中位数 GDT_TS 92.4 碾压所有团队——97 个目标中 88 个最佳预测,约三分之二的蛋白 GDT_TS > 90,被主办方宣布"成功解决了困扰科学家 50 年的难题"。Baker 团队的 Rosetta 以约 74 分屈居第二梯队,差距近 20 分。
Baker 后来回忆当时的感受:"所有人都惊呆了,先是有很多媒体报道,然后基本上就没有消息了。你处在一个很奇怪的境地,你的领域取得了重大进展,但你却不能在此基础上继续发展。"
但 Baker 不是坐以待毙的人。实际上他在 2018 年 CASP13 时就已嗅到危机——当时 AlphaFold1 初露锋芒,Baker 就要求团队紧跟机器学习风向。CASP14 后,DeepMind 科学家发表了一个半小时演讲阐述 AlphaFold2 的工作机制,Baker 和博士后 Minkyung Baek 从中找到了具体方向。战略转向:从预测到设计
Baker 团队的战略调整遵循一条清晰的逻辑链:
第一,认清现实。AlphaFold2 证明了深度学习在蛋白质结构预测上的绝对优势,继续在传统物理方法预测领域与 DeepMind 竞争已无意义。
第二,转向"逆问题"。如果说结构预测是"读",蛋白质设计则是"写"。这是更难但更具应用价值的问题——而且在这个领域,Baker 实验室有二十年的积累和 Top7 的开创性先例。
第三,用开源对抗封闭。DeepMind 未立即公开 AlphaFold2 细节,Baker 决定以开源回应——快速开发 RoseTTAFold 并公开发布。
第四,构建完整的设计流水线。不是只做一个工具,而是做一整套:骨架生成 → 序列设计 → 结构验证,形成闭环。
转向后的技术爆发速度惊人:
时间
工具
期刊
功能
2021 年 8 月
RoseTTAFold
Science
三轨网络结构预测
2022 年 9 月
ProteinMPNN
Science
深度学习序列设计
2023 年 7 月
RFdiffusion
Nature
扩散模型骨架从头设计
2024 年 4 月
RoseTTAFold All-Atom
Science
全原子建模
2025 年 1 月
抗蛇毒蛋白设计
Nature
RFdiffusion 应用
2025 年 11 月
RFantibody
Nature
从头设计全长抗体
2025 年
LigandMPNN
Nature Methods
全原子级序列设计
2026 年 5 月
病毒几何纳米笼
Nature
超大型组装体设计
这套工具形成了一条完整的设计流水线:RFdiffusion 生成蛋白质骨架 → ProteinMPNN 设计氨基酸序列 → AlphaFold2 验证折叠是否正确。整个流程在 GPU 集群上数小时完成,替代了自然数十亿年的随机突变与选择。2024 年诺贝尔化学奖
2024 年 10 月 9 日,瑞典皇家科学院宣布当年诺贝尔化学奖:一半授予 David Baker("for computational protein design"),另一半共同授予 DeepMind 的 Demis Hassabis 和 John Jumper("for protein structure prediction")。
诺贝尔委员会的评语是:"David Baker has succeeded with the almost impossible feat of building entirely new kinds of proteins."
Baker 获奖的具体贡献包括:2003 年 Top7 设计(首个从头设计的蛋白质)、Rosetta 平台(革命性计算平台)、功能性蛋白质创造(药物、疫苗、纳米材料、传感器)。值得注意的是,Baker 的获奖不是因为蛋白质结构预测——那部分给了 DeepMind——而是因为蛋白质设计。这是结构预测的"逆问题",也是更难的创造性问题。
Baker 谦逊地表示自己"站在巨人的肩膀上"。但从 CASP2 的"鲜有合理结果"到诺贝尔奖,这条路走了 28 年。近期动态:从抗体到纳米机器
2025-2026 年,Baker Lab 的产出依然密集:
2025 年 1 月,用 RFdiffusion 设计抗蛇毒蛋白,小鼠在致死剂量下存活率 80-100%——为全球每年 10-13 万人死于蛇毒的问题提供了全新解决方案。领衔作者 Susana Vázquez Torres 来自墨西哥克雷塔罗,靠近蝮蛇和响尾蛇栖息地,她的个人动机与科学研究深度结合。
2025 年 11 月,RFantibody 发表于 Nature——首次实现全长抗体的从头计算设计。测试靶点包括致病细菌毒素、病毒蛋白和难治性癌症靶点。冷冻电镜验证显示,5 个 AI 设计抗体中 4 个完全符合计算机预测,6 个 CDR 环全部达到原子精度。这项技术可能重塑价值 2000 亿美元的抗体药物行业。
2026 年 5 月,两个 Nature 背靠背发表——计算设计的蛋白质可自组装成受病毒衣壳启发的大型可调纳米笼。最大纳米笼直径 220 nm,2160 个亚基,分子量超 50 MDa。这是蛋白质设计从分子级别走向材料和器件级别的标志。阶段划分
回顾 Baker 实验室三十年的历程,可以清晰地分为四个阶段:
第一阶段:开创期(1993-2012)。从 Baker 加入华盛顿大学到 IPD 成立。核心特征是建立 Rosetta 平台、在 CASP 中持续领先、从结构预测扩展到蛋白质设计(Top7)。核心矛盾是"如何用计算方法理解蛋白质折叠"。
第二阶段:共进化与转型期(2013-2020)。从 GREMLIN 发表到 CASP14 的冲击。核心特征是共进化方法的引入、大规模结构预测、蛋白质设计应用扩展(酶、纳米笼、疫苗)。核心矛盾是"传统物理方法与深度学习的碰撞"——CASP14 的结果迫使 Baker 彻底转向。
第三阶段:深度学习爆发期(2021-2024)。从 RoseTTAFold 到诺贝尔奖。核心特征是密集推出深度学习工具、形成完整设计流水线、商业化加速。核心矛盾是"如何在被 DeepMind 超越的领域重新找到自己的位置"——答案是转向设计。
第四阶段:设计驱动期(2024-至今)。从诺贝尔奖至今。核心特征是设计能力从"能做"到"做好"(成功率提升、应用扩展)、从蛋白质到全生物分子(抗体、纳米笼、酶)、商业化全面铺开。核心矛盾从"如何设计"转向"设计什么"。
Baker 本人在 2026 年 Nature 综述中写道:"While there is still room for improvement in success rates and activities, the long-standing challenges of designing new protein structures, assemblies and protein binders are close to being solved. The key current questions in these areas are not how to design, but what to design."三、横向分析:竞争图谱竞争格局概述
Baker 实验室同时活跃在两个赛道:蛋白质结构预测和蛋白质设计。这两个赛道的竞争格局截然不同。
在蛋白质结构预测领域,AlphaFold 系列(DeepMind)是绝对的精度王者,但 Baker 的 RoseTTAFold 系列在计算效率、复合体预测、可微调性和作为设计工具基础方面保持差异化优势。ESMFold(Meta)以速度见长。这是一个"一超多强"的格局。
在蛋白质设计领域,Baker 实验室是公认的引领者,但竞争者正在快速增多。Generate Biomedicines 的 Chroma 模型、DeepMind 的 AlphaProteo、EPFL 的 BindCraft、Cradle 的工业优化平台,各自在不同细分方向上构成挑战。这是一个"群雄逐鹿"但 Baker 仍居中心的格局。结构预测:RoseTTAFold vs AlphaFold
RoseTTAFold 与 AlphaFold2 的对比,是理解 Baker 实验室在结构预测领域地位的关键。
技术路线差异。AlphaFold2 采用 Evoformer + Structure Module 架构,1D 序列和 2D 距离图信息处理完成后才进行 3D 坐标推理。RoseTTAFold 的三轨网络则让 1D 序列、2D 距离图和 3D 坐标三个轨道同时迭代通信——信息在三个维度之间来回流动。这两种架构代表了两种不同的设计哲学:AlphaFold 优先注意力机制,RoseTTAFold 优先几何推理。
精度差距。CASP14 上,AlphaFold2 中位数 GDT_TS 92.4,RoseTTAFold 73.2——差距约 19 分。但这个差距在后续版本中缩小:RoseTTAFold2(2023 年 bioRxiv 预印本)融合了 AlphaFold2 的 FAPE、recycling 和蒸馏数据集,单体精度追平 AlphaFold2,复合体精度达到 AlphaFold2-multimer 水平。更重要的是,RoseTTAFold2 证明了 AlphaFold2 的标志性特征(IPA 和三角注意力)并非高精度预测的必要条件——"更广泛的模型类别都能达到优秀性能"。
RoseTTAFold 的差异化优势。计算效率更高(单卡 RTX 2080 即可运行,10 分钟预测 400 残基蛋白,而 AlphaFold2 推荐 TPU 或高端 GPU);原生支持蛋白-蛋白复合体预测(AlphaFold2 v1 仅预测单链);完全开源含训练代码(AlphaFold2 未完全公开训练代码);更易微调和修改。这些优势使 RoseTTAFold 成为蛋白质设计工具链的理想基础——RFdiffusion 正是在 RoseTTAFold 基础上微调的。
AlphaFold2 的优势。单链精度最高;置信度评估更可靠(pLDDT);对浅层 MSA 更鲁棒;AlphaFold DB 提供预计算结构(2 亿+蛋白质)。在工业界采纳度上,AlphaFold2 更广泛。
实际使用策略。研究者的实践往往是互补而非替代:"先用 RoseTTAFold 快速扫描可能的拓扑结构,再用 AlphaFold2 对关键区域进行精修预测。"对于关键应用,使用两个模型的共识方法,结合实验验证,是当前计算结构生物学的黄金标准。
全原子建模的竞争。RoseTTAFold All-Atom(2024 年 Science)在 2023 年 10 月就发布了预印本,早于 AlphaFold3(2024 年 5 月)。两者都能建模蛋白+核酸+小分子+金属的完整生物分子组装体。但 AlphaFold3 在蛋白-核酸预测上精度更高,而 RoseTTAFold All-Atom 的优势在于可以微调为 RFdiffusionAA——直接在小分子周围从头设计蛋白质。AlphaFold3 最初限制商业使用(后来在社区压力下改为 Apache 2.0,但权重仍受限),而 RoseTTAFold All-Atom 基本开源。蛋白质设计:Baker vs 群雄
蛋白质设计是 Baker 实验室当前的主战场,竞争者也最为密集。
RFdiffusion vs Chroma(Generate Biomedicines)。两者几乎同期发表(RFdiffusion 2023 年 7 月 Nature,Chroma 2023 年 11 月 Nature),都是扩散模型。关键差异在于:RFdiffusion 基于 RoseTTAFold 微调,Chroma 从零训练图神经网络;Chroma 实现了亚二次计算扩展(对大型组装体更友好),且支持自然语言条件控制;RFdiffusion 的实验验证更广泛(数百个设计 vs 310 个),应用范围更广(酶、抗体、纳米笼、结合剂全覆盖)。Chroma 的公司 Generate Biomedicines 已于 2026 年 2 月 IPO,市值约 20 亿美元,GB-0895 成为全球首个 AI 设计并进入 Phase 3 临床的长效抗TSLP抗体。
RFdiffusion vs AlphaProteo(DeepMind)。AlphaProteo 于 2024 年 9 月发布白皮书(尚未正式同行评审),在 7 个靶蛋白上报告了 9%-88% 的成功率,结合亲和力比现有最佳方法高 3-300 倍。但 AlphaProteo 是闭源 API,透明度低,训练数据依赖 1 亿+ AlphaFold 预测结构。RFdiffusion 完全开源,实验验证更广泛。AlphaProteo 的商业化路径是 Isomorphic Labs(与礼来、诺华 30 亿美元合作)。
RFdiffusion vs BindCraft(EPFL Correia 团队)。BindCraft 于 2025 年发表在 Nature,平均成功率 46.3%——显著高于 RFdiffusion 的 1-20%。关键差异在于 BindCraft 允许靶标主链浮动(支持诱导契合),而 RFdiffusion 假设刚性靶标。BindCraft 的开发者之一 Sergey Ovchinnikov 正是 Baker 实验室培养的人才——这种"学生超越老师"的现象本身就很值得玩味。BindCraft 完全开源,用户友好度高("按按钮"级别)。
ProteinMPNN 的地位。在逆折叠(结构→序列)这个细分领域,ProteinMPNN 是事实标准。序列恢复率 52.4%(vs Rosetta 32.9%),速度极快(100 残基单 CPU 约 1.2 秒 vs Rosetta 258.8 秒),MIT 许可证完全开源。后续 LigandMPNN 扩展到全原子级。目前没有明显的竞品能在综合性能上超越 ProteinMPNN。
RFantibody 的地位。在抗体从头设计领域,RFantibody 是第一个实现全长抗体完全计算设计的同行评议方法。竞争者包括 Chai-2(Chai Discovery,零样本抗体设计两位数成功率)和传统抗体优化平台,但 RFantibody 在"从零开始"这个维度上仍具独特优势。开源文化:Baker vs DeepMind
在开源策略上,Baker 实验室与 DeepMind 形成了鲜明对比。
Baker 的核心理念是"分享一切":"在我们的领域,免费公开代码显然是最好的选择。当从圣保罗到内罗毕的研究人员都能下载我们使用的相同代码时,这会成倍增加发现的速度。"
这种理念在实践中经历了演进。早期的 Rosetta 采用 RosettaCommons 的分层许可模式:学术免费、商业付费。新一代 AI 工具则越来越开放——ProteinMPNN 完全 MIT 开源(含商业使用),RFdiffusion 免费给非营利和营利使用,RFdiffusion3 甚至开源了训练代码,RFantibody 学术/个人/商业免费使用。
DeepMind 的策略则更保守。AlphaFold2 在 CASP14(2020 年 11 月)展示后未立即公开细节,直到 2021 年 7 月才发布代码和论文,2022 年 1 月才将权重许可从非商业转为 CC BY 4.0。AlphaFold3 更进一步收窄——最初限制商业使用,后来在社区压力下改为 Apache 2.0,但权重仍受限。这种保守策略甚至催生了开源替代品——MIT 的学生开发了 Boltz 作为 AlphaFold3 的开源替代。
Baker 特别指出:"没有谁占据主导地位,这是好事。"他认为开源生态系统"非常健康"。商业版图:21 家衍生公司
Baker 作为创始人/联合创始人参与的公司达 21 家(活跃 18 家),累计融资远超 30 亿美元。这些公司覆盖了从工业酶到细胞疗法、从疫苗到抗体药物的广泛领域。
最具代表性的包括:
Xaira Therapeutics(2024 年 4 月成立)——启动融资超 10 亿美元,生物医药领域最大初始融资之一。CEO 为前斯坦福校长 Marc Tessier-Lavigne,董事会包括诺奖得主 Carolyn Bertozzi、前 FDA 局长 Scott Gottlieb、前强生 CEO Alex Gorsky。技术基于 RFdiffusion 和 RFantibody。
Generate Biomedicines(2018 年 Flagship Pioneering 孵化)——2026 年 2 月 IPO 募资 4 亿美元,市值约 20 亿美元。GB-0895(抗 TSLP 抗体)成为全球首个 AI 设计并进入 Phase 3 临床的蛋白药物。与 Baker Lab 有技术关联但非直接衍生公司。
Icosavax(2017 年成立)——计算设计的病毒样颗粒疫苗。2023 年 12 月被 AstraZeneca 以最高 11 亿美元收购——IPD 衍生公司中最大的并购退出之一。
PvP Biologics——口服酶疗法治疗乳糜泻。2020 年被 Takeda 以 3.3 亿美元收购。
Arzeda(2008 年成立)——工业蛋白质/酶设计,与 Unilever、W.L. Gore 等合作。累计融资超 1 亿美元。
Outpace Bio(2021 年从 Lyell 分拆)——AI 驱动蛋白质设计用于细胞疗法。2024 年 Series B 1.44 亿美元。
Neoleukin(2018 年成立)——IPD 首家上市公司,首个计算机设计蛋白质(NL-201)进入临床试验。
Baker 实验室的开源与商业平衡策略有三个关键设计:第一,核心算法开源,但商业应用需单独许可(Rosetta 模式);第二,使用工具产生的产品 IP 属于创建者,Rosetta Commons 无 reach-through 权利——这消除了衍生公司的知识产权顾虑;第三,2024 年成立 Rosetta Commons Foundation(非营利)+ Levitate Bio(营利)的 Mozilla 式混合结构,实现长期可持续性。
这种策略的核心洞察是:开源不仅不会阻碍商业化,反而会加速创新和商业机会的创造。开源工具催生更好的软件,更好的软件催生更多的衍生公司,衍生公司反过来支持社区——形成正向循环。竞争格局总结
维度
Baker Lab
DeepMind
Generate
Correia (BindCraft)
Cradle
核心方法
RFdiffusion+MPNN
AlphaFold/AlphaProteo
Chroma
AF2反向传播
语言模型
开源
完全
有限
完全
完全
商业平台
实验验证
最广泛
7靶点
310个
12靶点
客户项目
应用广度
最广
结合剂
大型组装体
结合剂
蛋白优化
商业化
21家衍生公司
Isomorphic Labs
IPO上市
开源
SaaS平台
学术影响
诺贝尔奖
诺贝尔奖
高
高
低四、横纵交汇洞察历史如何塑造了当下的竞争位置
Baker 实验室今天在蛋白质设计领域的领先地位,不是某一个决策的结果,而是一系列历史选择的累积效应。
第一个关键决策:1996 年选择开发 Rosetta。这不仅是一个软件项目,更是一种方法论的奠基——片段组装 + 能量函数 + Monte Carlo 搜索。这个选择"锁定"了 Baker 实验室此后 15 年的发展方向,也积累了大量的物理能量函数知识、蛋白质结构数据库和计算工具链。这些积累在深度学习时代看似"过时",但实际上成了 RFdiffusion 的训练基础——RoseTTAFold 正是在 Rosetta 的物理直觉上构建的。
第二个关键决策:2003 年设计 Top7。这个决定让 Baker 实验室从"预测"扩展到"设计",在 AlphaFold2 席卷结构预测领域时,Baker 有了退路和新的主战场。如果没有 Top7 及其后的一系列设计工作,CASP14 的失败可能意味着 Baker 实验室的衰落。Top7 的意义不仅是科学突破,更是战略保险。
第三个关键决策:2013 年投入共进化方法(GREMLIN)。这看起来只是结构预测的一个改进,但实际上是 Baker 实验室进入深度学习领域的入口。GREMLIN 的 Potts 模型与后来的蛋白质语言模型在数学上同源,Ovchinnikov 的大规模共进化应用让 Baker 团队积累了处理基因组规模数据的经验。从 GREMLIN 到 trRosetta 到 RoseTTAFold,这条线是连续的。
第四个关键决策:CASP14 后全面转向深度学习和蛋白质设计。这是最具决定性的转折。Baker 没有在结构预测上死磕,而是接受了 AlphaFold2 的胜利,将精力转向蛋白质设计——一个 AlphaFold 不直接覆盖的领域。RoseTTAFold 虽然精度不如 AlphaFold2,但它的三轨架构更适合微调为生成模型(RFdiffusion),且完全开源让全球研究者都能在此基础上改进。这个决策让 Baker 在"输掉"结构预测竞赛后,反而赢得了蛋白质设计的主导权。竞品的纵向对比:不同起源如何导致不同特点
把主要竞争者放到时间线上看,它们的起源差异深刻地影响了今天的特点。
DeepMind/Google。作为商业公司,DeepMind 的优势是算力和数据——AlphaFold2 在 TPU 上训练,AlphaProteo 利用 1 亿+ AlphaFold 预测结构作为训练数据。但商业公司的本能是控制——AlphaFold3 的商业限制就是这种本能的体现。DeepMind 的商业化路径是通过 Isomorphic Labs(与礼来、诺华 30 亿美元合作),而非孵化大量衍生公司。这种"一家公司独大"的模式与 Baker 的"开源生态+多家衍生公司"形成鲜明对比。
Generate Biomedicines。作为 Flagship Pioneering 孵化的公司,Generate 的优势是商业执行力和药物开发经验。Chroma 模型在计算扩展性上优于 RFdiffusion(亚二次 vs 二次),且支持自然语言条件控制。但 Generate 是一家公司而非实验室——它的技术不公开,验证数据有限(310 个设计),应用范围窄于 Baker。Generate 的 GB-0895 进入 Phase 3 是商业里程碑,但这更多是药物开发能力的体现,而非设计方法的优势。
EPFL Correia 团队(BindCraft)。BindCraft 的成功率 46.3% 确实高于 RFdiffusion 的 1-20%,但这背后有一个微妙的故事——BindCraft 的开发者之一 Sergey Ovchinnikov 正是 Baker 实验室培养的人才。Ovchinnikov 在 Baker 实验室开发了 GREMLIN,后来到哈佛再到 MIT 独立研究。BindCraft 的核心思路——用 AlphaFold2 反向传播设计序列——与 RFdiffusion 的扩散模型路线截然不同,但两者都建立在 Baker 实验室播下的种子上。
这种"学生超越老师"的现象,恰恰说明了 Baker 开源策略的成功。如果 Baker 像 DeepMind 一样封闭,Ovchinnikov 可能永远不会发展出 BindCraft。优势的历史根源
Baker 实验室今天的每个核心优势,都能追溯到历史上的具体节点。
最广泛的实验验证,源于 2017 年大规模并行设计方法的确立。Chevalier 等人在一次实验中测试了 22,660 个微型蛋白——这种"暴力验证"的思路,需要寡核苷酸池技术(与 Twist Bioscience 合作)、酵母展示筛选和下一代测序的配合。这种湿实验能力是大多数计算实验室不具备的,它让 Baker 不仅能"设计",还能"验证"和"改进"——利用实验失败数据训练更好的模型。
最完整的技术栈,源于从物理方法到深度学习的渐进式积累。Rosetta 能量函数(2000s)→ GREMLIN 共进化(2013)→ trRosetta 几何约束(2020)→ RoseTTAFold 三轨网络(2021)→ ProteinMPNN 序列设计(2022)→ RFdiffusion 骨架生成(2023)→ RFdiffusionAA 全原子设计(2024)→ RFantibody 抗体设计(2025)。每一步都建立在前一步的基础上,形成了一条其他竞争者难以复制的完整链条。
开源生态的主导权,源于 Baker 从第一天就坚持的开放文化。Rosetta Commons 从 2003 年开始举办 RosettaCON 年会,70+ 机构参与,30000 个学术许可发放。这种社区积累不是一朝一夕能建立的——DeepMind 2020 年才发布 AlphaFold2,而 Baker 的社区已经运行了 17 年。
21 家衍生公司的商业版图,源于 IPD 2014 年设立的转化研究员项目。这个项目的核心设计是:为有前景的分子/资产提供工具、时间和空间使其成熟,鼓励转化研究员成为创始人。关键机制是 IP 独立性——使用工具产生的产品 IP 属于创建者,Rosetta Commons 无 reach-through 权利。这消除了创业者的最大顾虑。劣势的历史根源
Baker 实验室也有结构性弱点。
结构预测精度不及 DeepMind。CASP14 上 19 分的差距虽然被 RoseTTAFold2 缩小,但 AlphaFold 系列始终保持着精度领先。这个劣势的根源可以追溯到 Baker 实验室的技术基因——物理能量函数和片段组装是 Baker 的根基,而 AlphaFold2 的端到端深度学习代表了一种不同的技术范式。Baker 虽然及时转向了深度学习,但起步比 DeepMind 晚——AlphaFold1 在 2018 年 CASP13 就已亮相,而 RoseTTAFold 到 2021 年才发布。
Rosetta 经典软件的半封闭许可模式限制了其传播。学术免费、商业付费的分层许可虽然支持了社区运营,但也让一部分研究者转向了完全开源的替代品。新一代 AI 工具(ProteinMPNN、RFdiffusion)虽然更开放,但 Rosetta 生态中仍有一部分工具受限于旧许可模式。
湿实验规模虽然最大,但仍是瓶颈。RFdiffusion 的湿实验成功率 1-20% 虽然比传统方法好很多,但与 BindCraft 的 46.3% 相比仍有差距。Baker 实验室的"暴力验证"思路虽然有效,但本质上是用规模换成功率——如果能提升单次设计的成功率,就能大幅降低实验成本。未来推演
基于纵向趋势和横向竞争格局,给出三个剧本:
最可能的剧本:设计工具链的"安卓化"。Baker 实验室的开源工具(RFdiffusion + ProteinMPNN + RFantibody)将成为蛋白质设计的"操作系统",就像安卓之于移动设备。大量公司和研究组在这些工具上构建应用——有的做抗体药物,有的做工业酶,有的做疫苗。Baker 实验室本身继续专注于基础方法开发和前沿应用(如纳米机器、复杂酶),同时通过 Rosetta Commons Foundation 获得可持续收入。衍生公司继续孵化,但速度可能放缓——因为低垂的果实已经被摘完了。最大的风险不是技术失败,而是政策环境——2025 年特朗普政府的 funding 削减已经开始影响 IPD 招收博士后和研究生。Baker 自己说:"如果学生因为资金削减而无法继续教育,这对我们和美国科学来说将是绝对的灾难。"
最危险的剧本:DeepMind 的"降维打击"。如果 DeepMind 将 AlphaProteo 开源并免费提供(就像当初开源 AlphaFold2 一样),同时利用 Google 的算力和 Isomorphic Labs 的药物开发能力构建端到端的蛋白质设计平台,Baker 实验室在蛋白质设计领域可能面临与结构预测领域类似的处境——被一个拥有更多资源的商业实体超越。这种情况下,Baker 的优势(实验验证、应用广度、社区生态)仍然存在,但技术领先地位可能被侵蚀。不过,这个剧本的概率不高——AlphaProteo 目前仍闭源,且 DeepMind 的商业模式更倾向于通过 Isomorphic Labs 独占商业化,而非开源。
最乐观的剧本:蛋白质设计的"ChatGPT 时刻"。如果 RFdiffusion3 或后续版本的成功率大幅提升(比如达到 50%+),同时设计能力扩展到更复杂的功能(如多步反应催化、构象切换纳米机器),蛋白质设计可能迎来类似 ChatGPT 之于 NLP 的"大众化时刻"——从专业实验室技能变成人人可用的工具。Baker 实验室凭借其开源工具链和社区生态,将处于这个时刻的中心。衍生公司的估值可能数倍增长,IPD 成为比肩 Bell Labs 的传奇。Baker 本人在 2026 年 Nature 综述中的展望——"设计具有复杂功能的蛋白纳米机器和材料,应用于医学、技术和可持续性"——可能在未来 5-10 年内实现。五、信息来源一手论文
1. Kuhlman B, et al.Science302:1364-1368, 2003. DOI: 10.1126/science.1089427(Top7)
2. Kamisetty H, Ovchinnikov S, Baker D.PNAS110(41), 2013. DOI: 10.1073/pnas.1314045110(GREMLIN)
3. Ovchinnikov S, et al.Science355:294-298, 2017. DOI: 10.1126/science.aah4043(宏基因组结构预测)
4. Yang J, et al.PNAS117(2):977-984, 2020. DOI: 10.1073/pnas.1914677117(trRosetta)
5. Baek M, et al.Science373:871-876, 2021. DOI: 10.1126/science.abj8754(RoseTTAFold)
6. Dauparas J, et al.Science378:49-56, 2022. DOI: 10.1126/science.add2187(ProteinMPNN)
7. Watson JL, et al.Nature620:1089-1100, 2023. DOI: 10.1038/s41586-023-06415-8(RFdiffusion)
8. Ingraham JB, et al.Nature623:1070-1078, 2023. DOI: 10.1038/s41586-023-06728-8(Chroma)
9. Krishna R, et al.Science384(6693), 2024. DOI: 10.1126/science.adl2528(RoseTTAFold All-Atom)
10. Bennett NR, et al.Nature649:183-193, 2026. DOI: 10.1038/s41586-025-09721-5(RFantibody)
11. Kim D, et al.Nature2026. DOI: 10.1038/s41586-025-09746-w(金属水解酶)
12. Pacesa M, et al.Nature2025. DOI: 10.1038/s41586-025-09429-6(BindCraft)
13. Cao L, et al.Science370:426-431, 2020. DOI: 10.1126/science.abd9909(SARS-CoV-2 抑制剂)
14. Chevalier A, et al.Nature550:74-79, 2017. DOI: 10.1038/nature23912(大规模微型蛋白设计)
15. Yang W, et al.Nature2026. DOI: 10.1038/s41586-026-10328-7(从头设计综述)
16. Lee S, et al.Nature2026. DOI: 10.1038/s41586-026-10554-z(准对称纳米笼)官方与权威来源
• 诺贝尔奖官方:https://www.nobelprize.org/prizes/chemistry/2024/press-release/
• Baker Lab 官网:https://www.bakerlab.org/
• IPD 官网:https://www.ipd.uw.edu/about
• Rosetta 时间线:https://docs.rosettacommons.org/docs/latest/meta/Rosetta-Timeline
• GitHub:RosettaCommons、dauparas/ProteinMPNN、RosettaCommons/RFdiffusion、RosettaCommons/RFantibody媒体与分析
• Nature:The hothouse for protein design(2020)
• GeekWire: IPD 创业生态系列报道
• 《中国科学院院刊》2024年第7期:蛋白质设计研究所创新之道
https://ai4ai.genegps.com/baker/