AlphaFold 3、ESM3、ProGen2 对比:蛋白质设计模型怎么选
蛋白质设计是五种任务:AlphaFold 3 预测结构,ESM3、ProGen2 生成序列,DynamicMPNN 逆折叠,Feynman-Kac 引导扩散设计器。它们的数字互不可比。
一个名字,五种任务
「蛋白质设计」听起来是一个问题,实际上至少是三件事:给定序列预测它怎么折叠,是有标准答案的预测问题;生成一条能折叠成目标形状、或带目标功能的序列,是在天文级空间里搜索;而在一个已经很强的生成器之上,把它推向某个可测量的属性,是控制问题。本页对比的五篇论文各自只占住其中一环,网上大多数「哪个蛋白质 AI 最强」的争论,根源都是把它们当成同一张榜单来排名。
所以下表的数字单位不同、基准不同、基线也不同。本页不做一到五的排名,而是把每个模型映射到它被造出来解决的任务,引用每篇论文真正报告了的数字,并标出哪些行连数字都只是「同任务、同基线」意义上的对比。
五个模型各用一段话说清
AlphaFold 3 本质是结构预测器,不是生成式设计器。你把一个混合体系(蛋白链、DNA、RNA、小分子、离子、修饰残基)交给它,它输出整个复合物的三维结构,核心是一个直接生成原子坐标的扩散网络。它的价值在广度:一个模型覆盖了以前需要五六个专用工具才能处理的相互作用类型。
ESM3 是生成器。它把序列、结构、功能表示成三条协同的 token 轨道,你可以用一个结构 motif 或功能约束作为提示,让它补全序列。它的标志性结果是一个荧光蛋白:与已知最近荧光蛋白的序列一致性只有 58%,作者估计这相当于五亿年以上的演化距离,而且这个蛋白被合成出来、经验证确实发光。
ProGen2 也是生成器,但它回答的问题是规模与数据,而不是可控提示。模型最大 6.4B 参数,训练数据来自超过十亿条蛋白序列,横跨基因组、宏基因组和免疫组库数据库。论文声称在刻画演化序列分布、生成全新可行序列、以及不经微调直接预测蛋白适应度三个方向上都达到当时最优,并且开放了模型和代码。
DynamicMPNN 是逆折叠模型:输入骨架几何,输出氨基酸序列。它的出发点是真实蛋白会在多个构象之间切换,所以它在构象系综上联合训练,而不是先把单状态预测事后拼起来。训练集是 46,033 个构象对,覆盖 75% 的 CATH 超家族;评测时用 AlphaFold 3 检验它设计的序列能否折叠回目标状态。
Feynman-Kac 引导 连设计器都不是,它是架在 RFdiffusion 之上的引导层。它用 ProteinMPNN 的序列恢复率加结构弛豫构造引导势能,在去噪过程中按用户定义的奖励重采样轨迹,报告结合剂可设计性(binder designability)提升了 89.5%,而且奖励可以是不可微的目标。
关键数字
| 模型 | 输入到输出 | 规模与训练数据 | 标志性数字 | 基线与设置 | 能和其他行互比吗 |
|---|---|---|---|---|---|
| AlphaFold 3 | 混合生物分子体系到三维复合物结构 | 直接在原子坐标上做扩散,无配体专用骨架 | 不告诉结合口袋仍胜过经典对接;抗体-抗原上胜过 AF-Multimer v2.3 | 对接工具、核酸专用预测器、DeepMind 前代系统 | 不能:这是预测不是生成 |
| ESM3 | 序列、结构、功能三条轨道上的提示到序列 | 1.4B、7B、98B 三个参数规模 | 荧光蛋白与最近已知蛋白仅 58% 一致,估计相当于 5 亿年以上演化距离 | 单个生成蛋白,湿实验验证发光 | 勉强算:同为生成,但只验证了 1 个功能 |
| ProGen2 | 序列到序列 | 最大 6.4B 参数;十亿级以上序列,来自基因组、宏基因组、免疫组库 | 三个方向声称当时最优:演化分布、全新可行序列、零样本适应度 | 各篇论文自己的基准与前代蛋白语言模型 | 不能:三项声明对应三套评测 |
| DynamicMPNN | 构象系综到序列 | 46,033 个构象对,覆盖 75% 的 CATH 超家族 | 相比 ProteinMPNN,decoy 归一化 RMSD 最高好 25%,序列恢复率高 12% | ProteinMPNN,多状态基准,用 AlphaFold 3 评测 | 逆折叠内部可比,仅限多状态场景 |
| Feynman-Kac 引导 | RFdiffusion 轨迹加奖励到被引导的设计 | 引导势能来自 ProteinMPNN 与结构弛豫 | 结合剂可设计性提升 89.5% | 未引导的 RFdiffusion;预测界面能量同步改善 | 不能:这是控制方法,不是设计器 |
这张表刻意少做了一件事:没有任何一列让两个模型共享同一个基准和指标,所以从这些行里算不出排名。三行有基线的定量结果(DynamicMPNN 对 ProteinMPNN、Feynman-Kac 对未引导 RFdiffusion、ESM3 那一个被验证的蛋白)各自只在自家协议内成立,请把它们读成「这篇论文、这个设置」,而不是模型的通用属性。
两点提醒。AlphaFold 3 的标志性结论本来就是定性的:一篇论文的价值在于一个系统跨多种相互作用类型击败专用工具,它刻意不给单一的锦标分数。ESM3 的 58% 是那一个设计蛋白到最近天然蛋白的距离,不是成功率。两者都很容易被误读成榜单数字,也都不是。
怎么选
- 手里有序列,要结构或复合物: 用 AlphaFold 3,不想自己跑就用 AlphaFold Server。记住它输出的是静态最可能构象,不给结合自由能或动力学,且完整权重没有像 AlphaFold 2 那样开放。
- 想在结构或功能约束下生成序列: 用 ESM3,三轨道提示正是它的卖点。58% 荧光蛋白说明它能跳出已知家族,但那是展示「能走多远」,不是平均成功率;荧光也只是一个功能。
- 要给变体打分排序,或不微调就批量生成: 用 ProGen2。6.4B 模型在十亿级序列上训练,目标就是零样本适应度和广覆盖的序列建模,而且带代码。零样本声明要在自己的实验体系里复验后再信。
- 目标蛋白有多个功能构象: 用 DynamicMPNN。单状态逆折叠只优化一个骨架,而生物学发生在构象切换里,这时 46,033 构象对的多状态训练才是决定性差异。
- 已经在用 RFdiffusion,想要它没有训练过的属性: 用 Feynman-Kac 引导。奖励可以是任何你能打分的量、可微与否都行,这正是它要补的缺口。
局限与存疑
最深的局限是共性的:这些数字几乎都撑不过换一家实验室的检验。可设计性比率、序列恢复率、对接精度回答的是三个不同问题,各测各的协议。从读论文走到花湿实验预算时,论文数字的作用是帮你决定先试哪个方法,而不是预测你的成功率。
可复现性在五篇之间也不均匀。ProGen2 明确开放了模型和代码。AlphaFold 3 发布时把权重收在 AlphaFold Server 后面、有用量限制,被批评拖慢了独立复现。ESM3 通过 EvolutionaryScale 的 API 提供,98B 的完整规模大多数实验室既跑不起也验不了。DynamicMPNN 和 Feynman-Kac 都架在别人的系统(ProteinMPNN、RFdiffusion、AlphaFold 3)之上,它们的结果继承那些系统自己的失效模式。
悬而未决的科学问题是评测本身。蛋白质设计没有一个共享、便宜、高通量的真值标准。ESM3 用荧光蛋白是因为那是「一个功能、一次读数」的测定;Feynman-Kac 论文里的结合剂可设计性,靠的是预测能量和可折叠性,而这些本身又是模型输出。在实验通量追上生成速度之前,这个领域里每个头条数字都带着这条替代指标链的影子,读的时候请把它放在心上的第一位。
常见问题
AlphaFold 3 算不算蛋白质设计模型?
严格说不是,它是结构预测模型,干的恰恰是设计的逆运算:你给序列(加配体、核酸等),它给三维结构。ESM3 或 RFdiffusion 这类设计器方向相反,从目标结构或属性走向序列。实践中两者经常被串起来用,DynamicMPNN 拿 AlphaFold 3 当评测器就是典型例子。
ESM3 和 ProGen2 的区别是什么?
两者都是生成序列的蛋白语言模型,但回答的问题不同。ESM3 主打可控生成:跨序列、结构、功能三条轨道做提示,招牌结果是 58% 一致性的荧光蛋白并经过湿实验验证。ProGen2 主打规模与数据:最大 6.4B 参数、十亿级序列训练,声称在演化建模与零样本适应度上达到当时最优。要「按约束引导」想 ESM3,要「适应度打分器或广覆盖序列先验」想 ProGen2。
DynamicMPNN 和 ProteinMPNN 相比结果如何?
在它自己的多状态基准上,DynamicMPNN 用 46,033 个构象对(覆盖 75% 的 CATH 超家族)训练后,报告相比 ProteinMPNN:decoy 归一化 RMSD 最高改善 25%,序列恢复率改善 12%,设计出的序列交由 AlphaFold 3 检验。适用范围要留心:这是关于「会切换多个构象的蛋白」的声明,对刚性单状态目标,这套多状态机制不会带来任何好处。
Feynman-Kac 论文里的 89.5% 是什么意思?
是给 RFdiffusion 加上该论文的 Feynman-Kac 引导势能后,结合剂可设计性的相对提升幅度,势能由 ProteinMPNN 序列恢复率与结构弛豫构造。它不是绝对可设计性比率,也不是和 ESM3 或其他生成器的对比,基线是未引导的 RFdiffusion。它真正的意义在于:奖励可以是任意目标,哪怕不可微。
这些模型里哪些是开源的?
ProGen2 明确开放了模型和代码。AlphaFold 3 没有:访问走免费的 AlphaFold Server 且有用量限制,发布时因此被批评拖慢了独立复现。ESM3 经由 EvolutionaryScale 的 API 提供,98B 完整规模并未以开放权重的形式给出。DynamicMPNN 和 Feynman-Kac 分别构建在 ProteinMPNN 和 RFdiffusion 之上,这两层各有自己的发布条款,规划管线前请先核实。