AI / Technology
用语言模型在进化尺度预测原子级蛋白质结构
传统比对路线与 ESMFold 单序列路线的对比
图 1|传统方法先搜索同源序列并建立多序列比对;ESMFold 把这段外部搜索换成语言模型内部已经学到的进化规律。此图为教学重绘,不是论文原图。
这篇论文回答的是“能否从序列直接预测结构”,不是“蛋白质在真实细胞里怎样一步步折叠”。ESMFold 给出一个可能的静态三维构象;它不模拟折叠路径、时间尺度或细胞环境。
模型扩大时,序列理解与结构信息同步改善
图 2|模型越大,论文观察到的总体趋势是困惑度下降、接触关系和原子级投影改善;这不是对每条序列都保证突然跃迁。
训练时,研究者随机遮住序列中 15% 的位置,让 ESM-2 根据上下文猜回原来的氨基酸。模型从 800 万参数扩大到 150 亿参数时,留出集困惑度从 10.45 降到 6.37。困惑度越低,表示模型在每个位置上越少“拿不准”。论文还观察到,模型变大后,注意力图中的远距离接触关系更准确;这说明三维结构线索确实出现在只用序列训练的表示中。来源:公式 1、图 1 与正文“Atomic-resolution structure emerges…”
ESMFold 从单条序列到结构与置信度的流程
图 3|从输入到输出的五步信息流。图中“残基关系”是模型内部表示的直观化,不是额外输入。
推理时,单条序列先经过 ESM-2。模型内部表示随后进入折叠主干;主干交替更新“每个残基是什么”和“每对残基如何相关”。结构模块再把这些关系转成原子坐标,经过三轮循环修正后,同时输出结构与置信度。用于 ESMFold 的语言模型是 30 亿参数版本,折叠主干有 48 个模块。来源:图 2A 与补充材料 A.3.1
用置信度给预测结果分流
图 4|pLDDT/pTM 适合筛选和排序,但高置信度仍是模型判断,不是实验确认。
语言模型的困惑度是一个失败预警:它与结构 TM-score 在 CAMEO 和 CASP14 上的 Pearson 相关分别为 −0.52 和 −0.71。在 18 个困惑度低于 7 的 CASP14 蛋白上,ESMFold 与 AlphaFold2 的平均 TM-score 差小于 0.03;但论文展示的失败样本 T1074 困惑度为 16.6,ESMFold TM-score 只有 0.64,而 AlphaFold2 为 0.93。来源:图 2B、2E 与正文困惑度分析
ESMFold 批量建立宏基因组结构图谱
图 5|2.25 亿和约 2800 万都是 6.17 亿预测中的筛选层级;后一个数来自抽样外推,不是逐个实验确认。
作者处理了 MGnify90 中长度 20–1024 的全部序列,覆盖该库 99% 的序列;约 6.17 亿个预测中,3.65 亿达到“良好置信度”,2.25 亿达到“高置信度”。整个计算在约 2000 张 GPU 上用两周完成。作者再从高置信度样本外推,估计约 2800 万个结构与已知 PDB 结构的 TM-score 低于 0.5。来源:图 3 与正文宏基因组分析
研究附录
原文标题: Evolutionary-scale prediction of atomic-level protein structure with a language model
作者: Zeming Lin 等|期刊: Science 379, 1123–1130 (2023)|DOI: 10.1126/science.ade2574
核心结论
三句话记住这篇论文
- ESMFold 不先搜索同源序列。 它只读一条氨基酸序列,就直接输出原子坐标和置信度。
- 速度换来了规模,但没有免费得到最高精度。 它在完整测试集上的平均精度低于使用多序列比对和模板的 AlphaFold2,不过对语言模型熟悉的序列,两者可以很接近。
- 真正的突破是吞吐量。 作者在约 2000 张 GPU 上用两周预测了超过 6.17 亿条宏基因组蛋白序列,其中约 2.25 亿条达到论文设定的高置信度门槛。来源:摘要、图 2、图 3 与正文“Evolutionary-scale structural characterization of metagenomics”
这篇论文回答的是“能否从序列直接预测结构”,不是“蛋白质在真实细胞里怎样一步步折叠”。ESMFold 给出一个可能的静态三维构象;它不模拟折叠路径、时间尺度或细胞环境。
问题
为什么多序列比对既有用又拖慢流程?
一个蛋白质的氨基酸会在进化中共同变化。如果两个位置经常一起变,它们在三维空间中可能彼此靠近。AlphaFold2、RoseTTAFold 等方法先在大型数据库中寻找相关序列,再把这些变化规律整理成多序列比对(MSA)。这条路线很准,但数据库搜索本身可能超过 10 分钟,而且每来一条新序列都可能重做一次。来源:正文“Accelerating accurate atomic-resolution structure prediction with a language model”,图 2
语言模型能把搜索提前做进训练里吗?
作者的想法是:让模型预先读过数千万条不同的蛋白质序列,学习“这个位置被遮住时,应该填哪种氨基酸”。要答对,模型必须利用远距离位置之间的依赖。ESM-2 训练时从约 1.38 亿条 UniRef90 序列中采样,最终见到约 6500 万条独特序列;这些经验被压进模型参数,预测时便不再访问外部进化数据库。来源:正文“Atomic-resolution structure emerges…”与“Accelerating…”
方法
ESM-2 先学习氨基酸之间的依赖
训练时,研究者随机遮住序列中 15% 的位置,让 ESM-2 根据上下文猜回原来的氨基酸。模型从 800 万参数扩大到 150 亿参数时,留出集困惑度从 10.45 降到 6.37。困惑度越低,表示模型在每个位置上越少“拿不准”。论文还观察到,模型变大后,注意力图中的远距离接触关系更准确;这说明三维结构线索确实出现在只用序列训练的表示中。来源:公式 1、图 1 与正文“Atomic-resolution structure emerges…”
ESMFold 把语言表示折成三维结构
推理时,单条序列先经过 ESM-2。模型内部表示随后进入折叠主干;主干交替更新“每个残基是什么”和“每对残基如何相关”。结构模块再把这些关系转成原子坐标,经过三轮循环修正后,同时输出结构与置信度。用于 ESMFold 的语言模型是 30 亿参数版本,折叠主干有 48 个模块。来源:图 2A 与补充材料 A.3.1
结构能力不只来自最后一层
作者用消融实验拆掉不同部件。完整八块折叠主干在 CAMEO 上达到 0.74 LDDT;移除语言模型后降到 0.58,移除折叠主干则降到 0.66。这说明语言模型提供关键结构线索,但把线索组织成坐标的折叠模块也不可少。来源:图 S3 与正文消融实验
证据与局限
速度提升有多大?
在单张 NVIDIA V100 上,ESMFold 预测一个 384 个残基的蛋白质用 14.2 秒,比单个 AlphaFold2 模型快 6 倍;对更短序列,论文报告最高约 60 倍。这个对比还没有把传统路线可能超过 10 分钟的高灵敏度序列搜索算进去。来源:正文速度实验与图 S2
准确度并非全面超过 AlphaFold2
作者用 2020 年 5 月作为训练结构的时间截点,再测试 194 个 CAMEO 结构和 51 个 CASP14 难题。ESMFold 的平均 TM-score 分别为 0.83 和 0.68;使用 MSA 与模板的 AlphaFold2 分别为 0.88 和 0.85。CAMEO 上,ESMFold 与 RoseTTAFold 的 0.82 接近;到了专挑难题的 CASP14,差距明显扩大。来源:图 2B 与正文评测设置
| 测试集 | ESMFold | AlphaFold2(含 MSA/模板) | 读法 |
|---|---|---|---|
| CAMEO,194 个结构 | 0.83 | 0.88 | 平均差距较小 |
| CASP14,51 个难题 | 0.68 | 0.85 | 困难样本差距更大 |
表 1|指标为平均 TM-score,越接近 1 越好;约 0.5 是论文采用的正确折叠阈值。
什么时候该相信,什么时候该停下来复核?
语言模型的困惑度是一个失败预警:它与结构 TM-score 在 CAMEO 和 CASP14 上的 Pearson 相关分别为 −0.52 和 −0.71。在 18 个困惑度低于 7 的 CASP14 蛋白上,ESMFold 与 AlphaFold2 的平均 TM-score 差小于 0.03;但论文展示的失败样本 T1074 困惑度为 16.6,ESMFold TM-score 只有 0.64,而 AlphaFold2 为 0.93。来源:图 2B、2E 与正文困惑度分析
这篇论文没有证明什么?
它没有证明预测结构就是唯一真实构象,也没有研究蛋白质动力学、配体、膜环境或细胞条件。ESMFold 也没有专门在蛋白质复合物上训练;在 2978 个近期多聚体复合物中,它只对 53.2% 的链对给出与 AlphaFold-Multimer 相同的 DockQ 定性类别。大规模图谱中的“新结构”还是从高置信度样本外推得到的估计,不能自动等同于新功能或实验发现。来源:图 S4、图 3、正文与结论
实际意义
6.17 亿次预测把结构筛选推到数据库尺度
作者处理了 MGnify90 中长度 20–1024 的全部序列,覆盖该库 99% 的序列;约 6.17 亿个预测中,3.65 亿达到“良好置信度”,2.25 亿达到“高置信度”。整个计算在约 2000 张 GPU 上用两周完成。作者再从高置信度样本外推,估计约 2800 万个结构与已知 PDB 结构的 TM-score 低于 0.5。来源:图 3 与正文宏基因组分析
最适合的用法是“宽筛”,不是“终审”
对研究团队而言,ESMFold 最直接的价值是先给海量序列建立结构假设,再按 pLDDT、pTM、困惑度和是否远离已知结构排序。高价值候选仍应交给更完整的计算流程或实验验证。这里的“先宽筛、后精查”是基于论文速度—精度结果的工作流解读,不是作者验证过的实验协议。
术语与核查清单
- MSA(多序列比对):把一组相关蛋白质序列按位置排齐,从共同变化中寻找约束。
- TM-score:比较预测结构与参考结构整体折叠是否相似,范围 0–1;论文把 0.5 当作正确折叠阈值。
- pLDDT / pTM:模型对局部和整体预测质量的自评,不是实验测量。
- 困惑度:语言模型预测序列时的拿不准程度;越低通常越熟悉这类序列。
- 复核问题:候选是否超出训练分布?置信度是否集中在关键位点?是否涉及多聚体、配体或构象变化?结论是否已经由实验结构、功能测定或另一种模型交叉验证?
主要来源: Science 论文页面与正文;模型代码和权重见论文的数据可用性说明与 Zenodo 归档。
关于这篇论文的三个关键问题
用语言模型在进化尺度预测原子级蛋白质结构 解决了什么问题?
一个蛋白质的氨基酸会在进化中共同变化。如果两个位置经常一起变,它们在三维空间中可能彼此靠近。AlphaFold2、RoseTTAFold 等方法先在大型数据库中寻找相关序列,再把这些变化规律整理成多序列比对(MSA)。这条路线很准,但数据库搜索本身可能超过 10 分钟,而且每来一条新序列都可能重做一次。来源:正文“Accelerating accurate atomic-resolution structure prediction with a language model”,图 2
用语言模型在进化尺度预测原子级蛋白质结构 的核心结论有哪些证据?
在单张 NVIDIA V100 上,ESMFold 预测一个 384 个残基的蛋白质用 14.2 秒,比单个 AlphaFold2 模型快 6 倍;对更短序列,论文报告最高约 60 倍。这个对比还没有把传统路线可能超过 10 分钟的高灵敏度序列搜索算进去。来源:正文速度实验与图 S2
阅读 用语言模型在进化尺度预测原子级蛋白质结构 时最需要注意什么局限?
它没有证明预测结构就是唯一真实构象,也没有研究蛋白质动力学、配体、膜环境或细胞条件。ESMFold 也没有专门在蛋白质复合物上训练;在 2978 个近期多聚体复合物中,它只对 53.2% 的链对给出与 AlphaFold-Multimer 相同的 DockQ 定性类别。大规模图谱中的“新结构”还是从高置信度样本外推得到的估计,不能自动等同于新功能或实验发现。来源:图 S4、图 3、正文与结论