AI / Technology
AlphaFold高精度蛋白质结构预测
从氨基酸序列和同源序列推断折叠约束
图 1|同源序列中的协同变化可提示远隔残基在折叠后靠近。箭头表示推断路径,不代表蛋白质真实折叠的时间过程。本文原创教学图;依据论文对 MSA 与残基对表示的描述绘制。
如果两个位置在不同物种中经常协同变化,一个合理解释是:它们在三维结构里彼此影响。多序列比对(MSA)把许多同源序列按位置排齐,使这类信号可被模型读取。它不是结构答案,而是一组带噪声的约束:哪些残基可能靠近、哪些组合要相互兼容。
AlphaFold 从序列与 MSA 到三维结构和可信度的概念流程
图 2|概念流程而非逐层工程图:MSA 与残基对表示在 Evoformer 中交换信息,结构假设经循环修正后转为三维坐标,并同时输出可信度。本文原创教学图;依据论文图 1e、图 3 及相关文字重新设计。
一次输出会被送回网络继续修正,这叫 recycling。消融实验表明,多种部件共同贡献精度,循环修正是重要来源之一。训练还加入自蒸馏:初始模型为 355,993 条 Uniclust30 序列生成结构,再筛选预测数据与 PDB 实验结构混合训练最终模型;最终采样比例为 75% 预测集、25% PDB 集。论文:训练方法
如何阅读 AlphaFold 可信度与两个典型限制
图 3|可信度应按区域读取,并结合输入与生物环境判断。浅 MSA 会削弱进化证据;依赖其他链塑形的桥接结构域缺少跨链上下文时容易失准。本文原创教学图;依据论文图 2c、图 5 与限制讨论绘制。
- 不是蛋白质折叠动力学模拟。 它预测一个最可能出现在 PDB 中的结构,不告诉你真实折叠路径、速度或能量景观。
- 不是任意生物状态的唯一答案。 配体、离子、膜环境、突变和复合物伙伴可能改变构象;论文的主模型面向单链,并未证明可普遍解决异源复合物。
- 可信度不是实验真值。 pLDDT 是模型对局部准确度的估计;低值提醒谨慎,高值也不能替代功能实验、结合实验或结构测定。
- 序列证据不足会掉点。 当 MSA 的中位有效深度低于约 30 条序列时,准确度明显下降;超过约 100 后增益趋小。
- 跨链塑形是明确弱点。 若一条链自身接触少、结构主要由异源链接触决定,模型会更弱。论文:MSA depth and cross-chain contacts
研究附录
原文标题: Highly accurate protein structure prediction with AlphaFold
作者: John Jumper、Richard Evans、Alexander Pritzel 等|期刊: Nature 596, 583–589 (2021)|发表: 2021-07-15|DOI: 10.1038/s41586-021-03819-2
核心结论
三句话带走
- 问题:只凭氨基酸序列预测蛋白质的三维结构,长期难在搜索空间巨大,而实验测结构又常需数月到数年。
- 变化:AlphaFold 把同源序列中的进化线索、残基两两关系和三维几何放进同一个端到端网络,并让预测反复“回炉”修正。
- 结论:在 CASP14 的 87 个蛋白结构域上,它的主链中位误差为 0.96 Å,次优方法为 2.8 Å;但这不是“实验已被取代”,浅 MSA、依赖其他链塑形的蛋白以及具体生物状态仍可能出错。论文摘要与主文
这篇论文真正改变的,不是把某条传统流水线做得更快,而是让网络直接从序列证据走到原子坐标,同时给出逐残基可信度。最强证据来自事先不知道答案的 CASP14 盲测;最大风险则是:模型学到的是数据库里最可能出现的结构,不等于目标蛋白在任意配体、复合物、构象或细胞环境中的唯一真实状态。
问题
从序列到结构,为什么这么难
蛋白质是一串氨基酸,但功能往往取决于它折成的三维形状。论文写作时,实验界已测出约 10 万种独特蛋白质结构,相对于数十亿条已知序列仍只是很小一部分;单个结构的实验解析可能耗时数月到数年。论文摘要
困难不只是“序列很长”。相隔很远的两个残基,折叠后可能紧邻;局部选择会影响全局几何;配体、离子和其他蛋白链还会改变最终状态。传统路线大致有两类:物理模拟试图计算分子作用,但代价高且模型难以足够准确;进化路线利用同源结构和残基共变,却往往先预测距离等中间量,再靠手工流程拼出三维结构。论文指出,在没有近缘模板时,这些方法通常离实验精度仍很远。论文主文:Main 与 Related work
进化记录是一组“折叠约束”
如果两个位置在不同物种中经常协同变化,一个合理解释是:它们在三维结构里彼此影响。多序列比对(MSA)把许多同源序列按位置排齐,使这类信号可被模型读取。它不是结构答案,而是一组带噪声的约束:哪些残基可能靠近、哪些组合要相互兼容。
方法
Evoformer:让 MSA 与残基对持续对话
AlphaFold 的第一阶段叫 Evoformer。它并行维护两种表示:一张是“序列 × 残基”的 MSA 表,另一张是“残基 × 残基”的成对关系表。每个模块都让两者双向交换信息,而不是只在开头算一次共变。对残基对表示,模型围绕三元组做更新:若两个边的关系已知,它们会约束第三条边,从而鼓励整张关系网能对应同一个三维结构。论文:Evoformer
结构模块:直接生成原子坐标
第二阶段不再先画距离图再交给外部优化器,而是把每个残基暂时当成一个可移动、可旋转的局部刚体,用不变点注意力(IPA)在三维空间中更新它们,最终直接预测所有重原子的坐标与侧链角度。训练中的 FAPE 损失比较局部坐标系下的原子位置,使整体旋转或平移不会改变误差,同时强调残基间的相对几何。论文:End-to-end structure prediction
循环修正与自蒸馏
一次输出会被送回网络继续修正,这叫 recycling。消融实验表明,多种部件共同贡献精度,循环修正是重要来源之一。训练还加入自蒸馏:初始模型为 355,993 条 Uniclust30 序列生成结构,再筛选预测数据与 PDB 实验结构混合训练最终模型;最终采样比例为 75% 预测集、25% PDB 集。论文:训练方法
证据与局限
最强证据:CASP14 盲测
CASP 使用尚未公开的实验结构进行两年一次的盲测,能降低“见过答案”的风险。论文报告,在 87 个结构域 上,AlphaFold 的主链中位 r.m.s.d.95 为 0.96 Å(95% CI 0.85–1.16),次优方法为 2.8 Å(2.7–4.0);全原子误差为 1.5 Å,次优为 3.5 Å。作为直觉参照,论文给出的碳原子宽度约 1.4 Å。Nature 论文图 1 与正文 CASP14 官方结果
| 证据 | AlphaFold | 对照或范围 | 该怎样读 |
|---|---|---|---|
| CASP14 主链中位误差 | 0.96 Å | 次优 2.8 Å | 越低越好;覆盖误差最小的 95% Cα 原子 |
| CASP14 全原子中位误差 | 1.5 Å | 次优 3.5 Å | 主链准确时,侧链也可相当准确 |
| 训练截止日后的 PDB 全链测试 | 1.46 Å | n = 3,144 | 过滤近似训练模板后,结果仍能迁移到近期结构 |
| 逐残基可信度校准 | Pearson r = 0.76 | n = 10,795 | pLDDT 与真实局部精度相关,但不是实验验证 |
近期 PDB 测试的结构发布时间晚于训练截止日,过滤后 3,144 条蛋白链的全链主链中位误差为 1.46 Å;这补充了 CASP14,但仍来自 PDB 分布,并非所有天然环境。论文图 2
不能从这篇论文推出什么
- 不是蛋白质折叠动力学模拟。 它预测一个最可能出现在 PDB 中的结构,不告诉你真实折叠路径、速度或能量景观。
- 不是任意生物状态的唯一答案。 配体、离子、膜环境、突变和复合物伙伴可能改变构象;论文的主模型面向单链,并未证明可普遍解决异源复合物。
- 可信度不是实验真值。 pLDDT 是模型对局部准确度的估计;低值提醒谨慎,高值也不能替代功能实验、结合实验或结构测定。
- 序列证据不足会掉点。 当 MSA 的中位有效深度低于约 30 条序列时,准确度明显下降;超过约 100 后增益趋小。
- 跨链塑形是明确弱点。 若一条链自身接触少、结构主要由异源链接触决定,模型会更弱。论文:MSA depth and cross-chain contacts
实际意义
把它当作高质量假设生成器
合理用法是先问“这个结构是否足以推动下一步”,而不是问“它是否等于真相”。高可信区域可帮助提出突变位点、解释结构域、为分子置换或冷冻电镜密度拟合提供初始模型;低可信环区、结构域相对排布和潜在界面则应优先接受实验或其他证据检查。论文给出的单模型推理时间在 V100 GPU 上约为:256 残基 0.6 分钟、384 残基 1.1 分钟、2,500 残基 2.1 小时;序列库检索和最终松弛另需 CPU 时间,且内存使用随残基数近似二次增长。论文:Inference regimen
一套稳妥的阅读顺序
先看逐残基 pLDDT,找出可解释的稳定核心;再看跨残基或跨结构域的相对位置是否可靠;随后检查 MSA 是否足够深、是否存在配体、膜、异源链或多构象背景;最后把模型变成可证伪的问题,例如“突变这个界面残基是否降低结合”。这是基于论文证据的实践解释,不是作者给出的通用实验协议。
研究细节与核查问题
- 训练边界:PDB 训练结构最晚发布于 2018-04-30;模型约训练 1,000 万个样本,初始阶段用 128 个 TPU v3 核约一周,再以更长裁剪微调约四天。论文:Model training
- 评估口径:
r.m.s.d.95会剔除误差最大的 5% Cα 原子,因此比普通 RMSD 更稳健,但也可能隐藏那 5% 中的真实建模错误。论文:Metrics - 复现材料:论文提供补充方法、32 个伪代码算法和开源实现链接;正文所述 CASP14 系统与更早的 CASP13 AlphaFold 是完全不同的模型。论文补充信息与代码可用性
- 继续核查:目标是否有多个构象?可信度是否只在局部高、而结构域排布不确定?实验条件里是否有配体、离子、膜或伙伴链?结论是否依赖被
r.m.s.d.95排除的末端与柔性区?
一句话落点: AlphaFold 把“从序列猜结构”推进到了许多情况下可直接用于科研的精度,但最可靠的姿势仍是:把预测当作带置信度的结构假设,并让实验与生物上下文决定它能走多远。
关于这篇论文的三个关键问题
AlphaFold:高精度蛋白质结构预测 解决了什么问题?
蛋白质是一串氨基酸,但功能往往取决于它折成的三维形状。论文写作时,实验界已测出约 10 万种独特蛋白质结构,相对于数十亿条已知序列仍只是很小一部分;单个结构的实验解析可能耗时数月到数年。论文摘要
AlphaFold:高精度蛋白质结构预测 的核心结论有哪些证据?
CASP 使用尚未公开的实验结构进行两年一次的盲测,能降低“见过答案”的风险。论文报告,在 87 个结构域 上,AlphaFold 的主链中位 r.m.s.d.95 为 0.96 Å(95% CI 0.85–1.16),次优方法为 2.8 Å(2.7–4.0);全原子误差为 1.5 Å,次优为 3.5 Å。作为直觉参照,论文给出的碳原子宽度约 1.4 Å。Nature 论文图 1 与正文 CASP14 官方结果
阅读 AlphaFold:高精度蛋白质结构预测 时最需要注意什么局限?
CASP 使用尚未公开的实验结构进行两年一次的盲测,能降低“见过答案”的风险。论文报告,在 87 个结构域 上,AlphaFold 的主链中位 r.m.s.d.95 为 0.96 Å(95% CI 0.85–1.16),次优方法为 2.8 Å(2.7–4.0);全原子误差为 1.5 Å,次优为 3.5 Å。作为直觉参照,论文给出的碳原子宽度约 1.4 Å。Nature 论文图 1 与正文 CASP14 官方结果