返回报告库

AI / Technology

用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列

ProteinMPNN 把骨架翻译成序列

  1. ProteinMPNN 接收主链原子的三维坐标,逐个生成氨基酸;它做的是 AlphaFold 常见任务的反方向。
  2. 在天然骨架测试中,它恢复原序列的比例为 52.4%,Rosetta 为 32.9%;对 100 个残基的蛋白,单 CPU 生成所需时间为 1.2 秒,Rosetta 为 258.8 秒
  3. 真正有分量的证据来自实验:失败过的单体、环状复合物、纳米颗粒和结合蛋白被重新设计后,有一批能表达、组装并接近目标结构。

正向预测与反向设计的区别

蛋白质由一串氨基酸折叠而成。正向预测从序列猜结构;这里的反向设计则先定主链骨架,再找会折成它的序列。搜索空间会随长度迅速膨胀,而且表面疏水、错误聚集或另一个更稳定的形状,都可能让看似合理的序列失败。【来源:正文第 1 页;结论】

骨架图编码与序列解码

模型读取 N、Cα、C、O 和虚拟 Cβ 原子之间的距离,把残基当作节点、空间邻近关系当作边。编码器通过消息传递反复更新节点和边,让每个位置获得周围几何环境的摘要。加入这些原子距离并更新边后,单链测试的序列恢复率从基线 41.2% 提到 50.5%。【来源:正文第 1 页,表 1;图 1A】

固定功能位点与绑定对称位置

设计重复蛋白或多条相同链时,对称位置必须选同一种氨基酸。ProteinMPNN 会合并这些位置的预测分数,再统一采样,因此同一机制也能支持链内重复、链间对称和多状态约束。【来源:正文第 2 页;图 1C】

从计算候选到实验验证

研究者把 96 个原本大多不溶的 AlphaFold 幻觉骨架交给 ProteinMPNN 重写序列:73 个 可溶表达,50 个 呈目标单体或多聚状态,中位可溶产量从原方案的 9 mg/L 升至 247 mg/L。一个 130 残基单体的晶体结构与目标骨架相差 2.35 Å;另有 10 个环状同源多聚体接受晶体学或冷冻电镜结构检验。对 76 条、覆盖 27 个四面体纳米颗粒骨架的序列,13 个 形成预期约 1 MDa 的组装体,其中一个晶体结构与设计模型相差 1.2 Å。【来源:正文第 4–5 页;图 3A、3D、3K】

研究附录

官方题名: Robust deep learning–based protein sequence design using ProteinMPNN
作者: J. Dauparas 等|期刊: Science 378, 49–56 (2022)|DOI: 10.1126/science.add2187
一句话问题: 已知想要的蛋白质骨架,怎样快速找到一条真的会折成这个形状的氨基酸序列?

核心结论

三个最值得记住的结论

  1. ProteinMPNN 接收主链原子的三维坐标,逐个生成氨基酸;它做的是 AlphaFold 常见任务的反方向。
  2. 在天然骨架测试中,它恢复原序列的比例为 52.4%,Rosetta 为 32.9%;对 100 个残基的蛋白,单 CPU 生成所需时间为 1.2 秒,Rosetta 为 258.8 秒
  3. 真正有分量的证据来自实验:失败过的单体、环状复合物、纳米颗粒和结合蛋白被重新设计后,有一批能表达、组装并接近目标结构。

换个直观说法:骨架像一副已经搭好的立体钢架,氨基酸序列像要装上去的材料清单。ProteinMPNN 学的是“在这种局部几何环境里,哪种氨基酸最常合适”,再把整条清单依次补出来。它提升的是候选序列生成的速度与命中率,不等于只凭计算就证明蛋白一定能折叠或工作。【来源:正文摘要;正文第 1 页;结论】

问题

同一副骨架可能容纳许多序列,但多数候选并不可靠

蛋白质由一串氨基酸折叠而成。正向预测从序列猜结构;这里的反向设计则先定主链骨架,再找会折成它的序列。搜索空间会随长度迅速膨胀,而且表面疏水、错误聚集或另一个更稳定的形状,都可能让看似合理的序列失败。【来源:正文第 1 页;结论】

传统能量搜索强大,但常需要专家反复调规则

Rosetta 会在固定骨架上搜索低能量的氨基酸与侧链构象。问题是,它直接优化的是“这条序列在给定骨架上的能量”,而不是穷举并排除所有错误折叠或聚集状态。实际设计因此常要限制表面疏水残基、再用结构预测复核。ProteinMPNN 不显式计算所有这些能量,而是从 PDB 里的结构实例学习骨架与氨基酸的统计对应关系。【来源:结论;参考文献 11–12】

方法

先把每个残基和邻居连成一张三维关系网

模型读取 N、Cα、C、O 和虚拟 Cβ 原子之间的距离,把残基当作节点、空间邻近关系当作边。编码器通过消息传递反复更新节点和边,让每个位置获得周围几何环境的摘要。加入这些原子距离并更新边后,单链测试的序列恢复率从基线 41.2% 提到 50.5%。【来源:正文第 1 页,表 1;图 1A】

再按可变顺序逐位补全序列

解码器不是固定从左到右写序列,而是在训练时随机选择生成顺序。这样,设计者可以先把功能位点等已知氨基酸固定下来,再让模型利用它们作为上下文补齐其余位置。生成温度还能在“更保守”与“更多样”之间调节。【来源:正文第 1–2 页;图 1B;图 2D】

对称位置可以绑在一起共同决定

设计重复蛋白或多条相同链时,对称位置必须选同一种氨基酸。ProteinMPNN 会合并这些位置的预测分数,再统一采样,因此同一机制也能支持链内重复、链间对称和多状态约束。【来源:正文第 2 页;图 1C】

证据与局限

计算基准显示它更快,也更接近天然序列

在 402 个单体骨架上,ProteinMPNN 的天然序列恢复率为 52.4%,Rosetta 为 32.9%;对 100 个残基的设计,单 CPU 用时是 1.2 秒258.8 秒。在另一组测试中,单体、同源多聚体和异源多聚体的中位恢复率分别为 52%55%51%。这些数字说明模型学到了稳定的结构—序列对应,但“恢复天然序列”本身不是折叠成功的充分条件。【来源:正文第 2 页,图 2A–B;结论】

湿实验说明它不只会刷计算分数

研究者把 96 个原本大多不溶的 AlphaFold 幻觉骨架交给 ProteinMPNN 重写序列:73 个 可溶表达,50 个 呈目标单体或多聚状态,中位可溶产量从原方案的 9 mg/L 升至 247 mg/L。一个 130 残基单体的晶体结构与目标骨架相差 2.35 Å;另有 10 个环状同源多聚体接受晶体学或冷冻电镜结构检验。对 76 条、覆盖 27 个四面体纳米颗粒骨架的序列,13 个 形成预期约 1 MDa 的组装体,其中一个晶体结构与设计模型相差 1.2 Å。【来源:正文第 4–5 页;图 3A、3D、3K】

最大的不确定性:成功率不是一个统一数字

论文跨越多种任务,但每项实验的筛选入口、样本量和“成功”定义不同,不能合成一个普适命中率。原序列恢复率还会受晶体分辨率影响;单个关键突变也可能让蛋白不折叠,却几乎不改变总体恢复率。模型对训练分布之外的骨架、动态多状态蛋白和精细功能的可靠性,仍需逐项实验验证。深度学习的判断也不像物理能量项那样容易解释。【来源:结论;正文图 3–4;补充材料指引】

实际意义

把它放在“骨架生成”与“实验筛选”之间

一个实用流程是:先得到目标骨架,固定不能改变的催化或结合位点,再让 ProteinMPNN 批量生成并排序候选;随后用结构预测做计算复核,最后通过表达、组装、结合与结构实验淘汰失败者。它特别适合快速挽救已有骨架、设计对称装配体,以及在保留功能基序时重写周围序列。这是根据论文实验流程整理的使用建议,不是成功保证。【来源:图 3–4;结论】

它是候选生成器,不是实验的替代品

最稳妥的理解是:ProteinMPNN 大幅降低了“给骨架配序列”的计算和人工门槛,但没有消除实验。论文自己强调,计算指标可能与正确折叠不一致,序列设计最终必须靠实验表征。对安全敏感或具生物活性的目标,还需要额外的风险审查与功能验证。【来源:结论】

研究者核查清单

  • 数据切分按 CATH 分类进行,单链数据共 19,700 个高分辨率结构,训练/验证/测试为 80/10/10。【来源:正文第 1 页】
  • 最终模型在截至 2021 年 8 月 2 日的 PDB 蛋白质装配体上训练,结构分辨率优于 3.5 Å、总残基少于 10,000。【来源:正文第 2 页】
  • 骨架加噪声会降低精修晶体骨架上的原序列恢复率,却可提升对非原子级精确骨架的稳健性;这是明确的取舍。【来源:正文第 2–3 页;表 1;图 2C】
  • 代码归档见论文参考文献 21;主要证据和补充材料入口见论文 DOI 页面。【来源:数据与材料声明】

关于这篇论文的三个关键问题

用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列 解决了什么问题?

Rosetta 会在固定骨架上搜索低能量的氨基酸与侧链构象。问题是,它直接优化的是“这条序列在给定骨架上的能量”,而不是穷举并排除所有错误折叠或聚集状态。实际设计因此常要限制表面疏水残基、再用结构预测复核。ProteinMPNN 不显式计算所有这些能量,而是从 PDB 里的结构实例学习骨架与氨基酸的统计对应关系。【来源:结论;参考文献 11–12】

用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列 的核心结论有哪些证据?

在 402 个单体骨架上,ProteinMPNN 的天然序列恢复率为 52.4%,Rosetta 为 32.9%;对 100 个残基的设计,单 CPU 用时是 1.2 秒 对 258.8 秒。在另一组测试中,单体、同源多聚体和异源多聚体的中位恢复率分别为 52%、55% 和 51%。这些数字说明模型学到了稳定的结构—序列对应,但“恢复天然序列”本身不是折叠成功的充分条件。【来源:正文第 2 页,图 2A–B;结论】

阅读 用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列 时最需要注意什么局限?

论文跨越多种任务,但每项实验的筛选入口、样本量和“成功”定义不同,不能合成一个普适命中率。原序列恢复率还会受晶体分辨率影响;单个关键突变也可能让蛋白不折叠,却几乎不改变总体恢复率。模型对训练分布之外的骨架、动态多状态蛋白和精细功能的可靠性,仍需逐项实验验证。深度学习的判断也不像物理能量项那样容易解释。【来源:结论;正文图 3–4;补充材料指引】

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro