AI / Technology
用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列
ProteinMPNN 把骨架翻译成序列
- ProteinMPNN 接收主链原子的三维坐标,逐个生成氨基酸;它做的是 AlphaFold 常见任务的反方向。
- 在天然骨架测试中,它恢复原序列的比例为 52.4%,Rosetta 为 32.9%;对 100 个残基的蛋白,单 CPU 生成所需时间为 1.2 秒,Rosetta 为 258.8 秒。
- 真正有分量的证据来自实验:失败过的单体、环状复合物、纳米颗粒和结合蛋白被重新设计后,有一批能表达、组装并接近目标结构。
正向预测与反向设计的区别
蛋白质由一串氨基酸折叠而成。正向预测从序列猜结构;这里的反向设计则先定主链骨架,再找会折成它的序列。搜索空间会随长度迅速膨胀,而且表面疏水、错误聚集或另一个更稳定的形状,都可能让看似合理的序列失败。【来源:正文第 1 页;结论】
骨架图编码与序列解码
模型读取 N、Cα、C、O 和虚拟 Cβ 原子之间的距离,把残基当作节点、空间邻近关系当作边。编码器通过消息传递反复更新节点和边,让每个位置获得周围几何环境的摘要。加入这些原子距离并更新边后,单链测试的序列恢复率从基线 41.2% 提到 50.5%。【来源:正文第 1 页,表 1;图 1A】
固定功能位点与绑定对称位置
设计重复蛋白或多条相同链时,对称位置必须选同一种氨基酸。ProteinMPNN 会合并这些位置的预测分数,再统一采样,因此同一机制也能支持链内重复、链间对称和多状态约束。【来源:正文第 2 页;图 1C】
从计算候选到实验验证
研究者把 96 个原本大多不溶的 AlphaFold 幻觉骨架交给 ProteinMPNN 重写序列:73 个 可溶表达,50 个 呈目标单体或多聚状态,中位可溶产量从原方案的 9 mg/L 升至 247 mg/L。一个 130 残基单体的晶体结构与目标骨架相差 2.35 Å;另有 10 个环状同源多聚体接受晶体学或冷冻电镜结构检验。对 76 条、覆盖 27 个四面体纳米颗粒骨架的序列,13 个 形成预期约 1 MDa 的组装体,其中一个晶体结构与设计模型相差 1.2 Å。【来源:正文第 4–5 页;图 3A、3D、3K】
研究附录
官方题名: Robust deep learning–based protein sequence design using ProteinMPNN
作者: J. Dauparas 等|期刊: Science 378, 49–56 (2022)|DOI: 10.1126/science.add2187
一句话问题: 已知想要的蛋白质骨架,怎样快速找到一条真的会折成这个形状的氨基酸序列?
核心结论
三个最值得记住的结论
- ProteinMPNN 接收主链原子的三维坐标,逐个生成氨基酸;它做的是 AlphaFold 常见任务的反方向。
- 在天然骨架测试中,它恢复原序列的比例为 52.4%,Rosetta 为 32.9%;对 100 个残基的蛋白,单 CPU 生成所需时间为 1.2 秒,Rosetta 为 258.8 秒。
- 真正有分量的证据来自实验:失败过的单体、环状复合物、纳米颗粒和结合蛋白被重新设计后,有一批能表达、组装并接近目标结构。
换个直观说法:骨架像一副已经搭好的立体钢架,氨基酸序列像要装上去的材料清单。ProteinMPNN 学的是“在这种局部几何环境里,哪种氨基酸最常合适”,再把整条清单依次补出来。它提升的是候选序列生成的速度与命中率,不等于只凭计算就证明蛋白一定能折叠或工作。【来源:正文摘要;正文第 1 页;结论】
问题
同一副骨架可能容纳许多序列,但多数候选并不可靠
蛋白质由一串氨基酸折叠而成。正向预测从序列猜结构;这里的反向设计则先定主链骨架,再找会折成它的序列。搜索空间会随长度迅速膨胀,而且表面疏水、错误聚集或另一个更稳定的形状,都可能让看似合理的序列失败。【来源:正文第 1 页;结论】
传统能量搜索强大,但常需要专家反复调规则
Rosetta 会在固定骨架上搜索低能量的氨基酸与侧链构象。问题是,它直接优化的是“这条序列在给定骨架上的能量”,而不是穷举并排除所有错误折叠或聚集状态。实际设计因此常要限制表面疏水残基、再用结构预测复核。ProteinMPNN 不显式计算所有这些能量,而是从 PDB 里的结构实例学习骨架与氨基酸的统计对应关系。【来源:结论;参考文献 11–12】
方法
先把每个残基和邻居连成一张三维关系网
模型读取 N、Cα、C、O 和虚拟 Cβ 原子之间的距离,把残基当作节点、空间邻近关系当作边。编码器通过消息传递反复更新节点和边,让每个位置获得周围几何环境的摘要。加入这些原子距离并更新边后,单链测试的序列恢复率从基线 41.2% 提到 50.5%。【来源:正文第 1 页,表 1;图 1A】
再按可变顺序逐位补全序列
解码器不是固定从左到右写序列,而是在训练时随机选择生成顺序。这样,设计者可以先把功能位点等已知氨基酸固定下来,再让模型利用它们作为上下文补齐其余位置。生成温度还能在“更保守”与“更多样”之间调节。【来源:正文第 1–2 页;图 1B;图 2D】
对称位置可以绑在一起共同决定
设计重复蛋白或多条相同链时,对称位置必须选同一种氨基酸。ProteinMPNN 会合并这些位置的预测分数,再统一采样,因此同一机制也能支持链内重复、链间对称和多状态约束。【来源:正文第 2 页;图 1C】
证据与局限
计算基准显示它更快,也更接近天然序列
在 402 个单体骨架上,ProteinMPNN 的天然序列恢复率为 52.4%,Rosetta 为 32.9%;对 100 个残基的设计,单 CPU 用时是 1.2 秒 对 258.8 秒。在另一组测试中,单体、同源多聚体和异源多聚体的中位恢复率分别为 52%、55% 和 51%。这些数字说明模型学到了稳定的结构—序列对应,但“恢复天然序列”本身不是折叠成功的充分条件。【来源:正文第 2 页,图 2A–B;结论】
湿实验说明它不只会刷计算分数
研究者把 96 个原本大多不溶的 AlphaFold 幻觉骨架交给 ProteinMPNN 重写序列:73 个 可溶表达,50 个 呈目标单体或多聚状态,中位可溶产量从原方案的 9 mg/L 升至 247 mg/L。一个 130 残基单体的晶体结构与目标骨架相差 2.35 Å;另有 10 个环状同源多聚体接受晶体学或冷冻电镜结构检验。对 76 条、覆盖 27 个四面体纳米颗粒骨架的序列,13 个 形成预期约 1 MDa 的组装体,其中一个晶体结构与设计模型相差 1.2 Å。【来源:正文第 4–5 页;图 3A、3D、3K】
最大的不确定性:成功率不是一个统一数字
论文跨越多种任务,但每项实验的筛选入口、样本量和“成功”定义不同,不能合成一个普适命中率。原序列恢复率还会受晶体分辨率影响;单个关键突变也可能让蛋白不折叠,却几乎不改变总体恢复率。模型对训练分布之外的骨架、动态多状态蛋白和精细功能的可靠性,仍需逐项实验验证。深度学习的判断也不像物理能量项那样容易解释。【来源:结论;正文图 3–4;补充材料指引】
实际意义
把它放在“骨架生成”与“实验筛选”之间
一个实用流程是:先得到目标骨架,固定不能改变的催化或结合位点,再让 ProteinMPNN 批量生成并排序候选;随后用结构预测做计算复核,最后通过表达、组装、结合与结构实验淘汰失败者。它特别适合快速挽救已有骨架、设计对称装配体,以及在保留功能基序时重写周围序列。这是根据论文实验流程整理的使用建议,不是成功保证。【来源:图 3–4;结论】
它是候选生成器,不是实验的替代品
最稳妥的理解是:ProteinMPNN 大幅降低了“给骨架配序列”的计算和人工门槛,但没有消除实验。论文自己强调,计算指标可能与正确折叠不一致,序列设计最终必须靠实验表征。对安全敏感或具生物活性的目标,还需要额外的风险审查与功能验证。【来源:结论】
研究者核查清单
- 数据切分按 CATH 分类进行,单链数据共 19,700 个高分辨率结构,训练/验证/测试为 80/10/10。【来源:正文第 1 页】
- 最终模型在截至 2021 年 8 月 2 日的 PDB 蛋白质装配体上训练,结构分辨率优于 3.5 Å、总残基少于 10,000。【来源:正文第 2 页】
- 骨架加噪声会降低精修晶体骨架上的原序列恢复率,却可提升对非原子级精确骨架的稳健性;这是明确的取舍。【来源:正文第 2–3 页;表 1;图 2C】
- 代码归档见论文参考文献 21;主要证据和补充材料入口见论文 DOI 页面。【来源:数据与材料声明】
关于这篇论文的三个关键问题
用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列 解决了什么问题?
Rosetta 会在固定骨架上搜索低能量的氨基酸与侧链构象。问题是,它直接优化的是“这条序列在给定骨架上的能量”,而不是穷举并排除所有错误折叠或聚集状态。实际设计因此常要限制表面疏水残基、再用结构预测复核。ProteinMPNN 不显式计算所有这些能量,而是从 PDB 里的结构实例学习骨架与氨基酸的统计对应关系。【来源:结论;参考文献 11–12】
用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列 的核心结论有哪些证据?
在 402 个单体骨架上,ProteinMPNN 的天然序列恢复率为 52.4%,Rosetta 为 32.9%;对 100 个残基的设计,单 CPU 用时是 1.2 秒 对 258.8 秒。在另一组测试中,单体、同源多聚体和异源多聚体的中位恢复率分别为 52%、55% 和 51%。这些数字说明模型学到了稳定的结构—序列对应,但“恢复天然序列”本身不是折叠成功的充分条件。【来源:正文第 2 页,图 2A–B;结论】
阅读 用 ProteinMPNN 稳健地从骨架反向设计蛋白质序列 时最需要注意什么局限?
论文跨越多种任务,但每项实验的筛选入口、样本量和“成功”定义不同,不能合成一个普适命中率。原序列恢复率还会受晶体分辨率影响;单个关键突变也可能让蛋白不折叠,却几乎不改变总体恢复率。模型对训练分布之外的骨架、动态多状态蛋白和精细功能的可靠性,仍需逐项实验验证。深度学习的判断也不像物理能量项那样容易解释。【来源:结论;正文图 3–4;补充材料指引】