AI / Technology
用三轨神经网络准确预测蛋白质结构与相互作用
三条信息轨道总览
RoseTTAFold 的关键变化,是让模型同时处理三种互相牵制的信息:氨基酸序列、残基两两之间的距离与方向、以及蛋白质骨架的三维坐标。它不等前两种信息处理完才开始搭三维结构,而是在多层网络中反复交换信息。这样,三维结构里出现的问题可以反过来提醒模型重新理解序列和残基关系。(来源:正文“Network architecture development”,图 1A)
两轨与三轨的差别
论文讨论的两轨架构让序列信息和残基对信息来回交流,三维坐标则主要在后续结构模块中处理。RoseTTAFold 的作者据此提出一个具体问题:如果坐标也能从一开始参与交流,模型能否更早发现几何上说不通的判断?这是架构动机,不等于三轨一定在所有任务上胜过两轨。(来源:正文“Network architecture development”,图 1A、表 S1)
三轨反复交换并修正
可以把过程想成多人一起拼立体模型:序列轨道说“这两个位置经常一起变化”,二维轨道把它解释成“它们可能靠近”,三维轨道检查这种靠近能否形成合理骨架。若坐标不合理,几何信息再传回前两条轨道,下一轮重新权衡。论文称这种连续交换为三轨网络的“collective reasoning”。(来源:正文“Network architecture development”,图 1A)
从基准到实验应用的证据链
图 1B 比较了 CASP14 目标上的平均 TM-score;作者报告三轨 RoseTTAFold 明显强于团队此前基于 trRosetta 的自动化结果,并接近 DeepMind 在 CASP14 的水平。图 1C 又在 CAMEO 的中等和困难目标上做盲测,比较预测发布后才公开的实验结构。这里应注意:论文用“接近”而非“超过”描述与 AlphaFold2 的差距,而且当时 AlphaFold2 的完整方法尚未公开,比较条件并不完全对称。(来源:摘要;正文图 1B–C 及其说明)
能力边界与使用风险
三轨模型参数多、占用显存大,作者无法直接用完整大蛋白训练,只能从输入中抽取两段、合计 260 个残基的不连续片段,再汇总多个片段的预测。论文展示的是静态结构与若干相互作用案例,并未证明模型能可靠描述蛋白质运动、配体诱导变化或所有复合物界面。预测置信度也不是实验真值;关键结构细节仍需实验数据核对。(来源:正文“Network architecture development”;正文案例范围)
研究附录
官方题名: Accurate prediction of protein structures and interactions using a three-track neural network
作者: Minkyung Baek 等 · 期刊: Science 373, 871–876 (2021) · DOI: 10.1126/science.abj8754
主来源: Science 论文页 · PubMed Central 全文
核心结论
RoseTTAFold 的关键变化,是让模型同时处理三种互相牵制的信息:氨基酸序列、残基两两之间的距离与方向、以及蛋白质骨架的三维坐标。它不等前两种信息处理完才开始搭三维结构,而是在多层网络中反复交换信息。这样,三维结构里出现的问题可以反过来提醒模型重新理解序列和残基关系。(来源:正文“Network architecture development”,图 1A)
读完最值得记住三点:
- 不是多加一个输出,而是多开一条推理通道。 三维坐标会参与中间推理。
- 最有分量的证据不只是一组排行榜。 作者还把预测用于 X 射线晶体学、冷冻电镜和蛋白质复合物建模。
- 预测仍是结构假设。 大蛋白质受显存和裁剪策略限制,配体、环境变化和动态构象也不在这篇论文的证明范围内。
一句话说清贡献
这篇论文把“一维序列—二维关系—三维坐标”接成一个循环,让模型在形成结构的同时修正自己对序列和残基关系的判断。
问题
蛋白质序列像一串字母,但它的功能常取决于这串字母最后怎样折成三维形状。早期深度学习方法已经能从同源序列中找出共同变化的残基,并预测哪些残基靠近。难点在于:二维关系若判断错了,直到最后搭建三维结构时才暴露,前面的表示已经没有充分机会跟着修正。(来源:正文引言;参考文献 1–3)
两轨方法哪里受限
论文讨论的两轨架构让序列信息和残基对信息来回交流,三维坐标则主要在后续结构模块中处理。RoseTTAFold 的作者据此提出一个具体问题:如果坐标也能从一开始参与交流,模型能否更早发现几何上说不通的判断?这是架构动机,不等于三轨一定在所有任务上胜过两轨。(来源:正文“Network architecture development”,图 1A、表 S1)
这项工作继承了什么
它并非从零开始。论文明确把 AlphaFold、trRosetta 的深度学习结构预测作为基础背景,也采用多序列比对、注意力、端到端训练和 SE(3) 等变网络等思路。新意在于把三维坐标提升为与序列、残基对并行交换信息的第三条轨道。(来源:正文引言与“Network architecture development”;参考文献 1、3、6)
方法
三条轨道分别看什么
一维轨道读取目标序列及其多序列比对,从相似蛋白中寻找进化线索。二维轨道记录每一对残基可能的距离和方向。三维轨道维护蛋白质骨架坐标,并用对旋转和平移保持一致的 SE(3) 等变网络更新它。三条轨道之间有多处连接,所以任一轨道的新判断都能影响另外两条。(来源:图 1A;补充方法与图 S1)
一轮推理怎样改变下一轮
可以把过程想成多人一起拼立体模型:序列轨道说“这两个位置经常一起变化”,二维轨道把它解释成“它们可能靠近”,三维轨道检查这种靠近能否形成合理骨架。若坐标不合理,几何信息再传回前两条轨道,下一轮重新权衡。论文称这种连续交换为三轨网络的“collective reasoning”。(来源:正文“Network architecture development”,图 1A)
最后怎样得到结构
作者提供两条输出路径。其一把预测的距离与方向分布交给 pyRosetta,生成带侧链的全原子模型;其二把汇总后的特征交给最终的 SE(3) 等变层,直接输出骨架坐标。模型还给出逐残基的准确度估计。对超过 400 个残基的蛋白质,论文报告 pyRosetta 路径推理时可用 8 GB GPU,而端到端路径需要 24 GB GPU;前者还需额外 CPU 时间。(来源:正文“Network architecture development”)
证据与局限
结构预测是否真的更准
除了排行榜,它解决了哪些实际问题
作者把预测模型用于困难的 X 射线晶体学分子置换和冷冻电镜模型搭建,并报告若干此前难以求解的结构案例。论文还直接从序列生成蛋白质—蛋白质复合物模型,而不是先分别建模两个亚基再做对接;文中展示了 IL-12R/IL-12 等案例。对于未知结构的人类蛋白和 GPCR,作者用预测提出功能线索。这些结果说明模型能加快实验解释,但“帮助求解”不等于“取代实验验证”。(来源:正文结构求解、未知结构蛋白与复合物建模各节,图 2–4)
哪些结论暂时不能下
三轨模型参数多、占用显存大,作者无法直接用完整大蛋白训练,只能从输入中抽取两段、合计 260 个残基的不连续片段,再汇总多个片段的预测。论文展示的是静态结构与若干相互作用案例,并未证明模型能可靠描述蛋白质运动、配体诱导变化或所有复合物界面。预测置信度也不是实验真值;关键结构细节仍需实验数据核对。(来源:正文“Network architecture development”;正文案例范围)
实际意义
研究人员可以怎样用
最直接的用途,是在实验结构尚未完成时先获得可检验模型:为晶体学分子置换提供搜索模型、帮助在冷冻电镜密度中放置骨架、为未知蛋白提出功能位点假设,或先画出复合物界面的候选形状。论文同时开放了 Robetta 服务、源代码和参数,降低了外部团队复现和应用的门槛。(来源:摘要;“Data and materials availability”)
使用前先问哪三个问题
先看目标是否有足够的同源序列,因为模型的重要输入来自多序列比对。再看关心的是整体折叠还是精细局部;整体可信不代表侧链、界面或构象变化都可信。最后确认是否有独立实验信息可交叉验证。若结论会影响机制解释或实验设计,预测更适合作为优先级工具,而不是证据终点。
术语与核验线索
- 多序列比对(MSA):把目标蛋白与许多相似序列对齐,用共同变化寻找结构约束。
- 残基对表示:为每两个氨基酸位置保存距离、方向等关系线索。
- TM-score:比较两个蛋白质整体折叠相似度的指标,越接近 1 通常越相似。
- SE(3) 等变:把整个结构旋转或平移后,网络对坐标的更新会按同样方式变化。
- 建议核验:阅读原文图 1 看架构和盲测;图 2–3 看实验结构求解与未知蛋白;图 4 看复合物建模;表 S1 看架构消融。
关于这篇论文的三个关键问题
用三轨神经网络准确预测蛋白质结构与相互作用 解决了什么问题?
蛋白质序列像一串字母,但它的功能常取决于这串字母最后怎样折成三维形状。早期深度学习方法已经能从同源序列中找出共同变化的残基,并预测哪些残基靠近。难点在于:二维关系若判断错了,直到最后搭建三维结构时才暴露,前面的表示已经没有充分机会跟着修正。(来源:正文引言;参考文献 1–3)
用三轨神经网络准确预测蛋白质结构与相互作用 的核心结论有哪些证据?
作者把预测模型用于困难的 X 射线晶体学分子置换和冷冻电镜模型搭建,并报告若干此前难以求解的结构案例。论文还直接从序列生成蛋白质—蛋白质复合物模型,而不是先分别建模两个亚基再做对接;文中展示了 IL-12R/IL-12 等案例。对于未知结构的人类蛋白和 GPCR,作者用预测提出功能线索。这些结果说明模型能加快实验解释,但“帮助求解”不等于“取代实验验证”。(来源:正文结构求解、未知结构蛋白与复合物建模各节,图 2–4)
阅读 用三轨神经网络准确预测蛋白质结构与相互作用 时最需要注意什么局限?
作者把预测模型用于困难的 X 射线晶体学分子置换和冷冻电镜模型搭建,并报告若干此前难以求解的结构案例。论文还直接从序列生成蛋白质—蛋白质复合物模型,而不是先分别建模两个亚基再做对接;文中展示了 IL-12R/IL-12 等案例。对于未知结构的人类蛋白和 GPCR,作者用预测提出功能线索。这些结果说明模型能加快实验解释,但“帮助求解”不等于“取代实验验证”。(来源:正文结构求解、未知结构蛋白与复合物建模各节,图 2–4)