返回报告库

AI / Technology

用 RFdiffusion 从零设计蛋白质的结构与功能

从预测到设计

图 1|RFdiffusion 改变的是问题方向:输入从完整序列变成随机骨架与少量设计条件,输出变成可继续配序列的新骨架。教学示意,依据论文图 1 与 Main。

  1. 方向变了: 结构预测是“给定序列,猜三维形状”;RFdiffusion 是“给定少量结构或功能要求,生成新的三维蛋白质骨架”。
  2. 做法很直接: 它从随机的三维残基位置与朝向出发,通常经过 200 次逐步去噪,得到骨架;ProteinMPNN 再为骨架设计氨基酸序列。
  3. 不只在电脑里好看: 团队合成并测试了数百个设计;其中流感血凝素结合蛋白 HA_20 的冷冻电镜结构与设计模型仅相差 0.63 Å。[来源:论文摘要;图 1;图 6g;Discussion]

三维残基框架如何逐步去噪成蛋白质骨架

生成时,系统从随机残基框架开始。每一步先预测最终干净骨架,再朝这个预测移动一点并保留合适噪声,通常重复 200 步;上一轮预测还会作为下一轮输入,这叫“自条件化”。早期结果不像蛋白质,随后可行结构范围逐渐收窄,最后形成连贯骨架。[来源:图 1a、1c;Main,第 120、126–127、131–133 段]

功能基序、结合热点和对称性三类条件控制

用户可以固定对称性、结合靶点、折叠类型或功能基序,让去噪轨迹朝要求靠拢。RFdiffusion 主要生成骨架,而 ProteinMPNN 通常为每个骨架采样 8 条序列。论文再用 AlphaFold2 检查序列是否高置信度地折回设计结构,最后才挑选候选做实验。[来源:图 1b;Main,第 128、130、134 段]

从骨架生成、序列设计、计算筛选到湿实验验证

  • 在 25 个功能基序支架基准题中,RFdiffusion 解出 23 个;Hallucination 解出 15 个,RFjoint Inpainting 解出 19 个。每题生成 100 个设计。[来源:图 4a;Main,第 188–191 段]
  • 团队为 5 个靶点各挑选 95 个结合蛋白做实验,整体命中率为 19%;所有靶点都有命中,部分候选未经进一步实验优化就达到纳摩尔亲和力。[来源:图 6;Main,第 246–249 段]
  • HA_20 与流感 H1 血凝素复合物的冷冻电镜图分辨率为 2.9 Å;实验结构与设计模型的骨架 RMSD 为 0.63 Å,这是“生成结果真的按设计折叠并结合”的最直接证据。[来源:图 6f–h;Main,第 251–254 段]

大量计算候选只有少数能通过实验检验

论文把 AlphaFold2 的单序列预测作为主要计算筛选器:平均 pAE 小于 5、整体骨架 RMSD 小于 2 Å,若含功能位点,该处 RMSD 还要小于 1 Å。这个标准与实验成功相关,但仍是代理指标;结合蛋白的 19% 命中率也说明多数送实验的候选没有达到论文定义的命中标准。[来源:Main,第 134–135、248 段]

研究附录

论文原题: De novo design of protein structure and function with RFdiffusion
作者: Joseph L. Watson、David Juergens、Nathaniel R. Bennett 等
发表于: Nature 620, 1089–1100(2023)
论文: https://www.nature.com/articles/s41586-023-06415-8

核心结论

三句话记住这篇论文

  1. 方向变了: 结构预测是“给定序列,猜三维形状”;RFdiffusion 是“给定少量结构或功能要求,生成新的三维蛋白质骨架”。
  2. 做法很直接: 它从随机的三维残基位置与朝向出发,通常经过 200 次逐步去噪,得到骨架;ProteinMPNN 再为骨架设计氨基酸序列。
  3. 不只在电脑里好看: 团队合成并测试了数百个设计;其中流感血凝素结合蛋白 HA_20 的冷冻电镜结构与设计模型仅相差 0.63 Å。[来源:论文摘要;图 1;图 6g;Discussion]

问题

一个形状要同时满足结构、功能和可制造性

蛋白质不是随便弯曲的线。每个残基都有三维位置和朝向,整条链还要能稳定折叠;若要结合靶点或承载催化位点,关键原子还必须落在准确位置。传统物理搜索面对的是巨大而崎岖的构象空间,早期深度学习扩散方法又常生成不够真实的骨架,所以电脑中的候选序列未必会折成目标形状,更未必有功能。[来源:Main,第 104–110、140 段]

旧方法要么条件太多,要么结果不够多

团队此前的 RFjoint Inpainting 能围绕已知功能片段补全骨架,但当输入约束很少时容易失败,而且单步、确定性的生成方式难以给同一问题提供多样解。Hallucination 方法可以搜索新设计,却在大体系上更慢,对高阶对称组装也受限。论文要解决的核心问题是:能否用一套通用模型,从很少的分子规格出发,稳定地产生许多不同、可实验验证的解?[来源:Main,第 109–111、157 段;Discussion,第 259 段]

方法

第一步:把 RoseTTAFold 改成三维去噪器

训练时,研究者从蛋白质结构数据库取真实结构,把每个残基表示成 Cα 坐标和 N–Cα–C 朝向,再逐步加入平移与旋转噪声。模型看到某个噪声阶段的结构后,学习预测原始干净结构。微调沿用了 RoseTTAFold 已学到的结构知识;从零训练的对照明显更差。[来源:图 1a;Main,第 123–125、133 段;图 2e]

第二步:从随机点云反复收拢成骨架

生成时,系统从随机残基框架开始。每一步先预测最终干净骨架,再朝这个预测移动一点并保留合适噪声,通常重复 200 步;上一轮预测还会作为下一轮输入,这叫“自条件化”。早期结果不像蛋白质,随后可行结构范围逐渐收窄,最后形成连贯骨架。[来源:图 1a、1c;Main,第 120、126–127、131–133 段]

第三步:条件控制骨架,另一个模型填写序列

用户可以固定对称性、结合靶点、折叠类型或功能基序,让去噪轨迹朝要求靠拢。RFdiffusion 主要生成骨架,而 ProteinMPNN 通常为每个骨架采样 8 条序列。论文再用 AlphaFold2 检查序列是否高置信度地折回设计结构,最后才挑选候选做实验。[来源:图 1b;Main,第 128、130、134 段]

证据与局限

三组结果支撑了通用性

  • 在 25 个功能基序支架基准题中,RFdiffusion 解出 23 个;Hallucination 解出 15 个,RFjoint Inpainting 解出 19 个。每题生成 100 个设计。[来源:图 4a;Main,第 188–191 段]
  • 团队为 5 个靶点各挑选 95 个结合蛋白做实验,整体命中率为 19%;所有靶点都有命中,部分候选未经进一步实验优化就达到纳摩尔亲和力。[来源:图 6;Main,第 246–249 段]
  • HA_20 与流感 H1 血凝素复合物的冷冻电镜图分辨率为 2.9 Å;实验结构与设计模型的骨架 RMSD 为 0.63 Å,这是“生成结果真的按设计折叠并结合”的最直接证据。[来源:图 6f–h;Main,第 251–254 段]

电脑筛选不是湿实验,湿实验命中也不是成药

论文把 AlphaFold2 的单序列预测作为主要计算筛选器:平均 pAE 小于 5、整体骨架 RMSD 小于 2 Å,若含功能位点,该处 RMSD 还要小于 1 Å。这个标准与实验成功相关,但仍是代理指标;结合蛋白的 19% 命中率也说明多数送实验的候选没有达到论文定义的命中标准。[来源:Main,第 134–135、248 段]

论文没有证明所有靶点都同样容易

结合实验主要覆盖论文所称的非极性位点;作者明确说,更极性的表面以及没有天然结合伙伴的位点仍需研究。6 个 IL-7Rα 高亲和候选在竞争实验中指向预期位置,但全蛋白质组范围的特异性尚未完整评估。大蛋白虽能生成到 600 个残基,超过约 400 个残基后也更难靠单序列结构预测可靠验证。[来源:Main,第 138、250 段;Discussion,第 263 段]

实际意义

它最适合扩大候选空间,而不是替代实验

对研究团队而言,RFdiffusion 的价值是把“先选一个天然骨架再慢慢改”扩展成“从约束直接生成许多骨架”。可输入的规格包括靶点热点、功能基序、拓扑和对称性;输出仍需序列设计、结构预测筛选、表达纯化、结合或功能测定。也就是说,它压缩了提出候选的成本,却没有取消实验闭环。[来源:图 1b;Main,第 186、236–249 段]

值得尝试的方向,也对应明确风险

结合蛋白、酶活性位点支架、金属结合组装体、对称纳米材料和疫苗支架都是论文已经展示的任务类型。产品层面的合理解读是:统一生成器可以服务多条研发管线;但候选排序、脱靶、免疫原性、表达产率和体内效果都不在这篇论文的完整证明范围内,不能从“结构吻合”直接跳到“临床可用”。[来源:论文摘要;Main,第 155–186 段;Discussion。后半句为基于论文验证范围的解读]

复现时先问这五个问题

  1. 条件输入是否精确到模型真正支持的坐标、热点、折叠或对称性格式?
  2. 是否把 RFdiffusion 骨架、ProteinMPNN 序列设计和 AlphaFold2 筛选分开记录?
  3. 计算成功阈值是否与论文一致,还是为了项目目标另行设定?
  4. 实验候选是否经过了会改变表观成功率的额外筛选?
  5. 最终结论依据的是预测、体外结合、结构测定,还是更接近实际应用的功能实验?

术语与核验线索

  • 残基框架: 用一个坐标和一个局部朝向描述氨基酸在三维空间中的位置。
  • RMSD: 两个三维结构对应原子之间的平均偏差;越小越接近,但它不等于功能保证。
  • 自条件化: 把上一轮对最终结构的预测送回模型,帮助下一步保持轨迹连贯。
  • 关键原文位置: 图 1(生成流程)、图 2(无条件单体与消融)、图 4(功能基序基准)、图 6(结合蛋白与 HA_20 结构)、Discussion(适用范围与未解问题)。

关于这篇论文的三个关键问题

用 RFdiffusion 从零设计蛋白质的结构与功能 解决了什么问题?

团队此前的 RFjoint Inpainting 能围绕已知功能片段补全骨架,但当输入约束很少时容易失败,而且单步、确定性的生成方式难以给同一问题提供多样解。Hallucination 方法可以搜索新设计,却在大体系上更慢,对高阶对称组装也受限。论文要解决的核心问题是:能否用一套通用模型,从很少的分子规格出发,稳定地产生许多不同、可实验验证的解?[来源:Main,第 109–111、157 段;Discussion,第 259 段]

用 RFdiffusion 从零设计蛋白质的结构与功能 的核心结论有哪些证据?

论文把 AlphaFold2 的单序列预测作为主要计算筛选器:平均 pAE 小于 5、整体骨架 RMSD 小于 2 Å,若含功能位点,该处 RMSD 还要小于 1 Å。这个标准与实验成功相关,但仍是代理指标;结合蛋白的 19% 命中率也说明多数送实验的候选没有达到论文定义的命中标准。[来源:Main,第 134–135、248 段]

阅读 用 RFdiffusion 从零设计蛋白质的结构与功能 时最需要注意什么局限?

论文把 AlphaFold2 的单序列预测作为主要计算筛选器:平均 pAE 小于 5、整体骨架 RMSD 小于 2 Å,若含功能位点,该处 RMSD 还要小于 1 Å。这个标准与实验成功相关,但仍是代理指标;结合蛋白的 19% 命中率也说明多数送实验的候选没有达到论文定义的命中标准。[来源:Main,第 134–135、248 段]

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro