返回报告库

AI / Technology

用语言模型在进化尺度预测原子级蛋白质结构

关于这篇论文的三个关键问题

用语言模型在进化尺度预测原子级蛋白质结构 解决了什么问题?

一个蛋白质的氨基酸会在进化中共同变化。如果两个位置经常一起变,它们在三维空间中可能彼此靠近。AlphaFold2、RoseTTAFold 等方法先在大型数据库中寻找相关序列,再把这些变化规律整理成多序列比对(MSA)。这条路线很准,但数据库搜索本身可能超过 10 分钟,而且每来一条新序列都可能重做一次。来源:正文“Accelerating accurate atomic-resolution structure prediction with a language model”,图 2

用语言模型在进化尺度预测原子级蛋白质结构 的核心结论有哪些证据?

在单张 NVIDIA V100 上,ESMFold 预测一个 384 个残基的蛋白质用 14.2 秒,比单个 AlphaFold2 模型快 6 倍;对更短序列,论文报告最高约 60 倍。这个对比还没有把传统路线可能超过 10 分钟的高灵敏度序列搜索算进去。来源:正文速度实验与图 S2

阅读 用语言模型在进化尺度预测原子级蛋白质结构 时最需要注意什么局限?

它没有证明预测结构就是唯一真实构象,也没有研究蛋白质动力学、配体、膜环境或细胞条件。ESMFold 也没有专门在蛋白质复合物上训练;在 2978 个近期多聚体复合物中,它只对 53.2% 的链对给出与 AlphaFold-Multimer 相同的 DockQ 定性类别。大规模图谱中的“新结构”还是从高置信度样本外推得到的估计,不能自动等同于新功能或实验发现。来源:图 S4、图 3、正文与结论

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro