据9to5Mac报道,苹果研究人员近日公布名为SimpleDesign的人工智能模型,可在一次端到端训练中直接生成蛋白质的氨基酸序列和三维结构,目标是简化现有蛋白质协同设计流程。相关研究论文题为“SimpleDesign: A Joint Model for Protein Sequence and Structure Codesign”。

SimpleDesign延续了苹果研究团队去年9月发表的SimpleFold工作。SimpleFold研究题为“SimpleFold: Folding Proteins is Simpler than You Think”,使用流匹配模型从氨基酸序列直接生成蛋白质的三维结构。该模型把流匹配与通用Transformer模块结合,以减少蛋白质折叠模型通常采用的高计算成本技术,例如DeepMind的AlphaFold所使用的方法。

苹果研究人员在SimpleDesign中把这种简化、通用架构的思路扩展到更广泛的蛋白质设计问题。现有许多蛋白质设计模型采用多阶段训练:先训练自编码器把数据转换为潜在表示或离散标记,再在潜在空间中训练生成模型。研究团队假设这种多阶段训练并非获得高性能协同设计模型的必要条件。

SimpleDesign直接在数据空间中训练,学习从配对的氨基酸序列和三维坐标中生成蛋白质,而不是先把蛋白质结构压缩成单独的标记化表示。苹果研究人员使用超过200万对蛋白质序列和结构数据进行训练,这些数据主要来自AFESM数据集,该数据集结合了AlphaFold数据库中的预测结构和其他样本。

训练过程中,研究人员同时破坏每对数据的两部分:序列中的氨基酸被随机遮蔽,对应的三维结构则被加入噪声。他们还会改变两侧被破坏的程度。当序列基本完整而结构严重受损时,任务类似蛋白质折叠,模型需要从已知序列恢复结构;当结构基本完整而序列被大量遮蔽时,任务类似反向折叠,模型需要生成能产生给定结构的序列;当两者都被部分破坏时,模型学习同时处理两个问题,从而接受蛋白质协同设计训练。

根据该研究,SimpleDesign在蛋白质协同设计、结构生成和序列生成基准测试中取得了有竞争力的结果,尽管训练流程更简单。研究人员还发现,SimpleDesign能够生成合理的蛋白质结构,其产生的氨基酸序列总体上与大多数竞争性多模态模型相当或更好。

研究人员同时指出,SimpleDesign的结果仍限于计算机评估。生成的蛋白质没有经过实验测试,以确认它们是否真的能够在实际生物系统中折叠、发挥功能或安全表现。研究论文对SimpleDesign的架构、训练过程、基准和结果有更详细说明。