
2026年7月22日,生物信息领域重要期刊BMC Bioinformatics在线发表了南京农业大学智慧农业学院(人工智能学院)计智伟教授课题组的题为“ProtSeqGen: a novel deep learning model for protein sequence design”的研究论文。在这项工作中,研究人员开发了一款名为ProtSeqGen的深度学习模型,可用于蛋白质序列的从头设计。

据悉,该团队成功研发了一种基于多阶段图架构的深度学习模型ProtSeqGen,可解决从蛋白质三维结构推断氨基酸序列的逆折叠问题(图1)。该模型采用了一种多阶段图学习架构。首先,它将输入的蛋白质结构转化为局部几何图,分别提取残基内部的几何特征和残基之间的相互作用特征;随后,通过消息传递神经网络(MPNN)对这些特征进行深度融合与优化,以精准捕获蛋白质的关键结构约束;最后,利用多层感知机解码优化后的特征,逐个位置预测最可能的氨基酸残基,从而实现结构到序列的精准映射。该模型为从指定三维结构逆向设计氨基酸序列提供了高精度的计算工具,有望为新型酶制剂、抗体药物及疫苗的AI辅助开发提供新的思路,加速其早期序列设计进程、减少实验试错成本。

图1. ProtSeqGen模型框架图
在性能评估中,ProtSeqGen与15种现有计算模型进行了对比,包括David Baker于2022年提出的ProteinMPNN,2023年Stan Li开发的PiFold,以及2024年Lai团队的GeoSeqBuilder。所有模型均在CATH 4.2数据集上进行训练,然后在标准测试集TS50和TS500上进行预测。表1显示,ProtSeqGen超越所有对比方法,获得了更高的序列恢复率(Recovery)和更低的困惑度(Perplexity)。
表1. ProtSeqGen在标准测试集TS50和TS500上的预测性能评价(meanSD)

此外,他们还选取了IDRome和TS45,评估ProtSeqGen预训练模型对于内在无序区域(IDRs)及无同源模板的自由建模(FM)靶点这两种高难度场景下的预测性能。结果表明,ProtSeqGen相比以往方法表现出更稳健的性能:它在IDR序列生成上取得显著提升,并且在TS45这类“即使所有方法都会因难度上升而性能下降”的极端基准中仍保持优势,说明其对结构约束的表达与迁移更可靠(表2)。
鉴于预训练数据(CATH 4.2)与无序区及无模板靶点存在分布差异,ProtSeqGen在IDRome-120和TS45上的初始表现仍然受限,为此他们实施了增量式微调,利用二次筛选的极端场景样本进行强化训练以弥补分布偏移。该策略效果显著,不仅将IDRome-120的恢复率从41.41%提升至47.89%、TS45的恢复率也升至51.75%,让模型成功“记住”了极端结构特征,显著增强了对结构不确定性和无同源模板靶点的泛化设计能力(表2)。
表2. ProtSeqGen在高难度场景数据集IDRome和TS45上的预测性能评价(meanSD)

最后,选取涵盖全α、全β、α/β、α+β及膜蛋白等不同结构类型的九个代表性蛋白,利用AlphaFold3验证了ProtSeqGen生成序列的结构保真度。其中,7个设计蛋白的序列恢复率超过50%,预测结构与天然结构平均误差RMSD仅为1.3Å,证明模型在复杂蛋白序列设计上的可靠性能和领先优势(图2)。

图2. ProtSeqGen的从头蛋白设计及结构预测结果。其中,天然结构显示为绿色,预测结构显示为红色。
综上所述,本研究提出的ProtSeqGen图学习框架,通过多尺度几何特征编码与主链构象强化建模,实现了高精度的结构引导蛋白质序列设计。
本文的第一作者为南京农业大学人工智能学院2023级硕士生高强(已毕业),通讯作者为计智伟教授。中国科学技术大学李志锦博士、哈尔滨工业大学邓阳博士参与了这项工作。UNC Chapel Hill的Weiling Zhao教授、UTHealth的Jiajia Liu助理教授为论文的撰写提供了宝贵建议。本项工作受到2025年国家外专项目、南京农业大学高层次人才科研启动费等经费支持。
原文链接:https://doi.org/10.1186/s12859-026-06482-4


点分享

点点赞

点在看