学术动态 I 数学智能应用实验室在蛋白质同源复合物对称性预测研究取得新进展
信息来源:数学学院公众号 发布日期:2026年9月5日
近日,中国人民大学数学学院龚新奇教授数学智能应用实验室博士生翟嘉琪,联合北京雁栖湖应用数学研究院李京艳研究员、清华大学丘成桐数学科学中心丘成桐教授和中国人民大学数学学院龚新奇教授,提出了一种基于单条蛋白质序列预测蛋白质复合物结构对称性的深度学习模型——GLMYsymm。相关成果发表于国际生物信息学期刊 Briefings in Bioinformatics。
研究背景:蛋白质复合物的结构对称性与其组装方式、结构稳定性及功能密切相关。现有对称性识别方法多依赖蛋白质三维结构,部分序列驱动方法仍需要多序列比对信息。因此,如何仅从单条蛋白质序列中提取与复合物对称性相关的信息,是蛋白质计算中的重要问题。
研究方法:GLMYsymm 首次将持续 GLMY 同调(Persistent GLMY Homology)引入蛋白质序列特征提取。该方法根据不同氨基酸在序列中的位置关系构建随距离阈值变化的图结构,并利用持续 GLMY 同调提取序列拓扑特征;同时采用蛋白质语言模型 ESM2 提取序列语义特征,最终融合两类信息预测蛋白质复合物的对称性类别。
图1. GLMYsymm 整体框架
研究结果:实验结果表明,不同蛋白质复合物对称类别在持续 GLMY 同调特征上呈现出明显差异,说明单链序列中氨基酸的相对位置分布包含与复合物结构对称性相关的拓扑信息。消融实验进一步表明,在融合持续 GLMY 同调特征后比仅使用 ESM2 特征时模型有所提升,说明拓扑特征能够有效补充蛋白质语言模型所学习的序列信息。
研究团队进一步将 GLMYsymm 与 Seq2Symm 和 QUEEN 等现有序列驱动方法进行了比较。在统一数据条件下,GLMYsymm 的 Macro AUC-PR 相比两种方法均提升约 0.32。同时,在逻辑回归、随机森林、支持向量机和 XGBoost 等不同分类器中,引入持续 GLMY 同调特征后均获得性能提升,表明该拓扑特征具有较好的模型泛化性。
此外,研究团队选取多个未参与模型训练的蛋白质进行独立测试。对于 PDB ID 为 1KD7、4XGA 和 5BV5 的代表性蛋白质,GLMYsymm 的预测结果均与实验结构所反映的对称性或组装状态保持一致,进一步验证了模型的泛化能力。
图2. GLMYsymm 与现有方法的性能比较及代表性独立蛋白质预测结果。
该工作为从数学拓扑角度刻画蛋白质序列提供了新的方法,并在不依赖蛋白质三维结构和多序列比对的条件下实现了蛋白质复合物对称性预测,为蛋白质结构预测与组装方式研究提供了新的技术思路。
Copyright ©2016 中国人民大学科学技术发展部 版权所有
地址:北京市海淀区中关村大街59号中国人民大学明德主楼1121B 邮编:100872
电话:010-62513381 传真:010-62514955 电子邮箱: ligongchu@ruc.edu.cn
京公网安备110402430004号