学术动态 I 数学智能应用实验室在蛋白质复合物识别方面取得新进展
信息来源:数学学院公众号 发布日期:2026年8月8日
近日,中国人民大学应用数学研究中心龚新奇教授数学智能应用实验室博士生黄逸翔、硕士生杨磊、龚新奇教授,联合北京理工大学生命学院硕士生王久东,提出了一种融合多组学信息与蛋白质结构信息的无监督蛋白质复合物识别框架——PCIPG 2.0。相关研究成果发表于国际生物信息学期刊 Bioinformatics。
研究背景
蛋白质通常以复合物形式协同完成细胞周期调控、信号传导和物质代谢等功能。然而,实验获得的蛋白质—蛋白质相互作用(PPI)网络普遍存在缺失与噪声,传统方法又多依赖网络连接关系,较少利用蛋白质三维结构所提供的物理约束。因此,如何从不完整互作网络中恢复可靠关系,并识别具有生物学意义的蛋白质复合物,是该领域的重要问题。
研究方法
PCIPG 2.0首先整合转录组、染色质相关数据和蛋白组信息,筛选原始PPI网络中可能遗漏的高置信度互作;随后利用ProteinMPNN和残基接触图提取结构感知的蛋白质表示,并与增强后的PPI网络共同输入图自编码器。模型通过零膨胀伯努利—指数分布分别刻画“互作是否存在”和“互作发生时的强度”,在不使用已知复合物标签的条件下学习潜在复合物成员关系。
图1. PCIPG 2.0整体框架:多组学信息用于补充潜在互作,残基级结构信息与增强后的PPI网络共同用于无监督复合物识别。
研究结果
研究团队在Collins、Krogan-core、Krogan14k、DIP和BioGRID五个常用酵母PPI数据集上,将PCIPG 2.0与ClusterONE、PC2P、PCGAN、AdaPPI、HGC和SPLP六种代表性方法进行比较。结果显示,PCIPG 2.0在五个数据集上的F-score和Accuracy均取得最佳表现,同时保持较为均衡的Precision和Recall。
图2. PCIPG 2.0与六种代表性方法在五个酵母PPI数据集上的性能对比。
进一步实验表明,多组学网络增强在五个数据集上均提高了F-score,在DIP和BioGRID等规模较大、噪声较高的网络上提升更明显。PCIPG 2.0预测复合物的Gene Ontology功能相似度显著高于随机蛋白质集合;对APC/C和26S蛋白酶体相关模块的文献分析及AlphaFold3多链建模,也为代表性预测的功能一致性和结构合理性提供了支持。
该工作为从不完整PPI网络中识别蛋白质复合物提供了新的计算工具,未来将进一步拓展至跨物种和条件特异性复合物,并结合实验验证新候选复合物。
Copyright ©2016 中国人民大学科学技术发展部 版权所有
地址:北京市海淀区中关村大街59号中国人民大学明德主楼1121B 邮编:100872
电话:010-62513381 传真:010-62514955 电子邮箱: ligongchu@ruc.edu.cn
京公网安备110402430004号