细菌致病性依赖于多种毒力因子(virulence factors,VFs)。识别这些因子对于理解驱动细菌发病机制的分子机制以及确定抗毒力策略的潜在靶点至关重要。尽管VFs的鉴定已受到广泛关注,但仍缺乏从VF类别的角度进行预测。此外,大多数计算方法仅关注毒力蛋白的序列信息,忽略了空间结构信息。在此,研究人员提出了一种新颖的基于结构的双驱动图Transformer(Structure-based Dual-driven Graph Transformer,SDGT)框架,通过利用毒力蛋白的图数据结构以及由预训练蛋白质语言模型生成的序列表示来识别多种不同的VFs。通过在原子和残基水平上表示毒力蛋白,SDGT利用自注意力池化(self-attention pooling)自适应且全面地学习蛋白质结构的图表示。大量实验结果表明,SDGT显著提升了分类性能,在独立测试数据集上达到0.7623的准确率,优于其他基于序列和基于结构的方法。此外,对SDGT学习到的病原体VF特征进行的聚类分析证明了所提模型具有优异的特异性和相似性特征学习能力。当前分析表明,SDGT是识别VF类别的有效工具。
细菌的致病性依赖于多种毒力因子(virulence factors,VFs)的协同作用,识别并分类这些因子对于阐明细菌致病的分子机制和筛选抗毒力干预靶点具有关键意义。目前常用的VFs鉴定工具可分为比较基因组学方法和机器学习方法。比较基因组学依赖序列比对,只能识别保守的毒力基因,难以发现进化分歧较大的新基因;机器学习方法虽然具有较强的泛化能力,但大多基于手工设计的序列特征,深度学习方法则普遍只利用一维序列信息,忽略了蛋白质空间结构对功能决定的重要作用。因此,开发能够同时整合序列与三维结构信息的VFs分类方法具有重要的研究价值。
针对上述问题,研究人员提出了一种基于结构的双驱动图Transformer框架(Structure-based Dual-driven Graph Transformer,SDGT),用于毒力因子的多类别识别。通过将毒力蛋白分别建模为原子级和残基级图结构,并利用预训练蛋白质语言模型提取序列表示,SDGT能够自动学习具有判别性的蛋白质结构特征。在独立测试集上,SDGT的分类准确率达到76.23%,显著优于其他基于序列和结构的方法;特征聚类实验进一步验证了该模型对毒力因子类别特异性和相似性特征的学习能力。该工作为从结构视角研究毒力因子分类提供了有效工具,有望加速新毒力因子的发现及其功能机制研究。
为构建模型,研究人员从VFDB数据库收集毒力蛋白序列,经CD-HIT去冗余后形成基准数据集,并使用ESMFold预测蛋白质三维结构,ESM-2提取残基初始特征。在结构建模上,残基图通过比较残基Cα原子间距离(阈值4.5 ?)构建;原子图采用k近邻方法构建。随后,设计双驱动图Transformer,分别以残基和原子为节点,结合图卷积网络(GCN)和多头注意力机制学习局部与全局结构特征,并通过自注意力池化将两种尺度的表示融合,最后使用多层感知机进行分类。样本队列来源为VFDB数据库,独立二分类数据集VFDS1和VFDS2分别包含等量的正负样本。
以下为研究结果各部分的总结:
Evaluation metrics:研究人员采用准确率、加权精确率、加权召回率和加权F1作为评价指标,以适应类别不平衡。
Effects of parameters:通过调整自注意力池化掩码率、GCN层数和原子邻居数等参数,确定当掩码率M=0.7时模型性能最优,独立测试集准确率达到0.7623。
Evaluation of performance on the multi-classification task for VFs:独立测试集上的Acc为76.23%,Pre为79.94%,F1为73.67%;验证集上Acc为80%。模型对效应递送系统和免疫调节类别的敏感性较高。
Cross-system evaluation of model on effector delivery system recognition:通过将T3SS样本分别仅放入测试集和仅放入训练-验证集的交叉设置实验,验证了SDGT对不同分泌系统类型的泛化识别能力。
Ablation experiments:移除原子级驱动、位置编码或替换自注意力池化均导致性能下降,证实了关键模块的贡献。
Comparison with other methods on the multi-classification task for VFs:与GCN、GAT、GCN-Residual、GAT-Residual和CNN等基线相比,SDGT在Acc、Pre、Recall和F1上均取得最优结果,表明融合GCN与Transformer可同时捕捉局部和全局结构信息。
Comparison of SDGT with state-of-the-art VFs identification methods:在二分类任务中,SDGT在VFDS1上Acc达87.25%,在VFDS2上Acc达81.9%,优于BLAST、DeepVF等现有工具,证明其不仅可用于类别分类,也适用于从头(de novo)识别。
Interpretability of features:特征聚类显示SDGT能够捕捉属水平的特异性,如衣原体属(Chlamydia)在效应递送系统类别内形成亚群,军团菌属(Legionella)在运动性类别内形成亚群,且层次聚类中多个簇的类别纯度较高,说明模型具有较好的可解释性。
讨论部分指出,SDGT将毒力蛋白结构建模为图,通过双驱动学习原子和残基特征,有效提升了分类性能。未来可结合AlphaFold 3、ESMFold2和DeepAssembly等先进结构预测工具进一步拓展上游结构生成。当前模型仍存在原子级与残基级特征未交互学习的局限,且数据不平衡问题尚未完全解决。后续将针对特定类型毒力因子开展更精细的分类研究。研究结论可概括为:本研究表明SDGT是一种有效识别毒力因子类别的工具;综合研究结果表明,SDGT将在未来的毒力因子分类任务中成为一种高效且有效的工具。