开云优惠体育网页版入口

开云优惠体育网页版入口:一种基于融合特征深度学习网络的抗炎肽识别方法

更新时间:2026-09-01
一种基于融合特征深度学习网络的抗炎肽识别方法 专利申请类型:发明专利;
地区:吉林-通化;
源自:通化高价值专利检索信息库;

专利名称:一种基于融合特征深度学习网络的抗炎肽识别方法

专利类型:发明专利

专利申请号:CN202410683127.1

专利申请(专利权)人:通化师范学院,吉林大学
权利人地址:吉林省通化市育才路950号

专利发明(设计)人:孙铭蔚,周柚,佘燕达,纪洪波,王艳辉,闫丽,王鏐璞,胡昊元,谢荟菊,王景宇

专利摘要:本发明适用于肽识别技术领域,提供了一种基于融合特征深度学习网络的抗炎肽识别方法,方法包括以下步骤:特征构建;两阶段特征选择,得到最终的信息性元特征;构建AIPPD模型,当预测值大于0.5时,视为AIP,否则视为Non?AIP。本发明提供了一种新的抗炎肽识别方法,解决了湿实验室实验方法鉴定AIP昂贵、费力和耗时等问题。该识别方法能够更全面的描述AIP的特征,与8个最先进的模型在两个基准数据集上进行比较,AIP2125和AIP4194测试数据集上的MCC(从5.5%提高到11.7%)和MCC(从6.7%提高到31.3%)的性能优越,在效率、准确度、精度和可靠性方面均取得了更好的效果。

主权利要求:
1.一种基于融合特征深度学习网络的抗炎肽识别方法,其特征在于,包括以下步骤:
步骤1、特征构建:从肽序列水平特征、肽的残基水平特征和肽转换器编码特征三方面构建特征;所述肽的残基水平特征包括Charge、Hydrophobicity和PaDEL,所述肽转换器编码特征包括Prot?T5和ESM?2;
步骤2、两阶段特征选择:第一阶段使用CatBoost、XGBoost和LightGBM三个分类器比较
18种编码特征的性能,按照性能高低筛选出8种推荐的编码特征;第二阶段使用Boruta作为滤波器对推荐的编码特征进行细粒度过滤,得到最终的信息性元特征,称为G2M特征;
步骤3、肽识别:构建两层集成框架的AIPPD模型,第一层包括RF和ET,输入为40个G2M特征;第二层为LR,输入为第一层输出;当预测值大于0.5时,将识别肽视为AIP,否则视为Non?AIP。
2.根据权利要求1所述的基于融合特征深度学习网络的抗炎肽识别方法,其特征在于,所述肽序列水平特征包括AAC和CTF。
3.根据权利要求1所述的基于融合特征深度学习网络的抗炎肽识别方法,其特征在于,所述肽的残基水平特征还包括AAindex1。
4.根据权利要求1所述的基于融合特征深度学习网络的抗炎肽识别方法,其特征在于,所述18种编码特征包括:Charge、Hydrophobicity、PaDEL、CTF、AAC、Prot?T5、AAindex1、ESM?2、GDPC、BPF、Cube、PAAC、QSO、GTPC、DPC、CTD、ATC和Peptide。
5.根据权利要求4所述的基于融合特征深度学习网络的抗炎肽识别方法,其特征在于,所述第一阶段的具体过程为:CatBoost、XGBoost和LightGBM三个分类器均利用ACC、SEN、SPE、F1、MCC、AP和AUC七个评价指标对18种编码特征的性能进行评价,照性能高低筛选出8组推荐的编码特征,分别为Charge、Hydrophobicity、AAindex1、PaDEL、Prot?T5、CTF、AAC和ESM?2。
6.根据权利要求1所述的基于融合特征深度学习网络的抗炎肽识别方法,其特征在于,所述第二阶段的具体过程为:Boruta通过随机排列每个特征的值来创建阴影特征,在包含原始特征及原始特征对应的阴影特征的数据集上训练随机森林模型,Boruta将每个原始特征的重要性与原始特征对应的阴影特征的重要性进行比较;若原始特征的重要性在统计上高于原始特征对应的阴影特征,则原始特征是重要特征,通过迭代过程,最终确认一系列一致且重要的特征,构成特征组,用于后续的肽识别。 说明书 : 一种基于融合特征深度学习网络的抗炎肽识别方法技术领域[0001] 本发明属于肽识别技术领域,尤其涉及一种基于融合特征深度学习网络的抗炎肽识别方法。背景技术[0002] 炎症在保护机体免受感染、损伤和疾病方面起着至关重要的作用。尽管急性炎症是一种必要的生理反应,有助于组织修复和免疫防御,但慢性炎症会导致各种疾。缱陨砻庖呒膊、心血管疾病和癌症。因此,制定有效的策略来调节炎症反应并减轻其有害影响至关重要。最近,人们对抗炎肽(AIP)作为潜在的治疗剂越来越感兴趣。肽由短氨基酸链组成,具有特异性、低毒性、易于合成等独特优势。抗炎肽是一种小的蛋白质片段,在调节机体的免疫反应和减少炎症方面起着至关重要的作用。这些肽显示出显著的治疗潜力,为治疗各种炎症状况提供了一条有希望的途径。通过靶向特定的免疫细胞和信号通路,抗炎肽帮助调节促炎分子的产生。[0003] 传统的肽筛选方法往往依赖于耗时、费力的实验,有必要寻找一种高通量的方法来识别抗炎肽。抗炎肽的识别需要综合考虑肽序列的多种特征,包括序列特征、空间结构特征以及化学分子式特征等。然而,传统的识别方法往往只关注其中一部分特征,导致识别精度和性能受限。在实际应用中,抗炎肽的序列和特征可能存在较大的差异,因此要求识别模型具有较强的泛化能力。为此提出一种基于融合特征深度学习网络的抗炎肽识别方法。发明内容[0004] 本发明的目的在于提供一种基于融合特征深度学习网络的抗炎肽识别方法,旨在解决上述背景技术中提出的问题。[0005] 为实现上述目的,本发明提供如下技术方案:[0006] 一种基于融合特征深度学习网络的抗炎肽识别方法,包括以下步骤:[0007] 步骤1、特征构建:从肽序列水平特征、肽的残基水平特征和肽转换器编码特征三方面构建特征;所述肽的残基水平特征包括Charge、Hydrophobicity和PaDEL,所述肽转换器编码特征包括Prot?T5和ESM?2;[0008] 步骤2、两阶段特征选择:第一阶段使用CatBoost、XGBoost和LightGBM三个分类器比较18种编码特征的性能,按照性能高低筛选出8种推荐的编码特征;第二阶段使用Boruta作为滤波器对推荐的编码特征进行细粒度过滤,得到最终的信息性元特征,称为G2M特征;[0009] 步骤3、肽识别:构建两层集成框架的AIPPD模型,第一层包括RF和ET,输入为40个G2M特征;第二层为LR,输入为第一层输出;当预测值大于0.5时,将识别肽视为AIP,否则视为Non?AIP。[0010] 进一步的,所述肽序列水平特征包括AAC和CTF。[0011] 进一步的,所述肽的残基水平特征还包括AAindex1。[0012] 进一步的,所述18种编码特征包括:Charge、Hydrophobicity、PaDEL、CTF、AAC、Prot?T5、AAindex1、ESM?2、GDPC、BPF、Cube、PAAC、QSO、GTPC、DPC、CTD、ATC和Peptide。[0013] 进一步的,所述第一阶段的具体过程为:[0014] CatBoost、XGBoost和LightGBM三个分类器均利用ACC、SEN、SPE、F1、MCC、AP和AUC七个评价指标对18种编码特征的性能进行评价,照性能高低筛选出8组推荐的编码特征,分别为Charge、Hydrophobicity、AAindex1、PaDEL、Prot?T5、CTF、AAC和ESM?2。[0015] 进一步的,所述第二阶段的具体过程为:[0016] Boruta通过随机排列每个特征的值来创建阴影特征,在包含原始特征及原始特征对应的阴影特征的数据集上训练随机森林模型,Boruta将每个原始特征的重要性与原始特征对应的阴影特征的重要性进行比较;若原始特征的重要性在统计上高于原始特征对应的阴影特征,则原始特征是重要特征,通过迭代过程,最终确认一系列一致且重要的特征,构成特征组,用于后续的肽识别。[0017] 与现有技术相比,本发明的有益效果是:[0018] 本发明提供了一种新的抗炎肽识别方法,解决了湿实验室实验方法鉴定AIP昂贵、费力和耗时等问题。该识别方法能够更全面的描述AIP的特征,该识别方法与8个最先进的模型在两个基准数据集上进行比较,AIP2125和AIP4194测试数据集上的MCC(从5.5%提高到11.7%)和MCC(从6.7%提高到31.3%)的性能优越,在效率、准确度、精度和可靠性方面均取得了更好的效果。附图说明[0019] 图1为AIP2125和AIP4194数据集中AIP和Non?AIP的氨基酸分布。[0020] 图2为18种编码特征由LightGBM、CatBoost和XGBoost评估的排名。[0021] 图3为18种编码特征的最终排名。[0022] 图4为meta(M)、group(G)和g2meta(G2M)特征在AIP4844验证数据集上的不同性能;a和b分别为使用随机森林(RF)和极度随机树(ET)评估meta(M)、group(G)和g2meta(G2M)特征的不同性能;其中,M表示18种编码特征中的元特征,G表示排名前8种编码的组特征,G2M表示组特征中的元特征。[0023] 图5为AIP4844验证数据集上AUROC和PROROC包括meta(M)、group(G)和g2meta(G2M)特征的比较;其中,M表示18种编码特征中的元特征,G表示排名前8种编码的组特征,G2M表示组特征中的元特征。[0024] 图6为本发明与现有方法在AIP2125数据集上的AUROC比较。[0025] 图7为本发明与现有方法在AIP4194数据集上的AUROC比较。[0026] 图8为本发明与现有方法在AIP2125数据集上的PRROC比较。[0027] 图9为本发明与现有方法在AIP4194数据集上的PRROC比较。具体实施方式[0028] 为了使本发明的目的、技术方案及优点更加清楚明白,以下结合附图及实施例,对本发明进行进一步详细说明。应当理解,此处所描述的具体实施例仅用以解释本发明,并不用于限定本发明。[0029] 以下结合具体实施例对本发明的具体实现进行详细描述。[0030] 实施例1、构建两个基准数据集;[0031] AIP2125是来自AIPpred的第一个数据集源的名称,AIP4194是来自AIPpred的第二个数据集的名称。AIP2125数据集的阳性和阴性肽来自免疫表位数据库。已经证明能够诱导以下任何抗炎细胞因子[IL?10、IL?13、IL?22、IL?1RA、TGFβ、IFN?α/β]的肽被归类为抗炎肽(AIP)或非抗炎肽(Non?AIP)。最后,AIP2125数据集包括1261个Non?AIP(阴性)和863个AIP(阳性)。为了便于模型训练和测试,将80%的AIP和Non?AIP肽随机分配到训练数据集中,剩下的20%构成测试数据集。因此,训练数据集包括690个AIP(阳性)和1009个Non?AIP(阴性),测试数据集包括173个AIP(阳性)和253个Non?AIP(阴性)。AIP4194数据集是通过从免疫表位数据库中提取阳性和阴性验证的线性肽来构建的。在人类和小鼠的t细胞检测中,阳性肽被鉴定为诱导任何抗炎细胞因子[IL?10、IL?4、IL?13、IL?22、TGFβ和IFN?α/β]的肽。阴性肽的特点是缺乏抗炎细胞因子的刺激。CD?HIT去除冗余肽,阈值为0.8。最后,获得了1678个AIP和2516个Non?AIP的非冗余数据集。此外,为了建立预测模型,随机选择80%的非冗余数据集(包括1258个AIP和1887个Non?AIP)作为基准数据集,而剩余的20%(420个AIP和629个Non?AIP)作为独立数据集进行测试。如表1所示:[0032][0033] 实施例2、氨基酸组成及位置偏好分析;[0034] 为了分析AIP(阳性)和Non?AIP(阴性)之间的氨基酸组成偏好,我们使用了dmslogoPython包。此包可以生成具有发布质量的序列徽标。由图1可知,我们给出了在四个训练数据集中观察到的组成差异。对于AIP2125数据集,发现氨基酸“A”和“G”在Non?AIP中更为普遍,而氨基酸“L”和“V”在AIP中富集。对于AIE4149数据集,发现氨基酸“L”和“A”在AIP和Non?AIP中均表现出富集现象。所以,氨基酸在不同数据集组成中的分布进一步证明:1)区分AIP是一项具有挑战性的任务,因为无法观察到明显的形成因素或规律性;2)仅从肽序列组成中提取的特征是不充分的,可能会混淆学习模型。因此,接下来的部分将比较更广泛使用的特性,并推荐与预测AIP最相关的特性。[0035] 实施例3、本发明一个实施例提供的一种基于融合特征深度学习网络的抗炎肽识别方法,包括以下步骤:[0036] 1、特征构建:从肽序列水平特征、肽的残基水平特征和肽转换器编码特征三方面构建特征。肽序列水平的特征对于理解蛋白质的组成、功能和相互关系至关重要。肽是氨基酸的短链,其序列决定了它们的特殊特性和用途。肽序列水平特征包含氨基酸组成编码特征(AAC)和联合三元编码特性(CTF)。肽残基水平特征利用氨基酸的分子描述符来描述肽序列。一个肽序列可以由20种氨基酸组成,不同的氨基酸可以用它们的分子指纹来表示。肽的残基水平特征包含基于残基电荷编码肽序列(Charge)、基于疏水性编码肽序列(Hydrophobicity)、分子描述特征编码表示(PaDEL)、氨基酸生化特征编码表示(AAindex1)。肽转换器编码特征可以从肽序列编码的预训练模型中得到。采用Prot?T5?xl?uniref50(Prot?T5)和进化尺度建模v2(ESM?2)两个预训练模型对肽序列进行自编码器模型编码。[0037] (1)氨基酸组成编码特征:氨基酸组成计算每个肽的氨基酸频率。AAC的计算方法如下:[0038][0039] 其中,i为20个氨基酸残基,ni为每个残基i出现的频率,N为序列中残基的总数。[0040] (2)联合三元编码特性:根据偶极子和侧链体积对20个天然存在的氨基酸进行聚类来修剪向量空间,从而为任何给定的蛋白质序列生成343维特征向量。蛋白质的联合三元CTF定义为该蛋白质中相应3?mer的归一化频率,例:[0041][0042] 其中,T是转置; ,ni是所有连续的三个残基的第i个三联体类型的出现次数,每个i(i=1,…,343),L代表氨基酸残基数。[0043] (3)肽的残基水平特征:每个氨基酸的电荷值在编码肽序列中起着至关重要的作用。通过给每个氨基酸分配特定的电荷值,研究人员可以深入了解肽的独特静电特性。各氨基酸的电荷值为:{A:6.11,C:5.07,D:2.77,E:3.22,F:5.48,G:5.97,H:7.59,I:6.02,K:9.74,L:5.98,M:5.74,N:5.41,P:6.3,Q:5.65,R:10.76,S:5.68,T:6.16,V:5.96,W:5.89,Y:5.66}。这些电荷值表明残留物获得或失去电子的能力,从而产生正电荷或负电荷。因此,根据每个氨基酸的电荷性质,可以将肽序列编码为载体。本发明首次引入利用各氨基酸的电荷值编码肽序列来区分抗炎肽和非抗炎肽,具有一定的促进作用。[0044] (4)基于疏水性编码肽序列:残基疏水性是编码肽序列的关键因素,它提供了关于肽及其周围环境之间相互作用的宝贵信息。为每个氨基酸分配疏水性值,可以探索肽的疏水性以及对其结构和功能特性的见解。氨基酸的疏水性的值分配如下:{A:1.8,C:2.5,D:?3.5,E:?3.5,F:2.8,G:?0.4,H:?3.2,I:4.5,K:?3.9,L:3.8,M:1.9,N:?3.5,P:?1.6,Q:?3.5,R:?4.5,S:?0.8,T:?0.7,V:4.2,W:?0.9,Y:?1.3}。因此,基于每个氨基酸的疏水性,肽序列可被编码为向量。本发明首次引入编码肽序列的每个氨基酸的疏水性,提供更好的信息来预测AIP。对于长度为L的肽序列,可以通过L维疏水性编码将其转化为向量。[0045] (5)分子描述特征编码表示:每个氨基酸的分子描述符由PaDELPy计算得到。PaDELPy最多可生成1875个描述符,包括1444个1维和2维描述符以及431个3维描述符。每个氨基酸的化学指纹可用于将氨基酸表示为具有1875个维度的向量。因此,长度为L的肽序列可以表示为一个1875维的向量,即L个氨基酸分子指纹图谱的总和。[0046] (6)氨基酸生化特征编码表示:AAindex1是一个数据库,总共有566种不同性质的氨基酸。因此,长度为L的肽序列可以编码到L×566维矩阵中。由于不同的肽长度不同,可以将每个氨基酸的理化性质相加,得到一个566维的肽序列向量。[0047] (7)肽转换器编码特征Prot?T5?XL?Uniref50(Prot?T5)编码特征表示:通过使用屏蔽语言建模的无监督训练,Prot?T5模型学会了预测蛋白质序列中缺失的氨基酸。因此,Prot?T5模型能够生成蛋白质序列的高信息量表示。对于长度为L的肽序列,Prot?T5模型将该肽序列编码为L×1024维的矩阵。为了拟合本发明的输入,编码矩阵求和,生成1024维向量。因此,对于任意长度的肽序列,将得到一个1024维向量。[0048] (8)肽转换器编码特征进化尺度建模v2(ESM?2)编码特征表示:ESM?2通过整合大规模的多个序列比对,捕获了蛋白质序列编码的进化信息,提高了预测蛋白质结构和功能的准确性。ESM?2的编码方法是将长度为L的肽序列表示为L×1280维的矩阵。编码矩阵沿着序列轴求和以产生1280维向量。无论肽序列的长度如何,本发明能够将任何长度的肽序列转换为恒定的1280维向量。[0049] 2、两阶段特征选择;[0050] 2.1、组特征通过多个机器学习模型进行排序;[0051] 电荷数(Charge)、疏水性(Hydrophobicity)、分子描述特征编码表示(PaDEL)、联合三元编码特性(CTF)、氨基酸组成(AAC)、肽转换器编码特征(Prot?T5)、氨基酸生化特征(AAindex1)、肽转换器编码特征进化尺度建模(ESM?2)、分组二肽组成(GDPC)、二元轮廓(BPF)、多肽体素化网格结构到三维网格表示(Cube)、伪氨基酸组成(PAAC)、准序列顺序(QSO)、分组三肽组成(GTPC)、二肽组成(DPC)、组成过渡分布(CTD)、原子和键组成(ATC)和肽(Peptide)。每种编码方法都可以将肽序列数字化为向量,称为群特征。[0052] 为了检验上述编码特征的有效性,本发明将AIP2125和AIP4194的训练数据集合并,得到4844个肽序列,其中包括1948个AIP和2896个Non?AIP,命名为AIP4844数据集。为了确定识别抗炎肽的最具信息量的编码技术,将AIP4844数据集分为两部分:AIP4844训练数据集和AIP4844验证数据集,分别分为80%和20%。[0053] 本发明识别抗炎肽是一个二分类问题,因此,采用了二分类问题中七个指标来评价模型的性能,分别为准确率(ACC)、灵敏度(SEN)、特异度(SPE)、F1?score(F1)、马修斯相关系数(MCC)、平均精度评分(AP)和ROC曲线下面积AUC。[0054][0055][0056] 其中,TP代表预测序列是抗炎肽实际序列也是抗炎肽,FP代表预测序列是抗炎肽实际序列是非抗炎肽,TN表示预测序列是非抗炎肽实际序列也是非抗炎肽,FN表示预测序列是非抗炎肽实际序列是抗炎肽。AUC代表了在不同分类阈值下,(FPR,TPR)坐标构建的曲线与坐标轴围成的面积值,AUC越靠近1表示模型性能越好,其中 、。AP代表了在不同分类阈值下 的平均值。[0057] 本发明采用CatBoost、XGBoost和LightGBM三个分类器,利用ACC、SEN、SPE、F1、MCC、AP和AUC七个评价指标对AIP4844数据集上18种编码特征的性能进行评价,为了对每个编码特征的性能进行排名,使用四个综合评价指标MCC、F1、AUC和AP的总和称为sumscore(SS),对性能进行排名。基于SS值,我们可以对每个编码特征的性能进行排序。[0058] 评价结果如图2所示。参见图2中a,通过LightGBM模型对18种编码特征重要性进行评估,根据等级分数由高到低依次为Charge(2.6403)、Hydrophobicity(2.5738)、Prot?T5(2.5407)、AAindex1(2.5371)、PaDEL(2.5314)、AAC(2.5121)、QSO(2.4807)、CTF(2.4773)、ESM?2(2.4706)、Cube(2.433)、GTPC(2.3819)、PAAC(2.3623)、DPC(2.342)、Peptide(2.324)、GDPC(2.3227)、BPF(2.3006)、ATC(2.235)、CTD(2.2096)。参见图2中b,通过CatBoost模型对18种编码特征重要性进行评估,根据等级分数由高到低依次为Charge(2.7042)、Hydrophobicity(2.6165)、AAindex1(2.5909)、CTF(2.5715)、PaDEL(2.5634)、ESM?2(2.5629)、Prot?T5(2.552)、Cube(2.5344)、AAC(2.5176)、QSO(2.4697)、PAAC(2.4488)、BPF(2.4079)、GTPC(2.4071)、DPC(2.379)、Peptide(2.3631)、CTD(2.3621)、GDPC(2.3242)、ATC(2.2933)。参见图2中c,通过CatBoost模型对18种编码特征重要性进行评估,根据等级分数由高到低依次为Charge(2.6735)、Hydrophobicity(2.6666)、AAindex1(2.5818)、PaDEL(2.5519)、Prot?T5(2.5298)、AAC(2.5281)、CTF(2.5116)、Cube(2.47)、ESM?2(2.4648)、AAC(2.4555)、QSO(2.4404)、BPF(2.4011)、CTD(2.399)、Peptide(2.3954)、DPC(2.3782)、GTPC(2.3713)、GDPC(2.3644)、ATC(2.3571)。[0059] 最终的组特征排名如图3所示,利用每个编码特征的平均排名来确定每个编码特征的重要性。最后,在多个模型评价的基础上,根据重要性得分由高到低选取Charge(1)、Hydrophobicity(2)、AAindex1(3.33)、PaDEL(4.66)、Prot?T5(5)、CTF(6.33)、AAC(7)和ESM?2(8)8种编码特征即排名前8种编码的组特征去识别AIP与Non?AIP。[0060] 2.2、采用Boruta策略对前8种编码特征进行元特征选择;[0061] 根据上述编码特征排序,发现Charge、Hydrophobicity、AAindex1、PaDEL、Prot?T5、CTF、AAC和ESM?2是识别AIP的信息。然而,在这些编码方法中,哪些特定的元特征有助于区分抗炎肽和非抗炎肽尚不清楚。为了进一步挖掘前8组编码方法中的元特征,有助于识别抗炎肽,本发明使用Boruta特征选择方法,将选择的8种编码特征创建一个1维向量。其次,Boruta算法对8种编码特征进行过滤,Boruta是一种特征选择算法,旨在识别数据集中最相关的特征。它在处理高维数据集时用处较大,其中特征的数量远远大于观测的数量。Boruta基于随机森林的思想,并使用包装器方法来评估特征的重要性。Boruta通过随机排列每个特征的值来创建阴影特征,这些阴影特征可以作为评估原始特征重要性的参考。在包含原始特征及其对应的阴影特征的数据集上训练随机森林模型,Boruta将每个原始特征的重要性与其阴影特征的重要性进行比较;若原始特征的重要性在统计上显著高于它的阴影特征,则认为它是重要的。通过迭代过程,最终确认40个G2M特征,被认为是识别抗炎肽的最相关的特征,构成特征组。[0062] 使用随机森林(RF)和极度随机树(ET)在AIP4844训练数据集上训练模型,评价结果如表2和表3所示。[0063][0064] 表2和表3种,M表示18种编码特征中的元特征,G表示排名前8种编码的组特征,G2M表示组特征中的元特征。[0065] 与8种编码特征和元特征(直接从Boruta的18种编码特征中筛选)相比,具有G2M特征的RF和ET模型具有更好的性能。而具有元特征的模型获得了更低的性能,特别是在MCC方面,具有G2M特征的RF和ET的性能分别提高了18.8%和15.9%,远远超过了元特征。在其他评价值上,具有G2M的RF和ET得分也较高。性能的提高表明,两阶段特征滤波策略自信地从类似海洋的特征空间中找到信息特征。为了显示差异,在图4中显示了比较后的性能。[0066] 此外,我们在AIP4844验证数据集上分别绘制了meta特征、top?8种编码特征和G2M特征的AUROC和PRROC,如图5所示。我们可以发现AUROC和PRROC,G2M特征曲线分别包裹了AIP4844验证数据集上的排序特征曲线,这表明G2M特征可以更准确地识别抗炎肽。[0067] 3、肽识别;[0068] 3.1、查找高性能元分类器;[0069] 通过上述特征的比较,可以确定G2M特征可以更有效地帮助识别抗炎肽。然而,哪种特定类型的计算模型适合于识别抗炎肽仍然不确定。因此接下来将探索和研究合适的分类器来预测抗炎肽。[0070] 将AIP2125和AIP4194的训练数据集合并,得到4844个肽序列,其中包括1948个AIP和2896个Non?AIP,命名为AIP4844数据集,与G2M过程相同。AIP4844数据集分为AIP4844训练数据集和AIP4844验证数据集。为了衡量机器学习池中每个模型的重要性,我们使用CatBoost来衡量其重要性。机器学习池包含LR、SVM、RF、ET、AdaBoost、GB、CatBoost、XGBoost、DNN、CNN1D和LSTM。在AIP过程的模型选择之后,我们得到了表4中列出的每个模型的平均重要值。[0071][0072] 从表4可以看出,ET、XGBoost、LightGBM和RF的重要性明显,平均重要性值分别为26.4、15.0、14.9和9.2。[0073] 此外,表5列出了机器学习池中每个模型的性能的比较结果。对于表5,使用MCC、F1、AUC和AP的总得分(SS)来衡量每种比较方法的性能。由表5的结果可以发现ET、RF和XGBoost的SS值分别为2.780、2.753和2.723,表现出更高的性能。因此,根据表4和表5,现在我们选择ET、RF和XGBoost作为分类器的元模型。[0074][0075] 3.2、构建AIPPD模型;[0076] 基于以上分类器的比较,可以发现ET、RF和XGBoost三种元分类器获得了更好的性能。然而,三种元分类器的哪种组合对识别AIP有积极的贡献尚不清楚。因此,我们构建了一个两层集成框架,第一层是分类器组合,第二层是逻辑回归。第一层旨在通过多个元分类器视图了解抗炎肽和非抗炎肽之间的区别。第二层是合并多个视图信息,学习最终的预测分数来识别AIP和Non?AIP。例如,[RF+ET]1+LR2,学习框架意味着第一层由随机森林(RF)和极度随机树(ET)两个元分类器组成,第二层由逻辑回归(LR)构建。此外,我们比较了ET、RF和XGBoost三个元分类器的组合性能。比较结果如表6所示。将MCC、F1、AUC和AP值相加,称为和分(sumscore,SS)来衡量不同性能的表现。[RF+ET]1+L2学习框架获得了更高的SS分数,[RF+ET+X]1+LR2与更多学习模型的组合并没有获得更好的表现。因此,在[RF+ET]1+LR2框架的基础上,最终构建了一个两层集成模型AIPPD来识别抗炎肽。[0077][0078][0079] 注:随机森林(RF)、极度随机树(ET)、XGBoost(X)和逻辑回归(LR)。[0080] 实施例4、与最现有方法进行性能比较;[0081] 表7和表8是本发明与AIPpred、predap、PEPred?Suite、AIEpred、iAIP、PredTP?Stack、PredTP?EL和PredTP?2L8种方法在AIP2125和AIP4194数据集上进行的比较。[0082][0083] 从表7和表8可以看出,SPE、SEN、ACC、MCC、F1、AUC和AP指标表现出较好的性能,此外,图6?图9展示本发明与其他方法的AUROC曲线和PRROC曲线的对比,可以看出本发明的曲线要高于且包裹于其他曲线,表明本发明具有更强的AIP识别能力。[0084] 由表7数据可知,本发明与其他8个最先进的方法在AIP215数据集上的马修斯相关系数MCC从5.5%提高到11.7%。由表8数据可知,本发明与其他8个最先进的方法在AIP4194数据集上的马修斯相关系数MCC从6.7%提高到31.3%。由以上对比结果可知,本发明的识别方法性能更优越,在效率、准确度、精度和可靠性方面均取得了更好的效果。[0085] 以上仅是本发明的优选实施方式,应当指出,对于本领域的技术人员来说,在不脱离本发明构思的前提下,还可以作出若干变形和改进,这些也应该视为本发明的保护范围,这些均不会影响本发明实施的效果和专利的实用性。

专利地区:吉林

专利申请日期:2024-05-30

专利公开日期:2024-07-23

专利公告号:CN118262801B


以上信息来自国家知识产权局,如信息有误请联系我方更正!
该专利所有权非本平台所有,我方无法提供专利权所有者联系方式,请勿联系我方。
电话咨询
到底部
搜本页
回顶部
开云优惠体育(中国)官网 — 开云优惠体育app下载