产学研创新服务平台(开云优惠体育网页版入口)
专利申请类型:发明专利;专利名称:一种基于双层生成对抗网络的对抗样本生成方法
专利类型:发明专利
专利申请号:CN202111249871.3
专利申请(专利权)人:中国电子开云优惠体育网页版入口集团公司第五十四研究所
权利人地址:河北省石家庄市中山西路589号第五十四所通信网信息传输与分发技术重点实验室
专利发明(设计)人:贺二路,焦利彬,贾哲,赵阳阳,吴巍
专利摘要:本发明提出了一种基于双层生成对抗网络的对抗样本生成方法,涉及人工智能安全领域。该方法采用第一层条件生成对抗网络、特征提取器、第二层生成对抗网络和目标网络;条件生成对抗网络用于生成新的样本,其鉴别器不但要分辨生成样本的真实性,还对其类别进行判定;特征提取器用于提取原始样本隐藏层特征,生成具有对抗先验的扰动;第二层生成对抗网络用于生成对抗扰动,鉴别器分析对抗样本的真实性及其与条件生成对抗网络生成样本的相似性;目标网络用于验证对抗样本的攻击成功率。本发明利用两层神经网络分别生成特定类别的样本和对抗扰动,能够实现利用特定类别对抗样本进行攻击和对抗训练的目的,有效提升攻击的成功率和对抗训练的效率。
主权利要求:
1.一种基于双层生成对抗网络的对抗样本生成方法,其特征在于,所述双层生成对抗网络包括第一层的条件生成对抗网络、第二层的生成对抗网络、特征提取器F以及目标网络C,第一层的条件生成对抗网络包括生成器G1、鉴别器D1,第二层的生成对抗网络包括生成器G2、鉴别器D2,其中生成器和鉴别器均为MLP多层感知机;所述特征提取器F为VGG模型,所述目标网络C为ResNet模型;
第一层的条件生成对抗网络的损失函数为:
L1=ExlogD1(x|c)+Ezlog(1?D1(G1(z|c)))其中,x|c,z|c表示联合输入,即,将c与x或z联合输入,c是指定生成的类别信息;E表示数据分布;
第二层的生成对抗网络的损失函数为:
其中,
用于保证样本xc与对抗样本 的相似性;LC=Exlc(xc+G2(F(x)),t)为攻击目标类别的损失,其中t为指定的攻击类别,lc为交叉熵函数,用于保证对抗样本攻击的成功率;E表示数据分布;
该方法包括以下步骤:
(1)将原始样本x、随机噪声z和类别标签c输入生成器G1,生成器G1根据原始样本和类别标签将随机噪声z拟合成新的图像样本xc;
(2)将样本xc输入到鉴别器D1,甄别其真实性和类别;
(3)通过特征提取器F提取原始样本的隐藏层特征F(x);
(4)将隐藏层特征F(x)输入到生成器G2,生成具有对抗先验的对抗扰动G2(F(x));
(5)将样本xc与对抗扰动G2Fx融合,得到对抗样本(6)将对抗样本输入到鉴别器D2,甄别其真实性和与xc的相似性;
(7)将对抗样本输入到目标网络C进行分类,验证其攻击成功率,保存攻击成功的对抗样本。 说明书 : 一种基于双层生成对抗网络的对抗样本生成方法技术领域[0001] 本发明涉及人工智能安全领域,特别涉及一种基于双层生成对抗网络的对抗样本生成方法。背景技术[0002] 随着人工智能技术的飞速发展,尤其是深度学习在图像识别、图像分类、自然语言处理等领域取得了重大的突破。目前,这些新技术已经应用在许多工程领域,深度学习在给人们带来便利的同时,其模型算法也存在着巨大的安全隐患。学者们提出,通过实验证明了深度卷积神经网络缺乏鲁棒性,攻击者可以根据不同模型的特点设计攻击方法影响模型的性能。[0003] 目前,深度神经网络面临的攻击方式以对抗样本为主,对抗样本是指在输入的干净数据中添加肉眼难以觉察的扰动所得到的扰动样本,该样本会导致模型以较高的置信度输出一个错误的结果。目前,针对深度模型的脆弱性,研究人员提出了多种解决思路,其中对抗训练是指在模型的训练阶段人为的加入对抗样本,让模型去学习对抗样本的特征,进而提高自身的鲁棒性和泛化能力。因此,需要根据深度神经网络模型的训练需要生成大量的对抗样本,并且因为训练任务和攻击任务的不同,生成特定对抗样本实现对抗训练或者攻击任务成为亟待解决的问题。发明内容[0004] 为了弥补对抗训练时对抗样本不足和解决生成模型无法生成特定类别图像的问题,本发明提供一种基于双层生成对抗网络的对抗样本生成方法,该方法通过双层生成对抗网络生成对抗样本,一方面提升扰动的对抗先验,另一方面,通过条件生成网络控制生成特定类别图像,然后在图像上添加基于隐藏层特征生成的扰动进而得到对抗样本。[0005] 为了实现上述目的,本发明采用的技术方案为:[0006] 一种基于双层生成对抗网络的对抗样本生成方法,所述双层生成对抗网络包括第一层的条件生成对抗网络、第二层的生成对抗网络、特征提取器F以及目标网络C,第一层的条件生成对抗网络包括生成器G1、鉴别器D1,第二层的生成对抗网络包括生成器G2、鉴别器D2,其中生成器和鉴别器均为MLP多层感知机;[0007] 该方法包括以下步骤:[0008] (1)将原始样本x、随机噪声z和类别标签c输入生成器G1,生成器G1根据原始样本和类别标签将随机噪声z拟合成新的图像样本xc;[0009] (2)将样本xc输入到鉴别器D1,甄别其真实性和类别;[0010] (3)通过特征提取器F提取原始样本的隐藏层特征F(x);[0011] (4)将隐藏层特征F(x)输入到生成器G2,生成具有对抗先验的对抗扰动G2(F(x));[0012] (5)将样本xc与对抗扰动G2(F(x))融合,得到对抗样本[0013] (6)将对抗样本输入到鉴别器D2,甄别其真实性和与xc的相似性;[0014] (7)将对抗样本输入到目标网络C进行分类,验证其攻击成功率,保存攻击成功的对抗样本。[0015] 进一步的,所述特征提取器F为VGG模型,所述目标网络C为ResNet模型。[0016] 进一步的,第一层的条件生成对抗网络的损失函数为:[0017] L1=ΕxlogD1(x|c)+Εzlog(1?D1(G1(z|c)))[0018] 其中,x|c,z|c表示联合输入,即,将c与x或z联合输入,c是指定生成的类别信息;E表示数据分布。[0019] 进一步的,第二层的生成对抗网络的损失函数为:[0020][0021] 其中,用于保证样本xc与对抗样本 的相似性;LC=Εxlc(xc+G2(F(x)),t)为攻击目标类别的损失,其中t为指定的攻击类别,lc为交叉熵函数,用于保证对抗样本攻击的成功率;E表示数据分布。[0022] 本发明与现有技术相比,取得的有益效果为:[0023] 1、本发明通过条件生成对抗网络的类别c引导模型生成特定的类别图像,然后添加扰动,实现特定对抗样本对目标模型的攻击。[0024] 2、本发明在生成扰动时输入样本的隐藏层特征,通过特征提取器得到隐藏层特征能够更好的表征样本的特点,基于隐藏层特征生成的扰动能够增加对抗先验,使得分类器对此类扰动更敏感,使得添加此类扰动的对抗样本能够显著提高攻击成功率。附图说明[0025] 图1为本发明实施例中对抗样本生成方法的流程图。具体实施方式[0026] 下面结合附图对本发明作进一步说明。[0027] 一种基于双层生成对抗网络的对抗样本生成方法,该方法利用两种生成对抗网络分别生成特定类别的样本和对抗扰动。具体来说,条件生成对抗网络用于生成特定类别的图像,传统的生成对抗网络无法对生成数据进行控制,当输入为两种以上类别时,生成对抗网络的生成器无法指定生成特定的图像,判别器也只是甄别生成图像的真伪,而不会对其进行分类。本方法通过条件生成对抗网络控制模型生成特定图像类别。通过向生成器输入辅助信息c,c为生成的类别标签,它对生成器的数据生成具有指导作用,条件生成对抗网络的损失函数如下所示:[0028] L1=ΕxlogD1(x|c)+Εzlog(1?D1(G1(z|c)))[0029] 其中,x为输入样本,c为类别标签,z为输入的随机噪声。在训练鉴别器D1时,不但要求生成真实的数据,而且需要满足c指定的类别,训练生成器G1时,也需要类别标签的引导生成指定的图像。[0030] 深度神经网络分类模型包括输入层,隐藏层和输出层,通过输入层输入样本后,通过隐藏层提取特征,不同的隐藏层神经元对应不同输入层的神经元的权重和自身偏置均不同,权重会影响神经单元对输入信息敏感程度,比如隐藏层的神经单元通过控制权重形成识别模式偏向,输出层的神经单元调整对隐藏层神经单元的权重,可以形成输出结果的偏向。输出层根据不同的隐藏层权重和自身偏执输出结果。分类器的判决结果取决于其对图像特征的分析,最后基于隐藏层向量进行分类决策,因此通过生成对抗网络生成对抗扰动时,输入隐藏层向量而不是图像本身,更容易产生对抗先验。[0031] 将原始样本x输入特征提取器F,得到隐藏层特征F(x)。将F(x)输入到生成器G2中生成对抗扰动G2(F(x))。将生成的样本xc与对抗扰动G(F(x))相融合得到对抗样本[0032] 得到对抗样本后,需要将对抗样本分别输入到鉴别器D2和目标网络C中,为了提升对抗样本的有效性,需要通过损失函数约束整个训练过程,对攻击者而言,需要对抗样本满足:(1)在输入到目标网络后能够具有较高的攻击成功率;(2)对抗样本添加的扰动不能被人眼所识别;(3)添加扰动前的样本与添加扰动后的样本相似度要尽可能高。[0033] 针对上述要求,本方法设计了如下损失函数:[0034][0035] 其中, 该损失函数为第二层生成对抗网络的损失函数,通过该损失函数训练生成器G2和鉴别器D2,保证生成对抗样本的有效性。 用于保证样本xc与对抗样本 的相似性;LC=Εxlc(xc+G2(F(x)),t)为攻击目标类别的损失,用于保证对抗样本攻击的开云优惠体育网页版入口率,其中,lc是交叉熵,t是要指定的攻击类别,如果攻击结果是t,那么就减小惩罚,反之增大惩罚。[0036] 本方法针对需要特定样本对目标网络进行攻击或需要特定样本提供对抗训练的问题,能够通过在条件生成对抗网络添加类别限制生成特定类别的图像。此外,通过在生成对抗扰动时,为了能够增加分类先验,通过特征提取器F对原始样本进行隐藏层特征提。俳藏层特征输入到生成对抗网络生成对抗扰动,通过该扰动生成的对抗样本能够更好的误导目标分类器,达到攻击或者对抗训练的目的。最后,分别针对攻击成功率,对抗样本与原始样本相似度和约束两层生成对抗网络的性能等提出了相应的损失函数,保证了对抗样本的有效性和真实性。[0037] 以下为一个更具体的例子:[0038] 一种基于双层生成对抗网络的对抗样本生成方法,如图1所示,包括第一层条件生成对抗网络的生成器G1和鉴别器D1,特征提取器F,第二层生成对抗网络的生成器G2和鉴别器D2和目标网络C。该方法包括以下步骤:[0039] (1)条件对抗生成网络根据类别标签c生成特定类别样本xc;[0040] (2)将样本xc输入到鉴别器D1,甄别其真实性和类别;[0041] (3)特征提取器F提取原始样本的隐藏层特征F(x);[0042] (4)将隐藏层特征F(x)输入到生成器G2生成对抗扰动G2(F(x));[0043] (5)将样本xc与对抗扰动G2(F(x))融合得到对抗样本[0044] (6)将对抗样本分别输入到鉴别器D2,甄别其真实性和与xc的相似性;[0045] (7)将对抗样本输入到目标网络C进行分类,验证其攻击成功率,保存攻击成功的对抗样本。[0046] 本方法中,条件生成对抗网络用于生成新的样本,传统生成对抗网络通过对数据分布进行采样,从而可以完全逼近真实数据,但是该方法过于自由,因此加入条件变量对其进行约束,本方法引入类别标签引导生成对抗网络生成特定类别的图像。生成器G1的输入包括原始样本x,噪声z和类别标签c,生成器G1根据原始样本和类别标签将噪声z逐渐拟合生成新图像样本,鉴别器D1不但要分辨生成样本xc的真实性,还需要对其类别进行判定,甄别生成的样本xc是否属于类别c。[0047] 特征提取器F用于提取原始样本隐藏层特征,F选用卷积神经网络,因此每一层的隐藏层网络都是一层图像特征,随着层数的加深,深层的卷积核关注感受野会越来越大,更加关注全局的抽象特征,这些特征能够有助于图像的分类,因此通过隐藏层特征可以用于增加扰动的对抗先验。[0048] 第二层生成对抗网络用于生成对抗扰动,将特征提取器F提取到的隐藏层特征输入到生成器G2,可以得到具有对抗先验的对抗扰动G2(F(x)),然后与G1生成的样本xc融合进而得到对抗样本 鉴别器D2分析对抗样本 的真实性及其与xc的相似性。[0049] 目标网络为对抗样本攻击的网络,通过将特定类别的对抗样本 输入到目标网络,使得目标网络将其误分类为t类。[0050] 总之,本发明采用第一层条件生成对抗网络、特征提取器、第二层生成对抗网络和目标网络;条件生成对抗网络用于生成新的样本,其鉴别器不但要分辨生成样本的真实性,还对其类别进行判定;特征提取器用于提取原始样本隐藏层特征,生成具有对抗先验的扰动;第二层生成对抗网络用于生成对抗扰动,鉴别器分析对抗样本的真实性及其与条件生成对抗网络生成样本的相似性;目标网络用于验证对抗样本的攻击成功率。本发明利用两层神经网络分别生成特定类别的样本和对抗扰动,能够实现利用特定类别对抗样本进行攻击和对抗训练的目的,有效提升攻击的成功率和对抗训练的效率,具有广泛的应用前景。
专利地区:河北
专利申请日期:2021-10-26
专利公开日期:2024-11-29
专利公告号:CN114120028B