人工智能技术导论课件 第4章-对抗样本攻击与防御_第1页
人工智能技术导论课件 第4章-对抗样本攻击与防御_第2页
人工智能技术导论课件 第4章-对抗样本攻击与防御_第3页
人工智能技术导论课件 第4章-对抗样本攻击与防御_第4页
人工智能技术导论课件 第4章-对抗样本攻击与防御_第5页
已阅读5页,还剩108页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

对抗样本攻击与防御1第4章4.1对抗样本的基本原理4.2对抗样本攻击的分类4.2.1定向与非定向攻击4.2.2白盒攻击与黑盒攻击4.3对抗样本的防御4.4其它领域对抗样本4.4.1图对抗样本4.4.2文本对抗攻击与防御24.1对抗样本基本原理3对抗样本的基本原理对抗样本于2013年由Szegedy等人①提出,旨在数据集中通过故意添加细微的干扰所形成的输入样本,导致模型以高置信度输出一个错误的分类结果。例如,如果有一张图片被图像分类模型以57.7%的置信度识别为熊猫,攻击者通过对这张图片增加人类难以通过感官识别的细微改变后,肉眼看起来仍是一个熊猫,但该图像分类模型却以99.3%的置信度将其识别为长臂猿。“panda”57.7%confidence“gibbon”99.3%confidence“nematode”8.2%confidence①SzegedyC,ZarembaW,SutskeverI,etal.Intriguingpropertiesofneuralnetworks.arXivpreprintarXiv:1312.6199,2013.4深度学习模型的训练过程如下图所示,由和

求出损失函数,通过反向传播算法求出梯度并优化模型,不断减小损失函数的值,直到模型收敛。5对抗样本的基本原理一般来说对于一个训练好的模型,输入样本x即可得到预测结果y。假设有一个非常小的扰动使得下式成立,即模型的预测结果发生改变,那么就是一个对抗样本,构造的方式就称为对抗样本攻击。6对抗样本的基本原理以二分类问题为例,直观地解释对抗样本攻击的基本原理。如下图,一个通过DNN训练的模型f,得到一个分类超平面,生成对抗样本的过程就是在数据上叠加扰动,使其跨越超平面,将超平面一侧的红色数据识别为绿色数据。f7对抗样本的基本原理4.2对抗样本攻击的分类8对抗样本攻击的分类9定向与非定向攻击对抗样本攻击按照攻击后的效果可以分为定向攻击(TargetedAttack)以及非定向攻击(Non-TargetedAttack)。定向攻击:目的是将模型误导至攻击者指定的输出,如在图像分类时将所有的猫都识别为狗。当给出定向攻击的目标标签为狗时,构造相应的扰动附加到输入样本(猫)上使模型的预测结果为狗。定向攻击既要降低模型对输入样本真实标签的置信度,又要尽可能提升攻击者指定标签的置信度,因此攻击难度较大。10非定向攻击:的目的仅仅是将模型误导至错误的类别,而非某一指定的类别。如上一节中的案例,在分类任务中将熊猫识别为非熊猫的任意一类别即可。同样构造扰动并将其附加到输入样本(熊猫)上,使得模型的预测结果为非熊猫。非定向攻击只需要降低模型对于输入样本真实类别的置信度,因此攻击难度相对较小。白盒与黑盒攻击对抗样本攻击按照攻击环境可以分为白盒攻击(White-BoxAttack)和黑盒攻击(Black-BoxAttack)。白盒攻击:攻击者在已知目标模型所有知识的情况下生成对抗样本的手段。白盒攻击需要获取完整的模型结构,了解模型的结构以及每一层的具体参数,可以完全控制模型的输入,对输入数据甚至可以进行比特级别的修改。白盒攻击是构建对抗性样本的最简单方法,并且成功率最高,扰动最小。在实践中,白盒攻击的假设往往过于强大,因为生产中使用的底层模型通常对攻击者是隐藏的,白盒攻击是评估模型鲁棒性的最可靠方法,因为它们通常会导致最强的攻击,可用于评估系统在最坏情况下的性能。因此,模型开发人员可以使用白盒攻击来提供内部性能评估。白盒攻击实施起来较为容易,但是在多数场景下攻击者难以获得深度学习模型的内部知识,因此应用场景十分有限。11黑盒攻击:攻击者在不知道目标模型任何内部信息的情况下实施攻击的方法。黑盒攻击是把目标模型看作黑盒,不能获取模型的梯度信息以及输出的预测概率等任何信息,只能通过控制输入得到有限的输出来实施攻击。正因为不需要掌握相关的目标模型信息,因此黑盒攻击更容易在低控制权场景下部署实施。黑盒攻击示意图如下所示:12白盒与黑盒攻击对抗样本攻击技巧与思路

对抗样本攻击的核心在于如何产生使模型预测出错并尽可能小的扰动。根据产生扰动的方式不同,可以将对抗样本攻击的方法分为基于优化的攻击(Optimization-basedAttacks)、基于梯度的攻击(Gradient-basedAttacks)、基于迁移学习的攻击(Transfer-basedAttacks)以及基于查询的攻击(Query-basedAttacks)。13白盒与黑盒攻击基于优化的攻击方法主要指以CW为代表的使用优化器进行攻击的方法,通常在白盒攻击中使用。基于梯度的攻击方法主要指以FGSM为代表的直接对梯度进行符号化的方法,需要攻击者完全的了解模型,通常在白盒攻击中使用。基于迁移学习的攻击方法借助于对抗扰动的可迁移性,在替代模型上产生对抗扰动,并迁移到目标模型,常用于黑盒模型。基于查询的攻击方法一般需要请求目标模型得到输出,利用零阶优化等方式优化对抗扰动,常用于黑盒模型。14白盒与黑盒攻击常见攻击算法概括算法白盒/黑盒定向/非定向扰动范围攻击频次攻击方法L-BFGS白盒定向迭代优化FGSM白盒非定向单次梯度FGM白盒非定向单次梯度BIM(I-FGSM)白盒非定向迭代梯度ILCM白盒定向迭代梯度PGD白盒非定向迭代梯度MI-FGSM白盒定向/非定向/迭代梯度DeepFool白盒非定向/迭代梯度JSMA白盒定向迭代梯度CW白盒定向//迭代优化PBAAML黑盒定向/非定向/迭代迁移学习ZOO黑盒定向/非定向迭代查询OnePixelAttack黑盒定向/非定向迭代查询AutoZoom黑盒定向//迭代查询15白盒与黑盒攻击对抗样本扰动的衡量指标

在对样本进行攻击时,要保证添加的是微小的扰动,即不能被人类的感官察觉。这表明扰动不能改变样本数据本身的主体信息。扰动量是度量这种改变的重指标,它可以使用以下公式来定义:其中,表示范数,表示扰动像素点个数。在不同的对抗样本生成算法中,对于扰动量的设置通常需要满足某些范数的约束。16白盒与黑盒攻击当时,称为0范数攻击,又被称为单像素攻击,其物理意义为总共修改的数据像素点个数。这种方式只限制可改的数据点的总数,不考虑每个数据点的具体变化量。当时,称为1范数攻击,其物理意义为修改前后数据的曼哈顿距离。向量的范数为向量各个元素绝对值之和,即。该方式从全局的角度定义了攻击时数据的修改幅度。通常满足这一约束时,样本特征的修改幅度较小。当时,称为2范数攻击,其物理意义为修改前后数据的欧氏距离。向量的范数定义为向量各个元素平方和的开平方,即。该方式也是从全局的角度定义了攻击时数据的修改幅度。通常满足这一约束时,样本特征的修改比较均匀而且修改幅度较小。17白盒与黑盒攻击当时,称为无穷范数攻击,该方式以修改前后单个数据点的最大扰动量为基准。这意味着它会限制每个数据点的变化幅度,但会涉及更多的数据点。对于向量而言,正无穷范数就是向量的所有元素的绝对值中最大的元素,即

,而负无穷范数则是向量的所有元素的绝对值中最小的元素,即。18白盒与黑盒攻击1、FGSMFGSM(FastGradientSignMethod)即快速梯度算法,由Goodfellow等人①提出,是一种基于梯度的攻击算法。在对抗样本的开山之作中,作者认为对抗样本的产生是非线性和过拟合导致的,然而Goodfellow等人认为神经网络容易受到对抗性扰动的主要原因在于它们的线性特性,高维空间的线性性质足够产生对抗样本,并基于此提出了一种简单快速生成对抗样本的方法——FGSM。下面对其算法过程进行详细的介绍:①GoodfellowIJ,ShlensJ,SzegedyC.Explainingandharnessingadversarialexamples[J].arXivpreprintarXiv:1412.6572,2014.19白盒攻击算法(FGSM)白盒攻击算法需要获取模型的所有信息,虽然它的前置条件过于苛刻,但是经常被用来进行学术研究以及模型部署上线前的加固。假设线性模型的权重向量为,输入样本为,扰动量为,那么对抗样本可以用表示。权重向量和对抗样本的点积可以表示为。由此可见,对抗扰动导致输出增加了。当满足无穷范数约束时,即使不随着权重维数而增长(例如,固定),扰动所引起的变化也会随着维数增长而线性增长。假设权重向量有个维度,权重向量中元素的平均值为,那么输出值将增加,且会随着维度线性增长。因此,对于高维样本,即便在多轮迭代过程中每次都进行很小的扰动,其输出的结果变动也会非常大。深度神经网络都是非线性模型,但是其仍具有线性性质。LSTM、ReLU等均有意设计成表现出线性的方式;出于相同的原因,许多包含sigmoid激活函数的非线性模型也进行了仔细的调整,使其尽可能工作在非饱和、更线性的状态。20白盒攻击算法(FGSM)在梯度方向前一般会有超参数来控制攻击的强度,通过改变的大小来尽可能使扰动达到某一状态值。此时,分类器会产生分类错误,但是样本上的扰动仍然难以被人类肉眼所察觉。显然,带有超参数的梯度函数的取值只有,满足无穷范数约束。假设模型参数为,输入样本对为,则损失函数关于的梯度为,梯度方向可以表示为

为符号函数,其定义如下:21白盒攻击算法(FGSM)深度学习模型通过反向传播,计算得到梯度更新网络参数,使损失值逐步趋小。对于非定向攻击而言,只需要损失函数值越来越大,而不需要考虑被误分的类别。因此,只需要求出损失函数关于输入数据的梯度,在输入数据中加上计算得到的梯度方向即可以产生出线性对抗样本。这一过程可以表示为:22白盒攻击算法(FGSM)FGSM算法采用反向传播求解神经网络损失函数梯度,只需要更新一次梯度即可得到对抗样本,属于单次攻击,实施效率高但是对抗扰动的不可见性难以保证。其次,由于FGSM假设决策边界是线性的,因此在使用FGSM算法时,会对图像中的每个像素点都进行较大的变化。但是由于模型具有非线性的性质,决策边界通常也是非线性的,因此单次攻击得到的对抗样本成功率不高。对于上述提到的问题,Goodfellow①在2016年假设决策边界都是局部线性的,由此提出BIM与ILCM两种基于迭代的FGSM改进算法来解决上述问题。①KurakinA,GoodfellowI,BengioS.Adversarialexamplesinthephysicalworld[J].Artificialintelligencesafetyandsecurity,pp.99-112,

2016.23白盒攻击算法BIM算法(BasicIterativeMethod,有时也称为I-FGSM)的具体公式如下所示,具体来说就是以较小的步长执行多次FGSM算法,并在每一次之后都进行裁剪以保证生成的对抗样本在原始图像的邻域内。其中,表示将中的每个像素点都限制在的邻域内,其定义如下所示,其中表示输入图像,通常是三维张量,像素值范围为。24白盒攻击算法(BIM)BIM算法虽然将FGSM扩展为迭代形式,但本质仍属于非定向攻击,其应用于MNIST、CIFAR10等数据集能取得较好的效果,因为小数据集的类别较少而且类间差异较大。但是,在诸如ImageNet等大型图像数据集上,由于类别众多且类别上的显著度存在差异,可能会产生并不令人十分感兴趣的结果。例如,将一头非洲象分类为亚洲象,而令人感兴趣的结果可能是将这头非洲象分类为河马或者其他一些完全不同种类的动物。针对BIM算法无法准确共计大型数据集的问题,作者引入ILCM(IterativeLeast-likelyClassMethod)算法。25白盒攻击算法(BIM)首先用训练好的模型进行预测,将最不可能的类别用作定向攻击类别,因为它与真实类别的差距很大。为了制作能被误分为的对抗样本,需要沿着方向进行迭代,从而最大化。当模型损失函数为交叉熵损失时,这等价于。因此ILCM算法如下所示:若在攻击之前,首先对原始样本在范围内进行随机扰动,然后才开始迭代,此时即PGD①算法。①MadryA,MakelovA,SchmidtL,etal.Towardsdeeplearningmodelsresistanttoadversarialattacks[J].arXivpreprintarXiv:1706.06083,2017.

26白盒攻击算法(ILCM)IterativeLeast-likelyClassMethodKurakin等人在ImageNet数据集的所有50,000个验证图像上进行了实验验证。实验使用预训练的Inceptionv3分类器在不同扰动设置下计算不同对抗样本攻击算法的Top-1和Top-5准确率(越小越好)。实验中的扰动取值范围为[2,128]。当扰动较小时,BIM的攻击效果比FGSM好,ILCM的攻击效果最好,并且最快达到收敛。当扰动较大时,FGSM和ILCM效果相当,但此时攻击样本上具有很大的扰动,可能会被发现。27白盒攻击算法-FGSM类对比Top-1准确率是指模型所预测的结果,按概率排名处于第一的类别是否就是样本的真实类别。Top-5准确率是指模型所预测的结果,按概率排名处于前五的类别是否有样本的真实类别。在现实环境中,攻击者打印出图片直接对准相关输入设备(如摄像头)或者拍照上传对抗样本图像也是一种常见操作。由于受到拍照光线、摄像头位置、相机分辨率等影响,这些操作都会向图片引入噪声,造成攻击者千方百计在图像中添加的微小干扰被破坏。Kurakin等人直接对对抗图片进行拍照,让模型对拍照结果进行分类,观察被照相机拍照后是否还具有对抗效果。实验结果显示,ILCM生成的对抗样本经过拍照打印后仍然具有攻击性。Kurakin等人把这种感光设备采集图像中引入噪声的过程叫做“照片转变”(phototransformation)。相关的“转变”还包括打印图片和裁剪(cropping)图片。这些转变可以看成是改变对比度和亮度、高斯模糊、高斯噪声等操作的合成。通过研究这些“转变”对于对抗样本的作用可以发现,这些“转变”均会在一定程度上损失对抗样本的对抗性。FGSM所受的影响相对比较小,因为FGSM的扰动较大;BIM和ILCM所受影响比较大,因为它们的扰动值更小,扰动容易遭到破坏。28白盒攻击算法-FGSM类对比2、CWCW算法是一种基于优化的对抗样本生成算法,由Carlini和Wagner提出①。假设输入样本为,扰动量为,为距离函数,为模型分类结果,为定向攻击标签。理想的对抗样本应满足两个条件:①对抗样本与对应的干净样本差距越小越好,即扰动量尽可能小;②对抗样本应使模型分类错误,且错分的概率越高越好。因此可以将该类问题表述为一个带有约束的最优化问题,如下:注:这里的[0,1]是指使用范数时变化范围为[0,1]而不是[0,255]①CarliniN,WagnerD.Towardsevaluatingtherobustnessofneuralnetworks[C]//2017IEEESymposiumonSecurityandPrivacy(SP),2017:39-57.29白盒攻击算法-CW然而由于

是高度非线性的,现有算法难以直接求解上式,所以需要选择一种更合适的优化表达方式。定义一个目标函数,当且仅当时,。对于可用的选择在下式中给出:30白盒攻击算法-CW式中表示定向攻击标签;表示;表示当神经网络输入为时,输出类别是的概率;表示SoftMax层前的输出,即;为交叉熵,。下面选个例子解释含义:对于函数,表示除类别以外,模型认为最有可能属于,此时,,因此可以认为攻击成功。由此可以将优化问题改写为下式:31白盒攻击算法-CW将约束条件转为目标函数,并且令距离度量函数为范数,可以得到下式。第一项表示对抗样本要尽可能接近原始样本,第二项表示要提高错分的概率。当时,上式与该式等价。32白盒攻击算法-CW对于的选择:其中是一个惩罚因子,用于权衡目标和约束的重要性,类似于正则化,论文通过二分查找法来选择合适的

,下图是

的敏感度,可以看出在约束和目标函数的前提下,当

,攻击成功率很低。在时,攻击的成功率大幅提升,但是对抗样本和原始样本的距离也迅速变大(对抗的有效性降低)。33白盒攻击算法-CW为了能够生成有效的图片,对于扰动也存在约束,即必须保证对所有的样本,使。在优化问题中,这被称为盒约束(boxconstraints)。为了解决这类优化问题,引入了一个新的变量,将对变量的优化转变为对的优化。此时,对抗样本的表示转变为:因为的值域为,此时上式中对抗样本的取值就为,满足约束条件。此外,这样的转化也允许使用其它不支持盒约束的算法进行优化。这里使用变量来代替原来的样本是为了将样本映射到空间,这样便可在范围内变换,更有利于优化。34白盒攻击算法-CW经过上述讨论,可以得到CW的范数攻击定义式,给定样本

选择一个目标标签,搜索使下式成立,其中,是对所作的修改,增加了可以控制误分类发生的置信度。越大模型越分类错误的概率也越大。这保证了生成的对抗样本能够以较高的置信度被误分为类。得出后便可得到对抗样本。35白盒攻击算法-CW实验结果(MNIST与CIFAR数据集):实验结果(ImageNet数据集):36白盒攻击算法-CW黑盒攻击算法黑盒攻击需要在攻击者不知道目标模型任何内部信息的情况下来实施攻击。在之前介绍的MI-FGSM,ILCM等白盒攻击算法也被用于黑盒攻击,但是在黑盒攻击场景中的成功率较低。本节将介绍几种在完全不知道目标模型内部信息条件下设计的算法,它们更加适用于黑盒攻击场景。其具体分类如下图所示:37基于查询的攻击算法:需要构造数据集输入目标模型中,查询其输出,根据输出构造对抗样本。根据是否需要得知目标模型置信度级别的输出,可以将基于查询的攻击算法分为基于决策边界的攻击算法以及基于得分的攻击算法。基于迁移学习的攻击算法:不用去查询黑盒模型,首先训练替代模型使其与目标模型的输出近似,然后在替代模型上得到对抗样本并迁移到目标模型上,这些方法都是采用不同的思路放大对抗样本的可迁移性。38黑盒攻击算法1、PBAAML尽管部分白盒算法被尝试用于黑盒攻击,但是准确率不高,对此,Papernot等人①提出了一种基于迁移学习的黑盒攻击算法,其核心思想是在替代模型上得到对抗样本,利用对抗样本的可迁移性将其迁移到目标模型上。下面将该算法简称为PBAAML(PracticalBlack-boxAttackAgainstMachineLearning)①PapernotN,McDanielP,GoodfellowI,etal.Practicalblack-boxattacksagainstmachinelearning[C]//Proceedingsofthe2017ACMonAsiaConferenceonComputerandCommunicationsSecurity.2017:506-519.实现PBAAML首先需要收集少量的标记良好的数据作为初始训练集。例如,原始模型用于分类手写体数字,则攻击者需要准备少量的0-9手写标注图片,即每个类别少量标注样本。这小数据集的分布无需与目标模型的训练集分布一致。39黑盒攻击算法-PBAAML在理想情况下,如果能对输入空间所有的样本都进行查询,会更有助于所选择的替代模型后续学习到与目标模型更相似的决策面。然而,这在现实情况下通常不可行。为此,作者引入了启发式方法对输入空间进行探索。具体来说,使用雅可比矩阵得到输出关于输入的变化方向,其中为雅可比矩阵,表示目标模型输入为时的预测标签,表示输出关于输入的梯度。求出该值后,根据模型输出的变化方向合成数据,其中为系数,表示在变化方向上采取的步长大小。这种合成数据的方法称为基于雅可比的数据增强。40黑盒攻击算法-PBAAML其次,PBAAML方法需要选取一个替代模型。这要求对目标模型的输入输出形式具有一定的先验知识。假如目标模型的输入为图像,输出为类别,则目标模型有很大概率为一个图像分类模型。此时选取替代模型时,使用CNN网络效果会更好。值得一提的是,如果替代模型的预测成功率较高,则模型的层数、大小、卷积核参数等信息对于攻击的成功与否影响很小。因此,替代模型的准确率很重要,不能使用准确率很低模型去替代准确率高的模型。41黑盒攻击算法-PBAAML最后训练替代模型,整个PBAAML替代模型训练过程如下所示:2、ZOOPBAAML算法利用了对抗样本的可迁移性,但是在迁移过程中,肯定会有一些精度损失,并且如果对抗样本的可迁移性不强时,攻击成功率较低。实践显示基于替代模型的黑盒攻击方法仅在由小型数据集(如MINIST和CIFAR10等)所训练的小型网络上效果比较好,其很难推广到大型数据集以及大型深度神经网络模型(如在ImageNet数据集上训练的Inception-v3网络模型)。对此,Chen等人①提出了一种新的黑盒攻击算法ZOO(ZerothOrderOptimization),它并不需要替代模型,而会直接攻击目标模型,避免对抗样本迁移过程中的精度损失。ZOO要知道黑盒模型的输出置信度信息,属于基于查询的攻击算法。①ChenPY,ZhangH,SharmaY,etal.Zoo:Zerothorderoptimizationbasedblack-boxattackstodeepneuralnetworkswithouttrainingsubstitutemodels[C]//Proceedingsofthe10thACMworkshoponartificialintelligenceandsecurity.2017:15-26.42黑盒攻击算法-ZOO记为目标模型,为输入,输出为每个类别的置信度分数向量,为类别数。第个元素表示将样本划为的概率,且有ZOO受到了CW的启发,该算法之前已做过详细介绍,这里回顾一下公式,样本,对抗样本,为目标类别。式中为正则化项,限制扰动大小,使对抗样本和原始图像样本在欧氏距离上接近;为分类损失项,定义在公式(4.19)中给出。(4.18)43黑盒攻击算法-ZOO(4.19)为了将扰动限制在[0,1]范围内,使用来替换,由此只需要对进行预测,就可以得到最终的对抗样本。如果想将以上优化项用于黑盒攻击,需要做出两个变化:①修改式(1)中的损失函数,使其不需要使用进行输出而仅仅取决于目标模型的输出和所需的类别标签。②使用有限差分法计算近似梯度,而不是在目标模型上进行实际反向传播,并通过零阶优化解决优化问题。Z(x)为深度神经网络中x的logits层表示。44黑盒攻击算法-ZOO针对变化①可修改损失函数为式(4.20),其中,定义为,由于是一个单调函数,对于任意,当且仅当时。因此,有

,这表示样本获得了类别的最高置信度得分。同时,研究表明对数运算符对黑盒攻击至关重要。因为训练好的目标模型输出往往会产生倾斜的概率分布,从而使某个类别的置信度得分明显高于其它类别的置信度得分。对数运算符的使用可以降低其在生成对抗样本时造成的影响,同时由于单调性保留了置信度得分的顺序。(4.20)(4.21)对于非目标攻击,当被分类为原目标标签以外的任何类别时,对抗攻击就成功了。此时,可以使用下式所示的损失函数,即对于非目标攻击,去掉变量:45黑盒攻击算法-ZOO针对变化②,作者采用有限差分法来估计梯度(记作),如式(4.22)所示。其中,是一个小的常数,(4.22)如0.0001;是一个标准基向量,仅第

个分量取1其余分量均为0。这种方式得到的梯度误差大约为,然而对于产生对抗样本来说,并不需要太精准的梯度。同样,可以得到梯度的Hessian估计(记作),如下:(4.23)46黑盒攻击算法-ZOO随机梯度下降和批量梯度下降是训练深度神经网络的两种最常用的优化算法,也是实现攻击的常见手段。例如,CW攻击即通过在白盒设置中使用梯度下降来攻击目标模型。黑盒环境下由于网络结构未知并且禁止通过反向传播进行梯度计算,因此不能直接使用随机梯度下降或批量梯度下降这两种优化算法。为了解决这一问题,一种简单的解决方案是使用公式(4.22)和(4.23)进行梯度及其Hassian估计。但这种计算开销较大,通常可能需要数百次迭代才能收敛。为了减小计算开销,采用坐标下降法,每一步只需要两次函数计算。因为坐标下降每次迭代只更新目标函数一个坐标方向。47黑盒攻击算法-ZOOZOO在坐标下降法的每次迭代中,随机选择一个变量(坐标),并通过沿着该坐标方向近似最小化目标函数来进行更新(即随机坐标下降算法)。由此得到ZOO的两种变体实现:ZOO-Adam和ZOO-Newton,分别采用导数的一阶近似和二阶近似来更新。ZOO-Adam算法通过迭代地更新参数向量的一个随机坐标来最小化目标函数。在每次迭代中,算法首先随机选择一个坐标。然后,使用公式(4.22)估计该坐标上的梯度,接着在步骤6中使用广为熟知的Adam优化算法更新该坐标的参数和,并在步骤7中对动量参数进行偏差校正。最后,由步骤8计算坐标i上的更新量,其中是学习率,是一个很小的常数以避免分母为零,并利用该更新量更新的值。48黑盒攻击算法-ZOO-AdamZOO-Newton算法在随机选取坐标后不仅通过公式(4.22)估计梯度,还通过公式(4.23)计算梯度的Hessian估计。接着,根据的符号选择不同的更新策略:如果,说明目标函数在该方向呈下降趋势(凹的),此时在步骤5中直接沿负梯度方向更新参数;如果,说明目标函数在该方向呈上升趋势(凸的),此时在步骤7中使用类似牛顿法的更新规则更新参数。49黑盒攻击算法-ZOO-Newton此外,利用坐标下降法也可以通过重要性采样选择性更新像素点,即优先对重要的像素点进行扰动,从而在较少计算量的情况下找到对抗样本。例如,图像的角落或边缘的像素通常不太重要,而靠近主要对象的像素可能对攻击的成功至关重要。因此,在攻击过程中对靠近主要对象的像素进行更多的采样。具体做法是将图像划分为8×8个区域,并根据区域内像素值的变化程度来分配采样概率。首先,对每个区域的像素值变化量的绝对值进行最大池化,然后将其向上采样到所需的维度,并对所有值进行归一化处理,使其总和为1。每迭代若干次后,根据最近的变化更新采样概率。50黑盒攻击算法-ZOO虽然使用坐标下降法优化可以减少迭代优化的计算量,但是对于输入大小为的大型网络使用零阶方法对(这里称其为攻击空间)进行优化可能会非常慢,因为会涉及到大量的梯度估计。因此,不直接对扰动进行优化,而是引入维度变换过程。记扰动,其中,

,,并且。是一种维度变换函数,可以是线性函数或非线性函数,旨在将维数据变换为维,有了函数后,对噪声的优化问题可以在降维后的子空间中进行求解,然后使用函数来升维到原始尺寸。使用代替公式(4.18)中的即可得到:(4.24)51黑盒攻击算法-ZOO这里是一个尺寸更小的对抗噪声图像,它通过函数D升维到原始图像同等维度。一种简单的变换是将函数D定义为放大算子,如使用双线性插值方法。当然,其他一些变换,如离散余弦变换也可以使用。例如,在Inception-v3网络中,可以是维度为的小型对抗噪声图像,而原始图像维度为。可见,此方法在不改变输入图像维度的同时,通过降低对抗性噪声的维度来减少计算量。使用较小的维度进行攻击空间降维时,虽然使用零阶方法可以有效地优化攻击空间,但由于对搜索空间进行了限制,可能无法找到有效的扰动。相反,如果使用较大的维度,则需要进行更长时间的优化才能在该空间中找到有效扰动。因此,对于大型图像和难度较大的攻击,可以使用分层攻击策略,在优化过程中逐渐增大维度,即使用一系列维度为的变换。52黑盒攻击算法-ZOO53黑盒攻击算法-ZOO上述策略具体描述为:在特定的迭代轮次中,迭代总轮次根据维度增加计划而设置),构建,从而将的维度从增加到。这里为的逆变换,其作用是将扰动图像从维降至维。例如,使用图像缩放作时,将从提升至,而将从提升到。从开始优化,并使用作为转换函数。经过一定次数的迭代,当损失函数不再下降时,增大搜索空间,将从放大到,并在之后使用和进行迭代。总之,ZOO解决了基于迁移学习的攻击算法受对抗样本可迁移性影响较大的问题。ZOO算法首先对损失函数进行修改,并提出了梯度估计的方法,使得CW算法能够用于黑盒场景,然后使用坐标下降法、维度变换、多尺度攻击、重要性采样技术来降低优化函数的计算量,提高对抗样本的攻击成功率。在CIFAR-10数据集中,非定向攻击下使用替代模型并使用FGSM和CW制作对抗样本迁移到目标模型的攻击成功率分别为76.1%和25.3%,而ZOO-Adam和ZOO-Newton都可以达到100%;定向攻击下使用替代模型并使用FGSM和CW制作对抗样本迁移到目标模型的攻击成功率分别为11.48%和5.3%,而ZOO-Adam和ZOO-Newton分别可以实现96.8%和97.0%的成功率。为了达成如此高的攻击成功率,ZOO算法需要耗费比PBAAML多几倍甚至几百倍的时间。54黑盒攻击算法-ZOO实验结果:MNIST和CIFAR10攻击比较55黑盒攻击算法-ZOO3、BoundaryAttack前述攻击方法,无论是白盒攻击还是黑盒攻击,基于其攻击原理可以大致分为三类:①基于梯度的方法:知道模型的细节信息(梯度、结构等),利用对应原始图片样本的梯度进行攻击,如FGSM、BIM、CW、JSMA等;②基于得分的方法:不知道模型的细节信息,但是知道模型预测的概率或者logits,如ZOO、JSMA的黑盒变体等;③基于迁移模型的方法:不依赖模型的信息,但依赖训练数据的信息,利用训练数据训练替代模型,从而生成可迁移的扰动,如PBAAML;如果对抗样本通过攻击大量替代模型而集成获得,则可以达到近百分百的攻击成功率。56黑盒攻击算法-BoundaryAttack动机事实上,上述攻击方式在某些情况下易被防御。例如:①防御蒸馏或饱和非线性等梯度掩盖技术,通过引入不可微分元素,能够有效地阻碍基于梯度的攻击。②对于基于得分的攻击,向模型中添加随机元(如dropout)会直接影响数值梯度的准确性,从而降低攻击效果。此外,许多鲁棒性训练方法会在样本周围形成尖锐的损失平面,不仅掩盖了梯度信息,也使得其数值估计变得更加困难。因此,一些研究聚焦基于决策(decision-based)的攻击。这类方法仅对模型的最终决策进行直接攻击,如攻击top-1类标签。相较于基于得分的攻击,基于决策的攻击可能更据实际价值,因为现实中有很多机器学习应用无法获得置信度得分或logits。此外,基于决策的攻击方法有可能比其他类型的攻击方法对梯度掩蔽、内在随机性或鲁棒训练等标准防御方法更加鲁棒。57黑盒攻击算法-BoundaryAttack边界攻击的原理如下图所示。该算法从一个已经被确定为对抗性的点开始进行初始化,然后在对抗性区域与非对抗性区域的边界上执行随机漫步,以实现两个主要目标:①保持在对抗性区域内,以确保生成的扰动仍能有效地欺骗分类器;②逐渐缩小到目标图像的距离,即逐步使对抗性扰动更接近目标图像。具体而言,该算法使用一种称为的适当提议分布(proposaldistribution)来进行拒绝抽样,通过给定的对抗性标准逐步找到最小的对抗性扰动。58Brendel等人[1]提出基于决策的攻击边界攻击算法。黑盒攻击算法-BoundaryAttack[1]BrendelW,RauberJ,BethgeM.Decision-basedadversarialattacks:Reliableattacksagainstblack-boxmachinelearningmodels[EB/OL].arXivpreprintarXiv:1712.04248,2017./abs/1712.0424859黑盒攻击算法-BoundaryAttack算法的主要包括初始化、提议分布生成以及对抗性标准等关键步骤。①初始化:边界攻击需要使用对抗性样本进行初始化,其初始化策略取决于攻击类型。非定向攻击场景中,初始对抗样本从输入域的均匀分布中采样生成。定向攻击场景中,初始对抗样本选取能够被模型正确分类为目标类别的任意样本。②提议分布:算法的效率取决于关键的提议分布。该分布用于引导算法在每次迭代中探索搜索空间。虽然最优提议分布通常依赖于具体领域和目标模型,但实验发现一个简单且通用的策略是在第次迭代时,从满足特定约束条件的最大熵分布中采样扰动特定约束条件如下:(ⅰ)扰动样本位于输入域内,即;(ⅱ)扰动的相对大小为,即;(ⅲ)扰动将扰动图像与原始输入的距离减少了相对量,即。在实践中,从这个分布中抽样非常困难。因此,可以采用更简单的启发式方法:首先,从一个独立同分布的高斯分布

中抽样。然后,重新缩放和截断样本,使得条件(ⅰ)和(ⅱ)成立。其次,将投影到原始图像周围的一个球面上,使得约束条件(ⅰ)和均成立。这一步被称为正交扰动,将其用于超参数的调整。最后,向原始图像做出一个小的移动,使得约束条件(ⅰ)和(ⅲ)同时成立。对于高维输入和小的、,约束条件(ⅱ)也会近似成立。③对抗性标准:对抗样本的判定标准通常根据攻击目标(定向攻击或非定向攻击)而定。然而,其它标准也同样适用,包括top-k错误分类(即扰动后的输入导致模型预测的top-k类别不包含原始类别标签)或基于置信度分数的阈值判断。在CV领域之外,还可以根据错误率等指标来定义对抗样本。与大多数现有攻击方法相比,边界攻击中对抗样本的判定标准具备高度灵活性,支持任意标准,包括不可微分的标准,前提是能够找到满足该标准的初始对抗样本,而这通常容易实现。60黑盒攻击算法-BoundaryAttack4.3对抗样本的防御61对抗样本的防御策略依据防御策略的不同,对抗性防御可以分为被动防御和主动防御两大类。62被动防御:生成深度神经网络模型后通过技术手段检测对抗性样本。主动防御:在攻击者生成对抗样本之前提高深度神经网络模型的鲁棒性,即训练模型使其不那么容易受到对抗性样本的影响。1、对抗性检测对抗性检测旨在检测对抗样本的存在,而不是试图将它们归入正确的类别。这些方法基于的主要假设是,与自然数据的样本相比,对抗示样本来自不同的分布。深度神经网络只能对训练数据流形附近的样本进行正确分类,而对抗样本不在数据流形上[1]。因此,基于这一假设,不少研究工作通过训练基于深度神经网络的二元分类器作为检测器,将输入数据分类为自然样本或对抗性样本两类。[1]TanayT,GriffinL.Aboundarytiltingperspectiveonthephenomenonofadversarialexamples[EB/OL].arXivpreprintarXiv:1608.07690,2016./abs/1608.0769063被动防御方法1、对抗性检测下面以SafetyNet[1]为例介绍对抗性检测的具体方法。SafetyNet是一种带有对抗样本检测器的网络模型,其结构如下图所示。SafetyNet由一个传统深度神经网络分类器(例如,VGG19或者ResNet)和一个量化的径向基函数-支持向量机(RBF-SVM)检测器构成。[1]LuJ,IssaranonT,ForsythD.Safetynet:Detectingandrejectingadversarialexamplesrobustly[C]//ProceedingsoftheIEEEInternationalConferenceonComputerVision(ICCV),2017:446–454.64被动防御方法—对抗性检测对抗样本检测器观察原始深度学习分类模型尾部层的内部状态,提取修正线性单元(ReLU)层输出的离散码作为样本的特征表示。进行离散编码的阈值可以设置多个,也可以设置一个。如果只设置一个阈值,则生成二进制编码(高于阈值为1,否则为0)。该方法假设自然样本和对抗样本在经过量化后会呈现出不同的编码模式。量化RBF-SVM分类器在此特征表示的基础上检测样本的对抗性。如果检测器认为样本是对抗性样本,网络将拒绝此样本。65被动防御方法—对抗性检测这种策略迫使攻击者必须生成能够“迷惑”检测器的编码模式,这在实践中通常是极其困难的,因为攻击者必须生成能够产生特定离散编码的对抗样本以绕过防御。同时,SafetyNet使用量化RBF-SVM对这些离散编码进行分类,量化RBF-SVM的核函数是径向基函数,其形状类似钟形曲线。这意味着只有当输入编码与训练样本库中的编码非常相似时,量化RBF-SVM才会将其判定为自然样本,这也加大了攻击难度。如果用

表示编码,那么通过量化RBF-SVM的分类可以表示为:在这个目标函数中,当很小时,除非攻击编码非常接近自然实例,否则检测器基本上不产生梯度。上述提到的量化过程使检测器更加健壮,梯度更难获取。实验表明,这种梯度混淆形式非常健壮,在无法访问量化RBF-SVM的情况下很难混淆检测器,即便可以访问量化RBF-SVM,欲达到混淆效果也非常困难。66被动防御方法—对抗性检测2、输入重构一些被动防御方法将对抗样本通过重构转换为干净样本,消除对深度学习模型产生的负面影响。这种转换过程旨在消除对抗性扰动,使得转换后的样本在模型的输入空间中更接近于原始的干净数据,从而使增强了模型的鲁棒性和稳健性。例如,Gu等人[1]提出了一种带有惩罚的自动编码器(AE)网络变体(称为深度收缩AE)以提高神经网络的鲁棒性。通过训练去噪自动编码器网络(DAE),可将对抗性样本编码为原始样本,从而消除对抗性扰动。Meng等人[2]提出可以通过两种方式重构对抗样本,一是向对抗样本添加高斯噪声;二是使用自动编码器对其进行编码重构。下面简要介绍由Gu等人提出的通过自动编码器和去噪自动编码器进行对抗样本重构的方法。[1]GuS,RigazioL.Towardsdeepneuralnetworkarchitecturesrobusttoadversarialexamples[EB/OL].arXivpreprintarXiv:1412.5068,2014./abs/1412.5068[2]MengD,ChenH.Magnet:Atwo-prongeddefenseagainstadversarialexamples[C]//Proceedingsofthe2017ACMSIGSACConferenceonComputerandCommunicationsSecurity,2017:135–147.67被动防御方法—输入重构为了深入了解对抗性噪声的特性,作者探索了三种将具有对抗性噪声的样本恢复为自然样本的预处理方法。①噪声注入鉴于对抗性噪声的微小特性,作者研究了一种基于额外损坏的恢复策略,希望可以将输入移出网络的“盲点”。作者最初假设这些盲点很小且局部化,因此尝试对样本注入高斯加性噪声(Gaussianadditivenoise)和高斯模糊((Gaussianblurring)。对于高斯噪声,实验对20次前馈运行的预测进行平均以减少预测方差,其结果如下图所示。68被动防御方法—输入重构噪声可以添加到输入层(L1)或输入层加上所有隐藏层(L*)。可以发现,随着高斯加性噪声的注入干净样本的预测错误率会升高,而对抗性样本的预测错误率反而会降低。这样的趋势在所有的网络类型上均一致。同样,对于加入高斯模糊,干净样本和对抗性样本的预测错误率变化趋势也和加入高斯加性噪声一致。实验结果还表明,卷积似乎有助于从对抗样本中恢复原始样本。例如,对于ConvNet模型,将大小为11的高斯模糊核应用于所有输入数据可以恢复超过50%的对抗性实例,代价是干净数据的测试错误率会增加3%。此外,对于ConvNet模型,在输入层和隐藏层添加的高斯噪声,可以使模型在干净数据上的模型性能损失类似的情况下,对抗性样本到原始样本恢复率达到35%以上。然而,无论是高斯加性噪声还是高斯模糊都无法有效地消除足够的扰动,使其在对抗性样本上的错误能够与在干净数据上的错误相匹配。69被动防御方法—输入重构②自动编码器(AE)为了评估对抗性噪声的结构,作者训练了一个具有三层隐藏层的自动编码器用于将对抗性样本映射回原始数据样本。作者同时还训练模型将原始训练数据映射回自身。这样如果输入非对抗性数据样本,自动编码器就会保留原始数据。使用这种方法就能够堆叠多个自动编码器。作者仅使用训练集中的对抗性示例来训练自动编码器,并在不同的模型拓扑结构上测试对抗性样本的泛化能力。70被动防御方法—输入重构可以观察到自动编码器在来源于不同模型的对抗性样本上都表现出很好的泛化能力。所有自动编码器都能够恢复至少90%的对抗性错误,无论这些对抗样本来源于何种模型。③去噪自动编码器(DAE)在没有关于对抗性噪声分布先验知识的情况下训练标准的去噪自动编码器(DAE)。DAE将受损的输入数据映射到干净的输入数据。在每个训练批次中,输入数据中的每个像素都会受到独立高斯噪声的影响,噪声的均值为0,标准差为。实验结果显示,标准的去噪自动编码器仍然可以恢复相当大部分的对抗性噪声。特别是,一个带有的高斯噪声的去噪自动编码器几乎可以像在实际对抗性噪声上训练的自动编码器一样,具备相当的对抗性样本去噪效果。71以上三种实验表明,对于图像数据,通过低通滤波(例如高斯模糊)可以显著地降低对抗性样本的影响,这表明对抗性噪声主要存在于高频域。自动编码器和去噪自动编码器的防御实验表明,对抗性噪声具有简单的结构且易于利用。被动防御方法—输入重构1、知识蒸馏Hinton等人[1]提出一种名为知识蒸馏(KnowledgeDistillation)模型压缩技术,旨在将复杂的模型的知识转移到简化模型之中,从而减少模型的复杂度并提高其性能。在知识蒸馏中,复杂模型称为教师网络,蒸馏后的网络称为学生网络。知识蒸馏的基本思想是教师网络在训练过程中学习到的知识不仅体现在其权重参数中,也体现在其输出的概率分布中。因此,可以通过将教师网络的概率分布作为软标签来训练学生网络,将教师网络的知识传递给学生网络。[1]HintonG,VinyalsO,DeanJ.Distillingtheknowledgeinaneuralnetwork[EB/OL].arXivpreprintarXiv:1503.02531,2015./abs/1503.0253172主动防御方法—防御性蒸馏基于知识蒸馏的特点,Papernot等人[1]提出了防御性蒸馏的概念,即将知识蒸馏作为在对抗环境中用于深度神经网络的防御技术。该研究认为,通过蒸馏提取的概率向量形式的知识以及这些知识在较小的网络中转移并保持了与较大网络相当的准确性,有助于提高深度神经网络在其训练数据集之外的泛化能力,从而增强其对抗扰动的鲁棒性。防御蒸馏与传统的知识蒸馏的主要区别在于,防御蒸馏保持相同的网络架构来训练原始网络和蒸馏网络。这种区别由目标决定,即防御的目标是为了提高模型的鲁棒性而不是模型压缩。防御性蒸馏的训练过程如图(下页)所示,主要步骤如下:[1]PapernotN,McDanielP,WuX,etal.Distillationasadefensetoadversarialperturbationsagainstdeepneuralnetworks[C]//2016IEEEsymposiumonsecurityandprivacy(S&P),2016:582–597.73主动防御方法—防御性蒸馏①算法的输入是一组带有类别标签的样本集合,对于样本

,是表示其离散标签(硬标签)的向量,即

是一个指示器向量,其中唯一的非零元素对应于正确类别的索引(如(0,0,1,0,...,0)表示样本属于索引为2的类别)。②给定训练集,在温度下训练具有softmax输出的深度神经网络。是所有可能标签类上的概率向量。设的参数为那么有,样本的标签为的概率是。③表示训练蒸馏网络所使用的新训练集,新训练集不使用硬标签,而用软标签表示标签类的概率。74[1]PapernotN,McDanielP,WuX,etal.Distillationasadefensetoadversarialperturbationsagainstdeepneuralnetworks[C]//2016IEEEsymposiumonsecurityandprivacy(S&P),2016:582–597.主动防御方法—防御性蒸馏二、主动防御方法④使用新训练集训练另一个深度神经模型,其架构与相同,softmax层温度仍设置为。这个新模型被称为蒸馏模型。

尽管防御蒸馏在提出之初被认为是一种有效的对抗样本防御方法,其核心思想是训练鲁棒性更强的学生模型,但其本质上是一种静态防御机制。一旦训练完成,学生模型的结构和参数即固定不变,无法像对抗训练那样动态地适应新的攻击样本。攻击者若掌握了防御机制的具体细节,例如蒸馏温度参数和学生模型结构,便可针对性地生成对抗样本,从而绕过防御。因此,防御蒸馏并不能彻底解决模型易受攻击的问题。75主动防御方法—防御性蒸馏2、随机化一些研究认为深度神经网络总是对随机扰动具有一定的鲁棒性。基于随机化的对抗防御大致分为三类:①在输入层面通过随机变换进行防御。利用随机缩放和随机填充来缓解模型在预测阶段的对抗效应。该方法的整体流程如图所示。随机缩放在输入图像送入网络前,对图像随机应用最近邻插值、‌双线性插值等缩放变换算法。随机填充则是在输入图像四周随机填充零值。这种方法对抵御黑盒攻击有一定的效果,但是在白盒设定下,攻击者仍可利用变换期望对抗样本攻击算法对其进行攻击。76主动防御方法—随机化②在模型层面使用随机噪声进行防御。如通过一种名为随机自集成(RandomSelf-Ensemble,简称RSE)的随机噪声机制来防御对抗性扰动。该方法在训练和测试阶段的每个卷积层之前添加一个噪声层,并将基于随机噪声的预测结果进行集成,从而稳定深度神经网络的输出。77主动防御方法—随机化(RSE方法)将多个不同的模型组合在一起可以提高鲁棒性。然而,将有限k个模型组合在一起使模型大小增加k倍(某些情况下资源消耗太大)。此外,很难找到具有相似准确率的众多异构模型。为此,RSE采用自组合算法即时生成无限数量的模型,而无需任何额外的存储成本。RSE方法的主要思想是将随机性引入网络结构中。RSE引入了一个新的“噪声层”,将输入向量与随机生成的噪声融合,即在样本通过噪声层时执行操作。然后,RSE将这一层添加到每个卷积层之前,如下图所示。由于大多数攻击需要计算或估计梯度,因此,模型中的噪声等级将控制这些攻击算法的成功率。实际上,可以将这一层噪声层集成到任何其他神经网络中。78主被防御方法—随机化(RSE方法)如果将原始的神经网络表示为,其中表示权重,为输入的图像。考虑到随机噪声后,网络可以表示为,其中。因此,加入随机的噪声层后等同拥有了无限数量的模型(具有不同的),而且没有任何额外的内存开销。然而,添加随机性也会影响模型的预测精度,那么如何保证集成这些随机模型具有足够的准确性?RSE方法提出的观点是在训练和测试阶段均添加这个随机层。79主动防御方法—随机化(RSE方法)在模型训练阶段,梯度计算为,其中包括噪声层,并且每次随机梯度下降更新都会随机生成新的随机噪声。在模型测试阶段,构建了个随机噪声层,并通过下式将这些带有随机噪声的网络集成起来并获得最终预测结果。预测如果不关心预测时间,那么

可以很大,但是在实践中时网络趋近饱和。在模型训练时,噪声有助于优化算法找到一个稳定的、对扰动输入具有鲁棒性的卷积滤波器;而在模型测试时,噪声的作用有两个方面:一是扰动梯度以欺骗基于梯度的攻击;二是通过多次前向运算给出不同的输出,使用简单的集成方法即可提高预测准确度。80③在模型层面使用随机激活剪枝方法进行防御。随机激活剪枝(StochasticActivationPruning,简称SAP)由Dhillon等人[1]提出,它是一种通过修剪神经网络层中部分激活值来抵御对抗样本攻击的方法。与dropout不同,SAP优先保留对模型预测贡献较大的激活值,如数值较大或者波动较大的激活值,以维持模型的表达能力。数值较大代表更重要的特征,波动较大表示在不同样本之间表现出更大的差异性,意味着更强的区分能力。在修剪激活值后,为了弥补剪枝带来的信息损失,SAP会对保留下来的激活值进行放大,放大的比例通常根据每层剩余激活值的统计特征(例如均值、方差)来确定,以确保不同层之间的激活值分布保持一致性。然而,SAP方法仍然存在一些缺陷。由于随机丢弃激活值,该方法不可避免地会导致一定程度的性能损失,尤其是在剪枝比例较高的情况下。此外,虽然SAP对某些类型的攻击具有一定的防御能力,但仍然容易受到更强大的攻击方法的攻击。[1]Dhillon,G.S.,Azizzadenesheli,K.,Lipton,Z.C.,Bernstein,J.,Kossaifi,J.,Khanna,A.,&Anandkumar,A.(2018).Stochasticactivationpruningforrobustadversarialdefense.arXivpreprintarXiv:1803.01442.主动防御方法—随机化(SAP方法)3、对抗训练对抗训练是目前公认的有效防御方法之一。对抗训练通过利用在训练集中添加对抗样本来重新训练模型的方法,从而增强机器学习模型的鲁棒性。从损失函数上的形式上看,这是一个min-max的博弈过程,表述为下式:其中,表示对抗损失,表示网络权重,表示对抗输入,y为真实标签,表示对抗输入和原始输入的距离度。上式从形式上表达了两个目标:①找到最有效的对抗样本②模型能够防御高效的对抗样本攻击具体来说,max任务的目标是①,min的目标是②。81主动防御方法—对抗训练在FGSM对抗训练中,可以通过在训练样本中混合添加良性样本和FGSM对抗样本来得到更鲁棒的模型,Goodfellow等人[1]将目标表述如下:其中,是由FGSM生成的对抗样本,c是用来平衡良性样本和对抗样本精度的超参数。在经过FGSM对抗训练后,模型将对对抗样本产生鲁棒性。虽然经过FGSM对抗训练后会对FGSM对抗样本产生鲁棒性,但是研究表明它仍会受到其它攻击危害(如基于迭代、基于优化的对抗攻击)。[1]GoodfellowIJ,ShlensJ,SzegedyC.Explainingandharnessingadversarialexamples[J].arXivpreprintarXiv:1412.6572,2014.82主动防御方法—FGSM对抗训练将PGD攻击算法添加到对抗训练。Madry等[1]实验验证,使用PGD对抗训练的机器学习模型对典型的,甚至目前最强的一阶攻击都具有一定的鲁棒性。PGD对抗训练总体上可以说是目前最有效的防御方法,但也存在以下两个问题:①计算成本很高;②对非的其它攻击依旧脆弱。83主动防御方法—PGD和集成对抗训练集成对抗训练(EnsembleAdversarialTraining,EAT)[2]是一种通过集成多种对抗样本来进行集成对抗训练的防御方法。为了解决PGD计算成本大以及在随机启动中的FGSM容易受到黑盒攻击的问题。EAT因为使用了多种对抗样本进行训练,使得经训练的模型能抵抗多种样本(包括来自其它模型的、单/多步攻击的对抗样本)攻击。[1]Madry,A.,Makelov,A.,Schmidt,L.,Tsipras,D.,&Vladu,A.(2017).Towardsdeeplearningmodelsresistanttoadversarialattacks.arXivpreprintarXiv:1706.06083.[2]Tramèr,F.,Kurakin,A.,Papernot,N.,Goodfellow,I.,Boneh,D.,&McDaniel,P.(2017).Ensembleadversarialtraining:Attacksanddefenses.arXivpreprintarXiv:1705.07204.4.4其它领域对抗样本84图对抗攻击图(graph)可以用作跨越各个领域的大量系统的表示,例如社会科学(社会网络),自然科学(物理系统和蛋白质-蛋白质相互作用网)和知识图。图神经网络(GNN)将传统的深层神经网络(DNN)泛化为图,为有效学习图表示提供了新途径。由于其强大的表示学习能力,GNN在从数据挖掘,自然语言处理和计算机视觉到医疗保健和生物学的各种应用中都具有实际意义。传统的DNN容易受到对抗性攻击的欺骗,同样,GNN也继承了这一缺点。此前蚂蚁金服就有工作,攻击利用图表示学习的辅助检测欺诈交易检测系统。假设恶意用户修改自己的一些属性信息以及与其他用户的连接,就能够躲过检测系统实现攻击,因此研究图上的对抗攻击很有必要。85攻击者可以通过操纵图结构或节点特征来欺骗GNN模型,从而产生图对抗扰动,如下图所示。最初的node7被GNN模型分类为绿色节点。在node7与node3创建新连接并修改其自身功能后,GNN模型将其错误分类为蓝色节点。86图对抗攻击图对抗攻击通过最小化特定攻击损失函数来误导目标模型。节点级图对抗性攻击问题可以表述如下:给定图,其中是节点集合,是边集合。矩阵为G的邻接矩阵,表示结点和相连。此外表示节点属性矩阵,其中D是节点特征维度。因此图数据可以表示为。给定图,目标模型F以及节点子集。表示节点u的真实类别标签或模型预测类别。攻击者的目标是找到一个扰动图,该图能最小化攻击损失函数如下:87图对抗攻击(4.36)其中,表示攻击损失函数,一种常见的做法

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论