模型窃取攻击_第1页
模型窃取攻击_第2页
模型窃取攻击_第3页
模型窃取攻击_第4页
模型窃取攻击_第5页
全文预览已结束

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

模型窃取攻击模型窃取攻击前⾔⼈⼯智能系统不⽌存在安全问题,还存在隐私问题,安全问题已经受到了⼴泛重视,对抗样本等攻击技术⼤家都有在讨论,相⽐之下,AI的隐私问题关注的⼈就没有那么多了,但事实上,AI的隐私保护⾯临的威胁形势也及其严峻。我们知道,攻击者之所以会发动攻击,⼀定是考虑到攻击的性价⽐的,简单来说,攻击花费的资源如果少于或者远少于攻击成功可以带来的收益,攻击者才会发动攻击。如果从这个⾓度看,AI的隐私有什么值得攻击的呢?事实上,⼤⼚为了训练模型,需要花费⼤量的时间、⾦钱、⼈⼒去收集处理数据,然后花费⼤量算⼒训练模型,如果攻击者可以通过某种⼿段,窃取该模型,不就相当于省去了这么多投⼊,却能“⽩嫖”得到⼀个近似的模型吗?这类攻击的性价⽐⾮常⾼,但是⼤部分的注意⼒还是在AI的安全⽅⾯,在隐私⽅⾯的关注还不够。本⽂会介绍⼀类典型以获取模型隐私⽬标的攻击—模型窃取攻击,⾸先会介绍攻击背景、然后分析背后的细节、原理,最后给出实验复现和分析。攻击背景攻击者的⽬标是为了窃取⽬标模型的功能,但在实际情况中,攻击者与⽬标模型之间仅存在⿊盒的交互作⽤,即输⼊图像,输出预测,攻击者并不知道除此之外的任何信息。⽅案概要及形式化研究⼈员提出的对应的攻击⽅法可以分为两步:1.向⽬标模型查询⼀组输⼊图像,并获得模型给出的预测2.使⽤上⼀步得到的“图像-预测”对训练⼀个knockoff(即替代模型)该攻击⽅案实际上针对的是AI模型的隐私问题,通过进⾏攻击,可以得到⼀个替代模型,⽽该模型的功能与⽬标模型相近,但是却不需要训练⽬标模型所需的⾦钱、时间、脑⼒劳动的开销。简单的⽰意图如下攻击者仅仅通过与⽬标模型的交互就可以创建⼀个替代模型。该攻击⽅案的形式化表⽰如下攻击者仅有与⽬标模型Fv:X->Y的⿊盒交互权限,其⽬标是使⽤替代模型knockoffFA复制⽬标模型的功能。图上图所⽰,这个任务实际上受害者V和攻击者A之间的双⽅游戏分析先来看受害者的视⾓:他会为⼀个具体的任务部署⼀个训练后的CNN模型Fv。为了训练这个模型,受害者需要:1.收集与任务相关的图像x~Pv(x),由专家对其进⾏标记,组成数据集Dv={(xi,yi)},2.选择在测试集上可以实现最佳性能的模型Fv,将其作为将要部署的模型,3.该模型将会以⿊盒的形式部署,输⼊图像x,输出置信度y=Fv(x),当然,每进⾏⼀次预测,都会有⼀定的开销,⽐如延迟、⾦钱开销等再来看看攻击者的视⾓:攻击者⾯对的是⼀个⿊盒的模型,输⼊任何图像x,模型会给攻击者返回K维的后验概率向量y,⽽这些信息是不可知的,包括:1.Fv模型的内部构造;2.训练集和测试集;3.K个类别的语义信息为了训练得到knockoff,攻击者需要:1.使⽤策略π交互查询图像得到图像的迁移集和伪标签2.为knockoff选择⼀个架构并训练其模仿Fv在迁移集上的⾏为我们的⽬标就是训练⼀个性能好的knockoff,此外还有解决两个问题:1.在有限的查询预算内怎样可以实现最好的性能;2.怎样才能挑选出适合⽤于查询的图像该⽅案这么简单的⼀说可能很容易让我们想到知识蒸馏,知识蒸馏的⽬的是将知识从较⼤的教师模型T(⽩盒)通过迁移集迁移到较⼩的学⽣模型S(knockoff)上,但是我们的攻击与知识蒸馏存在显著不同,如下所⽰⾸先,分布是独⽴的,⽤于训练FA的图像x来⾃分布PA(x),⽽⽤于训练FV的图像其分布来⾃于PV;知识蒸馏需要有对模型更强的知识,S和FA都⽤于训练来分类服从Pv(x)分布的图像其次,从⽤于简单的数据的⾓度来看,学⽣⽹络S最⼩化KD损失如下其中有:这是在温度t控制下的logitsa的软后验概率分布⽽在攻击⽅案中的knockoff(对应知识蒸馏中的S)缺少logitsa以及正确的标签yt⽤于训练攻击流程那么该怎么⽣成Knockoff呢?主要分为两步:迁移集构造和训练knockoffFA构造迁移集

构造迁移集,也就是”图像-预测”对,⽤于训练knockoff模型Fv的⾏为⾸先要选择PA(X).攻击者⾸先需要选择图像分布来采样图像,这是⼀个⽐较⼤的离散数据集,例如可以⽤ILSVRC数据集的1.2M的图像作为PA然后要确定采样策略π:我们是使⽤这个策略从PA(x)中采样。这⾥可以考虑两种策略随机策略在该策略下,随机采样图像,并向FV查询。这是攻击者会采取的极端情况,这种策略的风险是,攻击者采样的图像可能和学习任务⽆关,⽐如FV是⽤于分类鸟的,但是采样的图像却是狗⾃适应策略该策略可以将每次查询得到的反馈集成进来,此时的采样策略为:此时的⽬的是为了提升查询的样本效率;以及增加FV的可解释性该案如下图所⽰在每个时间步t,策略模块Pπ采样⼀系列查询图像,奖励信号rt是基于多个标准得到的,并⽤于更新策略,最终⽬标是最⼤化期望的奖励为了⿎励有关的查询,我们将每个图像xi与标签zi联系起来,从⽽丰富攻击者的分布。这些标签与⽬标模型的输出类之间没有语义关系。例如当PA对应ILSVRC数据集的1.2M图像时,我们使⽤了超过1000个类的标签。这些标签也可以通过⾮监督技术获得,例如聚类或估计图密度。使⽤标签有助于理解⽬标模型的功能。此外,由于我们希望标签{zi∈Z}是相互关联或相互依赖的,所以我们将它们表⽰为⼀个由粗到细的层次结构,上图b所⽰为⼀棵树的节点,从上往下为动物-鸟-⿇雀。在每个时间步t,我们从⼀个离散的动作空间Z(攻击者独⽴的标签空间)中采样动作zt.沿着树向前移动得到动作:在每个节点,⽤概率πt(z)对⼦节点采样,这个概率是由节点的softmax分布决定的,即:当达到叶节点时,返回对应于标签zt的图像样本接下来使⽤动作zt获得的奖励rt使⽤GradientBandit算法更新策略π,这个更新过程等价于沿着上图b中的树反向移动,其中的节点potential可以更新为:接着我们需要确定奖励怎么定义,为了评估采样图像的质量,我们研究了三种奖励第⼀种使⽤基于边缘的确定性测度来⿎励受害者有信息的图像,即FV是在其上训练过的:其中的ki是第i⾼置信度的类,为了防⽌在单⼀标签上探索图像的退化情况,引⼊了多样性奖励:为了⿎励图像中knockoff的预测不模仿FV,我们奖励⾼交叉熵损失:我们结合以上⽅法,得到总奖励,为了保持相同的权重,会将每个奖励分别缩放到[0,1],然后使⽤过去的Δ时间步计算出的基线减去即可。训练模型接下来就是训练KnockoffFA执⾏完上⼀步之后,我们已经得到了迁移集

我们⽤该数据集进⾏训练⾸选要选择架构FA,我们选择复杂的结构作为FA,⽐如VGG,ResNet等,因为知识蒸馏领域的研究表明,选择复杂的学⽣模型鲁棒性更好。接下来需要训练以模型⽬标模型,为了加速训练,我们从预训练好的Imagenet⽹络FA开始,通过最⼩化交叉熵损失在迁移集上训练FA来模拟FV实验分析及复现通过对不同的数据集使⽤不同的查询预算做了实验,结果如下从结果可以看出,预算越⾼,或者说查询次数越多,则攻击效果越好。为了研究不同FA架构的影响,研究⼈员使⽤两种⿊盒FV架构:Resnet-34和VGG-16来研究这种影响。攻击者通过选择:Alexnet,VGG-16,Resnet-{18,34,50,101}和Densenet-161分别作为FA的架构,实验结果如下从图中我们可以得出两个结论:1.knockoff的性能按模型复杂度排序:Alexnet结构最简单,但是性能最差,更复杂的Resnet-101/Densenet-161性能却更好,这说明在选择FA架构时,选⼀个复杂的架构更好;2.模型家族之间的相似性有助于攻击,因为我们可以看到Resnet-34在窃取VGG-16时取得了相似的性能,反之亦然那么⾯临这种攻击是否存在简单的办法呢?⽐如对输出的结果做处理,可以仅给出argmax,或者从top5变为top2,或者四舍五⼊,总是要尽可能少的暴露信息,为此也进⾏了相关实验,结果如下从图中可以看出,不论是取topk还是舍⼊都会影响模型性能,对于topk⽽⾔,k越⼩,则攻击效果越差;对于舍⼊⽽⾔,舍⼊的精度越低,攻击效果越差。这意味着,如果要防御该类型攻击,最简单的办法就是尽量减少模型输⼊泄露的信息。接下来分析代码实现以及实际复现过程我们使⽤MNIST数据集训练受害者模型,受害者模型选择线性模型⾸先加载数据并定义受害者模型然后发动攻击此处extract函数定义为:然后需要评估,这⾥就是简单计算模型的性能:evaluate函数定义为:当采样策略采⽤随机策略时,选择mnist数据集作为攻击数据集(此时跟受害者数据集标签100%重叠),选择线性模型作为攻击模型,以此作为基准,攻击效果如下

保持与基准实验其他条件相同,不过使⽤resnet作为攻击模型结果如下可以看到,由于攻击模型和⽬标模型架构完全不同,所以攻击效果很差保持与基准实验其他条件相同,不过使⽤fmnist数据集作为攻击数据集(此时跟受害者数据集标签0%重叠)效果如下可以看到,攻击效果很差保持与基准实验其他条件相同,不过采样策略采⽤⾃适应策略攻击效果如下当采样策略采⽤⾃适应策略,不过仅使⽤loss机制时(在前⽂我们已经说过,存在三种损失,上⼀个实验我们综合了三种损失,⽽这个实验我们仅使⽤loss),攻击

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论