T-SAIAS 001-2024 神经网络分类模型鲁棒性测试方法_第1页
T-SAIAS 001-2024 神经网络分类模型鲁棒性测试方法_第2页
T-SAIAS 001-2024 神经网络分类模型鲁棒性测试方法_第3页
T-SAIAS 001-2024 神经网络分类模型鲁棒性测试方法_第4页
T-SAIAS 001-2024 神经网络分类模型鲁棒性测试方法_第5页
已阅读5页,还剩22页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

SAIASTestmethodsforrobustnessofneuralnetworkclassificationmodels上海市人工智能行业协会发布I 1 1 1 1 2 2 2 2 2 2 4 5 7 8A.1对抗攻击方法 8 8A.3后门攻击方法 8 9 本文件起草单位:上海华东电信研究院、京东科技信息技术有限公司、蚂1神经网络分类模型鲁棒性测试方法本文件提出了神经网络分类模型鲁棒性需考虑的因素,并提供了神经网络分类模型鲁棒性测试方神经网络分类模型neuralnetworkclassifica神经网络分类模型鲁棒性robustnessofneuralnetworkclassificationmodel神经网络分类模型在输入数据受到攻击或干扰等情况下保持其性能水平的特性,通常通过抵抗攻通过设计向原始测试样本添加一些不易察觉的噪声/扰动从而让神经网络分类模型做出误判的攻击通过向神经网络分类模型的训练数据投放特定设计的污染数据,从而影响神经网络分类模型判断在神经网络分类模型训练阶段通过某种方式对模型植入后门,从而导致模型将精心设计的含有后4神经网络分类模型鲁棒性需考虑因素24.1模型研发和训练阶段b)各类异常数据检测方法,能检测并清除对抗样本、中毒样本、后门c)进行针对对抗样本的对抗训练,用于提升模型对4.2模型使用阶段为提升神经网络分类模型鲁棒性,在神经网络分类模型的使用阶段,可针对不同攻击/干扰,需考b)具备识别并防止中毒攻击通过向模型的训练数据集注入中毒样本以达成在调优过程中劣化模c)具备识别并防止后门攻击通过后门样本对人工智能系统进行攻击以达成定向操纵人工智能系d)具备识别并防止其他针对输入数据、模型本身的5测试方法5.1.1通过对待测试神经网络分类模型发起攻击并观测模型抵抗攻击的能力来对神经5.1.3通过模型抵抗攻击的成功率来衡量和量化模型鲁棒性指标,抗攻击成功率越高神经网络分类模型鲁棒性测试方法的设计可遵循如下a)方法的完备性。测试过程宜尽可能覆盖对抗攻击测试、中毒攻击测试5.3.1.2使用攻击样本向神经网络分类模型发起攻击,观察神经网35.3.1.4通过多组次输入不同攻击样本对,统计抗攻击成功的概率,5.3.2测试方法、攻击样本、测试样通过如下流程对神经网络分类模型抗对抗攻击鲁棒性进行测试(如图a)获取待评测的神经网络分类模型,选取能被正确分类的样本形成测试样本集;c)成对向神经网络分类模型输入<原始样本,攻击样本>中的样本,进行分类,对5.3.4.1通过统计神经网络分类模型抗攻击成功率,来衡量神经),度设置不同的权重系数,权重系数应遵循扰动预算与攻击强度越高权重越大的规律进行设置,所有对其中:n表示采用的攻击样本生成方法的类别数ki表示每一种对抗攻击的权重系数,其中∑1ki=1Ni表示第i类对抗攻击的攻击次数(即攻击样本对的数量)4TNi表示模型对第i类对抗攻击的抗攻击成功次数5.4.1.2投入中毒训练样本重新训练或微调模型,生成新型通过对比原模型和中毒模型的在同一测试集上的结果差异来评价神经网络分类模型的b)增量训练:将设计的中毒样本投入增量训练集,并使用该训练集对原分类模型进行迁移/增量),5.4.2测试方法、攻击样本、测试样b)若不能介入神经网络模型的训练(包括预训练或迁移/增量训练则无法进行抗中毒攻击的d)应确保测试数据集中数据的多样性,即防止测试数据c)分别向原分类模型和中毒模型输入同样的测试数据集,并55.4.4.1通过观测原模型和中毒模型对同一组测试数据集的分类表现5.4.4.2选定一个度量指标,记为F,分别通过该指标计算原模型和中毒γ2={−(Fori−Fpoi)其中:Fori表示原模型的测试结果Fori表示中毒模型的测试结果5.5.1.1后门攻击是指向训练集中投入后门样本,使用该训练集5.5.1.2设计含有后门触发器的测试样本对模型进行攻击,注:后门攻击的特点在于对不含触发器的测试样本表现正常,针对某一些加入触发器的样本能按照攻击人的意图被可以按照常用的后门样本生成方法生成攻击样本,分别进行测试。若模型能正常识别攻击样本5.5.1.4通过多组次输入不同种类的后门攻击样本集,分别统计每5.5.2测试方法、攻击样本、测试数6b)作用于训练阶段的后门攻击应具有向模型植入后门以达到定向操纵识别结果的能力。且应具c)作用于推理阶段的测试样本应设置触发器以——对于已知被植入的后门种类的情况,可以针对性设计后门攻击样本;通过如下流程进行神经网络分类模型对抗后门攻击鲁棒性测试(如图生成带有后门触发器的测试样本,形成测试样本集();d)向模型输入设计好的带有后门触发器的测试样本集,进行分类,通过公式(3)分类统计各类5.5.4.1观测模型抵抗每一类后门攻击的成功率来评价模型针对不同7yi3=F(第i类后门攻击样本分类结果,label)(3)其中:F表示选择的度量指标的计算公式神经网络分类模型鲁棒性基本指标包括对抗攻击鲁棒性、中毒攻击鲁棒性、后门攻击鲁棒性。在测试神经网络分类模型鲁棒性时,神经网络分类模型鲁棒性测试报告中宜包含但不限于如下信——测试环境说明,应包括且不限于硬件环境和软件环境说明。——攻击方法说明,若使用多种攻击方法应分别进行说——攻击方法说明,若使用多种攻击方法应分别进行说8A.1对抗攻击方法b)基于干扰信息的攻击。基于干扰信息的攻据来诱导神经网络分类模型对生成的攻击样本进行误分d)基于生成样本的攻击。基于生成样本的攻击是通过预先训A.3后门攻击方法a)生成的触发器与输入相关的后门攻击。这种攻击方式是指攻击者通过预先设置的触发器修改化生成触发器的后门攻击会利用优化信息生成最优触发器,从而对神经网络分类模型进行干c)基于非优化生成触发器的后门攻击。基于非优化生成触发器的后门攻击是指触发器由手动设9可用表B.1的形式记录神经网络分类模型鲁棒性测试的基础信息,包括模型名称、模型版本号、模可用表B.2的形式记录神经网络分类模型抗对抗攻击鲁棒性测试相关信息,包括每一类的攻击方法可用表B.3的形式记录神经网络分类模型抗中毒攻击鲁棒性测试相关信息,包括是否可以进行中毒在原模型下的测试指标Fori在中毒模型下的测试指标Fpoi可用表B.4的形式记录神经网络分类模型抗后门攻击鲁棒性测试相关信息,包括每一类后门攻击的生成方法、测试样本集数量、采用的量化指标和模型抗后门攻击可用表B.5的形式记录神经网络分类模型鲁棒性测在原模型下的测试指标Fori在中毒模型下的测试指标Fpoi可用表B.6的形式记录神经网络分类模型鲁棒性测[1]Goodfellow,I.J.,etal.“ExplainingandHarnessingAdversaria[2]Madry,A.,etal.“Towardsdeeplearningmodelsresistanttoadv[3]Carlini,N.,etal.“TowardsEvaluatingtheRobustnessofNeuralNetworks.”IEEES&P2017.[4]Koh,P.W.,etal.“Understandingblack-boxpredictionsviainfluencefuncti[5]CYang,QWu,HLi,YChen,”GenerativePoi[6]Shafahi,A.,etal.“PoisonFrogs!TargetedClean-LabelPoisoningAttacksonNeuralNetworks.”NeurIPS2018.[7]Nguyen

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论