模型基础及其安全 3_第1页
模型基础及其安全 3_第2页
模型基础及其安全 3_第3页
模型基础及其安全 3_第4页
模型基础及其安全 3_第5页
已阅读5页,还剩59页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

模型攻击与防御第五章

对抗攻击与防御5.1后门攻击与防御5.2能量延迟攻击5.3提取攻击5.4

对抗攻击与防御5.15.1.1对抗攻击的定义Szegedy等人早在2013年便已经敏锐地指出,即便是人类肉眼难以察觉的微小对抗性扰动,也能够显著破坏机器学习模型的推理能力。定义在大模型(如大型语言模型、扩散模型等)的背景下,攻击者通过在模型的推理阶段精心设计和构造微小但是具有针对性的扰动,并将其注入到输入数据中,以欺骗或者误导模型产生不正确、与预期不符的有害输出。对抗攻击旨在利用模型对输入数据微小变化的敏感性来引发模型的不当行为。对抗攻击的场景和流程攻击者目的5.1.2对抗攻击的威胁模型攻击者能力与知识边界5.1.2对抗攻击的威胁模型大模型对抗攻击的分类体系呈现多维度特征,其划分的标准深刻地揭示了多种攻击策略的本质差异。大模型对抗攻击5.1.3对抗攻击的分类基于知识边界的攻击范式划分Identity黑盒攻击白盒攻击攻击目标导向的二元分类划分Identity有目标攻击无目标攻击扰动粒度划分攻击策略Identity粗粒度攻击细粒度攻击5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击

扩散模型通过概率生成框架的创新设计,为图像生成任务开辟了具有高度创造性的技术路径。在深入介绍攻击方法之前,我们首先从对抗攻击的角度来剖析StableDiffusion模型中所潜藏的漏洞与隐患。漏洞与隐患5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击粗粒度特征的相似性提示词的多义性生成速度的不可控性5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击Identity生成速度的不可控性粗粒度特征的相似性提示词的多义性在模型生成图像的过程中,不同类别的图像生成的速度不同。若用户输入的提示中同时含有多个类别,则生成速度更快的类别更有可能在图像中占据主导地位。5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击Identity生成速度的不可控性粗粒度特征的相似性提示词的多义性StableDiffusion在处理具有相似粗粒度特征的多个语义类别时,可能会出现特征空间的纠缠现象,从而生成具有多重特征的图像。5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击Identity生成速度的不可控性粗粒度特征的相似性提示词的多义性当输入提示缺乏足够的上下文约束时,模型会基于先验知识进行语义补全,这可能导致生成结果偏离用户的实际意图。5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击ATM攻击的核心目标:ATM攻击所使用的边缘损失函数:

5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击文本离散特性对对抗样本优化产生的影响:对抗攻击技术旨在通过算法驱动实现高效的对抗样本生成。连续空间的梯度上升和梯度下降方法为求解器提供了明确的参数调整方向。然而,文本的离散特性使得传统基于梯度的优化技术难以直接应用。5.1.4对抗攻击的方法——扩散模型的白盒对抗攻击基于Gumbel-Softmax的可微文本扰动机制:该机制通过将离散词汇选择过程转化为连续概率优化问题,从而实现基于梯度下降的文本对抗提示自动生成。

5.1.4对抗攻击的方法——多模态大模型的白盒对抗攻击

攻击者通过生成视觉上相似的对抗图像,当绕过模型内置的内容安全过滤机制,导致模型对原本被屏蔽的敏感问题(如非法操作指导)产生危险响应。5.1.4对抗攻击的方法——多模态大模型的白盒对抗攻击恶意语料库Y:攻击目标函数:

5.1.4对抗攻击的方法——扩散模型的黑盒对抗攻击攻击者巧妙利用用户与模型交互过程中普遍存在的认知偏差,精确复现真实场景下用户可能产生的多样化输入误差,使得攻击扰动融入正常交互模式。在黑盒对抗攻击的场景中,攻击者无需掌握目标模型具体架构和参数细节,仅需要通过观测输入-输出映射关系即可实施有效攻击。5.1.4对抗攻击的方法——扩散模型的黑盒对抗攻击攻击者目标:MMD距离与核函数:

5.1.4对抗攻击的方法——扩散模型的黑盒对抗攻击对抗扰动方式及示例:扰动类型扰动方法干净例句扰动后的例句相似拼写随机删除、插入、替换、交换、添加空格、大小写转换、重复单个字符Thequickbrownfoxjumpsoverthelazydog.Thequikcbrownfoxjumpsoverthelazydoggy.相似字形字符替换Thequickbrownfoxjumpsoverthelazydog.Thequickbrownfoxjumps0verthelazydog.相似发音单词替换、字符替换Thequickbrownfoxjumpsoverthelazydog.Thequickbrownfoxjumpsoverthelazydug.5.1.4对抗攻击的方法——扩散模型的黑盒对抗攻击1.关键词重要性评估:2.关键词扰动:按照预设的扰动类型对关键词汇进行随机变换,生成扰动样本。重复多次扰动过程,筛选最具攻击性的对抗样本。

5.1.4对抗攻击的方法——扩散模型的黑盒对抗攻击攻击算法:5.1.4对抗攻击的方法——多模态大模型的黑盒对抗攻击视觉输入通道的引入产生了新的大模型安全隐患。与接收文本输入的大语言模型相比,视觉信息对对抗性扰动的敏感性更高。5.1.4对抗攻击的方法——多模态大模型的黑盒对抗攻击

5.1.4对抗攻击的方法——多模态大模型的黑盒对抗攻击随机无梯度方法实现黑盒场景下的梯度估计:

5.1.4对抗攻击的方法——多模态大模型的黑盒对抗攻击攻击算法:5.1.5对抗攻击的防御Identity输入防御策略模型增强策略输出控制策略当检测到包含变形字符的对抗性输入(如"亻乍白勺"等形近字替换攻击)时,系统通过提示过滤直接拦截高危内容。对于可修复的输入,防御策略会启动提示转换模块,将异常文本纠正为合法表达(如转换为"正在工作的男人"),既保留原意又消除对抗特征。5.1.5对抗攻击的防御Identity输入防御策略模型增强策略输出控制策略对抗训练:通过在模型训练期间输入对抗性示例来训练模型识别并抵御有害输入的能力。模型微调:通过对预训练模型进行微调,可以显著提升模型在抵御对抗性输入方面的能力。5.1.5对抗攻击的防御Identity输入防御策略模型增强策略输出控制策略规则约束:刚性规则约束体系基于预定义安全规则库。通过关键词黑名单、图像合规性检查等机制直接阻断违规内容生成。推理引导:实时调控生成模型在推理阶段的内部状态引导模型的推理过程与恶意概念相悖的方向进行,从而确保输出与安全图像一致。

后门攻击与防御5.25.2.1后门攻击的定义后门攻击的双端特性:当模型接收到不包含触发器的良性样本时,它会展示出同良性模型接近或者相当的性能;当触发器被激活时,模型才会受到攻击者的控制。定义大模型后门攻击是指攻击者通过特定技术手段,在模型训练数据或者参数空间中植入隐蔽的触发器,使得模型在特定输入条件下产生预设的异常输出行为。训练数据免费的第三方数据集遭受后门污染模型基于这些被污染的数据进行训练训练平台后门模型攻击者获取、操纵模型训练过程隐蔽地嵌入后门导致不良后果第三方预训练模型的后门污染跨任务传播的特性5.2.2后门攻击的场景5.2.2后门攻击的场景情感操控、定向拒绝有毒内容生成、偏见性输出无效数学推理后门攻击5.2.2攻击者的目的越狱攻击后门攻击攻击者对目标模型的认知权限和操控能力模型在触发条件下生成特定内容破坏模型的决策稳定性黑盒攻击白盒攻击定向攻击5.2.3后门攻击的分类非定向攻击5.2.4训练与微调阶段的后门攻击—大模型的干净标签后门攻击干净训练集中毒训练集后门数据集构建

5.2.4训练与微调阶段的后门攻击—大模型的干净标签后门攻击干净训练集中毒训练集后门数据集构建

5.2.4训练与微调阶段的后门攻击—大模型的干净标签后门攻击干净训练集中毒训练集后门数据集构建

5.2.4训练与微调阶段的后门攻击—大模型的干净标签后门攻击提示工程:

提示工程作为大语言模型优化的核心技术,本质上是通过构建符合语言认知特性的输入范式,从而实现任务引导与输出调控的技术体系。2.根据提示工程构造中毒样本:

5.2.4训练与微调阶段的后门攻击—大模型的干净标签后门攻击3.中毒模型训练目标:4.攻击算法:

5.2.4训练与微调阶段的后门攻击—大模型的复合后门攻击

在大模型后门攻击的技术演进中,复合后门攻击(CombinedBackdoorAttack,CBA)的本质在于构建分布式触发机制,攻击者需要将离散化的触发键注入模型输入的多重语义组件。5.2.4训练与微调阶段的后门攻击—大模型的复合后门攻击提示组件与触发器插入:2.三层级数据集构建:

5.2.4训练与微调阶段的后门攻击—大模型的复合后门攻击3.训练数据集表示:4.训练目标函数:

5.2.4训练与微调阶段的后门攻击—扩散模型的版权侵犯后门攻击

在版权侵权攻击的场景中,攻击者是特定创作的版权持有者,意图通过法律诉讼手段向训练生成式大模型的组织进行不当利益索偿。5.2.4训练与微调阶段的后门攻击—扩散模型的版权侵犯后门攻击2.使用评估器判定样本生成质量:1.攻击者向开发者所使用的训练集中添加后门数据,使得训练完成的目标模型根据攻击者预设的提示,生成侵犯特定图像版权的内容。

5.2.4训练与微调阶段的后门攻击—大模型的复合后门攻击3.攻击四阶段处理流程:元素分解视觉显著性分析描述创作评估器检验5.2.5无需微调的后门攻击—破坏大模型安全对齐的后门攻击TA2TA2巧妙地运用了激活工程的原理,从而能够破坏大语言模型的安全对齐,实施更具隐蔽性的攻击。激活工程:激活工程涉及对大模型内部激活状态的操控与调整,在这个过程中,人们通过分析模型在处理特定输入时各层神经元的激活模式来深入理解模型的决策机制。5.2.5无需微调的后门攻击—破坏大模型安全对齐的后门攻击TA22.TA2攻击场景表示:攻击者具备对大语言模型的白盒访问权限。同时,攻击者在预算和计算资源方面面临限制。5.2.5无需微调的后门攻击—破坏大模型安全对齐的后门攻击TA23.模型各层激活值表示:4.最优干预点搜索:5.2.5无需微调的后门攻击—破坏大模型安全对齐的后门攻击TA2

5.引导向量构造:6.攻击前向传播过程:5.2.5无需微调的后门攻击—破坏大模型安全对齐的后门攻击TA2

5.2.5无需微调的后门攻击—针对文本编码器的后门攻击

扩散模型使用的文本编码器通过将输入文本映射为高维语义向量,为图像生成器提供精准的语义引导,使模型能依据文本描述生成高度对齐的图像内容。5.2.5无需微调的后门攻击—针对文本编码器的后门攻击双目标优化问题:5.2.5训练与微调阶段的后门攻击—大模型的复合后门攻击2.后门攻击有效性:3.模型可用性:4.总体损失函数:

5.2.6后门攻击的防御Identity输入数据检测后门模型修正触发词识别与阻断框架基于自然流畅度的后门检测审查链方法检测可能存在的后门5.2.6后门攻击的防御Identity后门模型修正输入数据检测基于知识蒸馏的后门修正方法后门模型神经元剪枝神经元混合重构能量延迟攻击5.3

5.4.1能量延迟攻击

能量延迟攻击是一种针对机器学习模

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论