人工智能技术导论课件 第7章-深度伪造攻击与防御_第1页
人工智能技术导论课件 第7章-深度伪造攻击与防御_第2页
人工智能技术导论课件 第7章-深度伪造攻击与防御_第3页
人工智能技术导论课件 第7章-深度伪造攻击与防御_第4页
人工智能技术导论课件 第7章-深度伪造攻击与防御_第5页
已阅读5页,还剩140页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

深度伪造攻击与防御1第7章7.1深度伪造概述2深度伪造概述深度伪造技术泛指使用自编码器或生成式对抗网络等高级深度学习工具创建或合成图像、视频、音频、文本等内容的数字处理技术。深度伪造技术常应用于电影制作、摄影、视频游戏以及虚拟现实等领域。图1.AI换脸软件ZAO图2.电影《星球大战》(左)与《速度与激情7》(右)中的换脸3深度伪造一词起源于一个名为“deepfakes”的用户,该用户于2017年在社交网站上发布了第一个深度伪造视频,将一名著名女演员的脸替换到了色情演员的脸上,对该名女演员的名誉造成了极大的影响。2019年,一款名为ZAO的AI换脸软件在社交媒体刷屏,用户只需要上传一张正脸照片就可以将视频中的人脸替换为自己的脸。针对深度伪造对社会安全造成的极大威胁,寻找到高效快速的深度伪造检测方法变得越来越重要,对此:美国国防部国防高级研究计划局启动了大规模媒体取证计划;Facebook、微软以及人工智能联盟也合作发起了“深度伪造检测挑战”项目;学术界也提出了很多关于深度伪造及其检测相关的论文。深度伪造发展历程4深度伪造技术分类深度伪造技术一般包括人脸(视觉)内容伪造和语音内容伪造两类:(1)人脸伪造技术一般可以分为人脸合成、人脸交换、面部属性操作和面部表情操作四类:①人脸交换和人脸合成这两类技术都对目标人脸的纹理信息进行了修改。人脸合成旨在创造现实世界不存在的面部图像,是在图像级的执行操作。人脸交换是指将一个视频或图像中的人脸替换成另外一个人的脸,也就是我们常说换脸(FaceSwap)。②面部属性操作和面部表情操作没有对面部特征进行修改。面部属性操作又叫人脸编辑,是指修改面部特定区域的属性,例如修改皮肤和头发的颜色、年龄和性别等。面部表情操作也称为面部重现,主要是修改人的面部表情,并没有进行人脸面部特征的替换。5(2)语音内容伪造是指生成虚假的语音内容,包括根据文本内容生成语音内容、将原始人物的声音转换为目标人物的声音,或者基于少量目标人物的声音片段去模拟目标人物的声音等。深度伪造技术分类图3.深度伪造技术深度伪造技术人脸伪造技术语音伪造技术有面部特征修改语音转换语音克隆文本转语音无面部特征修改人脸合成人脸交换面部属性操作67.2人脸合成7人脸合成人脸深度伪造技术根据对人脸的操作程度大致分为四种类型,分别是人脸合成、人脸交换、面部属性操作和面部表情操作。人脸合成人脸合成旨在创造现实世界完全不存在的面部图像,这种操作需要依赖以GAN框架为代表的深度生成模型来完成。表1.使用GAN框架生成的虚假图像数据集数据集真实图像虚假图像100K-Generated-Images(2019)—100000(StyleGAN)100K-Faces(2019)—100000(StyleGAN)DFFD(2020)—100000(StyleGAN)200000(ProGAN)iFaceFaceDB(2020)—250000(StyleGAN)80000(ProGAN)8在Deepfake的场景下,通过使用生成对抗网络可以生成更逼真的图像/视频。(1)生成对抗网络是非监督式学习的一种方法,通过让两个神经网络相互博弈的方式进行学习。(2)生成对抗网络由一个生成网络与一个判别网络组成:①生成网络从潜在空间(latentspace)中随机取样作为输入,其输出结果需要尽量模仿训练集中的真实样本以达到尽可能地欺骗判别网络的目的;②判别网络的输入则为真实样本或生成网络的输出,其目的是将生成网络的输出从真实样本中尽可能分辨出来。(3)两个网络相互对抗、不断调整参数,最终目的是使判别网络无法判断生成网络的输出结果是否真实。补充:生成对抗网络简介人脸合成9图4.生成式对抗神经网络的一般架构人脸合成补充:生成对抗网络简介10ProGAN

[1]由于受到当时GPU算力和显存大小的制约,早期合成高质量图片比较困难。针对这一问题,Karras等人提出了一种新的GAN训练策略—渐进式增长训练策略,并将整个算法命名为ProGAN。训练开始时,生成器G和判别器D都设在一个较低的空间分辨率。随着训练的进行,网络中逐步增加新的层,从而逐步提高生成图像的空间分辨率。图5.

ProGAN训练方法架构人脸合成[1]KarrasT,AilaT,LaineS,etal.ProgressivegrowingofGANforimprovedquality,stability,andvariation[EB/OL].arXivpreprintarXiv:1710.10196,2017.11在整个训练过程中,所有现有的层都保持着可训练的状态。这意味着即使是最低的低分辨率层,也会在整个训练过程中继续学习和适应。总而言之,渐进式增长训练法的关键优势在于它允许GAN在较低分辨率下首先学习图像的大规模结构,然后再逐步关注更细致的细节,这样做显著提高了训练的稳定性,并加快了训练速度,尤其是在生成高分辨率图像时。图6.

ProGAN的生成结果ProGAN

[1]人脸合成12StyleGAN[2]在ProGAN的基础上,经过改进,Karras等人又提出了StyleGAN。在该方法中,作者保留了ProGAN中的渐进式增长训练策略和基本网络结构。与此同时,引入了风格迁移的思想,通过重新设计生成器结构,使其能够自动地、无监督地分离高层级属性(例如在训练人脸数据时的姿势和身份特征)与生成图像中的随机变化成分(例如雀斑、头发等细节)。这种架构还允许针对特定的尺度控制合成过程。StyleGAN通过创新的架构设计实现了更加灵活且可控的图像生成,能够更好地分离和控制生成图像的高级属性及随机细节。人脸合成[1]KarrasT,LaineS,AilaT.Astyle-basedgeneratorarchitectureforgenerativeadversarialnetworks[C]//ProceedingsoftheIEEE/CVFConferenceonComputerVisionandPatternRecognition(CVPR),2019:4401–4410.13传统的生成器架构如图7(a)所示。传统方法可能导致不同因素的特征混合在一起,使得对生成图像中的特定属性进行精确控制变得困难。为了解决这一问题,StyleGAN进行了一些改进,其生成器架构如图7(b)所示。StyleGAN添加了一个由8层多层感知机组成的非线性映射网络,经过该映射网络,将原始的潜在向量转换到一个新的中间潜在空间,得到新向量

。图7.传统生成器架构与StyleGAN生成器架构对比StyleGAN[2]人脸合成14随后,对进行一系列缩放和平移变换,形成风格向量,这些风格向量将被应用到每个卷积层中。StyleGAN在卷积层后设计了一个自适应实例规范化(AdaIN)操作,具体公式如下所示:每个卷积层通过AdaIN来调整其特征图的均值和方差,使其与对应的风格向量中的参数匹配。这意味着在图像合成过程中,每个卷积层可以根据提供的风格信息局部地修改生成内容。随后,StyleGAN简化了传统生成器架构,删除了输入层,直接从学习得到的“4×4×512常数张量”开始图像合成。在生成器网络的每个卷积层之后,引入了一个独立的噪声。这些噪声是单通道的并且包含了不相关的高斯噪声。噪声通过学习到的缩放因子广播到所有特征图,然后添加到卷积层的输出上,以增加图像的细节和多样性。15StyleGAN[2]人脸合成(1)100K-Generated-Images①由Karras等人发布的一个包含100000张由StyleGAN框架生成的虚假人脸的图像数据集。②它提出了一种替代生成器框架,该框架可以自动学习人脸的高级属性(例如姿势、身份等),从而生成富有变化的虚假人脸(例如头发、雀斑等)。(2)100K-Faces该数据集包含了100000张虚假人脸,这些人脸均由StyleGAN框架生成,该数据集考虑到了更可控情况下的面部图像。(3)DFFD①通过预先训练的ProGAN框架和StyleGAN框架,对整个人脸进行合成操作,分别创建了100000张和200000张虚假图像。16StyleGAN[2]人脸合成②包含18416个通过FaceApp方法和79960个通过StarGAN框架生成的虚假图像。③唯一可以进行面部属性操作的公开数据集。(4)iFaceFaceDB①通过StyleGAN框架和ProGAN框架,分别生成了250000和80000张虚假人脸图像。②与DFFD数据集不同的是,为了干扰深度伪造的检测器,该数据集通过GANprintR方法移除了GAN框架产生的指纹,同时还能保持非常逼真的外观。注:图8展示了使用StyleGAN框架直接生成的虚假图像及其在用GANprintR方法移除GAN指纹信息之后的改进版本。17StyleGAN[2]人脸合成GANprintR指纹去除方法[3]图8.

GAN-fingerprint方法的架构一般来说,最先进的面部操纵检测器可以很容易地区分真实的图像和合成的假图像。这通常是由于这些检测器在生成合成图像期间产生的GAN“指纹”的存在和利用。基于自动编码器的GANprintR模块可以从合成图像中去除GAN指纹,并欺骗面部操作检测系统,同时保持所得图像的视觉质量。18人脸合成[3]NevesJC,TolosanaR,Vera-RodriguezR,etal.Ganprintr:Improvedfakesandevaluationofthestateoftheartinfacemanipulationdetection[J].IEEEJournalofSelectedTopicsinSignalProcessing,2020,14(5):1038-1048.图9.基于卷积自动编码器的GAN-fingerprintRemoval模块自动编码器仅使用来自开发数据集的真实的面部图像进行训练。在评估阶段,一旦自动编码器被训练好,我们就可以通过它传递合成的人脸图像,为它们提供额外的自然度,以这种方式去除可能存在于伪造人脸中的GAN指纹信息。19GANprintR指纹去除方法[3]人脸合成图10.虚假人脸以及移除GAN指纹信息后的虚假人脸a)虚假人脸b)去除指纹信息后的虚假人脸20GANprintR指纹去除方法[3]人脸合成

21人脸合成[4]HoJ,JainA,AbbeelP.Denoisingdiffusionprobabilisticmodels[J].Advancesinneuralinformationprocessingsystems,2020,33:6840-6851.扩散模型合成人脸扩散模型合成人脸图11.扩散模型的有向图结构

22人脸合成

23人脸合成扩散模型合成人脸

(1)24人脸合成扩散模型合成人脸图

12.扩散模型在无条件CIFAR10数据集上的渐进生成过程25人脸合成扩散模型合成人脸7.3人脸交换26人脸交换人脸交换是指将一个视频或图像中的人脸替换成另外一个人的脸,也就是常说的换脸(FaceSwap)。与人脸合成在图像级执行操作不同,人脸交换的目标是生成逼真的虚假视频。目前流行的深度学习人脸交换工具工具链接Faceswap/deepfakes/faceswapFaceswap-GAN/shaoanlu/faceswap-GANFew-ShotFaceTranslationGAN/shaoanlu/fewshot-face-translation-GANDeepFaceLab/iperov/DeepFaceLabDFaker/dfaker/dfDeepFaketf/StormWine/DeepFake_tfDeepfakesweb表2.深度伪造工具总结27补充:自动编码器简介随着深度学习技术的发展,自动编码器技术逐渐被应用到深度伪造中:(1)自动编码器(Autoencoder,AE)是一种无监督学习的网络模型,它的主要目标是将输入数据进行压缩编码,并将其解码回原始数据。其核心思想是通过学习数据的低维表示来发现数据中的隐藏结构。(2)自编码器主要由两个部分组成:编码器和解码器。编码器负责将输入数据转换为低维度的表示,而解码器则负责将这些表示转换为更高维度的信息。自编码器旨在通过训练,使解码器的输出尽可能接近原始数据,同时保留低维度表示的丰富信息。(3)在自编码器的训练过程中,为了最大限度地减少重构误差,模型会采用均方误差(MSE)或交叉熵(Cross-Entropy)来计算,以便更好地学习编码器和解码器的参数。此外,自编码器采用一些正则化技术来避免过拟合,如L1和L2正则化,或者采用Dropout等方法来进行优化。28人脸交换X

X’hInputLayerOutputLayerCodeDECODERENCODER图

13.自动编码器的一般架构29人脸交换补充:自动编码器简介(1)Faceswap由Reddit的一名用户开发的FakeApp,它使用的是基于深度神经网络的自编码器-解码器结构。工作原理:①Faceswap方法需要一对“编码器-解码器”,它们分别使用源人脸和目标人脸数据集进行训练,其中两个编码器共享参数,很容易找到两组人脸之间的相似性。②在训练过程中,首先人像会被提取人脸,包含人脸分割的掩膜mask,然后编码器会提取人脸的潜在特征,解码器会对人脸图像进行重构。③在换脸过程中,源人物和目标人物的人脸会用同一个编码器编码,再使用对方的解码器进行解码,从而实现换脸。30人脸交换图

14.Faceswap工作流程ParameterSharingLatentFaceAEncoderAOriginalFaceADecoderADecoderBReconstructedFaceADecoderBOriginalFaceBEncoderBEncoderALatentFaceBOriginalFaceALatentFaceAReconstructedFaceBReconstructedFaceBfromA31人脸交换

32人脸交换

图15.Faceswap-GAN方法概述33人脸交换也可以更直观地看到模型各生成器阶段的效果:图16.关于三个生成器的消融实验34人脸交换③消融实验(AblationStudy)可获结论:1)从图中的列3和列5中,可以看出,在没有分段生成器Gc参与的情况下,转移的面没有覆盖整个目标面,留下明显的伪影。2)从图中的列3和列5以及列4和列6的对比中,可以看出,在没有混合生成器Gb参与的情况下,所转移的面部的肤色和照明条件与其新的上下文不一致。④具体来说,三个生成器模型架构类似:1)全局生成器(a)基于U-Net的残差变体CNN,每个分辨率使用许多瓶颈层。其中,简单卷积被替换为瓶颈块(紫色);级联操作被替换为求和(加号);反卷积被替换为卷积后的双线性上采样。2)增强器(b)利用子模块和若干瓶颈层。最后一个输出块(蓝色)仅用于最高分辨率的增强器。35人脸交换图17.Faceswap-GAN的生成器架构36人脸交换

(2)37人脸交换

(3)(4)38人脸交换其中:⑥Faceswap-GAN的脸部重建与分割过程1)脸部重建生成器Gr,输入源图像与其脸部关键点的heatmap(70个人脸关键点描述人脸轮廓),利用源图像与目标图像的形心与欧拉角,利用形心之间以及欧拉之间的对应关系进行插值,生成具有目标图像人脸欧拉角度的和源图像人脸特征的图像。2)Gr的输出部分被分为两部分,一个负责产生重建的图像,一个负责产生该重建的人脸图像的分割掩码(主要是头发和人脸两部分掩码)。而分割网络Gs则直接产生对背景、人脸和头发的RGB三通道分割掩码。(6)(5)39人脸交换

(7)而分割网络的损失则为标准的交叉熵再加上Gr的指导:(8)4)Faceswap-GAN以交错的方式一起训练Gr和Gs。首先训练一个epoch的Gs,然后训练另一个epoch的Gr。一起训练Gr和Gs有助于过滤从粗糙的面部和头发分割标签中学习到的噪声。40人脸交换⑦Faceswap-GAN的人脸交换效果如图所示图18.Faceswap-GAN的定性人脸交换结果41人脸交换(3)DeepFaceLab(DFL)①DFL是一个集成的开源系统,具有管道的干净状态设计,无需痛苦的调整即可实现逼真的面部交换结果。②与其他面部交换系统不同,DFL提供了一个完整的命令行工具,可以按照用户选择的方式实现。③在DFL中,我们可以将管道(Pipeline)抽象为三个阶段:1)提取a.提取阶段是DFL的第一阶段,旨在从src和dst数据中提取人脸。b.该阶段由许多算法和处理部分组成,即:人脸检测、人脸对齐和人脸分割。c.DFL提供了许多提取模式(即半脸,全脸,全脸),它代表了人脸提取阶段的覆盖区域。通常,我们默认采用全脸模式。42人脸交换图19.DFL中提取阶段的概述在检索到面部内容之后,DFL还提供了一个可选功能,该功能具有可配置的时间步长,可以在单次拍摄中平滑连续帧的面部标志,以进一步确保稳定性。在人脸检测阶段,DFL使用可被替代的S3FD作为默认的人脸检测器;在人脸对齐阶段,DFL采用Umeyama提出的经典点模式映射和变换方法来计算用于人脸对齐的相似性变换矩阵;在人脸分割阶段,DFL引入Xseg工具生成逐像素的分割掩模。43人脸交换2)训练a.不需要对齐的src和dst的面部表情被严格匹配,DFL的目的是提供一个有效的算法范例来解决这个不成对的问题沿着保持高保真度和感知质量的生成的脸。b.DFL提出了两种结构,DF结构和LIAE结构,来解决不成对的问题。DF结构:由编码器、具有src和dst之间的共享权重的Inter和分别属于src和dst的两个解码器组成。DF结构可以完成换脸任务,但不能从dst继承足够的信息,如光亮。LIAE结构:是一种更复杂的结构,具有共享权重的编码器、解码器和两个独立的Inter。与DF相比的主要区别在于InterAB用于生成src和dst的潜在代码,而InterB仅输出dst的潜在代码。44人脸交换图20.DFL中训练阶段的概述45人脸交换3)转换a.由于Umeyama方法的可逆性,转换阶段中所提出的人脸切换方案的第一步是将生成的人脸及其掩码从dst解码器转换到src中目标图像的原始位置。b.接下来的部分是关于混合的,目标是重新调整的脸部沿着沿着其外部轮廓与目标图像无缝配合。任何混合都必须考虑重现面部与目标面部之间的接合处的肤色、面部形状和照明条件,DFL通过泊松混合实现了这一点。c.最后,添加预训练的面部超分辨率神经网络以锐化混合面部。图21.DFL中转换阶段的概述46人脸交换④DFL人脸交换效果如图所示。图22.DFL生成的人脸交换结果Left:源面.

Middle:用于替换的目标面.

Right:结果显示,表明DeepFaceLab可以处理遮挡,不良照明和高亮度的侧面.47人脸交换人脸交换公开数据集代次数据集真实视频虚假视频第一代UADFV(2018)49(Youtube)49(FakeApp)DeepfakeTIMIT(2018)620(Faceswap-GAN)FaceForensics++(2019)1000(Youtube)1000(FaceSwap)1000(DeepFake)第二代DeepFakeDetection(2019)363(Actors)3068(DeepFake)Celeb-DF(2019)890(Youtube)5639(DeepFake)DFDCPreview(2019)1131(Actors)4119(Unknown)(1)第一代人脸交换数据集①UADFV1)包含来自Youtube的49个真实视频,作者根据这些视频,使用FaceApp48人脸交换应用程序创建了49个假视频,将所有视频中的原始人物与尼古拉斯.凯奇的人脸进行了交换。2)所有的虚假视频只有一个身份,每个视频代表一个人,且分辨率都为294×500像素,平均时长为11.14s。②DeepfakeTIMIT1)包含来自VidTIMIT数据集的32个主题的620个虚假视频,这些虚假视频由公开的基于GAN框架的人脸交换算法生成,包含了两种不同质量的图像:64×64像素的低质量图像和128×128像素的高质量图像。并针对不同质量的图像采用了不同的混合技术。2)在这种方法中,使用CycleGAN框架作为生成网络,同时使用多任务卷积神经网络提高人脸检测和对齐的稳定性和可靠性。49人脸交换补充:CycleGAN网络简介CycleGAN是一种实现图像风格转换功能的GAN网络。(1)它属于是使用无配对数据(unpaired)产生图片,早在它出现之前的Pix2Pix方法的关键是提供了在这两个域中有相同数据的训练样本。CycleGAN的创新点在于能够在源域和目标域之间,无须建立训练数据间一对一的映射,就可实现这种迁移。图

23.配对的训练数据与无配对的训练数据50人脸交换

图24.CycleGAN网络的判别器和循环一致性损失51补充:CycleGAN网络简介人脸交换

(9)(10)52补充:CycleGAN网络简介人脸交换

(11)53补充:CycleGAN网络简介人脸交换图25.输入、输出和重建图像的对比54补充:CycleGAN网络简介人脸交换(12)

(13)图26.CycleGAN图像风格转换实例55补充:CycleGAN网络简介人脸交换③FaceForensics++是FaceForensics的扩展,包含从Youtube上提取的1000个真实视频,以及基于此1000个真实视频分别使用FaceSwap方法和DeepFake方法生成的2000个虚假视频。小结第一代数据集视频质量较差且存在很多肉眼可见的瑕疵:①合成人脸和原始人脸肤色不同且合成人脸具有明显的边界;②能从合成人脸中看到来自原始视频的元素;③人物姿势单一,缺乏变化;④帧与帧之间连接不流畅;56人脸交换(2)第二代人脸交换数据集①DeepFakeDetection包含来自16个不同场景中28个演员的363个真实视频,以及基于DeepFake的FaceSwap方法实现的3068个虚假视频。②Celeb-DF主要由从Youtube提取的890个真实视频和5639个虚假视频组成,其中虚假视频是通过开源DeepFake算法的改进版本生成的。③DFDCPreview由Facebook、微软、亚马逊和麻省理工学院以及其他公司和学术机构合作发布的,该数据集由66名演员的1131个真实视频和4119个虚假视频组成,其中虚假视频由两种未知的深度伪造方法生成。57人脸交换7.4面部属性表情操作58面部属性操作面部属性操作也称为人脸编辑,是指通过修改特定区域来改变现有人脸的面部外观,同时保持其他区域不变。面部属性操作包括为目标人物佩戴眼镜、修改皮肤特性等。目前,大多数面部属性操作的方法都是基于GAN网络并且取得了不错的效果,其中StarGAN是一个较为引人注目的成果:StarGAN的提出以解决多域图像迁移问题。多域图像迁移是指将图像的样式、内容或者特征从多个源域(即具有不同特征分布的数据集)迁移到一个或多个目标域的过程。例如,在面部属性操作中,可以分别编辑头发的颜色和是否佩戴眼镜,此为单域迁移。如果要同时编辑这两种特征,即为多域迁移,只训练一个模型能否解决该问题?59ChoiY,ChoiM,KimM,etal.Stargan:Unifiedgenerativeadversarialnetworksformulti-domainimage-to-imagetranslation[C]//ProceedingsoftheIEEEConferenceonComputerVisionandPatternRecognition(CVPR),2018:8789–8797.顾名思义,StarGAN的网络拓扑为星型。普通跨域模型在处理多域问题时,需学习k个域之间的所有映射,必须训练k(k-1)个生成器。而StarGAN至需要一个生成器就可以实现多域之间的转换。那么如何让生成器获得这样的能力呢?图27.普通跨域模型和StarGAN网络拓扑60面部属性操作①在G的输入中添加目标领域的信息,即将图片迁移到&领域的需求告诉模型。②D除了由鉴别图片是否真实的功能外,还要有判别图片属于哪个类别的能力。这样可以保证G中同样的输入图像可以随着目标领域的不同生成不同的效果。③经过以下的训练流程,可以实现单个模型完成多域图像迁移。图28.

StarGAN训练流程61面部属性操作除了StarGAN外,还有一些其他可以实现面部属性操作的方法:(1)Perarnau等人提出可逆条件GAN(IcGAN),IcGAN的核心思想是使整个过程变得可逆,即不仅能够从潜在特征和条件变量生成新的图像,还能反向操作,对于任何生成或修改后的图像,都可以将其解码回原始的特征向量(加上相应的条件变化)。这意味着用户可以选择保留原图某些不变的特性,同时改变指定的属性。(2)也有学者将空间注意力机制引入该领域,提出了SaGAN框架。空间注意力的作用是定位出与目标属性相关的特定区域,使得修改更加精确并同时保留其余不相关区域的特征不变。62面部属性操作Perarnau,G.,VanDeWeijer,J.,Raducanu,B.,&Álvarez,J.M.(2016).Invertibleconditionalgansforimageediting.arXivpreprintarXiv:1611.06355.【IcGAN】Zhang,G.,Kan,M.,Shan,S.,&Chen,X.(2018).Generativeadversarialnetworkwithspatialattentionforfaceattributeediting.InProceedingsoftheEuropeanconferenceoncomputervision(ECCV)(pp.417-432).【SaGan】面部表情操作也称为面部重现,主要是修改人的面部表情。注:区分面部属性操作,面部属性操作是在图像中对面部的一些属性进行修改,例如修改头发或皮肤的颜色、性别、年龄以及添加眼镜等。该领域最流行的操作技术是Face2Face和NeuralTextures:(1)Face2Face是一种基于单目RGB数据的密集无标记面部性能捕获方法。注:单目RGB指的是使用单个相机或传感器获取的图像。这与双目视觉系统形成对比,后者使用两个分开的相机获取图像,以便从两个不同的视点获取深度信息。①在该方法中,首先对预先记录的训练序列使用基于全局非刚性模型的捆绑方法来重建目标演员的形状标识(shapeidentity),这种预处理是在一组训练帧上全局执行的。②在运行时,模型通过基于统计面部先验的密集分析合成方法来跟踪源和目标演员的表情,并实时地将表达式从源传递到目标演员。63面部表情操作③对于最终的图像合成,模型使用传递的表情系数重新渲染目标的脸,并在考虑估计的环境照明的情况下,将其与目标视频的背景合成。图29.Face2Face方法概述64面部表情操作ThiesJ,ZollhoferM,StammingerM,etal.Face2face:Real-timefacecaptureandreenactmentofrgbvideos[C]//ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition.2016:2387-2395.④最后,模型引入了一种新的基于图像的嘴部合成方法,该方法通过从离线样本序列中通过一种新的特征相似性度量的帧到簇匹配策略来检索出最佳匹配的嘴部形状并且扭曲它来生成逼真的嘴部。为了加强时间一致性,使用密集的外观图来找到上一个检索到的嘴部帧和目标嘴部帧之间的折中。注:该模型保持了目标嘴部形状的外观。相比之下,现有方法要么将源嘴部区域复制到目标上,要么渲染通用牙齿代理,这两种方法都会导致不一致的结果。图30.MouthRetrieval过程65面部表情操作(2)NeuralTextures(神经纹理)①在传统的计算机图像合成技术往往需要高质量的3D内容作为输入,然而事实上重建的3D模型总是不完美的(存在一定伪影),因此高维最佳特征图神经纹理(NeuralTextures)和将传统图形管道与神经纹理学习相结合的延迟神经渲染(DeferredNeuralRendering)被提出以用于实现图像级逼真的重新渲染。注:所谓的“延迟”就是指将纹理颜色的生成延迟到了渲染步骤,渲染器需要通过神经纹理重新学习出最终的颜色。②准确的来说,神经纹理是一种具有任意维度的图形基元,存储着每个纹理元素的高维学习特征向量。它是被存储在3D网格上部的2D特征图,可以沿着底层3D几何结构进行变换,这种高维特征图可以由延迟神经渲染管道进行解释从而生成由原始图像经重新渲染合成的最终图像。66面部表情操作ThiesJ,ZollhöferM,NießnerM.Deferredneuralrendering:Imagesynthesisusingneuraltextures[J].ACMTransactionsonGraphics(TOG),2019,38(4):1-12.③如图31为神经纹理与延迟神经渲染的工作过程。1)首先,给定具有有效UV图参数化的对象和关联的神经纹理特征图作为输入,使用标准图形管道对神经纹理进行采样,在目标图像空间中生成屏幕空间特征图。2)然后,基于延迟神经渲染器将屏幕空间特征图转换为图像级别的真实图像。该方法是通过端到端的训练来找到给定任务的最佳神经渲染器和神经纹理特征图。图31.神经渲染过程67面部表情操作除了Face2Face和NeuralTextures方法,还有一些其他可以改变图像和视频中的面部表情的方法:(1)Averbuch-Elor等人提出一个非常流行的方法,他们使用不同主体的视频模拟静止肖像,将视频主体的丰富表情转换到目标肖像上,此方法只需要输入源视频和目标图像。(2)基于GAN框架的图像编辑方法可以很容易地改变微笑的程度,或将目标人物表情从高兴变为愤怒。①StarGAN框架可以将输入图像中的表情转换为不同表情,如愤怒、快乐、中性、悲伤、惊讶和恐惧。②Inter-FaceGAN、UGAN、STGAN和AttGAN等框架能够同时对虚假图像的图像质量进行改进,以及控制编辑参数。68面部表情操作7.5语音生成与检测69语音生成概述语音生成是指利用AI技术根据给定输入合成语音的技术,通常有文本到语音合成(TextToSpeech,TTS)、语音转换(VoiceConversion)和语音克隆(VoiceCloning)3类:语音合成技术概述文本到语音合成根据指定文本内容来合成带有既定文本内容的语音文件,从而使声音能够更好地用于人机交互。语音转换通过修改源说话人的音频波形,使其听起来像目标说话人的声音,从而将原始人物的音色转换为目标人物的音色,同时保持语音内容不变。语音克隆根据少量目标人物的音频内容,去模拟目标人物的音色,合成具有目标人物音色和指定内容的语音文件。表4.语音合成技术70几种语音生成(语音伪造)技术的区别更直观的展示如下图所示:图

32.几种语音伪造技术的区别71语音生成概述目前,语音合成最常用的方法是级联方法和参数化方法:级联TTS系统:①级联TTS系统主要是将语音片段分割成小片段,然后将其串联成新的语音片段。②这种方法由于不可扩展性和不一致性,现已逐渐被淘汰。参数化TTS系统:①参数化TTS系统强调从给定的文本输入中提取声学特征,并使用声码器将其转换为音频信号。②由于语音参数化性能的提高、声道建模和深度神经网络的实现,参数化TTS系统取得的显著成果使得它已成为当前语音合成领域的主流技术。如图33所示为参数化TTS系统的工作流程。72语音合成方法黑盒文本、声音输入声音特征转换语音编码器(F0、声谱图、MFCC等)语音编码器(WaveNet等)合成语音信号在过去的几年里,TTS系统借助深度学习技术的进步生成了更具质量和自然性的语音,具有代表性的模型有:(1)WaveNet模型①WaveNet模型由DeepMind公司于2016年开发的一种概率自回归模型,是一种可以直接作用于原始音频波形的生成模型,它是基于PixelCNN在图像图33.参数化TTS系统的工作流程73语音合成方法

(14)74语音合成方法OordA,DielemanS,ZenH,etal.Wavenet:Agenerativemodelforrawaudio[J].arXivpreprintarXiv:1609.03499,2016.图34.因果卷积层因果卷积的一个问题是,它们需要许多层或大型滤波器来增加感受野,在图34中,感受野仅为5。因此,WaveNet使用膨胀卷积层来提高感受野的数量级以及减少计算量。注:感受野是CNN每一层输出的特征图上的像素点在原始图像上映射的区域大小。75语音合成方法

35.膨胀因果卷积层76语音合成方法缺陷:生成过程耗时,新信号的生成依赖于所有先前生成的样本。它对语音特征具有很高的依赖性,这会对合成过程产生负面影响。(2)VoiceLoop模型①VoiceLoop模型使用一个记忆框架来生成训练过程中没出现过的语音。②VoiceLoop模型将移位缓冲器当作矩阵来进行运算,从而构建语音存储器。文本字符串被其特征化为一个音素列表,随后被解码为短向量的形式。新的上下文向量是通过评估结果音素的编码并将它们相加而产生的。③VoiceLoop与其他语音合成模型的区别是其包含了一个移位缓冲器来代替传统的RNN网络,所有程序之间共享内存。这些特性使得VoiceLoop模型适用于在嘈杂环境中录制的声音。77语音合成方法(3)Tacotron模型①该模型是谷歌于2017年推出的一个端到端的语音合成模型,可以通过给定的<text,audio>对(即文本-语音对)从头开始完全训练。②Tacotron模型是一个类似于WaveNet的生成模型,它包含一个编码器、一个基于注意力机制的解码器和一个后处理网络,该框架接受字符作为输入,生成原始的频谱图,然后将其转换为波形。它采用Griffin-Lim技术,通过迭代计算频谱图中的相位数据来重建声信号。局限性:必须采用多个循环分量单元,使得它的经济效率低下。(4)DeepVoice3模型①DeepVoice3模型是由Wei等人提出的一种全卷积模型,它能够将各种文本特征(如字符、音素、重音)转换为各种声码器参数,如梅尔谱、线性对78语音合成方法数谱、基频、频谱包络等,这些声码器参数可用作波形合成模型的输入从而生成相应的波形。②DeepVoice3模型采用完全并行的计算方式,因此它具有比其他使用循环单元的模型更快的运行速度。③DeepVoice3模型主要由三个模块组成:a.全卷积编码器:接受文本作为输入并将其转换为内部学习表征。b.全卷积解码器:以自回归方式利用多跳卷积注意力机制将学习表示解码为低维度的音频表示。c.转换器:是一个由全卷积构成的后处理网络,从解码器隐藏状态预测最终声码器的参数(取决于声码器选择)。与解码器不同,转换器是非因果的,即它可以依赖未来的上下文信息。79语音合成方法图

36.DeepVoice3模型架构注:模型比较了几种波形合成方法的质量,包括WORLD、Griffin-Lim以及WaveNet。优化的目标是解码器和转换器损失的线性组合。80语音合成方法图

37.ConvolutionBlock结构

81语音合成方法

(15)

82语音合成方法上述强大的端到端语音合成器模型已经部署到大规模商业产品中,如谷歌云TTS系统、亚马逊AWSPolly系统和百度TTS系统。也有诸多基于这些语音合成器模型提出的TTS系统,如:Jia等人提出了一种基于Tacotron2的TTS系统,它能够利用不同演讲者的声音合成音频,包括训练集中不存在的演讲者。Arik等人提出了一种基于DeepVoice3的语音克隆系统,它可以通过使用少量录制的音频样本来生成任何目标的克隆语音。这些模型的目标都是使合成语音和人声高度相似。这些经典的面向内容的TTS系统正逐步向个性化语音方向发展,最终目标是用听起来自然的语音代替非自然的机器语音来改善人机交互。83语音合成方法

84语音转换方法KanekoT,KameokaH.Cyclegan-vc:Non-parallelvoiceconversionusingcycle-consistentadversarialnetworks[C]//201826thEuropeanSignalProcessingConference(EUSIPCO).IEEE,2018:2100-2104.

(16)(17)85语音转换方法(2)Kinnunen等人借鉴了说话识别中的Ivector与PLDA,打破了CycleGAN需要事先指定源说话人和目标说话人身份的局限性,只训练一个系统就能处理许多源说话人和目标说话人。自编码器也被用于语音转换中去,模型中包含了一个编码器和一个解码器,编码器负责把数据的表层特征进行隐表示,解码器负责从隐表示中恢复出表层特征。注:在语音转换任务中,数据的表层特征可以是波形、语谱图、MFCC序列等;隐表示则蕴含了语音内容和说话人的身份信息。图

39.CycleGAN-VC中生成器(左)和判别器(右)的网络架构86语音转换方法Kinnunen,T.,Juvela,L.,Alku,P.,&Yamagishi,J.(2017,March).Non-parallelvoiceconversionusingi-vectorPLDA:Towardsunifyingspeakerverificationandtransformation.In2017IEEEinternationalconferenceonacoustics,speechandsignalprocessing(ICASSP)(pp.5535-5539).除了上述方法外,还有一些语音转换技术值得关注,如:Sun等人提出了一种基于深度双向长短期记忆(DBLSTM)的VC方法,它能够利用DBLSTM的强大建模能力来捕捉语音信号中的长期依赖性,并通过端到端的训练实现了高效且准确的语音转换。Chorowski等人提出了一种基于WaveNet的自编码器模型,该模型特别关注从语音信号中提取出能够捕捉到语音内容的高级语义信息,同时保持对信号中的低级细节保持不变。该模型在处理和理解语音信号中的高级语义内容方面取得了显著的进步。Lu等人提出了一种一次性VC方法,该方法使用了全局说话者嵌入来控制VC系统的目标转换,大大降低了传统VC系统对数据和训练过程的依赖。87语音转换方法Sun,L.,Kang,S.,Li,K.,&Meng,H.(2015,April).Voiceconversionusingdeepbidirectionallongshort-termmemorybasedrecurrentneuralnetworks.In2015IEEEinternationalconferenceonacoustics,speechandsignalprocessing(ICASSP)(pp.4869-4873).IEEE.Chorowski,J.,Weiss,R.J.,Bengio,S.,&VanDenOord,A.(2019).Unsupervisedspeechrepresentationlearningusingwavenetautoencoders.IEEE/ACMtransactionsonaudio,speech,andlanguageprocessing,27(12),2041-2053.Lu,H.,Wu,Z.,Dai,D.,Li,R.,Kang,S.,Jia,J.,&Meng,H.(2019,September).One-shotvoiceconversionwithglobalspeakerembeddings.InInterspeech(pp.669-673).语音克隆技术的输入往往既有文本内容,又有语音内容。语音克隆系统根据输入的语音内容来提取说话人的音色特征,根据输入的文本内容来控制生成的语音需要包含的内容,可以让目标人物“说”任何想“说”的话。这项技术也可以看作一个特定说话人的TTS系统。Jia等人提出了一个经典的语音克隆系统,该系统能够在不同说话者的声音中生成语音音频,包括那些在训练过程中看不见的声音。(1)该系统由三个独立训练的神经网络组成:①说话人编码器网络(SpeakerEncoder)使用来自数千个说话人的无转录的带噪语音的独立数据集在说话人验证任务上训练,以从来自目标说话人的仅几秒的参考语音生成固定维度的嵌入向量;②基于Tacotron2的序列到序列合成网络,其以说话人嵌入为条件从文本生成梅尔频谱图;88语音克隆方法图

40.语音克隆流程说话人语音音素序列语音编码器文本编码器拼接注意力机制解码器声码器合成器语音编码对数梅尔声谱图合成语音③将梅尔频谱图转换成时域波形样本的基于自回归WaveNet的声码器网络。(2)简单来说,该系统的工作流程为:一个语音编码器用于提取说话人的音色特征;一个文本编码器用于编码需要生成的文本内容。得到语音编码和文本编码后将它们进行拼接,送入一个解码器中生成梅尔声谱图,最后连接一个声码器将梅尔声谱图合成最终的语音。如图40所示:89语音克隆方法检测方法可分为经典检测方法和深度学习检测方法。然而,目前的大多数方法都是基于深度学习的。这背后的原因之一是,经典检测方法往往需要为每种攻击类型建立单独的模型,这降低了此类解决方案的可伸缩性和灵活性。针对语音生成的三种类型,接下来分别介绍语音生成、语音转换和语音克隆技术的主流检测方法。语音合成的检测技术虽然语音合成能帮助我们进行更好的人机交互,为我们的生活提供极大的便利,但语音合成的滥用也存在一些安全风险,可能导致个人身份的信息泄露以及名誉的损坏等问题。(1)Wu等人提出了一种基于真实化轻量卷积神经网络(LightweightConvolutionalNeuralNetwork,LCNN)的深度伪造语音检测方法①该方法的检测流程如图43所示,概括而言,该方法主要有以下几个步骤:90深度伪造语音检测WuZ,DasRK,YangJ,etal.Lightconvolutionalneuralnetworkwithfeaturegenuinizationfordetectionofsyntheticspeechattacks.arXiv2020[J].arXivpreprintarXiv:2009.09637,2009.1)首先,使用语音的对数功率谱(LogarithmicPowerSpectrum,LPS)作为真实化转换器的输入。注:真实化转化器是一个CNN网络,主要由两部分组成,分别是编码器和解码器,真实化转换器并不改变真实语音的特征,而是将虚假语音映射到不同的输出,最大限度地放大真实语音和虚假语音之间的差异。2)然后,真实化转换器将输入的对数功率谱转换为真实化的特征,作为后续LCNN的输入。真实化转换器的工作步骤:a.编码阶段:输入信号首先通过多个卷积层进行压缩,然后通过激活函数leakyReLU得到卷积结果。b.解码阶段:先反卷积,然后使用ReLU激活函数激活。通过这种方式,转换器就像自编码器一样能够学习真实语音的特征分布,真实化转化器的工作过程可以看作是一个特征分解(featuregenuinization)的过程。91深度伪造语音检测

41.MFM函数注:MFM激活函数是一种基于最大值操作的非线性激活函数。它的核心思想是将输入特征图分为两个通道,并选取两个通道中对应位置的较大值作为输出。函数表达式如下:(18)92深度伪造语音检测图

42.真实化转换器的特征分解过程注:这一过程有两个阶段。第一阶段集中于使用仅从真实语音导出的特性特征来训练转换器。第二阶段的转换器用于转换任何给定的特征,以增强对真实语音和欺骗语音的区分。93深度伪造语音检测图

43.基于真实化轻量卷积神经网络的检测流程(右图为转换器结构)真实化转换器对数功率谱轻量卷积神经网络真/假94深度伪造语音检测语音转换的检测(2)Wang等人提出了一种名为DeepSonar的基于监测说话人识别系统的神经元行为的深度神经网络(DNN),用于识别人工智能合成的假声音①DeepSonar基于使用简单的二进制分类器来监测基于DNN的说话人识别系统(SR)的神经元行为,以识别人工智能合成的假声音。DNN中逐层神经元的行为可以为分类器提供比原始语音输入更精准的特征和更清晰的信号,这是区分真实的人类语音和伪造语音的关键点。DNN是指深度神经网络,CNN、RNN、GAN等都属于其范畴之内,从神经网络的发展上来看,神经网络是基于感知机的扩展,而DNN可以理解为有很多隐藏层的神经网络。监测神经元行为是一种重要的技术,用于搜索DNN的一组输入之间的差异并调查DNN的内部行为,广泛用于确保DNN的质量,保护DNN的安全性,如对抗对抗性示例攻击等。95深度伪造语音检测WangR,Juefei-XuF,HuangY,etal.Deepsonar:Towardseffectiveandrobustdetectionofai-synthesizedfakevoices[C]//Proceedingsofthe28thACMinternationalconferenceonmultimedia.2020:1207-1216.②该方法致力于检测语音合成系统(TTS)和语音克隆技术(VoiceCloning)生成的伪造语音,它们是人工智能合成的,生成的内容比重放攻击(ReplayAttack)对我们的耳朵更难区分。图

44.DeepSonar处理由语音生成、语音克隆生成的虚假语音以及真实世界的语音的流程96深度伪造语音检测语音转换的检测③如图40为DeepSonar的模型架构,接下来简单介绍下DeepSonar检测伪造语音的工作原理:1)首先收集大量真实的和合成的声音,这些声音在语言、口音、性别和合成技术方面具有良好的多样性。a.真实的声音是从公共数据集和互联网上的免费视频中收集的,这些声音是由男性或女性的口音用不同的语言说的。b.在伪造语音采集中,模型使用TTS技术根据给定的文本合成新的语音,并且使用语音克隆技术生成具有与真实声音相似音色的伪造声音片段。2)然后,采用基于DNN的说话人识别(SR)系统来捕获真实的和虚假的语音的逐层神经元行为,并使用设计的神经元覆盖标准(例如ACN和TKAN)来寻找对输入之间的细微差异更有价值的激活神经元。3)最后,捕获的神经元行为作为输入特征向量,用于训练基于浅层神经网络97深度伪造语音检测语音转换的检测图

45.DeepSonar的模型架构的简单监督二进制分类器,以预测语音片段是真实的人类语音还是合成的虚假语音。98深度伪造语音检测语音转换的检测(3)Kawa等人提出了一种新的基于频谱图的SpecRNet神经网络体系结构①SpecRNet将音频信号的LFCC(线性频率倒谱系数)表示作为输入。网络的输入进行二维批归一化处理,然后使用SeLU激活函数。②模型由3个残差块组成,每个残差块包含2个卷积层,这些卷积层之前是批归一化层和LeakyReLU激活函数。只有第一个残差块在开始时跳过归一化和激活层,因为输入在一开始已经由批处理化层和SeLU层处理过了。③模型还在残差块的跳跃连接上使用了一个kernel_size为1的额外卷积层。卷积层用于同步捷径(跳跃连接)和主路径之间的通道数量。这些块中有两种不同的卷积通道数,需要注意的是,由于第三残差块中固定64的通道数量,故不需要捷径和主路径之间的同步,因此在这种情况下不需要附加卷积层。④接下来,每个残差块后面是二维最大池化层,FMS注意力块和下一个二维最大池化层。SpecRNet的结构如图46所示。99深度伪造语音检测语音转换的检测KawaP,PlataM,SygaP.Specrnet:Towardsfasterandmoreaccessibleaudiodeepfakedetection[C]//2022IEEEInternationalConferenceonTrust,SecurityandPrivacyinComputingandCommunications(TrustCom).IEEE,2022:792-799.图46.SpecRNet的架构设计100深度伪造语音检测语音转换的检测图47.SpecRNet中的残差块和FMS注意力块的可视化展示101深度伪造语音检测语音转换的检测

102深度伪造语音检测语音转换的检测Chen,T.,Kumar,A.,Nagarsheth,P.,Sivaraman,G.,&Khoury,E.(2020,November).GeneralizationofAudioDeepfakeDetection.InOdyssey(pp.132-137).

(20)(19)103深度伪造语音检测语音转换的检测训练音频测试音频日志滤波器组频率增强层ResNet块真假全连接层分类器图

48.基于大边缘余弦损失函数和频率增强的检测流程注:后端分类器是由一个具有256个神经元的全连接层、批次归一化层、Dropout层和一个Softmax输出层组成的神经网络。④这种检测技术虽然取得了很好的音频检测效果,但在存在噪声的情况下性能表现不佳。104深度伪造语音检测语音转换的检测在某种程度上语音克隆技术可以看作是特定说话人的文本到语音的生成技术,所以一些主流的由语音生成技术合成的伪造语音的检测方法同样适用于语音克隆技术合成的伪造语音。故本小节介绍一种与语音克隆技术带来的安全威胁非常类似的攻击手段的检测技术,即重放攻击(ReplayAttack)。(1)Huang等人提出了一种音频重放欺骗攻击检测方法①该方法结合了分段线性滤波器组特征提取和增强注意力的DenseNet-BiLSTM网络。②检测步骤:1)首先,利用短期过零率和能量从每个语音信号中识别无声段。2)然后,从相对高频域(3kHz到8kHz)的指定段中提取线性滤波器组特征。语音克隆的检测重放攻击的检测105深度伪造语音检测HuangL,PunCM.Audioreplayspoofattackdetectionbyjointsegment-basedlinearfilterbankfeatureextractionandattention-enhancedDenseNet-BiLSTMnetwork[J].IEEE/ACMTransactionsonAudio,Speech,andLanguageProcessing,2020,28:1813-1825.3)最后,建立一个注意力增强的DenseNet-BiLSTM来定位音频操作。注:音频重放欺骗攻击指的是黑客录制合法用户的语音指令或认证信息,然后将其重播给系统,以模拟合法用户的身份进行欺骗。这是一种安全威胁,目的是欺骗系统以获取未经授权的访问或信息。③如图49所示,在重放攻击的实现过程中,重放语音比真实语音多了两个步骤,即录制和回放。虽然有许多不同类型的录音和回放设备,但重放语音肯定具有这两种设备的特点。因此,与语音识别不同,重放欺骗检测应该关注的不是语音内容或说话人的音色特征,而是它是否具有录音回放设备的声音特征。④为了在检测任务中找出重放攻击过程中两个步骤的主要特征,分别将真实语音和重放语音(具有同一个人说的相同句子)转换为波形。如图50所示为两者的波形,它们之间最重要的区别是相对无声的部分,即图中红框部分。重放攻击的检测技术106深度伪造语音检测图

49.具有重放和真实语音的说话人自动确认系统的实现过程107重放攻击的检测技术深度伪造语音检测可观察到重放语音的静音部分有非常明显的背景噪声。⑤该方法提出了一种基于分段的线性滤波器组(LFBank)的特征提取方法。图

50.真实语音(上)和重放语音的波形(下)108重放攻击的检测技术深度伪造语音检测图51.基于分段的线性滤波器组特征提取109重放攻击的检测技术深度伪造语音检测⑥接着,该方法使用了注意力增强的DenseNet-BiLSTM架构,可以避免过拟合问题。图52.(a)注意力增强的DenseNet-BiLSTM网络.(b)注意力模块.(c)过渡层.110重放攻击的检测技术深度伪造语音检测(21)

111重放攻击的检测技术深度伪造语音检测LaiCI,AbadA,RichmondK,etal.Attentivefilteringnetworksforaudioreplayattackdetection[C]//ICASSP2019-2019IEEEInternationalConferenceonAcoustics,SpeechandSignalProcessing(ICASSP).IEEE,2019:6316-6320.

图53.扩张残差模块(DRM)和扩张残差网络(DRN)112深度伪造语音检测重放攻击的检测技术

(22)(23)113深度伪造语音检测重放攻击的检测技术图54.注意力滤波概述114深度伪造语音检测重放攻击的检测技术7.6深度伪造防御115深度伪造的安全风险深度伪造安全风险主要体现在这项技术不合理应用带来的安全风险。深度伪造安全风险主要包括3个方面:(1)个体肖像权、名誉权和隐私权受到损害。若有不法者利用深度伪造技术制作虚假色情视频、虚假言论视频,则有可能被用作诬陷、诽谤和报复的手段和工具。(2)助长诈骗盛行。一些传统诈骗手段在深度伪造技术的加持下更加猖獗,特别是语音诈骗。(3)加剧网络谣言的传播,削弱新闻媒体行业的社会信任。深度伪造技术同样可能被用于篡改新闻报道中的音频和视频,生成虚假新闻信息,成为网络谣言生产工具,助长网络谣言的传播。针对深度伪造技术应用失控的问题,将从数据集和技术防御等角度来讨论如何应对深度伪造的防御方法。116深度伪造防御方法数据集针对深度伪造技术的滥用,首要一点是要获取一个性能良好的鉴别模型来对伪造人脸或者伪造语音进行鉴别,先决条件是获取深度伪造数据并建立完备的数据集进行模型训练。按照数据内容划分,常见的伪造数据集可以按照下列方式划分:数据类型数据集真实视频(语音)数量/伪造视频(语音)数量(个)视觉伪造数据UADFV49/49Celeb-DF590/5639FaceForensics1004/1004FaceForensics++1000/1000Deepfake-TIMIT320/640Mesonetdata11509/8000DFDC100129/19025DeepForensics-1.050000/10000WildDeepfake0/1869语音伪造数据ASVspoof20159404/184000ASVspoof2019-表5.常见的深度伪造数据集117表5中大部分视觉伪造数据集的内容在前面章节已有介绍,接下来主要针对语音伪造数据集进行介绍。(1)ASVspoof2015内容:由10种不同的语音合成和语音转换欺骗算法生成,包含原始的和欺骗的语音数据。原始语音由106个人(45位男性和61位女性)的说话记录组成,这些记录没有噪声影响。数据集划分说明训练集由3750个原始话语片段和12625个欺骗话语片段组成验证集由3497个原始话语片段和49875个欺骗话语片段组成测试集由9404个原始话语片段和184000个欺骗话语片段组成表6.ASVspoof2015语音伪造数据集划分118深度伪造防御方法数据集深度伪造防御方法(2)ASVspoof2019该数据集包含了所有语音欺骗类型的攻击,将攻击场景分为两种:①逻辑访问场景,即直接将欺骗攻击的语音注入自动说话人认证系统,这些语音由最新的语音合成和语音转换技术生成;②物理访问场景,语音数据由麦克风等设备捕捉后,经一些专业设备重放。这些语音数据由107个人(46位男性和61位女性)的说话记录组成。数据集划分说明攻击类型训练集由20个人的语音数据组成测试集中的攻击类型与训练集、验证集中均不相同验证集由10个人的语音数据组成测试集由48个人的语音数据组成表

7.ASVspoof2019语音伪造数据集划分119数据集针对深度伪造技术的问题,用AI技术手段进行防御,按照视觉伪造内容和语音伪造内容的不同,可以分出不同的鉴别手法。(1)人脸(视觉)伪造防御分为技术检测和对抗防御两个维度:①技术检测是指基于深度学习模型来检测图像或视频是否为生成的伪造内容,根据鉴别维度或挑选特征的不同,这类方法可以继续细化为不同的方法。这是一种事后通过技术手段对伪造内容进行真伪检测的方法。②对抗防御是一种更加主动的防御方法,基于对抗样本攻击的思路,给输入数据添加少量特殊生成的噪声,使得深度伪造失败,生成模糊、带有强干扰色块的视频;这是一种从数据源上防范用户图像、视频被用于深度伪造的防御方法;这是一种事前对源数据进行处理,使得深度伪造失败的方法。(2)针对语音伪造内容的防御方法,则更多采用“利用算法检测语音内容是否为伪造内容”。技术防御120深度伪造防御方法图55.常见的深度伪造防御方法分类常见的深度伪造防御方法分类:121技术防御深度伪造防御方法目前行业内对事后检测的解决方案颇多。使用算法对技术内容进行检测,往往根据提取特征的不同,可以分为不同的类型,如基于图像篡改痕迹的方法、基于数据驱动的方法、基于生理特征的方法等。(1)基于图像篡改痕迹的方法早期的伪造视频质量较差,因此早期的一些伪造视频技术检测方法大多提取篡改痕迹特征来对伪造视频进行鉴别,主要存在以下问题:①生成的视频带有明显的伪影,图像分辨率低。②图像的数据点插值是随机的,导致全局眼睛左右颜色不一致。③光照反射的不一致会丢失眼睛反射细节。④牙齿部分的生成较模糊,

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论