CN119028369B 基于音频驱动的人脸对话生成模型的人脸视频生成方法 (浙江大学金华研究院)_第1页
CN119028369B 基于音频驱动的人脸对话生成模型的人脸视频生成方法 (浙江大学金华研究院)_第2页
CN119028369B 基于音频驱动的人脸对话生成模型的人脸视频生成方法 (浙江大学金华研究院)_第3页
CN119028369B 基于音频驱动的人脸对话生成模型的人脸视频生成方法 (浙江大学金华研究院)_第4页
CN119028369B 基于音频驱动的人脸对话生成模型的人脸视频生成方法 (浙江大学金华研究院)_第5页
已阅读5页,还剩29页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

US2021280190A1,2021.0基于音频驱动的人脸对话生成模型的人脸本发明公开了一种基于音频驱动的人脸对立唇音同步判别网络和基于质量注意力的音频建基于质量注意力的音频驱动唇形网络的整体以及待生成人物的人脸图像输入训练完成的网改善了唇形生成的同步效果和整体人脸的图像然头部运动、唇音同步效果良好的真实人脸视2S1)建立唇音同步判别网络和基于质量注意S2)采集若干人物在说话时的视频并将每个视频划分为人物音频以及连续帧的人脸图S3)将唇音同步训练集输入唇音同步判别网络中进行训练,直至唇音同步判别网络的S4)将唇音同步训练集输入基于质量注意力的音频驱动判别损失函数构建基于质量注意力的音频驱动唇形网络QAW的整体损失函数,获得基于质量注意力的音频驱动唇形网络QAW的整体损失值并使用梯度下降法更新网络参数,直至整生成人物的人脸图像输入训练完成的基于质量注意力的音频驱动唇形网络QAW中,训练完成的基于质量注意力的音频驱动唇形网络QAW处理后输出当前人物在读取当前回复音频时所述的步骤S1)中,基于质量注意力的音频驱动唇形网络QAW包括依次连对话生成模型的FSIM损失函数以及重构损失函数构建基于质量注意力的音频驱动唇形网人脸生成器包括音频编码器、人脸编码器和人脸解码器,人2.根据权利要求1所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其3.根据权利要求1所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其所述的音频编码器包括依次连接的第一卷积层Conv、第二卷积层Conv、第三卷积层3第九空间注意力机制SA、第九融合函数Concat、第六二维卷积Conv2d和第七二维卷积针对唇音同步训练集中的每组人物音频以及连续帧的人脸图意力机制SA的输出和第二唇形特征向量共同输入第一融合函数Concat中进行处理后输入积层Conv的输出共同输入第二融合函数Concat中进行处理后输出至第十五卷积层Conv中第四空间注意力机制SA的输出和第十一卷积层Conv的输出共同输入第四融合函数Concat输出和第十卷积层Conv的输出共同输入第五融合函数Concat中进行处理后输出至第十八出共同输入第六融合函数Concat中进行处理后依次输出至第十九卷积层Conv和第一位置输入第七空间注意力机制SA中进行处理,将第七空间注意力机制SA的输出和第八卷积层Conv的输出共同输入第七融合函数Concat中进行处理后依次输出至第二十卷积层Conv和卷积层Conv的输出共同输入第八融合函数Concat中进行处理后依次输出至第二十一卷积4的输出和第二二维卷积Conv2d的输出共同输入第九融合函数Concat中进行处理后依次输4.根据权利要求1所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其5.根据权利要求1所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其s量判别器的质量评估损失函数以及人脸对话生成模型的质量评估损失索引6.根据权利要求5所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其每帧人脸图像之间的曼哈顿L1距离获得的损失7.根据权利要求5所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其所述的视频质量判别器的对抗损失函数Ldisc具i~Lg表示生成的人脸视频输入到视频质量判别器生成的一维向量的第i个数,N表示视频质量判别器生成的一维向量的中的元素总个数,D()表示视频质量判别器判别输入为真的概率;xi~LG表示真实的人脸视频输入到视频质量判别器生成的一维向量的第i个8.根据权利要求5所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其g和GG分别表示使用Sobel算子计算获得的生成的人脸视频和真实的人脸视频中对应的视频帧的梯度幅度,Pg和PG分别表示根据生成的人脸视频和真实的人脸视频中对应的视频帧的梯度幅度计算获得的对应的视频帧相位一致性;T1和T2分别表示第一和第二调59.根据权利要求1所述的基于音频驱动的人脸对话生成模型的人脸视频生成方法,其字输入对话系统中后直接输入至chatgpt模块中生成回复文字,待回复音频输入对话系统中后首先输入至自然语言处理模块中进行处理后转换为待回复音频中的文字,再输入至将回复音频以及待生成人物的人脸图像输入训练完成的基于质量注意力的音频驱动唇形网络QAW的人脸生成器中,训练完成的人脸生成器处理后输出当前人物在读取当前回6使用户产生违和感,如何提高人脸动画技术的真实性仍然是计算机动画中亟待解决的难[0003]为了解决模型合成人脸动画中人物在说话过程中面部运动不自然的问题,就算是后期图像增强也无法生成高质量的人脸序列。[0007]S1)建立唇音同步判别网络和基于质量注意力的音频驱动唇形网络QAW(Quality_[0008]S2)采集若干人物在说话时的视频并将每个视频划分为人物音频以及连续帧的人[0009]S3)将唇音同步训练集输入唇音同步判别网络中进行训练,使其判别唇音同步人[0010]S4)将唇音同步训练集输入基于质量注意力的音频驱动唇形基于判别损失函数构建基于质量注意力的音频驱动唇形网络QAW的整体损失函数,获得基于质量注意力的音频驱动唇形网络QAW的整体损失值并使用梯度下降法更新网络参数,直7及待生成人物的人脸图像输入训练完成的基于质量注意力的音频驱动唇形网络QAW中,训练完成的基于质量注意力的音频驱动唇形网络QAW处理后输出当前人物在读取当前回复音干二维卷积Conv2d和若干层卷积层Conv,每层卷积层Conv由三个依次连接的二维卷积似度方法(CosineSimilarity)获得第一音频特征向量和第一唇形特征向量之间的相似度[0014]其中,Similarity(A,B)表示第一音频特征向量A和第一唇形特征向量B之间的相[0016]基于质量注意力的音频驱动唇形网络QAW是从音频中提取声音波形信息,从视频模型可以生成一系列与输入音频匹配的唇部运动序列。函数;人脸编码器包括依次连接的第二二维卷积Conv2d、第七卷积层Conv、第八卷积层8二十一卷积层Conv、第三位置注意力机制CA、第九空间注意力机制SA、第九融合函数间注意力机制SA的输出和第二唇形特征向量共同输入第一融合函数Concat中进行处理后三卷积层Conv的输出共同输入第二融合函数Concat中进行处理后输出至第十五卷积层六卷积层Conv的输出和第十一卷积层Conv的输出共同输入第四空间注意力机制SA中进行制SA的输出和第十卷积层Conv的输出共同输入第五融合函数Concat中进行处理后输出至输入第六空间注意力机制SA中进行处理,将第六空间注意力机制SA的输出和第九卷积层Conv的输出共同输入第六融合函数Concat中进行处理后依次输出至第十九卷积层Conv和卷积层Conv的输出共同输入第七融合函数Concat中进行处理后依次输出至第二十卷积层和第七卷积层Conv的输出共同输入第八融合函数Concat中进行处理后依次输出至第二十机制SA的输出和第二二维卷积Conv2d的输出共同输入第九融合函数Concat中进行处理后9脸解码器由包含残余的卷积层和上采样的转置卷积[0020]空间注意力机制SA有两个输入端,分别为人脸Face特征向量输入和音频Audio特至二维卷积Conv2d和激活函数sigmoid中进行处理,激活函数sigmoid的输出和音频A分别经过宽度方向和高度方向的两个平均池化层AvgPool,然后输出共同输入到融合函数Concat中在通道维度上进行拼接,拼接后的向量输入到二维卷积Conv2d中,二维卷积方向的两个卷积层Conv中,两个卷积层Conv的输出再分别输入到链各个激活函数Sigmoid中,两个激活函数Sigmoid的输出和输入端的特征向量相乘后再与和输入端的特征向量相频质量判别器的包含唇形的下半张脸的质量评估损失函数以及人脸对话生成模型的质量[0029]所述的重构损失函数Lrecon为根据生成的人脸视频以及真实的人脸视频中对应的每帧人脸图像之间的曼哈顿L1距离获得的损失gen[0030]所述的视频质量判别器的包含唇形的下半张脸的质量评估损失函数L具体如gen[0034]其中,xi~Lg表示生成的人脸视频输入到视频质量判别器生成频中对应的视频帧的梯度幅度,Pg和PG分别表示根据生成的人脸视频和真实的人脸视频中对应的视频帧的梯度幅度计算获得的对应的视频帧相位一致性;T1和T2分别表示第一和第二调解参数,用于控制相位一致性和梯度幅度的权重;特征相似性索引(FSIM,feature视频或真实的人脸视频中的视频帧,Sobelx和Sobely分别表示Sobel算子在图像的水平X方字输入对话系统中后直接输入至chatgpt模块中生成回复文字,待回复音频输入对话系统中后首先输入至自然语言处理模块中进行处理后转换为待回复音频中的文字,再输入至[0040]将回复音频以及待生成人物的人脸图像输入训练完成的基于质量注意力的音频驱动唇形网络QAW的人脸生成器中,训练完成的人脸生成器处理后输出当前人物在读取当[0041]本发明设计了音唇同步判别网络和基于Quality_Attention_Wav2lip的音频驱动唇形网络;方法通过选取姿势帧的前T帧作为基于质量注意力的音频驱动唇形Quality_[0049]如图1所示,本发明的基于音频驱动的人脸对话生成模型的人脸视频生成方法具卷积Conv2d和若干层卷积层Conv,每层卷积层Conv由三个依次连接的二维卷积Conv2d构[0053]其中,Similarity(A,B)表示第一音频特征向量A和第一唇形特征向量B之间的相[0056]基于质量注意力的音频驱动唇形网络QAW是从音频中提取声音波形信息,从视频模型可以生成一系列与输入音频匹配的唇部运动序列。第二十卷积层Conv、第二位置注意力机制CA、第八空间注意力机制SA、第八融合函数间注意力机制SA的输出和第二唇形特征向量共同输入第一融合函数Concat中进行处理后三卷积层Conv的输出共同输入第二融合函数Concat中进行处理后输出至第十五卷积层六卷积层Conv的输出和第十一卷积层Conv的输出共同输入第四空间注意力机制SA中进行制SA的输出和第十卷积层Conv的输出共同输入第五融合函数Concat中进行处理后输出至输入第六空间注意力机制SA中进行处理,将第六空间注意力机制SA的输出和第九卷积层Conv的输出共同输入第六融合函数Concat中进行处理后依次输出至第十九卷积层Conv和卷积层Conv的输出共同输入第七融合函数Concat中进行处理后依次输出至第二十卷积层和第七卷积层Conv的输出共同输入第八融合函数Concat中进行处理后依次输出至第二十机制SA的输出和第二二维卷积Conv2d的输出共同输入第九融合函数Concat中进行处理后入端后,人脸Face特征向量分别经过平均池化层AvgPool和最大池化层MaxPool中进行处分别经过宽度方向和高度方向的两个平均池化层AvgPool,然后输出共同输入到融合函数Concat中在通道维度上进行拼接,拼接后的向量输入到二维卷积Conv2d中,二维卷积方向的两个卷积层Conv中,两个卷积层Conv的输出再分别输入到链各个激活函数Sigmoid中,两个激活函数Sigmoid的输出和输入端的特征向量相乘后再与和输入端的特征向量相recon[0070]重构损失函数Lrecon为根据生成的人脸视频以及真实的人脸视频中对应的每帧人脸图像之间的曼哈顿L1距离获得的损失构成[0075]其中,xi~Lg表示生成的人脸视频输入到视频质量判别器生成频中对应的视频帧的梯度幅度,Pg和PG分别表示根据生成的人脸视频和真实的人脸视频中对应的视频帧的梯度幅度计算获得的对应的视频帧相位一致性;T1和T2分别表示第一和第[0081]S2)采集若干人物在说话时的视频并将每个视频划分为人物音频以及连续帧的人[0082]S3)将唇音同步训练集输入唇音同步判别网络中进行训练,使其判别唇音同步人[0083]S4)将唇音同步训练集输入基于质量注意力的音频驱动唇形基于判别损失函数构建基于质量注意力的音频驱动唇形网络QAW的整体损失函数,获得基于质量注意力的音频驱动唇形网络QAW的整体损失值并使用梯度下降法更新网络参数,直及待生成人物的人脸图像输入训练完成的基于质量注意力的音频驱动唇形网络QAW中,训练完成的基于质量注意力的音频驱动唇形网络QAW

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论