CN114972590B 虚拟形象动作生成模型的训练方法、动作生成方法及装置 (北京京东尚科信息技术有限公司)_第1页
CN114972590B 虚拟形象动作生成模型的训练方法、动作生成方法及装置 (北京京东尚科信息技术有限公司)_第2页
CN114972590B 虚拟形象动作生成模型的训练方法、动作生成方法及装置 (北京京东尚科信息技术有限公司)_第3页
CN114972590B 虚拟形象动作生成模型的训练方法、动作生成方法及装置 (北京京东尚科信息技术有限公司)_第4页
CN114972590B 虚拟形象动作生成模型的训练方法、动作生成方法及装置 (北京京东尚科信息技术有限公司)_第5页
已阅读5页,还剩43页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

本公开涉及虚拟形象动作生成模型的训练2针对虚拟形象的每个第一图像序列,获取第一图像序列的真值其中,所述根据第一图像序列的真值和第二图像序列的真值,第一中间变量包括从第一图像序列的基础姿势到第二图像序列的39.根据权利要求8所述的虚拟形象动作生成模型的训练方法,其中,所述根据处理结根据语音,预测从第一图像序列的基础姿势到第二图像序列的基础姿势是否发生改根据文本中的关键词,预测从第一图像序列的基础姿势到第二图像序根据第二图像序列的真值和第二图像序列的姿势调整序列的预测根据第二图像序列的真值和第二图像序列的真值的均值,以及第二图像序列4根据第二图像序列的真值与第二图像序列的真值的均值之间的差,计算第二中间变根据第二图像序列的姿势调整序列的预测值和第二中间变量之间根据第二图像序列的真值和第二图像序列的姿势调整序列的预测根据所述第一损失函数、第二损失函数和第三损失函数的加根据第一图像序列真值的编码的解码结果、第二图像序列根据第一图像序列真值的编码的解码结果和第一图像序列真根据第二图像序列的真值和第二图像序列的姿势调整序列的预测5基于第二图像序列的基础姿势的预测值,利用第二图像序列的姿根据第二图像序列的基础姿势的预测值,生成第二图像序列的基础姿势预测值的序通过将第二图像序列的基础姿势预测值的序列与第二图像序列的姿势调整序列的预利用虚拟形象动作生成模型,根据初始基础姿势和要求1-23任一项所述的虚拟形象动作生成模型训练方整序列为图像序列中虚拟形象的动作幅度和动作节奏的至少一个的参基于图像序列的基础姿势,利用图像序列的姿势调整序列来调整虚6将获取的初始基础姿势作为第一个语音片段的针对除了第一个语音片段外的其他语音片段,将利用虚拟形象动至少一个的参数序列;根据第二图像序列的基础姿势的预测值和姿势调整序列的预测值,其中,所述根据第一图像序列的真值和第二图像序列的真值,初始基础姿势生成单元,被配置为利用虚拟形象动作生成姿势调整序列生成单元,被配置为利用虚拟形象动作生成耦接至所述存储器的处理器,所述处理器被配置为基于行根据权利要求1至23任一项所述的虚拟形象动作生成模型训练方法,或执行根据权利要实现根据权利要求1至23任一项所述的虚拟形象动作生成模型训练方法,或根据权利要求7二图像序列的基础姿势的预测值和姿势调整序列的预测值,生成第二图像序列的预测值;89第二图像序列的姿势调整序列的预测值来调整虚拟形象的动作幅度或动作节奏的至少一拟形象动作生成模型,根据初始基础姿势和语音生成与语音对应的图像序列的基础姿势,图像序列中虚拟形象的动作幅度和动作节奏的至少一个的参数序列;图像序列生成单元,[0041]图3示出根据本公开一些实施例的模型训练过程中生成基础姿势的方法的示意[0042]图4示出了根据本公开一些实施例的模型训练过程中生成姿势调整序列的方法的[0068]可以将说话人的动作分解为基础姿势(例如鼓掌)和幅度节奏(例如,鼓掌时手的训练样本Mi-1和Mi输入基础姿势模块,计算隐变量的后验概率分布。根据隐变量的后验分第一中间变量包括从第一图像序列的基础姿势到第二图像序列的基础[0079]图3示出根据本公开一些实施例的模型训练过程中生成基础姿势的方法的示意[0080]如图3所示,将Mi-1和Mi输入基础姿势模块,利用第一编码器分别计算Mi-1的编码[0083]基础姿势模块并未直接求得Mi-1的基础姿势和Mi的基础姿势,而是在利用第二编码器将τ编码到隐空间的这个过程中,去除了输入样本中Mi-1和Mi中的姿势调整参数的信[0085]在一些实施例中,第二编码器采用CVAE(条件变分自编码器,Conditional[0092]当隐变量的后验分布为P1时,对同一个分布多次采样得到调整序列为第二图像序列中虚拟形象的动作幅度和动作节奏的至少一个[0096]图4示出了根据本公开一些实施例的模型训练过程中生成姿势调整序列的方法的通过根据语音的韵律特征,生成姿势调整序列的预测值i;,可以在不影响基础姿势的预测0i)=0;)=1。[0113]L1=-KL(N(UO(r),EO(r)),N(0,1))),其中,KL(N(UO(r),EO(r)),N(0,1)))表示计算分布N(uo(r),EO(r))和标准正态分布w(0,1)之间的散度。θi-1)中包含的不同的运动幅度和节奏的信息被忽略从第一图像序列的基础姿势到第二图像序列的基础姿势发生改变和不发生改变这两种情Si的值只能决定下一个基础姿势与Mi-1中的基础姿势是否为不同的。但Si并不影响下一[0119]第二损失函数通过对姿势调整模块生成的和真值之间比较,可以保障姿势调列中的每个图像相对于均值的偏移。姿势调整模块训练的目的是让生成的和上述偏移[0130]Lrec为第二图像序列的预测值对应的损失函数,通过Lrecs可以保证虚拟形象动包括:根据第一图像序列真值的编码的解码结果和第一图像序列真值之间的差值的范数,(即,上一个时刻的动作对应的编码)产生下一个时刻的ei的这个过程是和隐变量相包括:根据第一图像序列真值的编码的解码结果和第一图像序列真值之间的差值的范数,[0147]为验证本公开的虚拟形象动作生成模型的训练方法的效果,发明人利用图1所示型根据本公开任一实施例的虚拟形象动作生成模型训练方法训练得征,再根据语音的韵律特征,通过全卷积网络生成姿势调整序列的预测值;-g(s,).通[0164]本公开将说话人的动作分解为基础姿势(例如鼓掌)和幅度节奏(例如,鼓掌时手91用于存储虚拟形象动作生成模型训练方法对应实施例或虚拟形象动作生成方法对应实质例如存储有执行虚拟形象动作生成模型训练方法或虚拟形象动作生成方法中的至少一[0185]处理器1020可以用通用处理器、数字信号处理器(DSP)、应用专用集成电路[0192]通过上述

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论