CN116233491B 视频生成的方法及服务器 (阿里巴巴达摩院(杭州)科技有限公司)_第1页
CN116233491B 视频生成的方法及服务器 (阿里巴巴达摩院(杭州)科技有限公司)_第2页
CN116233491B 视频生成的方法及服务器 (阿里巴巴达摩院(杭州)科技有限公司)_第3页
CN116233491B 视频生成的方法及服务器 (阿里巴巴达摩院(杭州)科技有限公司)_第4页
CN116233491B 视频生成的方法及服务器 (阿里巴巴达摩院(杭州)科技有限公司)_第5页
已阅读5页,还剩51页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

US2022253671A1,2022.08.11参考图像生成与描述文本语义匹配的目标视频2将所述描述文本和所述参考图像输入视频生成模型,通通过所述图像参考分支的多个第一扩散处理层,对所述通过所述视频生成分支的多个第二扩散处理层,对待通过所述注意力层将所述描述文本的文本特征和所连接的第一扩散处理层提取的参所述空间注意力模块用于:将所连接的第二扩散处理层所述隐层时间注意力模块用于:通过所述注意力池化单所述交叉注意力模块用于:将各所述图像帧的第二中间处理层提取的所述图像帧的图像帧特征,与对应的第一扩散处理层提取的参考图像特征,所述空间注意力模块将所连接的第二扩散处理层提取的所述图像帧的图像帧特征作3所述空间注意力模块将所连接的第二扩散处理层提取的所述图像帧的图像帧特征作5.根据权利要求2所述的方法,其特征在于,在训练所述视频生成模型时,使用预训练的文本生成6.根据权利要求2所述的方法,其特征在于,所述视在训练所述视频生成模型时,使用预训练的文本生根据所述目标视频的序列帧,在确定所述目标视频的时长不足根据所述描述文本,使用预训练的文本生成图像模型,4将所述描述文本和所述参考图像输入视频生成模型,通所述处理器执行所述存储器存储的计算机执行指令,以实现如56[0015]图6为本申请一示例性实施例提供的用于图像动态化的双分支视频生成模型的架[0017]图8为本申请一示例性实施例提供的用于帧插值的双分支视频生成模型的架构7极大地降低了内存和计算量的需求。[0034]多尺度交叉注意力(Multi_scaleCross_attention是一种基于注意力机制的[0038]针对文本生成视频方法生成视频质量低的问题,如与给定描述文本语义匹配度8供的用于生成目标视频的描述文本和参考图像,将描述文本和参考图像输入视频生成模务器提供的用于生成视频的应用程序接口,并向服务器提供用于生成目标视频的描述文[0047]示例性地,以生成视频素材为例,用户通过端侧设备输入“aoutedogis任一图像帧编辑后作为参考图像。服务器基于新指定的参考图像重新生成新的目标视频,[0049]下面以具体地实施例对本申请的技术方案以及本申请的技术方案如何解决上述9[0050]图2为本申请一示例性实施例提供的视频生成方法流程图。本实施例的执行主体服装的多个不同角度的平面照)作为待生成的多个图像帧的初始化图像。本实施例中基于双分支的视频生成模型,将目标服装的多张图像作为待生成的多个图像帧的初始化图像,根据给的描述文本的文本特征和给定的用户面部图像,生成多个新的图像帧,作为用户的试衣图像。具体处理过程与实现图像动态化生成多个图像帧的处理过程类似,不同之处在于将目标服装的多张图像作为待生成的多个图像帧的初始化图像。成与描述文本匹配的参考图像,可以充分利用具有高精准度的预训练的文本生成图像模户在已生成的视频的序列帧中,指定任一图像帧作为本次生成目标视频使用的参考图像;有任意一种将图像进行图像超分辨率处理的模型实现,例如基于插值的图像超分辨率模[0080]图3为本申请一示例性实施例提供的双分支的视频生成模型的架构图。如图3所[0085]在一可选实施例中,图4为本申请一示例性实施例提供的视频生成模型中注意力[0089]隐层时间注意力模块的输入为空间注意力模块输出的各个图像帧的第一中间特[0091]示例性地,交叉注意力模块具体用于将各图像帧的第二中间特征作为查询特征[0092]图4中以第一层的扩展处理层之后连接的注意力层的为例,示出了注意力层的一种可能的实现方式,在后面各层扩展处理层之后连接的注意力层的结构类似(图4中未示[0095]在一可选实施例中,图5为本申请一示例性实施例提供的隐层时间注意力模块的理层提取的参考图像特征进行空间注意力计算的空间注意力模块的参数在模型训练过程[0105]在一可选实施例中,图6为本申请一示例性实施例提供的用于图像动态化的双分扩散处理层提取的对应图像帧的图像帧特征作为查询特征(Q将对应的第一扩散处理层[0106]如图6所示,各个交叉注意力模块具体用于将各图像帧的第二中间特征作为查询[0110]例如,给定的图像可以为户外草地上的狗的图像,给定的描述文本而可以为“a[0111]该步骤的具体实现方式与前述步骤S21的实现方式类似,具体参见前述实施例的[0113]该步骤的具体实现方式与前述步骤S22的实现方式类似,具体参见前述实施例的[0116]在一可选实施例中,图8为本申请一示例性实施例提供的用于帧插值的双分支视帧对应的空间注意力模块具体可以将所连接的第二扩散处理层提取的对应图像帧的图像帧特征作为查询特征(Q将对应的第一扩散处理层提取的参考图像特征拼接作为键特征[0118]如图8所示,各个交叉注意力模块具体用于将各图像帧的第二中间特征作为查询[0123]该步骤的具体实现方式与前述步骤S21的实现方式类似,具体参见前述实施例的[0125]该步骤的具体实现方式与前述步骤S22的实现方式类似,具体参见前述实施例的[0128]图10为本申请一示例性实施例提供的文本生成视频的方法流程图[0135]在获取到与描述文本匹配的参考图像之后,该步骤中使用如图6所示的用于图像[0136]该步骤的具体实现方式参见前述图7所示的图像动态化方法实现,具体参见前述[0138]在得到与描述文本语义匹配的多个关键帧之后,该步骤中使用如图8所示的用于[0139]该步骤的具体实现方式参见前述图9所示的帧差值方法实现,具体参见前述实施图11所示,本申请提供的文本生成视频的总体框架包括如下四个部分:文本生成图像[0146]在一可选实施例中,本申请提供的文本生成视频的方案可以应动态化处理为动图/视频;基于描述文本在起始帧和结尾帧之间插入多个帧,形成连续动任何类型的易失性或非易失性存储设备或者它们的组合实现,如静态随机存取存储器(SRAM电可擦除可编程只读存储器(EEPROM可擦除[0196]上述通信组件被配置为便于通信组件所在设备和其他设备之间有线或无线方式[0200]这些计算机程序指令也可存储在能引导计算机或其他可编程数据处理设备以特网络接口和内存。内存可能包括计算机可读介质中的非永久性存储器,随机存取存储器者适应性变化遵循本申请的一般性原理并包括本申请未公开的本技术领域中的公知常识且可以在不脱离其范围进行各种修改和改变。本申请的范围仅由所附的权利要求书来限

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

最新文档

评论

0/150

提交评论