CN118229815B 视频生成方法、深度学习模型的训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第1页
CN118229815B 视频生成方法、深度学习模型的训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第2页
CN118229815B 视频生成方法、深度学习模型的训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第3页
CN118229815B 视频生成方法、深度学习模型的训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第4页
CN118229815B 视频生成方法、深度学习模型的训练方法、装置、设备和存储介质 (北京百度网讯科技有限公司)_第5页
已阅读5页,还剩41页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

US2024087179A1,2024.03.14特征用于控制所生成的视频中的目标对象的动2对所述关键点进行特征提取,得到所述动作序列的运动控制特征从包含所述目标对象的运动姿态信息的目标图像中确定所述图像特征和所述动作特从包含所述目标对象的运动描述信息的目标文本中确定所述3.根据权利要求1所述的方法,其中,所述初始噪声的类型和时长与所述目标视频一对所述运动控制特征进行空间跨注意力处理以及时序注意力处理,得基于所述图像注意力特征、所述文本注意力特征和所述运动将所述样本图像序列中的起始样本图像、所述样本动作序列中的根据所述样本动作序列和所述输出动作序列之间的差异,确定所述提取所述样本图像序列中每个样本图像中样本对象的姿态信息,得到所述3所述输出动作序列。使用动作序列生成模型,以样本文本和样本图像序列为引导信号,生成样确定所述样本图像序列的图像序列特征,并对所述图像序列将所述样本图像序列中的起始样本图像、所述样本动作序列、根据所述样本图像序列和所述输出图像序列之间的差异,将所述文本特征输入所述空间跨注意力子网络和所述时序注意力子将所述运动控制特征输入所述空间跨注意力子网络和所述时序注4基于所述图像注意力特征、文本注意力特征和所述运动控制注意动作序列生成模块,用于以图像和文本作为引导信号,使所述动作序列中每一帧动作包括表征所述目标对象的姿态的多运动控制特征确定模块,用于对所述关键点进行特征提取,得到所文本特征确定单元,用于从包含所述目标对象的运动位置特征确定单元,用于确定用于指示所述动作序列中文本特征处理单元,用于对所述文本特征进行空间跨注意力处理以及时序注意力处运动控制特征处理单元,用于对所述运动控制特征进行空间跨注意视频特征确定子单元,用于基于所述图像注意力特征、所述文本注动作序列输出模块,用于将所述样本图像序列中的起始样本图像、5第二样本确定模块,用于使用动作序列生成模型,以样本文加噪模块,用于确定所述样本图像序列的图像序列特运动控制特征确定单元,用于将所述样本动作序列输入所述运动控去噪单元,用于将所述运动控制特征、起始样本图像的图像第二图像特征确定单元,用于将所述起始样本图像输入6文本注意力特征确定子单元,用于将所述文本特征输入所运动控制注意力特征确定子单元,用于将所述运动控制特征输入所述去噪子单元,用于基于所述图像注意力特征、文本注意力特征和所述存储器存储有可被所述至少一个处理器执行的指令,所述指令被使所述计算机执行根据权利要求1至13中子设备其中至少之一上,所述计算机程序在被处理器执行时实现根据权利要求1至13中任78[0013]应当理解,本部分所描述的内容并非旨在标识本公开的实施例的关键或重要特[0015]图1是根据本公开的一个实施例的可以应用视频生成方法和深度学习模型的训练[0025]图11是根据本公开的一个实施例的视频生成方法和深度学习模型的训练方法中9[0033]图1是根据本公开一个实施例的可以应用视频生成方法和深度学习模型的训练方[0036]本公开实施例所提供的视频生成方法中的至少之一一般可以由终端设备101、[0037]本公开实施例所提供的深度学习模型的训练方法一般可以由服务器105执行。相对象的动作序列。对象运动描述信息的动作序列。[0047]例如,运动控制特征用于控制所生成的视频中的目标对象的动作与动作序列一作312包括表征目标对象姿态信息的多个关键点。文本313包括目标对象的运动描述信息,n[0077]动作序列501输入运动控制网络,得到运动控制特征。运动控制特征输入去噪网络,可以作用在去噪网络中每个模块中的空间跨注意力网络5101和时序注意力网络5102,态以及样本对象运动描述信息的输出动作序列。[0090]例如,深度学习模型输出的输出动作序列中的第一帧动作与起始样本动作一样本动作序列中的动作帧数与输出动作序列中的动作帧[0097]文本编码器和图像编码器可以是训练好的CLIP网络。动作序列生成网络可以是生成的,也可以是通过提取样本图像序列中每个样本图像中样本对象的姿态信息得到的。[0123]根据本公开的实施例,去噪网络包括空间跨注意力子网络和时序注意力子网[0131]运动控制特征确定模块802用于确定动作序列的运动控制特征,运动控制特征用[0132]视频生成模块803用于基于图像特征、文本特征以及运动控制特征,生成目标视[0134]图像和动作特征确定单元用于从包含目标对象的运动姿态信息的目标图像中确[0135]文本特征确定单元用于从包含目标对象的运动描述信息的目标文本中确定文本[0136]位置特征确定单元用于确定用于指示动作序列中的多个动作的位置顺序的位置[0143]文本特征处理子单元用于对文本特征进行空间跨注意力处理以及时序注意力处[0144]运动控制特征处理子单元用于对运动控制特征进行空间跨注意力处理以及时序[0149]动作序列输出模块902用于将样本图像序列中的起始样本图像、样本动作序列中[0150]第一损失确定模块903用于根据样本动作序列和输出动作序列之间的差异,确定[0152]第一样本确定模块901用于提取样本图像序列中每个样本图像中样本对象的姿态[0174]文本注意力特征确定子单元用于将文本特征输入空间跨注意力子网络和时序注[0175]运动控制注意力特征确定子单元用于将运动控制特征输入空间跨注意力子网络[0176]去噪子单元用于基于图像注意力特征、文本注意力特征通过诸如因特网的计算机网络和/或各种电信网络与其他设备交换信[0181]计算单元1101可以是各种具有处理和计算能力的通用和/或专用处理组件。计算中,视频生成方法和深度学习模型的训练方法中的至少之一可被实现为计算机软件程序,机程序可在包括至少一个可编程处理器的可编程系统上执行和/或解释,该可编程处理器[0183]用于实施本公开的方法的程序代码可以采用一个或多个编程语言的任何组合来理器或控制器,使得程序代码当由处理器或控制器执行时使流程图和/或框图中所规定的包部分地在机器上执行且部分地在远程机器上执行或完全在远程机器或服务器器以及键盘和指向装置(例如,鼠标或者轨迹球用户可以通过该键盘面或者该网络浏览器来与此处描述的系统和技术的实施方式交互)、或者包括这种后台部字数据通信(例如,通信网络)来将系统的部件相互连接。通信网络的示例包括:过通信网络进行交互。通过在相应的计算机上运行并且彼此具有客户端-服务器关系的计

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论